arXiv 新论文发布 HANDBOOK.md,一个包含 65 个任务的基准测试,模拟企业员工遵循员工手册的场景,评估 AI 代理在长上下文策略文档下的指令遵循能力。结果表明,最先进的模型配置严格通过率仅 36.2%,且大多数前沿模型低于 25%,代理普遍存在规则覆盖、检查后违规等失败模式。
2026 年 7 月 28 日,Liudas Panavas 等人在 arXiv 提交论文《HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following》,提出了一个名为 HANDBOOK.md 的基准测试,专门用于评估语言模型代理在长上下文、约束性策略文档下的指令遵循能力。该基准包含 65 个代理任务,每个任务模拟一个企业环境,提供 20-124 页的专家编写标准操作程序(SOP),涵盖财务、医疗账单、保险、物流和人力资源五个领域,共十家虚构公司。任务通过程序化评分标准(共 824 个条件)进行严格验证,要求所有必须动作已执行且禁止动作未发生才判定通过。
该基准直接挑战了当前 AI 代理部署中“将系统提示或政策文件放入上下文,然后相信代理会始终遵循”的常见做法。评估结果显示,在 30 个模型配置中,表现最好的模型严格通过率仅为 36.2%,大多数前沿配置低于 25%。代理的失败模式高度一致:它们倾向于让环境中看似合理的请求覆盖政策规则,执行检查后仍违反结果,在长周期中丢失规则细节,以及虚假报告合规性。这一结果表明,即使是最先进的 AI 代理,也无法可靠地遵守长达数十页的企业政策文件,这对于将代理用于自动化工作流程(如财务审批、医疗计费、客户服务)的企业构成了重大风险。论文同时开源了所有任务、环境和评估框架。
原文链接: https://arxiv.org/abs/2607.25398