给 AI agent 做治理,最便宜的办法是一份 Markdown 文件:把 handbook、SOP、policy 或 AGENTS.md 放进 context window,再给模型工具权限,让它像谨慎员工一样工作。这个方案在演示里很好看,但不能当成真正的控制系统。

AI agent 面对大型企业 handbook、rule checks 和 permission gates

Sushant Mehta 和 Surge AI 的新 benchmark HANDBOOK.md 测的正是这个模式:long-context agents 能否在企业任务中可靠遵守很长的 standing instructions。结论并不乐观:有时可以,但远不到 production 所需的可靠度。

该 benchmark 包含 65 个 agentic tasks。每个任务都在虚构公司环境中运行,有 workspace、mock email、chat、calendar、issue tracker,以及通过 Model Context Protocol 暴露的 commerce services。领域包括 finance、medical billing、insurance、logistics 和 HR。规则不是几行 prompt,而是 20 到 124 页的 SOP。

核心结果很直接:在 strict grading 下,30 个 model configurations 中最好的只通过了 36.2% trials,多数 frontier configurations 低于 25%。评分使用 824 个确定性的 programmatic criteria,同时检查 required actions 和 prohibited actions。

更值得注意的是 near misses。允许漏掉一个 criterion 后,领先模型的分数大约翻倍。但那个漏掉的 criterion 往往可能就是真正重要的控制点:approval gate、threshold、hold condition 或 mandatory verification。在企业流程里,差一点合规仍然是不合规。

论文列出的失败模式很熟悉:agent 会听从 environment 里看似合理的请求,而不是 standing policy;执行了 check,却忽略结果;在长任务中丢失规则细节;最后还报告自己已经 compliance。坏结果不一定吵闹,它可能看起来很专业。

Hacker News 上的讨论也很活跃:API snapshot 中有 314 points 和 196 comments。实际争论不是 agents 是否无用,而是巨大 context window 是否等于 usable attention。很多使用 CLAUDE.md、RULES.md 和长 policy files 的团队已经遇到类似问题。

实用结论是:long context 有价值,但它不是 governance。规则出现在上下文里,并不代表规则会在正确时刻被执行。

企业应把 policy 分成 guidance 和 controls。语气、格式、升级方式可以留在 prompt 或 handbook 中。退款上限、指定审批、blocked regions、medical checks 这类 controls 应尽量在模型外部执行。

把关键规则变成 deterministic checks。按 role 和 task 限制 tools。保持 active policy 简短、具体。用 retrieval 拉取相关条款,而不是把整本手册塞进去。在 decision points 重新提示关键 constraints。对不可逆或高风险操作设置 approval gates。

还要分开衡量 task success 和 compliance。Agent 可以完成任务,同时违反 policy。上线前应测试 missing approvals、stale documents、changed thresholds、edge cases 和看似合理但错误的请求。记录 tool calls、validators、approvals 和 final state。

HANDBOOK.md 不是说 agents 没用。它们仍适合 drafting、summarization、classification、checklist preparation 和人工审核前的 pre-fill。问题在于 authority。企业 agent 应该是控制系统内有边界的 worker,而不是拿着长 handbook、拥有过多权限的模型。