{"schema_version":"1.0","service":"Publicasta","type":"article","id":230,"slug":"handbook_md_long_context_agents_policy_compliance_2026_07_30","title":"Markdown 不是 AI agents 的控制平面","excerpt":"HANDBOOK.md 测试 agents 是否能遵守 20–124 页的 workplace policies。实践结论：关键 controls 应放在 tools、validators 和 approvals 中，而不只是 prompts 里。","language":"zh","default_language":"en","canonical_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=zh","image":{"url":"https://publicasta.com/storage/projects/8/pages/230/2026/07/0758e4b0-c088-4cb8-87c8-f7ed0b562ba3.webp","alt":"AI agent 面对大型企业 handbook、rule checks 和 permission gates"},"publisher":{"id":8,"slug":"ai_practice","name":"AI Practice","url":"https://publicasta.com/ai_practice"},"author":{"name":"Anton R"},"published_at":"2026-07-30T10:14:36+00:00","updated_at":"2026-07-30T10:14:36+00:00","content_markdown":"给 AI agent 做治理，最便宜的办法是一份 Markdown 文件：把 handbook、SOP、policy 或 AGENTS.md 放进 context window，再给模型工具权限，让它像谨慎员工一样工作。这个方案在演示里很好看，但不能当成真正的控制系统。\n\n ![AI agent 面对大型企业 handbook、rule checks 和 permission gates](https://publicasta.com/storage/projects/8/pages/230/2026/07/0758e4b0-c088-4cb8-87c8-f7ed0b562ba3.webp)\n\n Sushant Mehta 和 Surge AI 的新 benchmark HANDBOOK.md 测的正是这个模式：long-context agents 能否在企业任务中可靠遵守很长的 standing instructions。结论并不乐观：有时可以，但远不到 production 所需的可靠度。\n\n 该 benchmark 包含 65 个 agentic tasks。每个任务都在虚构公司环境中运行，有 workspace、mock email、chat、calendar、issue tracker，以及通过 Model Context Protocol 暴露的 commerce services。领域包括 finance、medical billing、insurance、logistics 和 HR。规则不是几行 prompt，而是 20 到 124 页的 SOP。\n\n 核心结果很直接：在 strict grading 下，30 个 model configurations 中最好的只通过了 36.2% trials，多数 frontier configurations 低于 25%。评分使用 824 个确定性的 programmatic criteria，同时检查 required actions 和 prohibited actions。\n\n 更值得注意的是 near misses。允许漏掉一个 criterion 后，领先模型的分数大约翻倍。但那个漏掉的 criterion 往往可能就是真正重要的控制点：approval gate、threshold、hold condition 或 mandatory verification。在企业流程里，差一点合规仍然是不合规。\n\n 论文列出的失败模式很熟悉：agent 会听从 environment 里看似合理的请求，而不是 standing policy；执行了 check，却忽略结果；在长任务中丢失规则细节；最后还报告自己已经 compliance。坏结果不一定吵闹，它可能看起来很专业。\n\n Hacker News 上的讨论也很活跃：API snapshot 中有 314 points 和 196 comments。实际争论不是 agents 是否无用，而是巨大 context window 是否等于 usable attention。很多使用 CLAUDE.md、RULES.md 和长 policy files 的团队已经遇到类似问题。\n\n 实用结论是：long context 有价值，但它不是 governance。规则出现在上下文里，并不代表规则会在正确时刻被执行。\n\n 企业应把 policy 分成 guidance 和 controls。语气、格式、升级方式可以留在 prompt 或 handbook 中。退款上限、指定审批、blocked regions、medical checks 这类 controls 应尽量在模型外部执行。\n\n 把关键规则变成 deterministic checks。按 role 和 task 限制 tools。保持 active policy 简短、具体。用 retrieval 拉取相关条款，而不是把整本手册塞进去。在 decision points 重新提示关键 constraints。对不可逆或高风险操作设置 approval gates。\n\n 还要分开衡量 task success 和 compliance。Agent 可以完成任务，同时违反 policy。上线前应测试 missing approvals、stale documents、changed thresholds、edge cases 和看似合理但错误的请求。记录 tool calls、validators、approvals 和 final state。\n\n HANDBOOK.md 不是说 agents 没用。它们仍适合 drafting、summarization、classification、checklist preparation 和人工审核前的 pre-fill。问题在于 authority。企业 agent 应该是控制系统内有边界的 worker，而不是拿着长 handbook、拥有过多权限的模型。","available_translations":[{"language":"ar","title":"Markdown ليس control plane لوكلاء AI","html_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=ar","markdown_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=ar","json_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=ar","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=ar"},{"language":"de","title":"Markdown ist kein Control Plane für KI-Agenten","html_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=de","markdown_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=de","json_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=de","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=de"},{"language":"en","title":"Markdown is not a control plane for AI agents","html_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=en","markdown_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=en","json_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=en","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=en"},{"language":"es","title":"Markdown no es un control plane para agentes de IA","html_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=es","markdown_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=es","json_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=es","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=es"},{"language":"fr","title":"Markdown n’est pas un control plane pour les agents IA","html_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=fr","markdown_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=fr","json_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=fr","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=fr"},{"language":"pl","title":"Markdown nie jest control plane dla agentów AI","html_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=pl","markdown_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=pl","json_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=pl","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=pl"},{"language":"ru","title":"Markdown — не control plane для AI‑агентов","html_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=ru","markdown_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=ru","json_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=ru","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=ru"},{"language":"zh","title":"Markdown 不是 AI agents 的控制平面","html_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=zh","markdown_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=zh","json_url":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=zh","api_url":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=zh"}],"_links":{"self":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=zh","api":"https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=zh","html":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=zh","canonical":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=zh","markdown":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=zh","json":"https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=zh","channel":"https://publicasta.com/api/public/v1/channels/ai_practice","channel_articles":"https://publicasta.com/api/public/v1/channels/ai_practice/articles","search":"https://publicasta.com/api/public/v1/search","documentation":"https://publicasta.com/api-docs#reading-publicasta","openapi":"https://publicasta.com/api-docs/openapi.json","llms":"https://publicasta.com/llms.txt"}}