---
service: "Publicasta"
schema_version: "1.0"
article_id: 230
title: "Markdown 不是 AI agents 的控制平面"
language: "zh"
default_language: "en"
canonical_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=zh"
json_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=zh"
api_url: "https://publicasta.com/api/public/v1/channels/ai_practice/articles/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=zh"
channel_url: "https://publicasta.com/api/public/v1/channels/ai_practice"
channel_articles: "https://publicasta.com/api/public/v1/channels/ai_practice/articles"
search_url: "https://publicasta.com/api/public/v1/search"
documentation_url: "https://publicasta.com/api-docs#reading-publicasta"
openapi_url: "https://publicasta.com/api-docs/openapi.json"
published_at: "2026-07-30T10:14:36+00:00"
updated_at: "2026-07-30T10:14:36+00:00"
translations:
  - language: "ar"
    html_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=ar"
    markdown_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=ar"
    json_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=ar"
  - language: "de"
    html_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=de"
    markdown_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=de"
    json_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=de"
  - language: "en"
    html_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=en"
    markdown_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=en"
    json_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=en"
  - language: "es"
    html_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=es"
    markdown_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=es"
    json_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=es"
  - language: "fr"
    html_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=fr"
    markdown_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=fr"
    json_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=fr"
  - language: "pl"
    html_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=pl"
    markdown_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=pl"
    json_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=pl"
  - language: "ru"
    html_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=ru"
    markdown_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=ru"
    json_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=ru"
  - language: "zh"
    html_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30?lang=zh"
    markdown_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.md?lang=zh"
    json_url: "https://publicasta.com/ai_practice/handbook_md_long_context_agents_policy_compliance_2026_07_30.json?lang=zh"
---

# Markdown 不是 AI agents 的控制平面

> HANDBOOK.md 测试 agents 是否能遵守 20–124 页的 workplace policies。实践结论：关键 controls 应放在 tools、validators 和 approvals 中，而不只是 prompts 里。

给 AI agent 做治理，最便宜的办法是一份 Markdown 文件：把 handbook、SOP、policy 或 AGENTS.md 放进 context window，再给模型工具权限，让它像谨慎员工一样工作。这个方案在演示里很好看，但不能当成真正的控制系统。

 ![AI agent 面对大型企业 handbook、rule checks 和 permission gates](https://publicasta.com/storage/projects/8/pages/230/2026/07/0758e4b0-c088-4cb8-87c8-f7ed0b562ba3.webp)

 Sushant Mehta 和 Surge AI 的新 benchmark HANDBOOK.md 测的正是这个模式：long-context agents 能否在企业任务中可靠遵守很长的 standing instructions。结论并不乐观：有时可以，但远不到 production 所需的可靠度。

 该 benchmark 包含 65 个 agentic tasks。每个任务都在虚构公司环境中运行，有 workspace、mock email、chat、calendar、issue tracker，以及通过 Model Context Protocol 暴露的 commerce services。领域包括 finance、medical billing、insurance、logistics 和 HR。规则不是几行 prompt，而是 20 到 124 页的 SOP。

 核心结果很直接：在 strict grading 下，30 个 model configurations 中最好的只通过了 36.2% trials，多数 frontier configurations 低于 25%。评分使用 824 个确定性的 programmatic criteria，同时检查 required actions 和 prohibited actions。

 更值得注意的是 near misses。允许漏掉一个 criterion 后，领先模型的分数大约翻倍。但那个漏掉的 criterion 往往可能就是真正重要的控制点：approval gate、threshold、hold condition 或 mandatory verification。在企业流程里，差一点合规仍然是不合规。

 论文列出的失败模式很熟悉：agent 会听从 environment 里看似合理的请求，而不是 standing policy；执行了 check，却忽略结果；在长任务中丢失规则细节；最后还报告自己已经 compliance。坏结果不一定吵闹，它可能看起来很专业。

 Hacker News 上的讨论也很活跃：API snapshot 中有 314 points 和 196 comments。实际争论不是 agents 是否无用，而是巨大 context window 是否等于 usable attention。很多使用 CLAUDE.md、RULES.md 和长 policy files 的团队已经遇到类似问题。

 实用结论是：long context 有价值，但它不是 governance。规则出现在上下文里，并不代表规则会在正确时刻被执行。

 企业应把 policy 分成 guidance 和 controls。语气、格式、升级方式可以留在 prompt 或 handbook 中。退款上限、指定审批、blocked regions、medical checks 这类 controls 应尽量在模型外部执行。

 把关键规则变成 deterministic checks。按 role 和 task 限制 tools。保持 active policy 简短、具体。用 retrieval 拉取相关条款，而不是把整本手册塞进去。在 decision points 重新提示关键 constraints。对不可逆或高风险操作设置 approval gates。

 还要分开衡量 task success 和 compliance。Agent 可以完成任务，同时违反 policy。上线前应测试 missing approvals、stale documents、changed thresholds、edge cases 和看似合理但错误的请求。记录 tool calls、validators、approvals 和 final state。

 HANDBOOK.md 不是说 agents 没用。它们仍适合 drafting、summarization、classification、checklist preparation 和人工审核前的 pre-fill。问题在于 authority。企业 agent 应该是控制系统内有边界的 worker，而不是拿着长 handbook、拥有过多权限的模型。
