Anthropic 投入 1 亿美元培训工程师,揭示企业 AI 真正的瓶颈
Anthropic 计划到 2027 年底培训 1 万名部署工程师。这项投入揭示了企业 AI 的难题:购买模型很容易,把模型变成受治理、可维护、有人真正使用的工作流程,却需要稀缺的实施判断力。
Anthropic 表示,将投入 1 亿美元,在 2027 年底前培训 1 万名“前沿部署工程师”(Frontier Deployed Engineers)。Claude Frontier Academy 面向大型企业和咨询公司的工程师,目标是让他们把一个看起来颇有吸引力的 AI 演示,推进到安全审查、工作流集成、部署和交接的完整阶段。

这项公告的重要性并不止于 Claude。它发出了一个有用信号:企业采用 AI 正撞上交付难题。许多公司可以买到模型访问权限,却很少能把这种访问权限转化为一个经过治理、每天有人使用的系统。真正稀缺的能力也不只是写提示词,而是把软件工程、流程设计、风险判断、领域知识和变革管理结合起来,让 AI 系统经得起真实组织的复杂环境。
对买方而言,实际启示很直接。在批准下一项模型订阅之前,先找出负责把用例变成运营流程的人。如果没有人承担这项责任,更大的模型大多只会制造一条更长的试点项目队列。
Anthropic 实际推出了什么
Anthropic 在 10 月 2 日的公告中,将这项计划描述为一个面向软件工程师、以提名为基础的实践项目。首批参与者来自埃森哲、贝恩、凯捷、澳大利亚联邦银行、德勤、麦肯锡、摩根士丹利和诺和诺德。公司表示,到 2027 年底,项目将逐步扩展至 1 万名工程师。
培训的核心是部署,而不是上一门简短的模型功能课程。参与者先参加由 Anthropic 工程师和持证讲师共同开展的线下项目。他们会完成一次模拟企业部署,选择一个用例,应对安全审查,并通过一项评分制实践考核。通过者获得 Resident Engineer 徽章,随后进入为期 12 周的驻留阶段。在驻留期间,他们在 Anthropic 工程师和同届学员的支持下,带领本组织内部的一个真实 Claude 用例。之后再经过一次评估,才有机会获得 Frontier Deployed Engineer 徽章。
Anthropic 称,申请人不必事先具备构建 AI 智能体的经验,但应当是能力较强的软件工程师,有使用大型语言模型进行开发的经历,曾帮助他人采用 AI,并且要带着一个明确命名的项目参加培训,回到组织后负责推进。最后一项要求很关键。这个项目并不是一般性的教育课程,而是试图把培训绑定到一项具体的组织工作上。
“前沿部署工程师”这个称谓,也说明了 Anthropic 认为市场缺少什么样的人才。他们不是改进基础模型的研究科学家,也不是把聊天机器人嵌入网页的普通应用开发者。这个角色处在模型供应商与业务流程之间:要把运营问题翻译成系统,把系统连接到数据和工具,定义系统可以在哪些地方采取行动,建立测试,并让一个没有参加培训的团队也能维护最终成果。
Anthropic 的说法仍然属于供应商自身的说法。公告没有提供独立证据,证明该学院一定能产出 1 万次成功部署;也没有公布完整课程、毕业率、定价模式,或与供应商中立培训项目的比较。这些限制并不会让计划失去意义,却决定了企业在把徽章当成生产环境能力证明之前,应该提出哪些问题。
这些数字指向实施能力缺口
近期几项调查从不同角度描述了同一个缺口。
德勤发布的《2026 年企业 AI 状况》报告称,2025 年员工获得 AI 访问权限的比例上升了 50%,并预计未来六个月内,至少有 40% 项目进入生产环境的公司数量将翻倍。但德勤同时报告,真正重新设计业务的组织只有 34%,而 AI 技能缺口被视为整合 AI 的最大障碍。报告把战略与运营准备度之间的距离称为准备度缺口:企业对计划的信心,高于对基础设施、数据、风险控制和人才的信心。
AI Leaders Council 发布的《2026 年企业 AI 人才研究》显示出更加明显的反差。受访者的 AI 使用率从 1 月的 87% 上升到 97%,但完全嵌入企业的使用率停留在 3%。只有 37% 的受访者表示所在组织提供 AI 培训,33% 表示组织没有明确的 AI 人才战略。这项研究并不是覆盖所有公司的中立概率抽样普查,因此其中的具体比例不应被当成普遍基准。不过,它所呈现的方向与德勤的发现一致:访问权限和实验速度,正在超过组织自身的能力建设速度。
美国商业圆桌组织 Conference Board 在 7 月报告称,55.1% 的受访员工每天或每周使用生成式 AI 或 AI 智能体,但过去六个月中只有 33.3% 使用过雇主提供的 AI 培训。近 28.3% 的人表示所在组织完全不提供 AI 培训。该机构的研究还区分了基础素养与高级能力。许多组织会教提示词和一般认知,却很少教员工如何管理智能体、把 AI 集成到工作流中,或者把 AI 应用于战略性业务问题。
Gartner 的 2026 年劳动力研究又提出了一个有关进度衡量方式的警告。调查显示,只有 27% 的高管拥有全面的 AI 战略,只有 20% 相信自己的员工队伍真正做好了使用 AI 的准备。Gartner 还报告称,在多个 AI 用例上都熟练的员工,更可能报告高生产力、高质量工作和有效的流程改进,而只在狭窄场景使用 AI 的人则较少如此。它的重点不是每名员工都要变成工程师,而是采用深度比启用账户数量更重要。
合起来看,这些证据描绘出一种“赋能幻觉”。一家公司可以拥有采购批准、企业许可证、提示词库和很高的周活跃用户数,却仍然没有能力改造一条糟糕的审批路径、安全地把智能体连接到内部系统,或判断某个输出是否适合用于高影响决策。
为什么部署人才不同于提示词培训
提示词培训容易购买,因为它容易包装。一场工作坊可以讲解如何给模型提供上下文、要求指定格式、让模型进行批评并持续迭代。这些都是有用技能,却不足以运营一条 AI 工作流。
生产系统必须回答一些无法整齐塞进提示词的问题:
- 确切的业务结果是什么,应如何衡量?
- 系统可以读取哪些数据,哪些数据绝不能进入上下文?
- 来源缺失、过时或相互矛盾时会发生什么?
- 哪些行动可以自动执行,哪些行动必须获得批准?
- 工具调用如何认证、记录和撤销?
- 哪组测试能够代表正常情况、边界情况和对抗性输入?
- 试点团队离开六个月后,谁负责这条工作流?
- 模型做出看似合理却错误的决定时,人如何接管和恢复?
- 每项任务、每位客户或每月的成本上限是多少?
- 如果模型、供应商、价格或数据保留政策变化,设计要如何调整?
部署工程师的价值在于,这些问题必须被放在一起回答。如果安全团队设计控制措施时不了解工作流,系统可能无法使用;如果业务团队选择工作流时不了解模型的失效方式,系统可能不安全;如果工程团队在运营部门没有负责人的情况下上线智能体,就不会有人维护评估集或审查异常。
因此,这个角色更接近产品工程和服务设计,而不是“AI 布道”。它需要足够的模型素养来理解不确定性,足够的工程纪律来构建集成,足够的领域知识来选择有意义的任务,也需要足够的组织授权来改变工具周围的流程。
供应商专属培训的取舍
模型供应商往往是学习自家能力的最佳地点。Anthropic 可以教授 Claude 在上下文处理、工具使用、评估实践和部署模式上的细节,这些内容可能是通用课程容易遗漏的。其工程师也能看到许多客户环境中的共性。驻留式学习可能比通过视频和测验获得的证书更具体、更接近实际工作。
但供应商专属培训也会创造一种买方需要定价并管理的依赖。深入掌握某一家供应商接口的人,可能变得不那么容易迁移;围绕供应商特有行为设计的工作流,迁移成本可能很高。供应商可能改变模型名称、速率限制、工具语义、数据保留条款或安全行为。徽章还可能混淆两个不同问题:这个人是否知道如何使用某供应商的产品,以及这个人是否能够设计一个有韧性的 AI 系统。
组织应当在自己的能力模型中把这两个问题分开。强有力的内部标准应包括供应商中立的能力,例如数据分类、威胁建模、测试设计、人工升级、成本核算、事件响应和工作流所有权。供应商专属知识可以建立在这层基础之上,并在产品变化时及时更新。
对 1 亿美元这个数字也应当谨慎解读。用它除以 1 万名目标工程师,得到的是每名工程师 1 万美元的简单算术平均值,但这并不是已公布的培训价格。这项投入可能包含讲师、场地、支持、工程时间、课程开发和部署协助,不能随意与在线课程学费相比。更重要的是,项目的价值不会由每名毕业生的平均支出决定,而取决于毕业生能否交付持久系统、转移知识,并缩短从已验证用例到可靠运营之间的时间。
这里还存在锁定问题。在大型咨询公司和潜在客户内部培训工程师,可以通过那些影响架构与实施决策的人扩大 Claude 的分发。这可能有利于 Anthropic 的业务,也可能对参与者有用;但这意味着买方仍要把最终设计与替代方案比较。提案应当说明为什么 Claude 合适,不能假设参加培训本身就证明了选择正确。
更好的 AI 实施团队评估方法
企业不必照搬 Anthropic 的称谓,也不必新设一个部门,但必须定义这个称谓所代表的能力。一次实用评估可以围绕五项测试展开。
1. 用例判断
团队应当有能力拒绝那些看起来漂亮、实际上薄弱的想法。一个好的首个用例,应有明确负责人、可衡量的基线、可访问的数据、模型出错时相对有限的后果,以及人工审查路径。“在全公司部署一个智能体”不是用例;“对收到的供应商文件进行分类,提取五个字段,把异常路由给采购部门,并衡量修正率”才是。
团队还应计算当前流程的成本和延迟。如果不知道基线,就无法证明价值;如果流程没有负责人,就没有人能决定某个错误是否可以接受。
2. 系统设计
团队必须能够画出系统边界。这包括模型、检索来源、数据库、API、工具、身份层、用户界面、日志和人工检查点。设计文件应说明模型获准做什么,以及它只能提出建议的事项。
设计应当能够经受供应商更换。这并不要求假装所有模型表现相同,而是意味着提示词、评估案例、应用逻辑、数据契约和业务规则,不应与某一家供应商的响应格式不可分割地融合。
3. 评估与故障处理
演示只展示少数成功路径。实施需要可重复的评估集,其中应包含有代表性的示例、已知失败、含糊案例、敏感输入,以及试图诱使系统越权的请求。
指标也不能只有答案质量。团队可能需要跟踪字段提取准确率、升级率、未经授权的工具调用尝试、人工解决所需时间、延迟、令牌或 API 成本,以及无需修正就被接受的输出比例。对智能体而言,任务成功完成并不够;如果系统偶尔采取未经批准的行动,整体仍然不安全。
团队还需要故障政策。低置信度结果可以转给审核人员;缺失来源可以让流程停止;记录冲突可以触发对账任务。安全行为往往是收窄系统权限,而不是添加一条更热情、更强硬的指令。
4. 运营所有权
每条生产工作流都需要一名对结果负责的负责人,而不只是对系统正常运行时间负责的人。这个人应当拥有预算、审查节奏和修改流程的路径,并知道谁更新评估集、谁批准新工具、谁处理事件,以及谁能够停用工作流。
许多试点正是在这里失败。技术团队交付了一个能工作的原型,业务团队却没有时间或权限维护它。最终,系统变成一款无人负责的应用,最初的假设在悄无声息中失效。
5. 员工采用
用户需要改变行为的理由。培训应使用真实工作流、真实示例和真实边界,说明信息缺失时系统会怎么做、如何质疑一个输出,以及何时必须升级处理。
Conference Board 的研究在这里很有参考意义:人们需要时间、工具和管理支持,而不只是一个课程访问权限。一家公司如果要求员工在下班后完成培训,再用完成率衡量成功,测到的只是接触内容的程度,而不是能力。
买方的 90 天测试
一次有用的实施测试,不必等到开展全公司转型项目才能进行。
前两周,选择一条工作流并写一份简短的工作说明。写明用户、业务结果、基线、数据来源、允许的行动、禁止的行动、升级规则和负责人。定义什么结果算成功,也定义哪些证据会促使团队停止项目。
第三至第六周,构建一个足够窄、但可以被评估的版本。保留人工参与环节。使用一组固定的历史案例或合成案例,并让它反映真实工作的分布。记录错误和修正,不要把它们从演示里剪掉。把系统连接到实时业务工具之前,先加入数据最小化、访问控制和日志记录。
第七至第十周,让一小组用户运行这条工作流。衡量完成时间、修正率、异常率、每个案例的成本和用户行为。询问工具究竟改变了流程,还是只是增加了一个新界面。测试文件不完整、来源相互冲突、用户要求执行禁止行动,或底层模型不可用时会发生什么。
最后两周,根据运营证据作出决定。如果工作流改善了基线,风险和成本也处于可接受范围,而且有人能够维护,就扩大规模;如果用户获得了价值但错误处理或异常路径薄弱,就重新设计;如果系统无法达到质量门槛、数据无法治理,或商业案例依赖专家永久监督,就停止。
最终产物应当是一份简短的部署记录:架构、数据地图、评估结果、已知限制、成本模型、事件处理程序和明确负责人。这份记录比笼统地说组织已经“准备好使用 AI”更有价值。
成本、隐私与锁定检查
实施问题同时也是财务和法律问题。
成本估算应包括推理、检索、存储、可观测性、集成维护、评估运行、人工审查和故障恢复。一个在理想路径演示中看似便宜的智能体,可能因为重复调用工具、处理长文档,或把每个异常都交给专家而变得昂贵。团队应在上线前设定预算和速率限制,然后把预期成本与流程完成后的价值比较,而不是只比较生成的令牌数量。
隐私审查必须区分任务真正需要的数据,与只是方便而被顺手加入的数据。分类发票可能不需要完整客户档案;起草回复也可能不需要永久访问邮箱。应限制上下文、凭证和保留期限。核实数据在哪里处理、日志如何保存、客户数据是否用于训练,以及在选定方案下删除请求和法律保全如何执行。
工作流应该有迁移方案。以可用格式导出提示词、模式、评估案例、业务规则和日志。在合理情况下保留与模型无关的接口。记录哪些行为是业务必需的,哪些只是供应商特有的便利功能。即使公司近期没有更换意图,也应定期测试第二个模型。这个测试能在价格、停机或政策变化迫使公司处理问题之前,暴露隐藏假设。
安全控制还必须覆盖 AI 特有的攻击面。把检索到的内容当成数据,而不是指令。严格收窄工具权限,分离读写凭证。不可逆行动必须获得明确批准。记录模型请求、调用的工具、工具运行时所使用的身份、结果和人工决定。对于任何能影响工作的系统,这些都是基础控制;随着智能体获得更大权限,它们的重要性也会提高。
谁适合参加 Claude Frontier Academy 一类的项目
拥有明确业务问题、内部工程人才,并承诺完成一个或多个真实部署的大型组织,可能会从这类项目中受益。咨询公司可以借此建设交付能力,但应保留供应商中立的架构,并披露哪些决策受供应商关系影响。银行、制造商、医疗机构和其他受监管组织可能看重其中的安全审查与交接重点,但仍需通过自己的法律、风险和合规关卡。
小型公司则应更加挑剔。如果只有一条狭窄的工作流,聘用或借调一名有能力的工程师,再让他与领域负责人配对,可能比创建正式学院更有效。小团队可以通过供应商文档学习,并建立供应商中立的评估习惯,不必支付企业级项目的成本。关键问题不是公司有没有“前沿”用例,而是这条工作流是否有足够的规模和价值,值得投入集成与持续审查。
当底层流程不稳定、数据治理薄弱,或没有人能够对结果负责时,公司应跳过这类项目,至少应推迟。培训无法弥补权限不清,也不应利用一张证书,为在组织尚未建立经过测试的控制框架之前,把智能体部署到高后果流程中提供正当性。
更大的信号
Anthropic 的培训投入既是一项业务行动,也是一个劳动力市场信号。公司希望有更多人能让 Claude 在客户内部真正产生作用;而市场需要的,是更多能够让 AI 系统发挥作用、同时不让对特定模型的热情取代工程判断的人。
随着采用从试点走向生产,这种区别会越来越重要。德勤的研究显示,访问权限在增长,但运营准备度存在缺口。Conference Board 发现,AI 使用速度超过了正式培训,基础素养并不等于高级工作流能力。Gartner 警告,访问指标可能掩盖薄弱的赋能工作,而员工体验会同时影响生产力和留任。Anthropic 的回应,是把有经验的工程师放进具体部署中。
买方应当让那些隐藏工作显形:指定负责人,写清边界,测量基线,测试故障模式,为人工审查编列预算,并保留更换供应商的选择。培训应该围绕业务流程,而不只是围绕界面。
现在有用的问题已经不再是“我们应该购买哪个模型”,而是“谁能安全地把这个模型变成一项有人维护的业务能力”。Anthropic 的 1 亿美元答案,是培训 1 万名专业人员。大多数公司需要的人数会少得多,但仍然必须识别这个角色,赋予它权限,并用真正运行的系统而不是证书来评判它。
来源
本文依据并保留了原文所归属的来源信息,包括 Anthropic 关于 Claude Frontier Academy 的公告、德勤《2026 年企业 AI 状况》报告、Gartner 的 2026 年劳动力研究、AI Leaders Council 的《2026 年企业 AI 人才研究》,以及 Conference Board 关于 AI 技能培训的研究。原始来源分别为:Anthropic 公告、德勤报告、Gartner 研究、AI Leaders Council 研究和 Conference Board 研究。
Comments
Sign in to comment.
No comments yet.