IROS 2026 上最值得关注的人形机器人论断,也最容易被过度解读。一篇简短的会场报道说,Agility 的 Digit v4 首次尝试就完成了一次端到端移动操作流程。这之所以有意义,是因为它把通常分开展示的两项工作连接起来:在空间中移动,以及用双臂完成有用任务。但这本身并不能证明人形机器人能够可靠地运行完整的仓库班次。

一台双足人形仓储机器人在工业设施中移动,同时用机械臂抓取周转箱。

区别很重要。机器人公司正在从精心安排的演示,转向必须能够导航、感知、抓取、从错误中恢复,并在设备和人员周围保持安全的系统。一次成功的运行可以说明控制器、机器人和任务在当时条件下彼此兼容,却无法建立生产速率、安全论证、失败分布或成本优势。

IROS 2026 于 9 月 27 日至 10 月 1 日在匹兹堡举行,是观察这一差距的合适场合。会议议程把移动操作、全身控制、学习和物理安全放在相邻的位置。会场上的 Digit 报道提供了新闻切入点,Agility 自己的披露则提供了商业背景。两者共同指向一个不那么戏剧化、却更有用的结论:人形机器人的下一项测试,不是学习策略能否让机器人同时移动身体和双手,而是这种能力能否被测量、界定,并作为一项服务稳定运营。

IROS 演示究竟说明了什么

公开说法来自 Chris Paxton。他介绍称,Agility Digit v4 在 IROS 2026 上完成了一次端到端移动操作运行,而且是“开箱即用”、首次尝试便成功。一篇保留了相关帖子和现有视频片段的机器人新闻报道补充了一个重要限定:报道没有给出成功率、尝试次数、任务清单或受控对比。

这仍然是有意义的结果。在传统机器人系统中,导航、机械臂运动、抓取和任务逻辑可能由不同模块负责。模块之间可以传递状态,但每个交接点都可能让隐含假设变得脆弱。移动操作机器人可能以略微错误的朝向抵达物体旁;机械臂规划器可能假设底座保持静止;物体没有处在摄像头模型预测的位置,也可能导致抓取失败。“端到端”通常意味着某个学习系统或联合控制系统,正在把机器人的更多行为作为一个决策问题进行协调。

这个词并没有说明系统中有多少部分是学习得到的,有多少部分是工程设计的,也没有说明任务是怎样被选择的。它同样不能告诉我们:是否有人随时可以介入,路线和物体摆放是否经过准备,或者机器人是否在此前的数据采集中见过这个场景。这些不是指控,而是解读一项演示所必需的基本变量。

因此,首次成功最多支持一个较窄的表述:在演示条件下,Digit v4 至少能够执行一种整合了移动和操作的场景。它不能支持更宽泛的说法,即 Digit 能够泛化到任意仓库工作。真正有用的编辑问题不是视频是否真实,而是什么样的证据可以把视频转化为运营层面的论断。

为什么移动操作比一次抓取视频难得多

固定机械臂有一个明显优势:它的工作空间、夹具、摄像头位置和碰撞边界都可以提前设计。工业单元看起来经常很重复,是因为可重复性本身就是产品的一部分。机器人不必理解整栋建筑,只需在已知范围内执行一套定义好的动作。

移动操作机器人放弃了部分这种控制。底座一旦改变位置,每次伸手的几何关系都会改变。地面可能不平,人员可能穿过路径,周转箱可能被部分遮挡。机器人必须决定在哪里站立、能够安全靠近到什么距离、从该位置能否够到物体,以及第一次抓取失败后该做什么。如果它采用双足形态,那么伸手或搬运时维持平衡,又会把行走与操作进一步耦合起来。

这正是“移动”一词分量很大的原因。走到标记点属于导航;从固定呈现位置拿起一个物体属于操作;在适应物体实际位置的同时完成两者,则是更长时域的能力。动作空间扩大了,小误差传播的路径也随之增加。

IROS 的议程反映了这个研究问题。会议列出了敏捷人形和足式运动的强化学习、复杂地面运动,以及通信与协作等专题。一个专门的“移动操作与具身智能”研讨会把接触密集型移动操作描述为构建稳健、可部署自主系统的基础。这个框架比泛泛谈论“通用智能”更有信息量:接触、恢复和部署条件,正是机器人的假设与物理世界相遇的地方。

Digit 的商业基线其实比标题更窄

Agility 的公开材料把 Digit v4 放在一个具体的工业角色中。在一份与拟议商业合并有关的申报文件里,公司称 v4 已经部署,并给出了最高 35 磅的承载能力、声称四小时的运行时间以及自主充电能力。同一份材料还表示,机器人具备 360 度环境感知、面向工业流程的自适应灵巧性,以及包含视觉—语言—动作模型在内的全身控制。

这些都是公司的说法,应当按公司披露来阅读。申报材料还展示了预期工作:Digit v4 把装有轴承部件、重量 25 磅的篮筐,从冲压机放入工业清洗机。这不是声称机器人可以完成人类能做的所有任务,而是一个具有明确物体类别、路线和目的地的具体物料处理流程。

Agility 在 2026 年 9 月的新闻稿中把 Digit v5 介绍为面向大规模协作工作的后续一代产品。公司的材料将 v5 的计划能力与 v4 进行对比,包括更大的标称起吊能力、更长的运行潜力、更大的工作范围和可更换末端执行器。材料还称,v5 计划在工作单元之外、与人员并肩运行。“计划”是这里的关键字:在产品发布、按所述条件测试并投入部署之前,这些 v5 数字都只是预期。

这条商业基线有助于解释 IROS 上的运行。该演示或许代表着从专用物料处理流程,向更整合的控制方式扩展。但它不应与公司已经披露的部署证据混为一谈,也不应与通用仓库替代方案混为一谈。至少有三个不同的里程碑:

  • 机器人能够在一次演示中完成选定任务;
  • 机器人能够以可测量的人工介入率,重复执行一套定义好的流程;
  • 机器人能够在真实运营时间表下提供可接受的经济性和安全性。

第一项是研究成果,第二项是工程成果,第三项是商业与运营成果。人形机器人报道经常把它们压缩成一句话。

大多数机器人演示缺少的是分母

“首次尝试”听起来很精确,却没有分母。是准备好的多少次试验中的首次?这次运行是否因为成功才被选中?设置期间发生过多少次失败?成功的定义是什么:碰到物体、抓住物体、把物体放到正确位置,还是在没有人工帮助的情况下完成完整序列?

严肃的评估应当公布任务定义及其周围条件。至少,读者需要知道:

  • 尝试了多少次,成功了多少次;
  • 每次运行之间物体、路线和目的地是否发生变化;
  • 机器人是否接受过先前演示或针对场景的调参;
  • 是否有远程操作员或安全观察员介入;
  • 每次运行持续多久,恢复过程花了多少时间;
  • 抓取失败、碰撞或导航错误会造成什么后果;
  • 机器人上启用了哪些传感器和计算设备;
  • 同一策略是否在第二台机器人或第二个地点运行。

这不是为了形式而增加的官僚程序,而是让能力具备可比性的方式。在固定、干净的呈现环境中达到 95% 的成功率,对某一种流程可能非常优秀,对另一种流程却毫无用处。在杂乱环境中达到 70%,如果机器人能识别不确定性并安全求助,也可能是有价值的研究进展。没有分母和运营条件,视频主要衡量的是被挑中的那个时刻有多好。

自主性也遵循同样的逻辑。机器人可以在低层运动上自主,却仍然依赖人来选择任务、批准恢复操作或重新摆放物体。人工监督并不会让系统变得虚假;它改变了正在出售的服务。仓库运营者购买一台偶尔需要帮助的机器人,和购买一台无人值守运行的机器人,是在购买两种不同的产品。

为什么整合控制仍然是实质性的技术进步

谨慎解读不应掩盖其研究价值。协调行走与操作很困难,因为机器人必须在接触点和身体平衡不断变化时,维持有用的身体姿态。能够改善伸手范围的底座动作,可能降低稳定性;更谨慎的站姿可能让机械臂够不到物体;抓取动作又可能改变负载分布。如果控制器把每个阶段独立处理,就可能产生局部合理、串联失败的动作。

端到端策略原则上可以学习这些阶段之间的关系。它可能学会更好的接近角度能够减少抓取失败,也可能学会底座应当更早停下,因为机械臂需要空间闭合并包住物体。如果拥有足够多样的数据和合适的安全层,这种方法可以减少手写规划器之间脆弱的接口。

但端到端不等于魔法。策略仍然依赖观测空间、训练分布、动作限制、硬件状态和恢复设计。学习系统在熟悉场景中可能动作平滑、速度很快,却在经验边界处校准不足。控制器还需要识别自己不知道该做什么。对实体机器而言,不确定性不只是屏幕上的置信分数;它可能变成掉落的负载、意外运动,或迫使人员进入工作区域。

因此,近期最有希望的架构可能是混合式的。学习组件负责提出动作并解释场景;经典控制、碰撞监测、力限制、地理围栏和监督逻辑约束接下来会发生什么。不同任务的具体分工会有所不同,但商业部署需要的不只是一个在视频片段中看起来有能力的策略。

运营测试考验的是恢复,而不只是完成

仓库不会为机器人成功一次付费,而是为机器人长期完成工作付费。最昂贵的事件往往不是戏剧性的故障,而是那些需要员工停下来、清走物体、重新摆放周转箱、重启系统,或解释机器人为何突然变得谨慎的小中断。

因此,部署报告应当在任务成功率之外提供恢复指标。机器人多久会暂停一次?恢复需要多长时间?第一次抓取失败后,它能否安全回到已知状态?它能否识别失败原因,还是必须由人员检查现场?电池、夹具、摄像头或网络连接出现退化时会发生什么?

Agility 的申报文件称,客户部署累计运行时间超过 65,000 小时,并描述了九个客户设施中的部署或承诺。这些数字比一次舞台运行更能说明成熟度,因为它们指向了真实环境中的重复使用。不过,运行小时数也需要背景。仅凭公开材料,无法得到生产性小时、人工介入、正常运行时间、任务构成、节省的人工成本或每次完成搬运的成本等完整拆分。

恰当的解读既不应轻率否定,也不应盲目相信。这些小时数表明公司已经超越了只在实验室讲故事的阶段,却不能证明每种流程都具备经济性、每个地点都有相同表现,或机器人可以在没有支持的情况下运行。真实部署说明了工程能力和客户意愿,但并不会自动证明单位经济性为正。

当机器人离开工作单元,安全问题就变了

在围栏内或其他受控工作单元里,机器人可以围绕可预测的边界进行设计。在工人身旁运行的机器人需要另一套安全论证。它必须限制力量和速度,探测人员与障碍物,传达运动意图,安全停止,并以受控方式重新启动。软件更新、维护流程和异常处理也会成为安全系统的一部分。

Agility 的材料称 Digit v4 具备安全系统,并采用面向工作单元的部署路径;与此同时,公司把 Digit v5 定位为计划在人员周围协作运行的产品。作为产品策略,这种演进是可以理解的,但它也说明为什么不能把不同代际视为可互换。未来的设计目标不是当前的认证,营销图示也不是危险分析。

物理环境同样重要。在标记好的托盘通道旁安全运行的机器人,未必能在工人搬运长物体、叉车盲转或地面湿滑时保持安全。一次成功的操作运行,除非把这些互动纳入测试,否则几乎无法说明问题。环境越通用,安全论证就越必须覆盖少见但可预见的情况。

对买方而言,实际问题不只是“机器人安全吗”,而是“哪些危险由机器人控制,哪些由设施控制,哪些依赖人员流程?”这个问题会引出具体要求:限制区域、速度上限、急停装置、检查周期、操作员培训、事故记录,以及明确的停机路径。自主性是系统属性,不是贴在模型上的标签。

成本与成熟度:人形外观不等于价值

在人类已经建成的工作场所里,人形外观可能有用。双腿可以利用现有通道和楼梯;直立身体能够触及为人手设计的货架和接口。能够使用既有空间和工具,正是通用形态的理由。

这同时也是一种成本。双足机器人需要平衡控制、跌倒管理、更复杂的维护,以及比固定机械臂或专用轮式机器更大的安全范围。如果任务只是让周转箱沿平坦、可预测的路线移动,传送带、推车或移动底座可能更便宜,也更容易维持运行。只有当使用现有空间和工具的能力足以抵消复杂度成本时,人形机器人才能证明其复杂性值得。

商业模式和购买价格同样重要。机器人即服务可以把决策从资本支出转为运营合同,却不会让劳动力消失。客户仍需承担占地、集成、充电、监督、维护和异常处理的成本。一台月费不高但需要频繁人工介入的机器人,未必胜过专用设备;如果一套更昂贵的系统能覆盖多个流程,且不需要大规模重新配置,它反而可能合理。

这正是 Digit 当前的画像比宽泛的“通用机器人”语言更可信的地方。一套定义明确的工业流程,让供应商有机会测量产出并建立支持流程。如果数据表明下一个任务值得解决,产品可以继续扩展。商业路径更可能不是一次性到来的“人类替代”,而是一组边界清晰的工作,逐渐由不断增长的控制和运营平台连接起来。

会议之后应当关注什么

接下来有用的披露不会像 IROS 视频那样具有电影感。应当关注重复试验、任务描述、介入率以及来自第二个地点的证据。还应区分:一种策略只是完成路线,还是能够从物体被移动、人员进入路径或夹具失去抓持中恢复。

就 Digit 而言,公司公布的客户部署、运行小时数和 v5 计划,为检验新说法提供了基线。如果一项新演示被描述为 v4 的能力,就应当结合 v4 的载荷、运行时间、末端执行器和安全背景进行比较。如果涉及 v5,读者应区分计划中的规格与独立观察到的现场结果。

对于更广泛的人形机器人行业,也可以使用同一份检查清单:

  • 任务的价值是否足以证明复杂身体形态的合理性?
  • 机器人的工作速率是否达到运营者真正关心的水平?
  • 它能否识别并控制失败?
  • 有多大比例的时间需要人工参与?
  • 环境发生变化时会怎样?
  • 面向目标场景的安全控制是否经过验证?
  • 这些说法来自一支机器人队列,还是来自一次精心挑选的运行?

会场上的 Digit 演示值得报道,因为它显示出行业正在攻克一个真实瓶颈:把抵达任务地点与实际完成物理工作连接起来。它应当被报道为整合能力的早期信号,而不是通用自主性的证明。

这一区分也是当前评估人形机器人的实用建议。要求对方给出任务定义、分母、介入政策和恢复数据。一台能够完成一次困难动作的机器人,可能是令人印象深刻的研究系统;一台能够反复完成有用工作、在做不到时说明原因,并在与人共享空间时保持安全的机器人,才是可部署系统。两种描述之间的距离,将决定机器人业务的走向。

来源