Xiaomi-Robotics-1 引发关注,并不只是因为演示视频里机器人在处理衣物和行李。更重要的是它提出了一个更大的命题:机器人学习也许终于有了类似语言模型的规模化路径。小米称,这个 vision-language-action 模型使用超过 100,000 小时的真实世界操作轨迹进行训练,这些轨迹通过 UMI 设备采集,随后又用跨机器人形态的数据进行 post-training,其中包括真实家庭中超过 7,200 小时的机器人数据。

机器人基础模型执行家庭操作任务

机器人领域长期受限于数据。文本和图像模型可以从海量互联网数据中学习,机器人却需要真实物理交互:接触、力量、滑动、变形、失败和恢复。如果小米的方法有效,价值会从单个硬件演示转向数据管线、跨形态训练和可复用的操作策略。

XR-1 的核心主张

XR-1 是面向移动操作的 VLA 模型,把视觉输入、自然语言指令和机器人动作连接起来。第一阶段用超过 1,700 个场景中的 UMI 轨迹做预训练,第二阶段再用真实机器人和开源机器人数据对齐到具体任务与机器人身体。

这些任务看起来很日常:整理沙发、分类鞋柜、收纳厨具、装载衣物、打包箱子。正因为日常,所以困难。布料会变形,拉链会卡住,物体会滑落,房间光照和摆放随时变化。机器人需要的不只是识别物体,还要处理接触、双臂协调和失败恢复。

为什么仍然需要怀疑

小米给出了适应新任务和多个 benchmark 的结果,包括 RoboCasa、RoboCasa365、VLABench 和 RoboDojo。官方页面还提到在每个任务少于 10 小时和少于 40 小时示范数据时的成功率提升。这些结果值得关注,但不等于家庭产品已经成熟。研究中的高成功率,在真实家庭中可能仍然不够可靠。

Hacker News 的讨论很有代表性:有人兴奋于机器人终于可能处理家务,也有人追问视频是否经过选择、失败次数是多少、模型权重何时开放、能否迁移到其他机器人身体,以及安全和隐私如何保证。

开放性会决定影响力

Xiaomi-Robotics-1 的 GitHub 仓库已经存在,但核查时主要包含 README 和 PDF;论文表示代码和模型 checkpoint 将会发布。这个差别很关键。没有权重、推理代码、评测脚本、许可证、数据说明和硬件假设,项目仍然只是强有力的发布。真正开放后,研究者和创业公司才能测试它是否能离开小米自己的环境。

数据来源也需要透明:是否有同意机制,如何保护家庭隐私,任务分布如何,失败和恢复是否被记录。机器人数据不仅要大,还要可理解、可审计、可复现。

可能先落地的地方

家庭机器人最吸引人,但第一批可靠应用可能出现在半结构化环境中:仓库、酒店后场、照护辅助、家电测试、轻型物流。那里任务仍然复杂,但范围可以限制,也可以收集更多示范并系统记录失败。

因此,XR-1 并不能证明通用家务机器人已经到来。它更像一个信号:机器人正在认真采用 foundation model 的方法。真正的转折点需要公开 checkpoint、独立复现、失败率、硬件成本、隐私规则,以及在混乱真实空间中的安全运行。