机器人进没进过的家就能干活:30 户零样本测试,成功率从 9% 提到 56%
人形机器人现在的通病是"一地一训":换一套房子就得重新采一遍数据。Figure 在 9 月 17 日发布的 Helix 2.5 给了一个不同答案——先在一块叫 Index 的人类行为数据集上预训练,再把同一个基础模型适配成三个全身动作(收拾客厅、叠毛巾、铺床),然后带进 30 户湾区人家:这 30 个环境以及里面被操作的物品,一条数据都没采过,也没有微调。
最有说服力的数字是那组消融:任务数据、架构、训练和评测全部固定,只把 Index 预训练加进来,零样本成功率从 9% 提到 56%。同时任务数据量只有上一代 Helix 02 某个代表性行为的一半,泛化范围却从单个环境扩到 30 个,官方换算成"规格便宜一倍、范围扩大 30 倍"。他们还报告了一条人类行为数据到机器人动作的缩放律——反复翻倍预训练数据后,最大一次训练的 loss 能提前预测到小数点后四位。
数据集本身也公开了构成:26.4 万次 App 下载、108 个国家、4.4 万周活贡献者,每天上传的视频相当于 4.9 年人类工作量,已向贡献者支付 1,500 万美元,每 1,000 小时数据含 373 类任务、1,146 种被操作物体、116 种环境。
这是厂商自测,56% 意味着还有四成多会失败,评测只覆盖三类家务;预训练数据来自人类第一视角视频,而不是机器人本体采集,跨形态迁移和安全性边界都没有公开结论;Figure 自己也写了"不是说通用人形机器人已经解决"。
我的判断:这条的价值不是"机器人会做家务了",而是把"泛化可以从人类数据里买"这件事摆上了台面。做具身智能的团队,下一轮数据预算怎么分——本体遥操作采集和人类视频之间——得重新算一遍。
