铭鸿体育资讯网

李飞飞时隔近两年再上 a16z 播客,信息量拉满。 这次聊的是 World La

李飞飞时隔近两年再上 a16z 播客,信息量拉满。
这次聊的是 World Labs 收购 SceniX 之后,机器人赛道的全盘布局。有句话特别值得琢磨:人也不全靠现实数据学习啊。
什么意思?人在行动前会在脑子里做大量模拟,推演那些没发生过、没法发生、或者没有足够真实数据的事件,然后从推演中学习怎么行动。足球比赛的战术推演、下棋时的算路,本质都是反事实推理。
机器人也一样。你不可能为所有可能遇到的情况都采集到足够的真实数据,仿真承担的就是真实数据承担不了的角色。
这也是 World Labs 收购 SceniX 的核心逻辑。
先说背景,挺有意思的。SceniX 最初其实是 World Labs 的客户,去年冬天 Marble 生成模型发布后,SceniX 第一时间就注册用了。后来李飞飞发现是自己以前的博士后李昀烛的公司,一聊才发现两边能力高度互补。
SceniX 做的是 real-to-sim-to-real 管线,把真实环境映射到高度对齐的数字世界里。对齐的意思是,数字世界里发生的事,在真实环境里也应该能发生。这样原本必须在真实环境里做的数据采集和评估,就能部分由可规模化生成的数字数据替代。
为什么要这么做?因为机器人领域最头疼的问题就是数据太少了。语言模型可以从互联网捞海量文本,但机器人不行,真实环境采集又慢又贵又危险。要让机器人真正工作,必须释放 scaling law 的力量,但数据从哪来?整个行业都在追问这个问题。
有人说纯视频模型路线也能做,为什么非要强调三维和仿真?
李昀烛的回答很实在:机器人工作的世界必须有一致性,空间一致、时间一致、不同视角一致、不同交互方式一致。视频模型进步很快,但经常出现你推一个物体它却离奇失踪的情况,这种结果给不了机器人正确的行动信号。
当然不是二元对立。模型不必只靠物理,也不必只靠学习,可以在两者之间,既抓住问题的本质结构,又能随数据积累不断改进。
更值得关注的是 World Labs 的定位。他们不做机器人大脑,不做硬件,做的是基础设施 —— 数字世界。
平台不挑机器人,单臂双臂、固定移动基座、各种夹爪末端执行器,都能放进数字世界里跑。也不挑模型,从头训练新模型也行,微调现在流行的 VLA 模型或世界动作模型也行。
李飞飞那句话很到位:具体用哪个模型其实不重要,因为模型总会换代,但基础设施不会。
这个判断挺清醒的。现在大家都在卷模型卷硬件,但机器人要真正规模化落地,中间缺一层可靠的数字训练场和评估场。真实环境评估有多慢?验证一个 2% 的提升可能要跑很久,迭代速度比语言模型慢好几个数量级。
仿真的价值不止效率,还有可靠性。在数字世界里可以系统地随机化光照、几何、物理参数,确保覆盖足够的状态空间,这在真实环境里几乎做不到。
落地路线也很务实。从完全结构化的工厂,到半结构化的仓库、餐厅、酒店,再到非结构化的家庭,一步步来。先攻克半结构化场景,走一条更可持续的路,而不是一上来就冲家庭通用人形机器人。
两年后的目标也很具体:在几个重要垂直用例里拿到经过验证的灯塔客户,证明这套基础设施确实能帮客户解决自动化需求。
做科技媒体观察下来,机器人行业现在有点像早期的 AI—— 大家都在卷模型卷算法,但底层的数据基础设施还没搭起来。World Labs 选的这条路,就是想把机器人的 scaling law 给真正释放出来。
模型会换代,硬件会迭代,但数字世界这套基础设施,会是长期的地基。
李飞飞 World Labs 空间智能 机器人仿真 具身智能