铭鸿体育资讯网

面具身算法岗被问烂的题,但 90% 的人答不到点上👇 ❌错误回答 "WAM 是

面具身算法岗被问烂的题,但 90% 的人答不到点上👇
❌错误回答
"WAM 是世界模型,VLA 是视觉语言动作模型,它们不一样。"
——等于没说,面试官想听的是本质区别和技术取舍。
✅正确答题框架
1️⃣先定义核心公式
VLA:视觉 + 语言 → 动作(reactive policy,直接映射)
WAM:当前观察 + 动作 → 未来观察 + 未来动作(显式建模动作后果)
2️⃣本质区别
VLA 像条件反射:看到杯子→伸手抓,不预测后果。
WAM 像先想再做:内部模拟 "伸手会不会碰倒杯子"→再决定怎么抓。
3️⃣为什么 WAM 泛化更好
VLA 学的是 "这个画面对应这个动作" 的映射,新物体新场景容易崩。
WAM 通过视频预测学到了物理动态(物体怎么动、碰撞会怎样),理解 "做这个动作世界会怎么变",所以新任务泛化更强。
4️⃣各自适用场景
简单结构化任务→VLA 够了,推理快
接触丰富、需要预测后果的任务→WAM 更有优势
实际中两者融合:WAM 提供物理先验,VLA-style head 输出动作
💡加分项
提到 DreamZero 的核心 insight:video diffusion backbone 里已经学到了世界动态,联合训练视频和动作比纯行为克隆泛化好。
⚠️避坑
不要说 "WAM 一定比 VLA 好",面试官会追问 WAM 推理慢、训练复杂的问题。要讲 trade-off。
WAM VLA 具身智能 机器人 AI 面试