ReflexVLA :快速+预判,反应关键操作
🎯 一句话概括
现在的机器人VLA模型只会"看一眼动一下",面对滚动的球、传送带上的物体——等你反应过来,东西早跑了。ReflexVLA 让机器人既能预判未来,又能快速出手,像人的反射一样。
🤔 解决什么问题?
1、推理延迟 :看到当前画面→想→动,等"想完"物体已经不在原位了
2、无预判能力:只对"现在"做反应,不会预判"下一秒球会滚到哪"
打个比方:打乒乓球时,你不能等球到了面前才挥拍——要预判轨迹、提前到位。
💡 核心方案
🏟️ ReflexBench — 6个动态任务基准
见图3
评测支持延迟感知:可注入真实延迟,同步/异步推理解耦评估。
🤖 ReflexVLA — 三大设计
1️⃣ 潜在未来预测
· 不生成未来图像(太慢),而是预测DINOv3的语义潜变量
· 追加H个future token,经Transformer后用掩码余弦相似度损失监督
· 与动作预测联合优化,计算开销几乎可忽略
比喻:不是画一张未来画面,而是在脑子里"想一下"未来大概长什么样。
2️⃣ 多帧时间融合
· 在视觉骨干中间层做跨帧时间融合(非简单拼接)
· 因果时间注意力,防止未来信息泄露
· 融合后序列长度不增,无额外注意力开销
比喻:看连续几帧提取运动趋势,而不是记住每一帧。
3️⃣ 推理延迟优化
· 批量视觉编码:V×T张图单批次送入,减框架开销
· CUDA Graph捕获重放:固定计算图一次编译,部署时直接回放
· 不改架构、不改学习目标,纯工程加速
📊 实验结果
消融路径(逐步叠加的效果),见图4
对比基线,见图5
1B小模型打平4B PUMA、碾压7B OpenVLA!
· LIBERO静态基准:97.2%,与最佳相当,证明动态设计不损泛化
· 真实世界:AgileX Piper臂,传送带16/20次成功,超SmolVLA(2)、媲美PUMA(13)
🔮 未来方向
· 将预测/时间模块纳入大规模预训练,释放更大潜力
· 探索更先进推理机制(如RTC实时控制等)
·
@科学薯 当科研人有了AI搭子
AI进化生活howto 人工智能 具身智能 深度学习 人工智能发展世界模型 VLA 数据科学




