铭鸿体育资讯网

原来AI不是看不懂,而是转不过弯

做多模态或者具身智能的朋友,估计都对大模型的空间推理能力挺无语的。

视角稍微一变,模型立马开始胡说八道。以前大家都觉得是 Transformer 缺乏物理直觉,根本不懂三维世界。

但 MirroS 最近这篇机制可解释性研究,把多模态大模型的中间层彻底扒开了。

结论相当反直觉,模型内部不仅理解空间,甚至在隐层激活里悄悄维护了一张精度极高的连续 3D 坐标系,也就是 S-Space。

研究人员做的一组因果实验非常硬核。直接去修改中间层里的坐标数值,模型输出的相对位置描述会立刻跟着改变,但如果问它物体的颜色,回答毫无影响。

这证明模型做空间判断时,确实是在实时读取这张内部几何地图。甚至对于画框外未出镜的足球、牵引绳另一端看不见的主人,模型都能在内部地图里自动脑补出相对位置。

那为什么换视角测试时模型会大溃败?

关键就在于研究者把感知和计算彻底拆开之后的惊人对比。

以 Qwen3.6-27B 为例,直接让模型回答准确率只有 60.96%,即便开思维链也就 83.56%。但如果只用模型提取的 S-Space 原始坐标,把后续的视角旋转交给外部一行 Python 矩阵旋转代码去算,准确率直接跳到了 95.21%。

这就说得很透彻了。模型的感知精度本身完全够用,真正拉垮的是让注意力机制在隐层里去硬算三维几何变换。

对做工程的人来说,这个结论非常有用。做具身智能和空间 Agent,没必要迷信端到端硬解一切。

让大模型负责高维感知与拓扑提取,把几何旋转、坐标映射交给外部数学工具,才是现阶段最靠谱的落地方向。

#AI #具身智能 #大模型 #多模态 #AI算法 #人工智能