[AI]《Full-bandwidth transformer》X Wang, Z Cai, Z Zhan, H Dong… [Johns Hopkins University & Princeton University & Microsoft] (2026)
在自回归语言模型领域,如何提升每个生成步骤的计算深度是一个悬而未决的难题。过去的方法受困于逐词生成的反馈机制,本质原因是模型每步的内部思考(顶层隐藏状态)被丢弃,只有单个词元被回传,信息带宽极窄,导致“非语言化”的中间计算被冻结。
本文的核心洞见是:把「下一步」的输入,重新看作「上一步词元」与「上一步完整思考」的融合体。由此,将上一步的顶层隐藏状态通过门控单元,与新生成的词元嵌入向量融合,再作为下一步输入这一关键操作,使冻结的计算得以重回模型底层进行再处理。
这项工作真正留下的遗产是一种“计算换数据”的新范式。它为后来者打开的新门是:让模型在不“自言自语”的情况下进行深度内部迭代,实现更短、更准的推理。但其训练依赖于复杂的多轮次目标,无法直接并行,这便是尚未跨过的应用门槛。
arxiv.org/abs/2608.08888 论文 人工智能








