ICLR'26:针对CoT的动态算力分配框架
📊 2026 ICLR (CCF A)
📄 标题 Adaptive Thinking: Large Language Models Know When to Think in Latent Space
❓ 背景
大语言模型(LLM)在回答前进行“思考”(即内部的思维链推理)能显著提升复杂任务的表现,但为所有问题分配固定的思考算力极不高效。简单问题会因过度思考浪费计算资源,而复杂问题则可能因预算不够而思考不足。现有的自适应分配方法要么依赖无法反映真实推理难度的表层指标(如输出熵),要么需要耗费极高的在线计算成本,难以实际应用。
⚙ 核心设计
为了实现“算力与问题难度精准匹配”,作者提出了一个轻量级的动态算力分配框架 Sonata:
① 确立自一致性为核心指标:作者发现“自一致性”(模型多次独立回答得到相同答案的概率)是判断思考必要性的完美代理指标:问题的一致性越低,越需要模型进行长思考。
② 隐空间特征聚类:研究证明,具有不同自一致性级别的问题,在模型最后一层的隐藏状态(Latent Space)中表现出高度的可区分性,自然形成了不同的聚类。
③ 轻量级预测适配器:Sonata 在线下利用校准数据集训练了一个极轻量的适配器(双层MLP)。在实际推理的预填充(Prefilling)阶段,该适配器直接读取查询语句的隐藏特征来预测自一致性,并在生成回答前瞬间决定是否需要开启思考以及分配多少预算。
📊 实验结果
卓越的降本增效能力:在 Qwen3(8B至235B规模)及 GPT-OSS 等多个模型上,Sonata 在维持原有准确率甚至带来最高 2% 精度提升的前提下,将思考 Token 的消耗大幅缩减了 20% 至 60%。
强大的零样本迁移性:仅在单一数学数据集上训练出的适配器,展现出了极强的泛化能力,能够无需重新微调直接应用于科学推理(GPQA)和代码生成(LiveCodeBench)等跨领域任务中,并维持稳定的算力节省效果。
极低的延迟与高兼容性:该方法引入的推理计算额外开销不到千分之一,且能与现有的思维链压缩或提前终止技术(如 REFRAIN)无缝叠加,进一步优化整体推理效率。
网络安全 LLM 智能体 AAAI 研究生 计算机 ICLR SCI论文 思维链

