清华、电子科技大及其他中国高校的一篇新论文发现:AI 智能体能连续数小时优化一份训练方案,却几乎意识不到方案本身已经错了的时候。
一旦训练开始,AI 智能体最初采用的策略,往往会变成它此后不断优化的那个策略。
在 1,338 条后训练轨迹中,3,557 次相邻训练实验仅有 74 次(2.1%)改变了高层策略。
多数迭代停留在同一方法内部,调调数据、超参数、格式,或修修 bug。
这些智能体并非无所作为。它们能够训练、评估、诊断失败,并改进检查点。
问题出在:当证据提示整个方法都该换的时候。
加入实验日志、技能库与评估器后,相较 Opus 4.6 基线,GSM8K 提升 12.6 分、HumanEval 提升 40.8 分——却仍未触发策略层面的改变。
人类指导能在训练前把方向扳回来,可一旦训练开始,智能体又会回到局部调参。
即便推理 token 增加 2–8 倍,换来的也多是更细的打磨,在 AIME 2025 上几乎无可靠增益。
对 AI 研发智能体而言,缺失的机制或许是一个显式触发器——去重新打开策略本身,而非只是持续优化它。
— 论文:
arxiv.org/abs/2608.19072 标题:
What is Missing from AI Post-Training AI: An Empirical Analysis
(《AI 后训练中缺失了什么:一项实证分析》)
#AI反常识howto #howto用好AI #ai #大模型 #深度学习 #文献 #带你一起读论文
