最强Agent改算法只拿0.25分
这篇把“AI 自我进化”这事终于讲清楚了——读完我第一反应是,别再吹了。很多做 LLM Agent / AutoML 的同学都有同感:跑 Kaggle 类基准,分数看着还行,但一上真实算法设计任务就露馅。AI4AI-Bench 这台新基准直接撕开遮羞布:最强系统 Claude Opus 5 平均分 0.250(基线 0.1,最优 1.0),42.8% 的自动改动比仓库原版更差。
⚡ 核心设计亮点
① 冻结 10 个研究仓库,覆盖 10 种不重复训练算法族(SFT、RL、蒸馏、剪枝等),让算法设计成为唯一变量。每个任务只允许 agent 修改源码,4 小时探索,最多 12 小时训练,评估器对 agent 隐藏。这意味着任何分数差异都只能归因于代码变更,没得甩锅。
② 进度坐标 φ + 三个锚点(无信息模型、仓库原算法、最优)把不同量纲的指标统一映射到 [0,1] 刻度。困惑度、准确率、美学分数都能直接平均,基线 0.1 正好对应仓库自带的算法。这个设计让跨任务比较变得可信,不像以前各说各话。
③ 对提交的 diff 做 8 族行为分类:运行侧(训练时长、超参、检查点、容量)与学习侧(损失、监督、更新规则、数据)。统计触及学习侧的比例,把“是否改成算法设计”变成可检验的命题。结果很残酷:263 个有效修改里,141 个完全没碰学习侧。
📊 落地效果 / 关键数据
- 最强 Claude Opus 5 平均 0.250,最佳 0.288,离最优 1.0 差一大截;
- 290 个 cell 中 124 个低于 0.1,19 个直接 0 分,其中 12 个集中在最低两档推理努力;
- 触及学习侧的提交平均 0.226,未触及仅 0.126,差距 0.100±0.022;
——
📄 论文:AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
🔗 arXiv:2608.20318
📚 每天为你拆解 1 篇 AI 前沿论文|久久为功,积累认知
欢迎关注、收藏、转发 ❤️
AI4AIBench LLMAgent 递归自我改进 AutoML 算法设计






