铭鸿体育资讯网

📌 MS 公布了无需微调即可让代理变聪明的技巧(已亲自验证)•SkillOpt

📌 MS 公布了无需微调即可让代理变聪明的技巧(已亲自验证)

•SkillOpt:模型保持不变,仅训练指令手册(技能文档)的方式•best_skill.md:300~2000 令牌的压缩指令手册,部署时额外计算为零•validation gate:如果验证分数不提升,该修改就被直接丢弃

1) 从概念开始。这不是微调(直接调整模型权重的方式)。更接近于文本空间中的梯度下降。因为模型重新训练成本高昂且难以回滚。相比之下,文本文档的修改、丢弃和回滚非常简单且成本极低。

2) 工作原理。有一个独立的优化器模型,它会查看代理实际工作记录(轨迹),然后建议在技能文档中添加/删除/替换编辑。但是,这种编辑只有在实际提升验证集分数时才会被采纳。否则就被丢弃。因此,不是任何编辑都会累积,而是只有通过验证的才会被逐步积累的结构。

3) 为什么有趣。报告称在 6 个基准测试、7 个目标模型、3 个运行环境(直接聊天、Codex CLI、Claude Code CLI)中,取得了全区间最高或并列最高性能(需确认来源,自家公布数据可能有夸大嫌疑)。此外,最近还添加了夜间自我进化功能:编码代理会在每晚回顾过去会话,只有通过验证关卡的才会固化为长期记忆和技能。感觉和 GitHub 程序员睡觉时整理记忆有点神似。

不过,这是否真是全新范式还有疑问。毕竟有人会反驳说,这本质上不就是精心设计的提示自动化吗。模型本身的局限性是无法逾越的。或许这只是个名字响亮、实则优化提示的工具而已。

💬 MS 将自动进化指令手册(而非微调)的项目开源了。模型保持不变、只让指令手册变聪明,成本负担大幅降低。不过,这到底是下一代学习方法,还是只是精巧的提示工程自动化,还得再观察观察 🤔

AI에이전트 프롬프트엔지니어링 SkillOpt

🔗 参考信息:•“SkillOpt 存储库说明及发布笔记” : 网页链接•“SkillOpt 文档及复现指南” : 网页链接