把 AI 丢进真实企业代码库:八个模型全卡住,榜单第一也只有 38.8%公开榜单上动辄七八十分的编码 Agent,换到别人公司的真实代码库上,最高分只有 38.8%。这是 Specific Labs 在 09-12 发布的 Real-SWE 给出的结果:题目不是专家编的、也不是合成的,而是从合作公司授权的私有生产代码库里取出来的真实工单,评的是「模型 + 原生 harness」这一整个组合。
榜单前四是这样:Fable 5.1 配 Claude Code 38.8%,GPT-6 Astra 配 Codex CLI 33.8%,Gemini 3.8 Flash 配 Gemini CLI 31.2%,GLM 5.3 配 Claude Code 28.8%。再往下是 Grok 4.6 和 Muse Spark 1.3 并列 23.8%,Kimi K3 18.8%,GPT-5.6 Sol 16.2%。每个任务跑八次独立运行取平均,也就是 pass@1 的口径。
钱和分数不成正比,这点比排名更值得看。单次 rollout 的平均估算成本从 2.50 美元(Gemini 3.8 Flash)到 6.96 美元(Fable 5.1);最便宜的 GPT-5.6 Sol 花 2.65 美元却只拿到 16.2%。题目环境也说明难度:样本任务来自一个有 20 万+ 用户、上过 App Store 前 100 的社交 App,一个处理过 10 万+ 银行账单的消费金融平台。
限制必须一起读。这些代码库不对外,外部无法复现,HN 上有人直接管它叫「pinky-promise benchmarking」(空口承诺式评测);每个任务只有八次运行,样本小;结果由发布方自己评估,不是第三方;也有开发者表示体感和榜单对不上,比如有人觉得 Gemini 3.8 Flash 排到第三这件事本身就说明榜单离实际使用很远。
我的判断:公开 SWE 类分数不能外推到自家仓库。要给团队选编码 Agent,就拿自己库里 10 到 20 个真实任务重测一遍,把「能改对」和「一次改对要花多少」分开记——这份榜单单是证明了这两件事跟公开排名都不一致。
