铭鸿体育资讯网

Paweł Huryn 在两个真实代码仓库中测试了前沿 AI 模型,让它们寻找并

Paweł Huryn 在两个真实代码仓库中测试了前沿 AI 模型,让它们寻找并修复预先植入的 105 个 Bug。GPT-6 Astra 以修复 48 个 Bug 领跑,其次是 Fable 5.1(43 个)、GPT-5.6 Sol(42 个)和 Gemini 3.8 Flash(20 个);Astra 的速度大约是其他模型的两倍,成本也更低,但同时也表现出了独特的盲点。因此,他建议将实现工作交给 Astra,而代码审查则交给 Fable 或 Sol。