铭鸿体育资讯网

AI 评测正在从Benchmark走向 Eval Harness

这两个月,AI 圈一直在讲 Harness。
Claude Code、Codex、DeepSeek Harness 都在证明一件事:同一个模型,换一套工具、Context、Loop 和 Runtime,最终表现可能完全不同。

现在,这个思路开始进入 Benchmark。
MirroS 联合清华、北大、MIT、Berkeley、CMU、NVIDIA 等 15 家高校及研究、产业机构发布了 HarnessEval。
它最有意思的地方,不是又做了一套新的评测题,而是把评测本身 Agent 化了。

传统 Benchmark 通常是:数据集 + 固定指标 + 一个最终分数。

HarnessEval 则会先理解当前 Case,再动态选择 Eval Skill、调用工具、拆分子任务、收集 Evidence,最后生成评测结果。

也就是说,它不只是告诉你:
模型得了多少分。
还试图回答:为什么是这个分?哪里做错了?证据是什么?

官方目前构建了 330 个评测 Case、11 个专业 Eval Skills,并对 18 个世界模型进行了 5,940 次 rollout。

我觉得这里真正值得关注的是一个趋势:Benchmark 正在从“数据集”变成“评测系统”。

过去我们建设 Eval,重点往往是准备评测集、定义指标、批量跑分。

但到了 Agent 时代,复杂任务越来越 Case-specific,同一个评测集里的不同任务,本来就未必应该用完全相同的方式判断。

未来更合理的模式可能是:
Eval Dataset 决定“测什么”,Eval Harness 决定“怎么测”。

先理解任务,再选择评测 Skill; 再拆解判断过程,绑定 Evidence; 最后不仅给 Pass / Fail,还能解释 Why Fail。

当被评测对象已经从 Model 变成 Agentic System,评测系统本身,可能也必须 Agentic 化。
大家都在研究 Agent Harness。

现在看来,Harness 的下一站,很可能就是 Eval。

#Benchmark #Harness #AIEvaluation #HarnessEval #AI #Agent #AgentHarness