铭鸿体育资讯网

看到一篇文章,把harness工程讲的很透彻,我们总是听到deepseek harness,却有可能不知道大模型和harness到底啥关系,为啥deepseek 要搞harness? harness相对于大模型,有点类似人体四肢器官相对于大脑的关系,大模型的任务是思考,但没法干活,需要harness去处理文件、写代码、操作命令行、测试、de ​

看到一篇文章,把harness工程讲的很透彻,我们总是听到deepseek harness,却有可能不知道大模型和harness到底啥关系,为啥deepseek 要搞harness?

harness相对于大模型,有点类似人体四肢器官相对于大脑的关系,大模型的任务是思考,但没法干活,需要harness去处理文件、写代码、操作命令行、测试、debug等各种实操工作,然后把结果返回给大模型,大模型再给出下一部指令。

现在ai行业卷模型性能已经到了边际效应越来越低的阶段,新模型多跑几分其实意义不大了,真正能抢占用户、拉开差距的反而是harness,几乎没有悬念,谁不做harness,谁就会退场。

codex、claude code、workbuddy这几个就是harness,几乎占据今年最主要的用户时间和收益,因为它们能干活,能创收,是实实在在的生产力工具。像豆包尽管靠聊天狂揽近2亿用户,但是现在还是推出豆包工作,不得不发展harness,因为聊天它不挣钱啊,用户粘性也差很多。

这个文章把一个完整的harness拆成了6块,首先是tools,它非常重要,是一组大模型可以识别的函数,用来找工具组件、执行代码任务,等于干活的家伙。

然后是loop和memory,这俩货一个负责把工作流串起来,另一个负责保存和管理历史对话,就像你把大象放进冰箱,动作包括:打开冰箱、放进大象、检查、关上冰箱,有严格的步骤,以及要记得自己做过什么。

再者是Context,管理上下文,现在ai基本百万上下文起步,所以不可能每次任务都塞进去百万,所以要管理上下文,合理的输入输出。

紧接着是Sandbox,也就是隔离环境,每个任务有独立的系统、储存、依赖环境,互不干扰,清清爽爽,就不容易犯错误,也能更方便大模型来管理,节约成本。

最后是明确目标 + 验证,这里需要你明确验收标准,比如自己写AGENTS.md / CLAUDE.md,或者让harness调用大模型写,直接决定产出物的质量。

除此之外还有权限管理、日志管理、evals测试,都是harness的要素。

上面的不是理论,是dsh、codex这些harness都在做的事,目标指向一个,那就是让harness更稳定、扎实、好用。

我感觉模型肯定会越来越强,但ai模型公司只做模型会变成单腿走路,“怎么让模型真正能干活”这件事,会越来越重要。科技先锋官大模型how i aiaiagent