铭鸿体育资讯网

DeepSeek最令美国恐惧的不是百万TOKEN费用更便宜,而是最终完成任务的费

DeepSeek最令美国恐惧的不是百万TOKEN费用更便宜,而是最终完成任务的费用同样碾压对手模型,因为一个任务需要几十轮,如果模型不够优秀,那么每一轮的费用加总后也有可能比TOKEN更贵的优秀模型费用要更高!

Artificial Analysis最新数据显示,在同一套AI综合能力评测中:DeepSeek V4 Flash 0731的平均任务成本只有0.03美元,综合指数为50。 Claude Fable 5的平均任务成本则达到3.15美元,综合指数60。

DeepSeek用不到1%的成本,拿到了Fable约83%的综合能力!这个数据是不是非常炸裂?过去大家只是关心百万TOKEN的费用,中美大模型的在这个费用上差异极大!但反映出来的数据并不准确,因为有个很简单的道理:

便宜的模型可能会因为反复在同一个任务反复试错,最终才完成任务,完成任务后一盘点才发现,便宜的模型每次价格确实非常低,但总得费用一加也不便宜,并且还因为消耗了大量的时间,两者一比较,反而损失可能更大!

我们大约使用Qoder编程开发了一年多,应该还是有些发言权的,记得去年在调用0.1x模型修改一个软件逻辑时一次基本是搞不好的,可能需要反复调用很多次,有时改错了还得回滚,搞到后来脾气也没了,老老实实自己去修改,要么耐着性子拆解步骤等AI慢慢一步步搞。

但是今年发现0.1x的模型也很灵光了,一般简单任务一次搞定,本来还想刷个手机消磨下时间,结果根本就不用等,立马搞定!逼着你不断给它任务,效率确实提高不少!

Artificial Analysis的统计方式尽管没法完整表现完成一次完整任务的消耗,但它已经最大限度的反映了实际Token的消耗,更接近“在标准化评测工作负载下,实际产生的平均账单”,所以说Artificial Analysis最新数据统计还是可以非常明显的反映出TOKEN的实际消耗。

模型好不好用,当然是用户最有发言权,X社交媒体上都是AI玩家的实际案例,比如有网友就表示,一个13B激活的便宜Flash模型,纯靠后训练就直接把代码Agent能力干涨7倍,价格还是地板价,这算是今年最大的惊喜了!

这个V4 Flash看着有284B(2840 亿)参数,但每次推理只激活13B(130亿)参数激活,显存占用、算力消耗远低于同效果稠密大模型,速度更快、成本更低。这就表示部署要求更低,可以用更少的算力资源部署这个模型,还能拿到接近于顶尖的Claude Fable 5模型!

工具调用、全栈开发、终端操作这些Agent核心场景,大部分指标都追平甚至超过了贵好几倍的中大型模型,部分硬榜已经摸到Claude Opus 4.8的尾巴!这个玩法真要把美国大模型给搞死了!DeepSeek又一次开辟了一个赛道:

之前大家都觉得模型能力涨就得堆参数、烧算力就能搞出超级优秀的大模型,但是这次DeepSeek只是后训练和Agent对齐磨到位,小激活模型照样能干旗舰的活,卖白菜价的TOKEN依然有钱赚。

没有人能拒绝优秀大模型的白嫖,同样也没有人能拒绝低价的诱惑,更要命的是性能还差不多,美国OpenAI、Anthropic这些顶级大模型动辄烧钱数千亿的玩法,越来越没有人相信了,全球开发者正在用脚投票告诉美国人闭源大模型们,中国开源优秀大模型正在占据全球AI模型的主流!