铭鸿体育资讯网

GLM-5.3 Flash来了:能力不输前沿模型,API价格却低得离谱 智谱最

GLM-5.3 Flash来了:能力不输前沿模型,API价格却低得离谱
智谱最近发布了 GLM-5.3 Flash。
如果只看名字,很容易把它理解成一个“缩水版 Flash 模型”,但这次其实不太一样:它并不是单纯靠砍能力换低价,而是在模型架构、长上下文和多模态能力上都做了明显调整。
最值得关注的地方,是它把“前沿模型的能力”和“便宜到可以高频调用的价格”放到了一起。
GLM-5.3 Flash 总参数为 320B,但每次只激活约 18B 参数,采用稀疏注意力和线性注意力结合的混合架构。相比 GLM-5.3,官方称其注意力计算量降低约 3.01 倍,KV Cache 降低约 4.44 倍。
简单理解就是:模型依然很大,但每次真正参与计算的部分更少,同时尽量降低长上下文带来的成本。
它支持文本、图片、视频和文件输入,拥有 100 万 Token 上下文,最大输出 128K Token。
这意味着它不仅适合普通聊天,还特别适合几类任务。
第一类是 Coding 和 Agent。
比如写代码、修改整个代码仓库、调试、调用工具、执行自动化流程等。尤其是 Agent 场景,一个任务往往需要反复调用模型几十次甚至上百次,这时候模型单次调用便宜一点,最终成本差距会非常大。
第二类是长文档和长代码处理。
100 万 Token 上下文意味着它可以一次性读取非常大的材料,比如长报告、大型代码库、多个文件,或者作为 RAG 和研究 Agent 的底层模型。
第三类则是多模态任务。
GLM-5.3 Flash 可以直接看截图、网页、视频和文件。比如前端开发时,可以让模型一边写代码,一边查看实际渲染出来的页面,再根据视觉结果继续修改。
而真正让 GLM-5.3 Flash 显得特别的,其实还是价格。
官方 API 标价为每 100 万 Token:
输入 0.15 美元,缓存输入 0.03 美元,输出 0.50 美元。
目前还有限时 5 折活动,输入甚至只需要 0.075 美元,输出 0.25 美元。
这个价格意味着,过去很多“模型能力够强,但调用太贵”的任务,现在开始变得可以大规模尝试。
比如让 AI 长时间跑 Coding Agent、批量整理资料、做网页自动化、反复读长文档,甚至作为某个 AI 产品的默认模型。
当然,它也不是“什么都能替代”。
官方和公开 Benchmark 显示它已经进入前沿模型能力区间,但 Benchmark 并不等于所有真实任务中的体验。对于极复杂的软件工程、极限推理,或者对稳定性要求非常高的任务,顶级闭源旗舰模型依然可能更加可靠。
所以我觉得 GLM-5.3 Flash 最准确的定位不是“最强模型”。
而是:
一个已经足够强,同时便宜到可以放心高频使用的前沿模型。
如果未来 Agent 真正开始大量进入我们的工作流,那么模型之间竞争的重点,可能不再只是“谁单次回答最好”。
而会逐渐变成:
谁能在足够强的前提下,把每一次智能调用的成本降得更低。
从这个角度看,GLM-5.3 Flash 可能比单纯刷新一个 Benchmark 第一名,更值得关注。