一个98%缓存命中率的账单,把开发者整不会了。
有团队在Codex运行中取得了98%的缓存命中率,处理超过700万输入词元,原本能跑5小时的配额却在短时间内被烧光。
问题不在缓存本身。GPT-6 Astra输出单价高达每百万Token 50美元,高频轮询的累加效应轻松吞掉缓存省下的差价。省的是零头,烧的是大头。
这组数据揭开的不是缓存失灵,而是一个被忽略的账本结构。90%折扣只作用在输入侧,而输出单价是输入的五倍。
同一份材料连续使用十次,后续九次全部命中缓存,这段重复输入的成本理论上能省下78.5%,但整个账单的降幅远没有这么乐观。
缓存写入本身就是一笔容易被忽略的前置开支。GPT-6 Astra的缓存写入单价是每百万Token 12.50美元,比常规输入还贵25%。
官方定价表写得清清楚楚,输入10美元,缓存读取1美元,缓存写入12.50美元,输出50美元。把前缀写进去却没有被高频命中,成本反而比不用缓存更高。
输出端才是账单失控的真正源头。我认为开发者盯着命中率这个指标,恰恰落入了误区。命中率只衡量输入侧有多少内容被复用,但真正烧钱的是模型每轮生成新回答的推理过程。
高频轮询意味着每一次调用都在输出端产生新费用,输入省下的部分很快被淹没。
调用结构比缓存配置更值得关注。缓存要求请求前半段完全一致,共享前缀至少需要达到1024个输入Token才能触发。
工具定义、系统指令、参数配置任何一处变动,之前的缓存前缀立即失效。开发者在优化缓存参数的时候,往往忽略了调用频率和轮询节奏才是成本的大头。
这次升级里有一个改动被严重低估了。GPT-6模型现在允许在两次响应之间切换推理强度而不中断缓存,只需追加configuration_update,保持请求级推理强度不变。
困难任务提高强度、常规追问降低强度,上下文照样复用。这个功能的实用价值在于把推理量控制和缓存复用解耦了,开发者终于不必在省钱和好用之间二选一。
缓存预热功能同样值得重视。应用可以在启动阶段、用户提问之前,提前准备共享指令、工具定义和参考资料。
处理工序被移出了用户等候时间,首次请求到达时模型已经可以快速响应。在持久智能体的场景里,这个功能的体感提升比省钱更直接。
GitHub的实测反馈显示,缓存改进使其需要新鲜处理的提示Token占比减少了超过一半,覆盖数十亿次请求。
这说明缓存的默认命中率确实在提升,但命中率提升和账单下降之间隔着一整套调用结构。
归根结底,这个案例暴露的问题是,开发者把缓存当成了省钱的主要手段,却忽略了输出成本和调用频率才是账单的核心变量。
改进的方向有两条:一是把推理强度的动态调节嵌入工作流,用低成本模型处理常规轮询、高成本模型处理复杂推理;二是建立调用频率的监控和熔断机制,避免高频轮询在输出端产生失控开支。缓存是工具,不是答案。
一个98%缓存命中率的账单把开发者整不会了,整不会的原因在于,省钱的入口和烧钱的出口从来不在同一侧。
信息来源:OpenAI《为 GPT-6 打造更出色的提示词缓存》,2026年9月22日。
