K2.8 Preview 全量上线,不用
Kimi K2.8 Preview 今天全量上线 Kimi Code 了。Model ID 还是 kimi-for-coding,客户端和第三方工具不用改配置,直接就能用。
这个对用 API 调工具链的人比较重要。之前 K2.7 Code 换 K2.8 的时候得改 model name,这次不用。Ollama 或者 LM Studio 里如果之前配过 Kimi 的 endpoint,重启一下进程就行,配置文件一个字符都不用动。
官方说综合性能接近 K3。K3 是 2.8 万亿参数,K2.8 Preview 具体多大没公开,但 thinking 效率比 K2.7 Code 改善明显。这个「接近」怎么理解?K3 是闭源部署的,K2.8 Preview 走的是 API,两者底层可能不是同一个权重,但官方把「无思考」模式的请求都路由到 K2.8 Preview 上,说明在不需要深度推理的场景下,K2.8 Preview 就是 K3 的降级版。
支持 thinking effort 三档调节:low、high、max,默认 max。这个设计跟 K3 一致。实际用的时候,跑简单代码补全或者单文件重构,low 档够用,token 消耗少不少。要处理跨文件的架构调整或者带视觉反馈的前端任务,得拉 max。话说回来,三档之间到底差多少,官方没给量化数据,只能自己试。
全部会员档位都开放了 1M 上下文窗口。这个比较实在。之前 K2 系列上下文窗口跟会员等级挂钩,低档位只能用 128K,做大型代码库分析的时候经常不够。现在统一 1M,不用纠结档位选哪个了。
K3 本身是 7 月 27 号开源的,2.8 万亿参数,MoE 架构,896 个专家激活 16 个。KDA 混合线性注意力加注意力残差,原生视觉理解。这些技术细节 K2.8 Preview 应该也继承了,毕竟官方说性能接近。本地部署 K3 的事就不提了,2.8 万亿参数,就算量化到 Q4_K_M,32G 显存也装不下,那是需要多卡集群的规模。
Kimi Code 定位是编码专用接口,跟通用对话接口分开。K2.8 Preview 全量上线意味着之前 Preview 阶段的部分功能限制应该解除了。具体哪些限制解了,官方公告里没细说,只能对比之前的行为差异来判断。
MoonEP 和 AgentEnv 这次也开源了,配合之前已开源的 FlashKDA,覆盖从高性能通信到分布式 RL 环境的链路。如果你关注 Infra 层面,这三个组件值得看一眼。但跟普通用户关系不大,主要是给做训练和推理优化的人看的。





