铭鸿体育资讯网

想把 27B 模型塞进 5.9GB:Ternary Bonsai 2 用三值权重

想把 27B 模型塞进 5.9GB:Ternary Bonsai 2 用三值权重保住 98.2% 的能力,M5 Max 上跑 46.8 token/秒 想在本地跑 27B 级别的模型,先要解决的是 50GB 级的内存占用;PrismML 在 9 月 17 日开源的 Ternary Bonsai 2 27B 把模型体积压到 5.9GB——权重是三值(-1、0、+1)配 FP16 分组缩放,平均每个权重 1.76 bit,上下文 262K,支持文本加图片输入,Apache-2.0 协议。

官方给的口径是这样:相对全精度的 Qwen3.8 27B,综合能力保留 98.2%(83.9 对 85.4),RTX 5090 上 143 token/秒,M5 Max 上 46.8 token/秒;在 4090 上每 token 耗电 0.714 mWh,比跑一个全精度 8B 模型还省 40%。对比上一代 Ternary Bonsai 27B,保留率从 95% 提到了 98% 以上。

这些数字全部来自发布方自己的基准和白皮书,目前没有第三方复测。把能力项拆开看,掉得最多的是知识和视觉(83.95 对 86.66、78.59 对 81.64),数学和编码基本持平,指令跟随还略高一点——所以"接近无损"是综合分的说法,不是每一项都无损。它跑在 CUDA 和苹果的 MLX 上,靠自定义低比特 kernel,通用推理框架不一定直接支持。

我的判断:如果硬约束是显存或内存、任务又是本地编码助手、私有文档分析这类高频调用,5.9GB 这个体积值得拉下来试;但别把它当成 27B 全精度的平替直接换掉线上模型,先在自己那批任务上跑一轮对照,尤其是视觉理解和多步 Agent 调用——这两类对能力退化最敏感。