铭鸿体育资讯网

1.76 bit 权重跑 27B PrismML 发了 Bonsai 2 27B。三值量化,FP16 分组缩放,每个权重有效比特压到 1.76,模型总大小 5.9GB。基础模型换成了 Qwen3.8 27B,综合基准拿到原模型 98.2% 的分数,内存占用不到 1/9。这个数字挺有意思,之前他们第一代 Bonsai 27B 基于 Qwen3.6 27B 做到的是 95%,这次直接 ​

1.76 bit 权重跑 27B

PrismML 发了 Bonsai 2 27B。三值量化,FP16 分组缩放,每个权重有效比特压到 1.76,模型总大小 5.9GB。基础模型换成了 Qwen3.8 27B,综合基准拿到原模型 98.2% 的分数,内存占用不到 1/9。这个数字挺有意思,之前他们第一代 Bonsai 27B 基于 Qwen3.6 27B 做到的是 95%,这次直接拉到 98.2%。

支持 262K 上下文窗口。这个长度在本地部署里算很能打了,配合 5.9GB 的体积,意味着你不需要为了塞进显存而砍 context 截断。很多量化方案为了省内存不得不牺牲上下文,这里看起来是反着来的。

硬件适配给了两个数据。NVIDIA RTX 5090 上词元吞吐量 143TPS,Apple M5 Max 上 46.8TPS。跑 5090 肯定不是瓶颈,关键看 M5 Max 那组数字,46.8TPS 意味着什么,日常对话和写代码应该是完全跟手的流畅度,不会有那种 token 一个个往外蹦的卡顿感。

能效数据也列了出来。RTX 4090 上 0.714mWh / Token,比全精度 8B 模型低 40%。这里有个容易看漏的点,他们拿来对比的基准是全精度 8B,不是全精度 27B。27B 压到 1.76 bit 之后,能效反而比不压缩的小模型还要好,这就是三值量化的红利。

PrismML 官方描述的使用场景比较具体:本地承担编程智能体循环、计算机使用工作流、私有文档解析、多模态调试、混合编排。仅在需要时才调用云端 API。这个定位其实很务实,不是要替代云端大模型做复杂推理,而是把日常那些不需要外传的任务截留在本地。话说回来,1/9 的内存占用加上 98.2% 的性能保留率,这种权衡比单纯堆参数有意思多了。

开源方面给的是 Apache 2.0 许可证。通过 CUDA 跑 NVIDIA GPU,通过 MLX 跑 Apple 设备。MLX 后端是原生支持,不是那种模拟跑的,延迟和内存管理应该都是最优路径。

5.9GB 这个体积值得单独说一下。一般 Q4_K_M 量化的 27B 模型,文件大小大概在 16GB 到 18GB 之间。三值量化直接砍到 5.9GB,省下来的空间足够你在消费级设备上同时开多个任务。之前 32G 显存跑 27B 还要精打细算关浏览器标签页,现在 5.9GB 的模型,显存压力完全不是一个量级。不对,应该是内存压力,三值量化对内存带宽的需求也低得多。

推理、编程、视觉、长程智能体四个维度都有提升。长程智能体这块是重点,因为智能体任务最怕的就是中间状态丢失,上下文一长模型就开始犯糊涂。262K 窗口加上 98.2% 的分数保留,说明压缩之后的模型在长距离依赖上并没有明显衰减。

0.714mWh 每 token 这个数据,放在本地部署的场景里其实挺关键。很多人忽略功耗,但如果你跑的是笔记本或者长时间挂着的智能体任务,电费也是成本。比全精度 8B 还省 40%,意味着你用一个 8B 的能耗预算,能跑 27B 的能力。

综合看下来,Bonsai 2 27B 的技术路线很清晰:不是去硬堆算力,而是通过极致压缩把模型塞进更小的资源窗口。5.9GB 体积、1.76 bit 权重、262K 上下文、98.2% 性能保留,这几个数字凑在一起,给本地部署提供了一个很实际的选项。