铭鸿体育资讯网

1/9 内存占用保留 98.2% 性能 看到 PrismML 新放出来的 Bonsai 2 27B,第一反应是去翻它的基础模型。之前 Bonsai 系列是挂在 Qwen3.6 27B 上,这回升级到了 Qwen3.8 27B,推理、编程、视觉这些能力跟着水涨船高。 最核心的数据还是那个压缩比。综合基准测试拿到了基础模型 98.2% 的分数,整体表现比 ​

1/9 内存占用保留 98.2% 性能

看到 PrismML 新放出来的 Bonsai 2 27B,第一反应是去翻它的基础模型。之前 Bonsai 系列是挂在 Qwen3.6 27B 上,这回升级到了 Qwen3.8 27B,推理、编程、视觉这些能力跟着水涨船高。

最核心的数据还是那个压缩比。综合基准测试拿到了基础模型 98.2% 的分数,整体表现比 Qwen3.6 27B 还要好。但代价呢,内存占用降到了不到 1/9。模型总大小 5.9GB。这个数字挺具体的,说明他们用的量化策略确实压榨出了空间。三值量化,FP16 分组缩放,每个权重的有效比特是 1.76。1.76 比特,这精度已经贴地了,不知道是怎么平衡长上下文下的状态漂移的。

上下文窗口开到 262K。配合 5.9GB 的体积,对本地部署来说是个很有想象力的组合。PrismML 自己提了几个场景:编程智能体循环、计算机使用工作流、私有文档解析、多模态调试、混合编排,说这些属于“真正的知识工作”,本地跑没问题,需要时才调云端 API。

硬件测试的数据也摆出来了。RTX 5090 上词元吞吐量 143TPS,Apple Silicon M5 Max 46.8TPS。还有个能效比,RTX 4090 上 0.714mWh/Token,比全精度 8B 模型低 40%。这效率数字放在 27B 级别的模型上挺扎眼的。

说真的,本地模型现在拼的已经不是单纯参数大小了。能不能在一个固定的显存预算里,把特定工作流的任务完成率顶上去,这才是关键。Qwen3.8 27B 本身的能力底子在那,Bonsai 2 相当于把它装进了一个极小的容器里。CUDA 和 MLX 都支持,Apache 2.0 开放权重。至于能不能真的在本地承担起知识工作流,那得看具体的 agentic 循环怎么搭了。