2.8 万亿参数的 Kimi K3 在 128GB MacBook Pro 上跑通了:每秒 1 个 token,512
一台上限 128GB 内存的 MacBook Pro,跑起了 2.8 万亿参数(约 1.45TB 专家权重)的完整版 Kimi K3——2026 年 9 月 8 日开源项目 deltafin 的实测。机器是 M5 Max + 128GB,四块 SSD 同时流式读取专家权重,稳定解码约 1.0 token/秒。听起来很科幻,但作者把难听话也说在前面:512 token 的提示词,出第一个 token 要等约 6.3 分钟。
这组基准的真实价值在别处。
第一,它证明了 SSD 流式这条路能走通:2.8T 的 MoE 模型每层只用 16 个专家,权重按 17.5MB 一个小文件从硬盘读,128GB 内存装不下的问题被绕开了。
第二,它量出了存储瓶颈的规律:1 块盘只有 4 块盘约 52% 的速度,2 块约 73%,3 块约 90%——慢的不是总带宽,而是每层 16 次读取里最慢的那次。
第三,它明确标注每项数字都是单次冷启动实测,日志全公开。
1 token/秒意味着聊天基本不可用,首 token 6 分钟更只适合跑批任务;这是验证性质的项目(fork 自 gavamedia/deltafin),prefill 慢的原因已定位、修复还没做;68 星的小项目,别当生产方案。我的判断:这台“能跑”的最大意义是指明了超大模型本地化的两条硬约束——内存装专家、SSD 供带宽,谁先解决首 token 延迟,谁才谈得上实用。
如果本地跑 2.8T 模型能到 20 token/秒,你最想拿它做什么?
