花一天把 Qwen3.8-27B 下载下来,17.1GB,GGUF 头校验通过。以为能换主力了——新出的 27B 参数表看着不亏。
跑完才发现,比 35B 慢了 8 倍。
一句话真相:跑不通的算力就是废的。别为参数表买单。
第一坑:误当 MoE。
35B 是 MoE,惯性思维带着,我直接沿用 --cpu-moe 配置去跑,tg 只有 1.05 tok/s,以为没跑对。
查 config.json 才发现:没有 num_local_experts,没有 num_experts_per_tok,架构是 dense + MTP。--cpu-moe 对 dense 模型无效,加了白加。
教训:先看 config,再下判断。
第二坑:ngl 甜蜜点完全猜错。
从 ngl=40 扫到 0,ngl=40 时 pp512 只有 32.89 tok/s,ngl=30 也差不多。准备放弃。
ngl=20 的时候,pp512 直接涨到 281.52 tok/s——8.5 倍。VRAM 反而最省,6.4GB。
原因:MTP 预测头就藏在第 20 层附近。ngl=40 时 MTP 头被挤到 CPU,prompt 处理全崩;ngl=20 时 MTP 头刚好全 offload 到 GPU,pp 瞬间起飞。
唯一甜蜜点就是 ngl=20。
第三坑:速度只有主力的 1/8。
ngl=20 最优配置下,Generation 只有 3.82 tok/s。主力 Qwen3.6-35B 是 30.79 tok/s,差 8 倍。
原因是 MTP 推测解码在当前的 llama.cpp build 上没跑起来,理论上的多 token 生成优势完全浪费。
6 道题同题横评:短题两模型打平(代码、翻译、文言文、数学),长题 Qwen3.8 全面翻车——强制输出 [Start thinking],200-400 字思考过程吃掉大半 token 预算。
6 题总分:Qwen3.8 是 48.5/60,Q3.6 是 58/60。
这次没换主力。Qwen3.6-35B 继续。Qwen3.8 保留做多模态备选——它支持图像输入,这点 35B 比不了。
跑不通的算力,就是废的。
评论区报你的显卡和显存,我帮你算能跑多大本地模型。







