铭鸿体育资讯网

尝试在 AI MAX+ 395上本地运行 Qwen 3.8 Flash Next

尝试在 AI MAX+ 395上本地运行 Qwen 3.8 Flash Next (UD-IQ4) 并接入Kimi Code 用于 Coding 任务:

1,AI MAX+ 395 现在在 Windows 系统中最大可以分配 102GB 显存(含共享),Qwen 3.8 Flash Next (UD-IQ4) 运行时的内存占用在 100GB 左右(此时约 57.9k 上下文,见图2)

2,由于Qwen 3.8 Flash Next的激活参数仅有 6B,AI MAX+ 395实际跑起来速度其实比之前开源的 Qwen 3.8 27B 更快:Prefill 大约 200 tokens/s,Decode 大约16 tokens/s,这个速度确实不Flash,但已经在可用范围内

3,根据Unsloth的报告,UD-IQ4 量化的 Top-1 Accuracy 接近原版的 90%,实际使用下来,体感我认为已经相当好了(注意:这是建立在“本地部署”这个大前提下的)

放在以前,我觉得无论是 AI MAX+ 还是 DGX Spark 都卡在非常尴尬的位置,跑27B Dense 或者 35B-A3B 这样的定位“边缘计算”的模型,它们的大内存派不上用场,推理速度又不够快

真要发挥大显存优势,跑个 Flash 级别的模型,比如 DeepSeek V4 Flash,那 128GB 内存又不够看,至少得是双机运行,而一旦双机运行了,推理速度又要雪上加霜

而 Qwen 3.8 Flash Next 的出现改变了这一点,125B 的尺寸完美卡在了 128GB 统一内存的优势区间,6B 的激活参数又让它的推理速度不至于太慢,速度能够落在可用的范围内,真的是“为AI MAX+和DGX Spark而生的模型”

至于 RTX Spark……我认为反而不在受益范围内,因为一旦开始推理这么大规模的模型,系统资源就不剩下多少了,最合理的做法依然是弄一台小主机开好 API 服务放在局域网里,然后用其他电脑的 Coding Agent 去访问 API