Kimi K3 / GLM5.3 / DeepSeek V4 / Qwen3.8 梯度下降优化器异同核心总览:Kimi K3、DeepSeek V4、Qwen3.8 预训练都采用「Muon + AdamW 混合优化器」;GLM5.3基座(GLM5.2底座)原生预训练是 AdamW,后训练阶段做了大量创新,但基座预训练没有大规模Muon。Muon 不是替代AdamW全部参数,而是二维线性权重矩阵用Muon;Embedding、输出头、Router、Norm等一维/查表类参数继续AdamW。一、先区分两个优化器底层原理
1. AdamW(传统逐元素自适应梯度下降)逐参数独立维护一阶动量m、二阶动量v,每个标量权重单独自适应学习率;权重衰减解耦。缺点:把权重矩阵拆成独立标量,忽略矩阵整体几何结构;万亿参数长训练下二阶动量容易数值漂移。
2. Muon(矩阵正交化梯度下降)Muon是基于牛顿‑舒尔茨迭代(Newton‑Schulz),对整个权重矩阵做正交化,约束更新方向的奇异值接近1,让矩阵更新在流形上均匀。
• 不再给每个参数单独二阶动量;
• 利用权重是二维线性变换矩阵的几何性质;
• 允许更大学习率、更快收敛,同等token下scaling效率更高;
• 只适合2D线性矩阵,Embedding、词表、路由这类参数不适合正交化,交给AdamW。
二、逐个模型配置
1. Kimi K3(月之暗面)
• 预训练:Per-Head Muon(Muon变体,MuonClip) + AdamW混合
• Muon:Attention、MLP、MoE专家的二维权重;按注意力头拆分矩阵做正交化(Per-Head),解决MLA多头共享大矩阵带来的头间更新互相绑架问题;搭配QK-Clip做数值稳定,防止attention logit爆炸。
• AdamW:Embedding、输出头、偏置、归一化参数。
• 学习率调度:余弦退火(替换K2时代WSD调度);梯度裁剪、BF16混合精度、梯度累积。
• 后训练SFT/RL:改用AdamW类优化器。
2. DeepSeek V4
• 预训练:Muon + AdamW混合,绝大多数主干线性矩阵使用Muon
• Muon:Attention、CSA/HCA、MoE专家的2D权重矩阵;自研两段式牛顿‑舒尔茨迭代(前8步激进、后2步精细稳定奇异值);没有QK-Clip,依靠mHC+RMSNorm从架构层面抑制数值爆炸。
• AdamW:Embedding、输出头、RMSNorm、mHC静态偏置、router等非二维矩阵参数。
• 配套:梯度裁剪、BF16、混合ZeRO并行;MTP多token预测损失。
3. Qwen3.8(Qwen3.8-Flash-Next)
• 预训练:Muon + AdamW混合,论文明确参数分工规则
• Muon:Attention/QKV、GDN投影、MoE专家fc1/fc2;融合存储的QKV合并矩阵先拆开,再各自正交化,避免把无关子块奇异方向混合。NS迭代8步。
• AdamW:token embedding、n-gram embedding、output head、MoE Router、GR低秩投影。
• 特殊改动:取消batch warmup,直接使用目标大batch启动训练,重拟合scaling law,支持更大学习率。
4. GLM 5.3(智谱)重点:GLM5.3基座和GLM5.2完全一致,基座预训练使用AdamW,没有Muon;5.3全部提升来自后训练SFT/RL,不是基座预训练优化器改动• 基座预训练:标准AdamW,MoE+DSA/MLA架构,常规warmup+余弦衰减,梯度裁剪。
• 后训练创新(不是预训练梯度下降):SAO单轨一步优化、OPD离线偏好蒸馏、长轨迹RL,后训练阶段优化器依然基于AdamW,没有Muon。GLM5系列早期论文讨论Muon Split方案,但5.2/5.3正式基座训练没有落地Muon。三、相同点 ✅
1. 后训练(SFT、RL)全部使用AdamW,Muon只用于基座预训练主干线性层;Muon不适合SFT/RL。
2. 都配套:梯度裁剪、BF16混合精度、梯度累积、余弦学习率调度。
3. 混合范式思想一致:主干线性矩阵用专门矩阵优化器,查表/一维参数交给AdamW,而不是全模型一刀切。
4. 全部是一阶梯度下降,没有用Sophia/AdaHessian二阶Hessian优化器。
四、核心差异对比表模型 预训练主干优化器 Muon特色 AdamW负责参数 关键差异点 Kimi K3 Per-Head Muon + AdamW 按注意力头拆分矩阵正交化;QK-Clip稳定 Embedding、head、norm Per-Head Muon,解决MLA多头共享矩阵问题;余弦LR替代WSD DeepSeek V4 Muon + AdamW 两段式牛顿舒尔迭代;依靠mHC架构稳数值,不用QK-Clip Embedding、head、norm、mHC偏置 Muon配合mHC流形约束残差连接 Qwen3.8 Muon + AdamW 融合QKV矩阵先拆分再正交化;NS迭代8步 Embedding、n-gram embedding、router 取消batch warmup,直接大batch起步 GLM5.3 纯AdamW(基座) ❌不使用Muon 全部参数 基座全程AdamW;能力提升完全来自后训练SAO/OPD
五、底层原理层面的异同
相同
Muon和AdamW都属于随机梯度下降SGD的变体,依赖梯度\nabla_\theta \mathcal L更新参数;都有权重衰减,都需要梯度裁剪防止梯度爆炸。
不同
1. AdamW:逐元素优化,每个参数独立自适应lr,维护m、v两个动量缓冲区,显存开销大。
2. Muon:矩阵层面几何优化,对整个2D权重矩阵做正交约束,不维护逐元素二阶动量;显存压力低于AdamW,收敛更快、允许更大学习率,但仅适用于二维线性矩阵。
3. Kimi/DeepSeek/Qwen三家Muon实现细节不一样:正交化迭代步数、矩阵拆分策略、数值稳定手段(QK-Clip / mHC)各不相同。
六、适用取舍总结
1. Muon是前沿预训练优化器,只适合基座大规模预训练;SFT/RL微调依然回归AdamW。
2. GLM5.3是这四个里面唯一基座没有上Muon的,走传统AdamW基座 + 后训练强化学习创新路线。
3. Kimi K3、DeepSeek V4、Qwen3.8都属于同一技术流派:混合优化器,主干矩阵Muon,其余AdamW,但矩阵拆分、正交迭代、数值稳定方案各有工程变种。
如果你需要,我可以进一步:
1. 给出Muon的简化伪代码;
2. 或者对比Muon和AdamW在显存、FLOPs、收敛曲线的定量差异。