AI 芯片变快”,而是让几千颗芯片像“一台大 GPU”一样协同,把原来被通信、显存、等待吃掉的有效算力捞回来。所以它对 AI 算力的提升,主要体现在“有效算力/利用率”,不是纸面 TFLOPS 乘以卡数。
一、核心提升:MFU(模型浮点算力利用率)跳级
传统“8 卡服务器 + 网卡拼集群”架构下,10 万卡集群里通信开销能占训练时间 40%+,很多卡在等数据。
华为马尔科夫实验室仿真:
• 4K 超节点组成的 10 万卡集群,相比传统 8 卡服务器组成的同规模集群,MFU 提升约 2.75 倍。
翻译:同样 10 万张卡,超节点架构“真干活”的产出接近原来的 2.75 倍。
二、训练侧:大模型/长序列/MoE 最吃香
• 统一内存编址:128K/256K 长序列训练不用频繁存 checkpoint、重分布参数
• All2All(MoE 专家并行)性能相比 RoCE 方案可提升 16 倍
• 10 万亿参数级模型:传统集群“堆卡边际收益递减”,超节点把 TP/EP 流量封闭在节点内,PP/DP 再走外网
• 华为昇腾 960 超节点:4096 卡、8E FLOPS FP8、1PB HBM,可支撑十万亿级模型
三、推理侧:低时延 + 大 KV Cache 是杀手锏
• 单超节点可把千亿/万亿模型权重 + 超大规模 KV Cache 放同一内存域
• Decode 请求节点内命中内存,不走跨机网络 → 实时对话、Agent、长上下文推理延迟大幅下降
• 大 EP(专家并行)推理吞吐可提升 1.4 倍以上,Prefill/Decode 不再互相卡
• RL 后训练里,Rollout 和 Trainer 异步解耦,后训练效率显著提升
四、工程侧:省功耗、省光模块、提可用度
昇腾 960 用 5500 个 NPO 光引擎替代 4.8 万个 800G 光模块:
• 系统功耗降 550kW+
• 无故障运行时间翻倍
• 可用度 99.8%
→ 同样算力,电费、运维、故障重算都下来,单位 Token 成本下降。
五、但别误读:超节点不是“魔法倍率”
• 单卡弱,超节点不会让它变成 H100;它解决的是“多卡内耗”
• 收益随模型规模放大:小模型、短序列、批处理推理,提升有限
• 软件栈、算子、通信库、故障隔离做不好,4096 卡也会退化成“贵的大集群”
• 真要训百万亿参数,还得“超节点 + 超集群”(灵衢/UALink/NVLink + 光互联 + 多层 CLOS)
六、一句话
超节点对 AI 算力的意义 = 把“堆出来的总算力”变成“用得上的有效算力”。
训练端 MFU 翻 2–3 倍,通信敏感型/MoE/长上下文场景收益最大;推理端降时延、提吞吐、降 Token 成本。
AI 芯片变快”,而是让几千颗芯片像“一台大 GPU”一样协同,把原来被通信、显存、等待吃掉的有效算力捞回来。所以它对 AI 算力的提升,主要体现在“有效算力/利用率”,不是纸面 TFLOPS 乘以卡数。 一、核心提升:MFU(模型浮点算力利用率
阅读:0
点赞:0