铭鸿体育资讯网

AI 芯片变快”,而是让几千颗芯片像“一台大 GPU”一样协同,把原来被通信、显存、等待吃掉的有效算力捞回来。所以它对 AI 算力的提升,主要体现在“有效算力/利用率”,不是纸面 TFLOPS 乘以卡数。 一、核心提升:MFU(模型浮点算力利用率

AI 芯片变快”,而是让几千颗芯片像“一台大 GPU”一样协同,把原来被通信、显存、等待吃掉的有效算力捞回来。所以它对 AI 算力的提升,主要体现在“有效算力/利用率”,不是纸面 TFLOPS 乘以卡数。

一、核心提升:MFU(模型浮点算力利用率)跳级

传统“8 卡服务器 + 网卡拼集群”架构下,10 万卡集群里通信开销能占训练时间 40%+,很多卡在等数据。

华为马尔科夫实验室仿真:

• 4K 超节点组成的 10 万卡集群,相比传统 8 卡服务器组成的同规模集群,MFU 提升约 2.75 倍。

翻译:同样 10 万张卡,超节点架构“真干活”的产出接近原来的 2.75 倍。

二、训练侧:大模型/长序列/MoE 最吃香

• 统一内存编址:128K/256K 长序列训练不用频繁存 checkpoint、重分布参数

• All2All(MoE 专家并行)性能相比 RoCE 方案可提升 16 倍

• 10 万亿参数级模型:传统集群“堆卡边际收益递减”,超节点把 TP/EP 流量封闭在节点内,PP/DP 再走外网

• 华为昇腾 960 超节点:4096 卡、8E FLOPS FP8、1PB HBM,可支撑十万亿级模型

三、推理侧:低时延 + 大 KV Cache 是杀手锏

• 单超节点可把千亿/万亿模型权重 + 超大规模 KV Cache 放同一内存域

• Decode 请求节点内命中内存,不走跨机网络 → 实时对话、Agent、长上下文推理延迟大幅下降

• 大 EP(专家并行)推理吞吐可提升 1.4 倍以上,Prefill/Decode 不再互相卡

• RL 后训练里,Rollout 和 Trainer 异步解耦,后训练效率显著提升

四、工程侧:省功耗、省光模块、提可用度

昇腾 960 用 5500 个 NPO 光引擎替代 4.8 万个 800G 光模块:

• 系统功耗降 550kW+

• 无故障运行时间翻倍

• 可用度 99.8%

→ 同样算力,电费、运维、故障重算都下来,单位 Token 成本下降。

五、但别误读:超节点不是“魔法倍率”

• 单卡弱,超节点不会让它变成 H100;它解决的是“多卡内耗”

• 收益随模型规模放大:小模型、短序列、批处理推理,提升有限

• 软件栈、算子、通信库、故障隔离做不好,4096 卡也会退化成“贵的大集群”

• 真要训百万亿参数,还得“超节点 + 超集群”(灵衢/UALink/NVLink + 光互联 + 多层 CLOS)

六、一句话

超节点对 AI 算力的意义 = 把“堆出来的总算力”变成“用得上的有效算力”。

训练端 MFU 翻 2–3 倍,通信敏感型/MoE/长上下文场景收益最大;推理端降时延、提吞吐、降 Token 成本。