攻克多跳时延难题!中科曙光重构国产智算通信效率
今天中科曙光发布的Token加速技术体系,最值得关注的技术点有两个:一是IBGDA在国内首次实现规模落地,并在十万卡级集群完成验证;二是scaleFabric在大规模集群中展现出显著的低时延优势,三跳时延可以做到较RoCE方案降低约63%。
说实话,这两个点都戳在了大规模集群的痛点上。IBGDA的意义在于让GPU更直接地参与网络通信,减少CPU介入带来的额外开销。在十万卡集群里,哪怕每次通信省下微秒级的开销,累积起来都是相当可观的效率提升。而scaleFabric的优势则体现在多级交换场景下能够有效抑制时延累积——对于十万卡级集群来说,数据往往需要经过多跳传输,单跳性能再好,如果多跳后时延失控,整体效率依然会下降。
此外,这套体系还覆盖了NVMe over RDMA、XDS、NFS over RDMA等存储加速能力,形成了计算、存储、网络协同优化的完整链路。在AI4S等复杂科学计算场景中,这种全链路协同正在成为提升集群实际吞吐的关键。中科曙光高级副总裁李斌说过,从万卡到十万卡,最核心的技术突破不在计算节点,而在互联系统。这话挺实在的。
RDMA IBGDA 智算网络
