铭鸿体育资讯网

GPU利用率从55%拉至95%!中科曙光用国产IB撬开大模型降本新空间 天天盘

GPU利用率从55%拉至95%!中科曙光用国产IB撬开大模型降本新空间

天天盘算力账单、抠集群利用率,给大家掏句实底,现在全行业都在喊大模型降本,可大多说法都没戳中真正的核心:GPU采购成本高只是明面支出,更隐形也更惊人的浪费,是GPU大量时间都在空转等数据。等KV Cache 加载、等存储读数据、等跨节点通信同步,算力闲置的隐性损耗,才是藏在背后的最大成本黑洞。

中科曙光推出的scaleFabric Token加速技术体系,可以说是精准命中这一痛点。长上下文场景下,KV Cache体积可达数十GB,跨节点搬运耗时漫长;训练数据从存储到显存要经过CPU内存多层拷贝,GPU看似满负荷运行,实际有效计算时间占比很低。作为国产的InfiniBand,scaleFabric的核心思路就是让数据少中转、让设备少等待。存储端通过NVMe over RDMA、XDS等直通技术,实现GPU直接访问远端存储,存储访问延迟降低80%;其中NFS over RDMA技术,实测可将GPU利用率从约55%提升至95%以上,单轮训练时间最高缩短一半。

降本不是靠砍硬件预算,而是靠把浪费的算力抢回来。算存传全链路打通,每一张卡都跑满有效算力,单Token成本自然就降下来了,这才是可复制、可持续的规模化降本路径。
中科曙光发布scaleFabric Token加速技术体系