AI 耗电厉害,这事大家都知道。
8 月 6 日彭博的一篇报道,揭开了一个藏得更深的麻烦:
数据中心不是耗电多这么简单,它的用电方式,正在把设备活活震坏,还顺手把风险甩给了整张电网。
伤在哪?伤在“抖”。
传统数据中心用电很稳,像匀速巡航的车。
AI 不一样。训练大模型的时候,几十万块 GPU 同时启动、同时收工,用电量在毫秒之间猛地蹿上去,又猛地砸下来。
Mainspring Energy 的总裁 Shannon Miller 打了个比方。
一座 1 吉瓦的数据中心,体量顶一个波士顿,其中一半的用电量,每隔几秒钟就开关一次。闪烁,闪烁,再闪烁。
而德州和美国中西部规划里的 AI 园区,有些超过 5 吉瓦,平均用电接近整个纽约市。
前特斯拉高管 Drew Baglino 补了一刀。
AI 设施的瞬时用电,有时冲到设计容量的 150%,一座 1 吉瓦的园区,一瞬间能吃下 1.5 吉瓦。
Uptime Institute 的顾问 Amber Villegas-Williamson 说得更直白,这就像开车反复猛踩油门,发动机一直超速运转,比匀速开磨损快得多。
比喻归比喻,设备已经在裂了。
xAI 在孟菲斯的 Colossus 超算,燃气轮机出现裂缝。英国好几处规模小些的数据中心,轮机也裂了。小型天然气内燃机的曲轴,断的也有。
为稳压装的电池,高强度跑上几周几个月就得换。
UL Solutions 的首席执行官 Jennifer Scanlon 还提醒,设备裂损会引发电弧闪络,电流在导体之间乱跳,反过来烧掉昂贵的 AI 芯片。
机器训练 AI,AI 回头折磨机器。这画面,多少有点魔幻。
设备坏了就要停机,停机就是烧钱。
Switch 的首席战略官 Jason Hoffman 说了实话,心疼的哪是换个泵换个断路器,心疼的是算力躺在那儿没法生钱。
停机损失,每分钟几千到几十万美元,看设施类型。
微软要求的可靠性是 99.999%。
为了够到这个数,Joulent 和雪佛龙在德州西部合建的 2.67 吉瓦 AI 园区,硬生生多留工程时间,供电启动从 2027 年推到 2028 年。
更扎心的是一个行业秘密。
搞数据中心融资的知情人透露,投资模型都按全年不停机来算,可一部分设施的实际运行率,已经掉到 80%上下。
问题解决不了,未来 12 到 24 个月,直接砸在投资者头上。
云厂商几千亿美元的资本开支,本来就让出钱的人神经紧绷。
现在设备加速折旧,又跟 GPU 机架折旧的质疑叠在一起。AI 这门生意能不能兑现盈利承诺,问号越画越大。
麻烦还不止在围墙里面。
施耐德电气的专家 Sreemant Roy 警告,这种上蹿下跳的负荷会让电网失稳,搞不好引发停电,还会产生次同步振荡,震坏电网上别的设备。
全球电力公司都为这事发愁。
监管机构早就急了。
北美电力可靠性公司 NERC 两年里反复警告,把数据中心列为电网稳定的最大风险之一。
去年 9 月的评估,美国 33 吉瓦在运数据中心,约四分之三的负荷模型根本反映不了这种抖动。
今年早些时候,NERC 发出罕见的三级警报,限大型数据中心 8 月 3 日前交应对方案。
8 月 3 日,刚过去 3 天。
各方也在想办法。
英伟达说从 2024 年 Blackwell 发布起就在跟电力专家磨合。
有的运营商用“侧边计算”,训练空档跑些虚拟任务,让 GPU 别闲下来,用电曲线就平了。
听着挺巧,细想挺亏,电本来就紧,还得额外烧电来维持平稳。
美国能源部去年在丹佛附近建了个测试平台,专门研究怎么把 AI 安全接进电网。
项目经理 Martha Symko-Davies 那句话值得记住,“我们现在有机会把这件事做对”。
有机会,不等于做对了。
一圈看下来,这事的味道很清楚。
AI 竞赛跑了这几年,大家比芯片,比模型,比参数,比谁的发布会热闹。
跑到今天才发现,最朴素的那关横在面前,电。
变压器不管你的模型多聪明,涡轮机不听你的发布会,毫秒级的冲击一次一次砸下来,金属会疲劳,曲轴会断,谎言不会,可裂缝会。
投资模型里写着全年无休,现实里跑出了八折出勤。
账面之外,物理世界有它自己的脾气。
从前挖金矿,先倒下的是矿工。
这回挖算力,先裂的是发电机。
淘金热里最稳赚的从来是卖铲子的,怕就怕,铲子也供不应求,还三天两头断柄。
