超大规模数据中心离网供电故障频发,停机代价高达数千万美元

Nashnova编辑部
Published todayAbout 4 min read

美国四座离网供电数据中心已有三座发生设备故障,AI负载的剧烈功率波动正在加速摧毁发电设备——一天停机损失可达数千万美元,离网供电模式的商业可持续性面临根本考验。

01

四座离网数据中心,三座出了什么问题?

美国目前共有四座离网或部分离网供电数据中心投入运营:xAI的Colossus与Colossus II、Crusoe的Stargate Abilene、Vantage的VA 2。其中三座已出现有据可查的故障。
故障类型包括:燃气发动机曲轴断裂、燃气轮机出现裂纹、关键供电故障被迫切换柴油备用电源长达约一天
这意味着→ 离网供电不是个别项目的坏运气,而是四分之三的故障率在暴露系统性的技术缺陷。
02

为什么AI负载会"搞坏"发电设备?

AI工作负载的功率曲线极不平稳:计算阶段需求飙升,结果汇聚时功率骤降。用大白话说= 发电机组一会儿被要求全力输出,一会儿又突然闲下来,反复"急刹车"式的功率振荡加速损耗机械部件。
随着数据中心规模扩大,功率振荡幅度可达数百兆瓦甚至吉瓦级别。能源咨询机构Wood Mackenzie指出,这种剧烈波动可直接导致发动机和涡轮机轴断裂
离网系统还面临设备异构难题:供电系统由不同厂商设备拼凑而成,协同调度难度高。有超大规模客户要求供电响应时间达到数十毫秒,而行业惯例是数百毫秒——这反映出AI对供电系统的要求,已远远超出现有设备的设计边界。
03

停机一天,谁损失多少?

Anthropic每月向xAI支付12.5亿美元购买Colossus和Colossus II的算力。按此月费推算,一天停机损失可能高达数千万美元
对xAI而言是直接的收入损失;对Anthropic而言是算力缺失带来的机会成本——模型训练中断、产品交付延迟。
这意味着→ 离网供电故障的代价不只是修设备那点钱,而是上下游同时失血:供电商赔钱、数据中心丢收入、算力买方耽误业务。
04

供电商自己扛得住吗?

行业惯例是供电商无法交付电力时不收费,部分合同还设有违约罚款条款;设备维修与更换费用通常由供电商自行承担。
电气工程师萨迪吉透露,她的一位客户的离网供电系统曾因多日停机,迫使供电商更换了价值数百万美元的设备。
Solaris等供电商已在合同中设置最高赔偿上限来控制风险敞口。用大白话说= 供电商知道这门生意可能赔大钱,正试图用合同条款给自己兜底——但设备老化速度若持续超预期,利润率仍会被持续侵蚀。
05

这对离网供电模式意味着什么?

大型科技公司选择离网供电,本质是为了绕开电网审批瓶颈、加速AI基础设施上线。但目前的故障频率表明,技术成熟度还没跟上扩张节奏。
这反映出一个更深层的矛盾:AI算力需求的增长速度,正在倒逼能源基础设施以"先上线、再解决问题"的模式运转——而这恰恰是电力系统最忌讳的运行方式。
对投资者来说,离网供电概念的核心风险已经不是"能不能建起来",而是"建起来之后能不能稳定跑起来"

Content is for reference only, not financial advice.

超大规模数据中心离网供电故障频发,停机代价高达数千万美元 · nashnova