智算中心把单机柜功率从几千瓦推到20–40kW,供配电的密度、散热耦合与连续性,已经从机房成本项变成算力SLA的隐形守门员。功率密度每翻倍,配电与散热的容错裕度就被压缩一次,断电容忍度趋近于零。把供配电当作算力交付的一环来管理,是新建与改造智算中心的前提。
传统机房单柜3–5kW,配电走列头柜加普通回路即可。智算中心GPU机柜动辄20–40kW,电缆截面、末端开关、母线槽载流与UPS容量都要重算。不是简单把老方案乘以倍数,而是从变压器到机柜末端的全链路重设计,任一截面瓶颈都会卡住整机柜上架。算力负载的供电特征可对照GPU算力集群的动态供电需求。
高密度机柜的热密度同步飙升,风冷逼近极限,液冷成为主流。液冷泵与阀门同样需要不间断电,一旦UPS切换出现电压凹陷,泵停转几秒就可能让冷板温度越过阈值。供电与散热是同一套连续性系统,不能各管各的。负载端电压不间断的机理见UPS输出THDv与负载电压质量。
GPU训练任务一次意外掉电,不仅丢进度,还可能损坏checkpoint与显存一致性。在线式双变换UPS让负载始终由逆变器供电,市电与电池切换0ms、负载端电压不间断,市电畸变与暂降被彻底隔离在负载之外。这一点没有妥协空间。关于切换时间的工程口径,可看UPS容量规划与冗余选型。
单台UPS再可靠也有故障概率,智算中心普遍采用N+1甚至2N配电。关键不是多买一台,而是让任意单点失效都不影响算力节点供电——双路进线、双UPS、双母线到双电源机柜。可用性靠架构冗余堆出来,而非靠单机能扛。更多行业观察见行业新闻。
头部云与智算客户已把“年停电时长”“切换是否可见”“暂降次数”写进SLA与机房验收。供配电设计不能只满足额定参数,要用实测波形与故障演练证明连续性。把指标量化进合同,供配电才从“不出事就行”变成可衡量的交付项。
对于通信基站、光伏离网、铁路信号等边缘侧分散供电场景,互雅 HGU-XE48 系列高频小功率逆变电源(3K-10K)以48V高频拓扑提供0ms切换与负载端电压不间断,是这类关键负载的优选供电单元。
关键要点:单柜功率跃升到20–40kW,供配电连续性成为算力SLA的隐形守门员;高密度机柜需要全链路重设计而非简单扩容;散热与供电耦合,液冷泵的连续电同样关键;在线式双变换0ms切换是算力负载底线;冗余要走到架构级N+1/2N,连续性指标写入SLA与验收。问题一:智算中心到底需要UPS还是靠市电加发电机?
发电机解决长时间停电,但启动有十几秒空档,这中间必须靠UPS顶住。在线式双变换UPS做毫秒级无缝接管,等发电机带载,二者是互补而不是替代。
问题二:单柜功率翻倍,配电主要卡在哪里?
卡在末端全链路:电缆与母线槽载流、列头柜开关、UPS单机容量与并机数量。任一截面不足都会限制整机柜上架,需从变压器到机柜统一核算。
问题三:为什么液冷普及反而抬高了供电要求?
液冷泵阀自身要不间断电,UPS切换若带电压凹陷,泵停转会迅速抬升冷板温度。散热与供电绑成同一连续性系统,供电标准被液冷反向抬高。