1、指数级增长的功率需求
人工智能大模型训练的计算需求不断提高处理器xPU(GPU、CPU或者TPU)的功率级别,也推动单个服务器IT机架的负载功率从传统的3-5kW猛增至100kW以上的数量级。目前商用的顶级算力训练集群如NVIDIAGB200平台的NVL72机架功率需求达到了120kW,2026年CES刚刚推出的Vera Rubin NVL72机架,由于搭载了更高性能的CPU、GPU和HBM4内存,单机架最高功率达到200kW。未来Rubin系列机架功率还会不断上升,据报道RubinUltra这样的极限配置可以让单机柜功率达到惊人的MW级别。
2、能源效率、功率密度与热管理
从全球最终电力需求的比例来看,据国际能源署(EA)估算,数据中心在2024年的用电占全球电力总需求的 1.5%,约415太瓦时 (TWh)。预计到2030年,数据中心的用电量将增长一倍以上,达到约945太瓦时,占比将达到约3%。根据焦耳定律(Ploss=I²R),在低电压架构下传输大功率会导致线路损耗呈平方倍增加。之前12V供电总线逐渐被淘汰,而目前主流的48V总线在处理未来100kW以上级别大功率时电流同样过大,不但产生巨大的能量浪费和散热难题,而且巨大铜线重量让数据中心建筑结构无法承受,不断上升的铜价使48V总线系统也不再经济。
IT机架的体积增加幅度和功率增长速度也不成比例,所以高功率密度设计一直是电源系统的永恒话题。这些不断增长的高效率和高功率密度的要求,使得在其他应用中已经使用的800V总线供电系统和中压交流输入的固态变压器成为意料之内的选择。如此之高的功率密度和xPU(CPU、GPU、TPU等终端处理器)负载端的电流密度也对热管理造成前所未有的挑战。
3、可靠性
成本高昂的算力服务器作为支撑大规模人工智能训练与推理任务的核心基础设施,其运行连续性和服务稳定性至关重要。为保障业务不中断、数据处理高效可靠,整个数据中心必须实现99.99%甚至更高的系统可用性。这意味着全年计划外停机时间不得超过约52.6分钟。在如此严苛的可用性指标下,供电系统的可靠性成为决定整体性能和TCO的关键因素之一。
据报道,在算力服务器的供电链路中,中间总线转换器(Intermediate Bus Converter,IBC)是故障高发环节。IBC通常承担着将高压直流总线(如48V)高效、稳定地转换为适用于负载点(Point-of-Load,POL)转换器输入电压(如12V或更低)的任务,处于供电架构的中枢位置。一旦IBC发生失效,将直接导致下游大量算力加速卡xPU或其他关键计算单元断电,进而引发系统级宕机。
此外,AC-DC的能量转换环节也面临电网电压质量不佳、雷击等应力冲击。这些应力对电源所采用的功率半导体器件(如硅MOSFET、GaN HEMT等)提出了极高的可靠性与稳定性要求。这些器件不仅需要在高频率、高功率密度、高温度梯度等严酷工况下长期稳定工作,还须具备优异的抗浪涌能力、低失效率、良好的一致性以及对制造工艺偏差和老化效应的强鲁棒性。此外,系统层面还需引入冗余设计、故障预测与健康管理(PHM)、快速故障隔离等机制,以进一步提升整体供电架构的容错能力和平均故障间隔时间(MTBF),从而满足算力服务器对极致可靠性的需求。
算力服务器电源从交流AC输入到xPU间每一个电能转化环节的架构进行解析,其中包括AC-DC转换(一次电源,或者PSU),总线电压到板卡之间的DC-DC转换(二次电源,也叫IBC),和xPU附近供电稳压的DC-DC转换(VRM)。