液冷系统故障时,AI集群能否保持可用,关键不在于“有没有备用泵”,而在于是否建立了从异常发现、风险隔离到业务迁移的完整闭环。液冷故障可能表现为流量不足、温度异常、压力变化、漏液,或冷却分配单元、循环泵等关键设备失效。若只依赖服务器自身保护,往往只能避免硬件损坏,却无法保证训练任务和在线推理持续运行。
先把故障分成三类
第一类是散热能力下降,例如流量不足、进回液温度异常或换热能力下降。这类故障应由温度、流量和压力监测及时发现,并根据风险等级降低节点负载、迁移任务或隔离异常机柜。第二类是液体泄漏,重点不是等待人工确认,而是通过漏液检测触发告警,并联动关闭相关阀件、停止局部循环或切断故障区域,避免影响扩大。第三类是液冷基础设施整体失效,包括冷却分配单元、循环泵或控制系统故障,此时必须预先设计应急散热和业务降级路径。
可用性设计应覆盖“设施侧”和“IT侧”。设施侧要明确关键设备的备用能力、故障切换方式、告警责任人和人工接管流程;IT侧则应将训练任务、推理服务和普通业务区分处理。训练任务可以优先迁移或暂停,在线推理则应保留健康节点承接流量,避免单个液冷机柜故障演变为集群级中断。
故障演练不能只测满载温度
正式上线前,应验证循环泵或冷却分配单元故障、流量不足、漏液告警、温度快速升高、节点重启、业务迁移和断电恢复等场景。测试指标不应只看芯片是否过热,还要记录告警是否及时、故障区域能否隔离、任务迁移是否成功、服务器更换是否影响其他节点,以及恢复后液冷系统能否稳定运行。
对于冷板式液冷,风冷仍可能承担内存、电源和其他部件的散热,因此不能在液冷异常后默认整台服务器仍然安全。浸没式方案则要额外关注液体管理、设备检修和槽体级故障处置。最终,液冷集群的可用性来自冗余监测、分区隔离、业务调度和应急流程的协同,而不是某个单一设备的散热性能。