AI存储的分级可靠性,核心不是“所有数据都用最高规格保护”,而是根据数据的重要程度、访问频率和恢复成本,选择不同的冗余策略。对于训练数据、检查点、模型文件和数据库日志,它们的可靠性要求差异很大,混用同一套保护方案往往导致成本浪费或保护不足。
训练数据集通常可以从原始数据源重新生成,丢失后通过重新分发恢复,不需要多副本或强一致性保护。使用单副本或纠删码即可,重点放在吞吐和带宽上。检查点文件则不同,它直接关系到训练任务的恢复效率。如果检查点丢失,训练可能回退数小时甚至数天。这类数据至少需要两副本或纠删码,并且写入确认必须在数据持久化后返回,避免因节点故障导致假写入。
模型文件和推理服务使用的数据,可靠性要求介于两者之间。模型文件通常有版本管理,丢失后可以从仓库重新拉取,但频繁重新加载会影响服务稳定性。建议对模型文件使用多副本或异地冗余,而对推理服务的缓存数据使用较低保护等级。数据库日志和元数据是最高优先级,必须使用三副本或同步复制,确保任何单点故障都不会导致数据丢失或事务回滚。
分级可靠性的实现,依赖于存储系统能否按卷或按目录设置不同的保护策略。一个统一的NVMe-oF存储池,如果只能对所有数据应用相同的副本数或纠删码参数,就无法真正实现分级。企业应验证存储平台是否支持按工作负载配置数据保护级别,并在故障切换时保持这些策略不变。
恢复时间也是分级的重要维度。训练数据即使丢失,从源重新分发的时间可能很长,但只要任务能续跑,业务影响就有限。检查点丢失则需要从上一个有效检查点恢复,恢复时间取决于检查点频率和数据量。数据库日志丢失则可能导致事务回滚或数据不一致,恢复时间必须控制在秒级。因此,分级可靠性不仅要看“保护了多少副本”,还要看“丢失后多久能恢复”。
最后,分级可靠性需要与故障演练配合。只配置不同保护级别而不验证故障场景,等于没有保护。企业应模拟存储节点故障、网络分区和链路中断,观察不同级别数据的恢复行为是否与预期一致。如果低保护级别的数据在故障后长时间不可用,而高保护级别的数据恢复正常,说明分级策略有效;如果所有数据恢复时间相同,说明分级没有真正落地。