算力调度的核心不是把任务平均分配到空闲设备,而是根据任务的性能、时延、数据、合规和可迁移性,选择能够稳定交付的资源池。GPU、国产加速芯片、通用 CPU、边缘节点以及跨地域资源不能仅按卡数或 FLOPS 相加比较;真正需要衡量的是有效吞吐、通信条件、运行时兼容性、排队时间和完成一次任务的综合成本。
先按任务属性分级
一级:核心在线任务。 包括在线推理、交易链路和对时延高度敏感的业务。这类任务应优先部署在本地或同城资源池,要求性能曲线稳定、故障切换明确,原则上不进行跨地域或跨架构迁移。调度目标不是最低单价,而是保证响应时间、可用性和数据边界。
二级:稳定训练任务。 大规模训练通常依赖固定的芯片代际、互联拓扑、集合通信和数据访问路径。数据不能出域时,应限定在本地或专有集群;允许迁移时,也必须确认检查点能够续跑、镜像可以复用,并验证跨架构后的精度和吞吐。训练任务适合独占或半独占资源,不能只按空闲卡数量派发。
三级:可迁移批处理任务。 批量推理、离线数据处理、渲染和部分科学计算通常可以切片、重试或延后,更适合跨地域统一调度。此类任务应设置优先级、超时回退和结果校验,让低峰资源得到利用,同时避免因跨地域传输导致成本反超。
四级:通用计算任务。 数据分析、代码构建和传统计算不应默认使用智能算力。调度器应先判断 CPU、GPU 或其他加速资源是否匹配,避免通用作业挤占训练队列。对可异步任务可以接受重试,对核心链路则应固定资源域。
分级后,还要为每类任务建立准入条件:数据能否跨域、镜像和运行时是否兼容、网络与存储是否满足要求、失败后能否恢复,以及成本是否按“完成一次有效任务”核算。只有可中断、可校验、对架构不敏感的作业,才适合进入跨地域调度白名单。这样形成的算力策略,才是从“资源目录”走向“可验收服务”的任务分级。