2026年10月05日 2026年10月4日 GPT-6星际争霸对抗中作弊避开人类强敌

UnifiedBus灵衢总线如何支撑百万级处理器对等互连

话题来源: 昇腾在中国AI训练市场份额反超英伟达:从单点适配到"芯片+生态"体系化构建意味着什么?

华为在2026年9月17日全连接大会上发布的Peerium计算架构与UnifiedBus(灵衢总线),回应的是一个被徐直军反复强调的现实约束:单看一颗芯片,华为受限于可用的先进制程节点,很难在单卡性能上占到优势。既然单点追不上,就把大量处理器互连成一台逻辑意义上的"大型计算机",在集群层面取得领先。UnifiedBus宣称可支持多达一百万个处理器对等互连,正是这条体系化路线中最关键的一块承重墙。

理解它的分量,要先看清"对等互连"相对于"主从设计"的差异。传统的大规模互连往往存在层级关系,某些节点承担调度、聚合或中转职责,一旦规模扩张,主从结构中的瓶颈节点和多级转发就会放大通信延迟与同步开销。UnifiedBus被描述为打破主从范式、转向对等互连,含义是让处理器之间以更平等的方式直接通信,减少层级带来的损耗。在百万级规模上,这种拓扑选择不是锦上添花,而是决定集群能否真正"用起来"的前提——节点越多,通信效率的边际影响越大。

为什么指标落在MFU上

华为把这套架构的目标明确指向大模型训练的模型浮点运算利用率(MFU)。这个取向值得专门说明:当芯片数量堆到极高规模,真正稀缺的往往不是理论峰值算力,而是这些算力中有多少能被训练任务实际消化。通信、同步与等待一旦占用过多时间,再多的卡也只是空转。把评价重心放在MFU而非单卡峰值,恰恰反映了"集群级补偿"思路的内在逻辑:当单卡制程受限时,靠互连效率和整体利用率把系统级可用算力拉回来。

这一思路在部署层面有对应的实物支撑。据披露,华为正在测试由25.6万张计算卡构成的Atlas 950 SuperPoD超级节点,目标是在未来两年支撑中国6至7家前沿实验室训练10万亿至40万亿参数规模的基础大模型。这类参数量级的训练对互连规模和稳定性的要求极为苛刻,也解释了为何总线能力会被放在与芯片同等重要的位置。

需要保持的审慎在于,"支持一百万处理器对等互连"目前属于厂商在发布会上给出的架构能力表述,25.6万卡的超节点也仍处于测试阶段。对关注算力基础设施的团队而言,更稳妥的做法是把这些数字理解为体系化路线的方向性信号,而把集群在真实训练负载下究竟能达到多少MFU、互连规模能稳定支撑到何种程度,留给自有模型与数据上的实测来回答。总线、集群规模与软件生态能补偿多少单卡劣势、补得多快,终究要由跑通的任务说话,而非由架构参数先行定论。

发表评论