在混合专家模型中,“激活参数”不是模型参数总量的另一种说法,而是推理计算时实际参与处理输入的参数规模。以厂商披露的 Naive-N0.5-Flash 为例,总参数约 3090 亿,推理时激活参数约 155 亿:前者描述模型整体包含多少参数,后者描述一次推理中有多少参数参与计算。两者回答的是不同问题。
MoE 通常将模型的一部分组织为多个专家模块,并由路由机制为输入选择其中若干专家。不同 token 可能被分配到不同专家,因此“激活”通常应理解为随输入而变化的计算参与范围,而不是模型永久只使用某一组参数。模型中负责共享处理的部分也可能参与计算,不能把专家参数数量简单等同于完整推理路径。
激活参数不等于显存需求
激活参数较少,通常意味着每个 token 所需的计算量可能低于同等总规模、但参数普遍参与计算的模型;但这不代表部署只需容纳激活部分的权重。若推理时需要访问分布在多个专家中的权重,显存或内存需求仍会受到总权重规模、权重精度、专家调度方式和推理框架等因素影响。并发量与上下文长度也会改变整体资源需求。
因此,不能仅凭“155 亿激活参数”推断模型一定更快、更省钱,或能在某种设备上运行。激活规模描述的是计算路径的一面,不涵盖权重存储、数据搬运和服务负载等全部成本。
比较 MoE 模型时,应先确认激活参数的统计口径是否一致,再结合硬件条件和实际任务测试延迟、吞吐、资源占用与输出质量。总参数更接近模型容量的规模描述,激活参数则更接近单次计算参与范围;两者都不能单独替代部署评估。