2026年10月08日 2026年10月7日 OpenAI发布Decisions API推理提速十倍

稀疏激活如何降低大模型推理成本

话题来源: Reflection AI发布首款开放权重模型Beam:总参数5010亿、每次激活230亿,瞄准代码与智能体任务

大模型推理成本不只由模型“有多大”决定,还取决于每次生成时究竟有多少参数参与计算。稀疏激活正是利用这一差别:模型保留大量参数,但针对每个输入只调用其中一部分,以减少单次推理的计算量。

混合专家(MoE)是常见实现思路。模型将部分网络组织为多个“专家”,由路由机制根据输入选择参与处理的专家。未被选中的专家不执行当次计算,因此总参数量可以很大,单次前向计算所需的活跃参数却相对较少。它并非让模型“变小”,而是把模型容量与每次计算量部分分离。

Reflection AI 的 Beam 可作为这一思路的例子:公开信息称其总参数量为 5010 亿,每次任务激活约 230 亿参数。公司还称,部分推理测试中其表现可与更大模型相比,而所需运算量约为对标模型的三分之一到四分之一。这些效率与性能数据目前属于厂商口径,不能直接视为独立验证的结论。

更重要的是,活跃参数减少不等于部署成本按比例下降。未激活的参数仍需存储;专家路由、参数读取和设备间通信也会影响实际速度与资源消耗。若硬件无法高效承载稀疏计算,理论上的计算节省未必能转化为同等幅度的服务成本下降。因此,评估稀疏模型不能只看总参数量或激活参数量,还要看真实任务中的延迟、吞吐、显存需求和单位任务成本。

对企业而言,稀疏激活的价值在于提供更灵活的成本—能力取舍,尤其适合需要处理复杂代码或智能体任务、又不愿为每次请求支付完整稠密计算代价的场景。选型时应把模型能力与实际部署表现放在一起测试;参数账面更省,只是成本优势的起点。

发表评论