【软盟资讯·新闻导读】8月26日,智谱上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型。它以320B总参数、18B激活参数和稀疏与线性注意力混合架构,将定价降至GLM-5.3的十分之一,引发模型开发者和企业应用团队关注。

智谱上线GLM-5.3-Flash,320B总参数但只激活18B
8月26日,智谱正式上线并开源GLM-5.3-Flash(320B-A18B)。从产品定位看,它并不是GLM-5系列对既有模型的简单增量更新,而是该系列首个原生多模态模型。模型名称中的“320B-A18B”,分别对应320B总参数和18B激活参数,也成为这次发布最受关注的两个数字。
总参数量代表模型整体规模,激活参数则更接近单个Token处理过程中实际参与计算的参数规模。GLM-5.3-Flash保留了320B级别的总参数规模,但将每次推理时的激活参数控制在18B。与资料中披露的上一代相关架构相比,其激活参数从32B降至18B,层数也从92层降至45层,两个关键指标都出现明显收缩。
这解释了为什么模型名称中的“Flash”不仅是速度感的产品命名,也对应其低成本推理方向。智谱方面将该模型定位为面向极低成本设计的前沿模型,并表示其能力超过GLM-5.2。资料显示,GLM-5.3-Flash还曾以匿名模型Ox-Alpha在OpenCode和OpenRouter上进行大规模测试,之后才正式揭晓身份。
原生多模态不是外挂式视觉能力
GLM-5.3-Flash的另一项核心变化,是将视觉能力原生集成进模型。按照已披露的信息,模型能够自主判断何时需要“观察”,并利用视觉反馈指导下一步行动。这一机制与单纯把图片转换成文字、再交给语言模型处理的方式不同,视觉信息被放进模型自身的任务判断和行动链路中。
这类能力的价值,主要体现在需要持续理解视觉环境并作出下一步操作的任务中。资料提到,GLM-5.3-Flash可用于前端开发、游戏开发和3D仿真等场景。对前端开发而言,模型不仅需要理解代码,还可能需要结合页面呈现进行判断;在游戏开发和3D仿真中,视觉反馈也可能成为任务推进过程的一部分。
不过,原生多模态并不等于所有应用都能直接获得相同效果。开发团队仍需要根据自身任务设计输入方式、反馈链路和错误处理机制。模型具备“何时观察”的能力,意味着应用可以围绕它构建更连续的视觉—推理—行动流程,但最终效果仍取决于任务编排和部署条件。
稀疏注意力与线性注意力混合,降低推理负担
价格大幅下降的技术基础,还来自注意力架构的调整。资料显示,GLM-5.3-Flash是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。两者并非简单替换关系,而是被组合到同一套模型架构中,以适应不同的计算需求。
在长上下文和持续交互任务中,注意力计算以及KV缓存都会影响推理过程的资源占用。公开资料称,相较于GLM-5.3,GLM-5.3-Flash的注意力计算量降低3.01倍,KV缓存大小降低4.44倍。这些变化对于需要长时间运行、连续输出或处理复杂上下文的应用具有直接意义:模型服务端需要承担的计算和缓存压力降低后,单位请求的资源消耗也有机会随之下降。
资料同时提到,GLM-5.3-Flash结合了30T Token多模态预训练语料。这里需要区分两个概念:更大规模的训练语料主要服务于模型能力形成,而激活参数、层数以及注意力机制则更多影响推理阶段的计算路径。智谱此次发布的特点,是在保持320B总参数规模的同时,压缩单次推理的激活规模,并通过注意力架构减少推理负担。
因此,“320B”和“18B”并不矛盾。前者描述模型整体参数规模,后者描述每个Token处理时被激活的参数规模。对于开发者来说,评估这类模型时不能只看总参数,也不能简单把激活参数理解为模型全部能力的缩小版。两组数字分别对应模型容量和推理效率,应该结合架构、上下文任务以及部署方式一起判断。
价格降到上一代十分之一,原因不止一个
GLM-5.3-Flash公布的价格是:输入价格为每百万Token 0.15美元,输出价格为每百万Token 0.50美元,命中缓存的输入价格为每百万Token 0.03美元。资料称,其价格为GLM-5.3的十分之一,限时折扣期间为GLM-5.3的二十分之一,同时为Claude Opus 4.8的四十分之一。
价格变化首先与模型架构有关。激活参数从32B降至18B,层数从92层降至45层,意味着单次请求不需要按照320B总参数规模完成完整计算。稀疏注意力和线性注意力混合架构又进一步降低注意力计算量与KV缓存规模。对于API服务商来说,这些变化有助于减少每个请求所需的算力和显存资源,从而为低价提供技术空间。
第二个因素是推理工程。智谱表示,GLM-5.3-Flash首次在大规模流量中使用国产芯片集群提供服务,并通过自研高带宽互联网络连接,在SGLang基础上构建专用推理引擎。资料称,在同一硬件上的初始基线基础上,其端到端服务性能提升了3倍,硬件效率和单Token成本达到与主流英伟达GPU相当的水平。
这部分信息说明,模型价格并不是只由参数量决定。模型架构、硬件适配、集群互联、推理引擎和服务调度都会影响最终成本。即使两个模型总参数规模接近,只要激活路径、缓存机制和硬件利用率不同,API价格也可能出现明显差距。
第三个因素则属于产品定价选择。资料中明确给出的价格对比,是GLM-5.3-Flash定价为上一代的十分之一,限时折扣进一步降至二十分之一。也就是说,十分之一并不能全部归因于参数压缩或注意力优化;公开信息同时显示,智谱还通过开源、API服务和编码平台接入等方式扩大模型使用范围,价格策略本身也构成产品推广的一部分。
对模型开发者意味着什么
对于模型开发者,GLM-5.3-Flash的开源和低价,降低了尝试320B级别模型的门槛,但并不意味着本地部署可以只按照18B模型来估算。18B是激活参数规模,模型整体仍有320B总参数,部署时还需要考虑完整权重、显存、并行方式和推理引擎适配。公开资料只明确了总参数、激活参数和架构方向,具体部署成本仍应以实际硬件环境和官方配置为准。
对于企业技术负责人,价格下降会改变模型选型逻辑。过去需要在能力、成本和多模态支持之间做出较大妥协的任务,现在可以把原生视觉能力、低激活参数和API价格放在同一张评估表中。尤其是前端开发、游戏开发、3D仿真等涉及视觉反馈的场景,团队可以重点验证模型是否适合自身工作流,而不是只比较文本问答效果。
对于AI应用团队,真正需要关注的是每次任务的完整调用链。低价模型可以降低输入、输出和缓存命中的费用,但应用仍可能因为重复传入上下文、过长的任务链路或无效的视觉观察而增加总消耗。合理的上下文管理、缓存使用和调用编排,可能比单纯比较模型单价更重要。
在模型正式接入生产环境前,团队还应分别测试文本任务、多模态任务、长上下文任务和连续行动任务。GLM-5.3-Flash的能力定位和技术架构已经公开,但不同应用对稳定性、响应速度、输出格式和工具调用的要求并不相同。低价格适合扩大试用范围,却不能替代面向业务流程的验证。
从“牛来”到正式发布,开源模型进入真实流量检验
在正式发布前,智谱曾以Ox-Alpha这一匿名模型在OpenCode和OpenRouter上进行测试。公开资料称,该模型在两个平台上创下调用量新高,其中OpenRouter在6天内处理了超过20万亿个Token,相关流量由国产芯片提供算力支持。
这段经历的重要性不只在于匿名模型最终揭晓身份,也在于模型在正式发布前已经经历了真实用户流量检验。与封闭环境中的单次演示相比,大规模调用会暴露上下文处理、并发服务、缓存、硬件利用率以及推理稳定性等问题。对于模型开发者和企业客户而言,这些工程指标往往决定了模型能否进入真实应用。
智谱还将GLM-5.3-Flash接入ZCode等编码平台,纳入GLM Coding Plan,并同步开放API调用。资料称,GLM Coding Plan每天限量发放10000张体验卡。对应用团队来说,这意味着模型的使用入口不再局限于研究者自行下载和部署,也可以通过编码平台或API进行验证。
不过,开源权重、平台接入和API低价对应的是不同使用方式。希望掌握部署环境的团队,会更关注权重、许可证和推理引擎;希望快速上线功能的团队,则更关心API稳定性、调用限制和应用集成成本。GLM-5.3-Flash同时覆盖这些路径,也使它的市场竞争不只停留在模型能力层面。
【软盟观察】
GLM-5.3-Flash把价格降到上一代十分之一,释放出的信号并不是“大模型越大越贵”这一逻辑失效,而是模型竞争开始从单纯堆叠参数,转向总参数、激活参数、注意力机制、硬件效率和服务定价的综合竞争。320B总参数保留模型容量,18B激活参数压低单次计算规模,稀疏与线性注意力混合架构减少注意力和缓存负担,再叠加国产芯片集群与专用推理引擎,构成了这次降价的技术基础;而十分之一的公开定价,则说明厂商还在主动用价格扩大模型的使用范围。
对应用开发者而言,低价最直接的影响是试错成本下降。团队可以把更多模型能力放进编码助手、视觉开发工具和复杂工作流中,也可以用更高频的调用验证原生多模态是否真正改善业务流程。但低价不等于总成本自动下降,调用次数、上下文长度、视觉输入、缓存命中和系统编排仍会影响最终账单。企业在选型时,不能只看每百万Token价格,还要测算完整任务链路的资源消耗和维护复杂度。
更值得关注的是,模型价格下降可能推动AI应用从“偶尔调用”走向“持续调用”。当模型能够以较低成本参与观察、推理和行动,应用就有机会承担更复杂的连续任务。不过,能力是否能转化为稳定产品,仍要看工具调用、错误恢复、权限控制和业务数据隔离等环节。GLM-5.3-Flash带来的真正变化,或许不是某一个价格数字,而是模型服务开始把高参数规模、多模态能力和低成本推理放在同一套产品逻辑中竞争。
关于文章版权的声明:
https://news.softunis.com/73914.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!

