【软盟资讯 · 7×24快讯】(2026年09月23日) 9月23日凌晨,高通在夏威夷2026骁龙峰会上宣布,携手阶跃、无量火及江波龙,基于第六代骁龙8超级至尊版平台,完成StepEdge-Omni 30B-MoE模型的端侧适配与推理优化。该模型采用混合专家架构,仅激活所需专家模块,内存需求较常规方案降低超50%,可在本地运行邮件理解、行程规划等全场景智能体任务,预填充吞吐达330 token/s、解码吞吐28 token/s,无需云端依赖,兼顾低时延与隐私保护。
【软盟观察】高通这步棋的关键,是把30B规模的MoE大模型真正塞进了手机端侧,还让内存需求降了超一半——过去端侧模型多在7B以下打转,30B能本地跑,意味着行程规划、邮件理解这类多步骤智能体任务,可以不把隐私数据上传云端就完成。混合专家架构“只激活所需专家”是省内存的核心,预填充330 token/s的吞吐也够看,说明它不只是能跑,而是跑得动、用得起。这背后是端云协同的新格局:重活交给云端大模型,轻量、敏感、低时延的活留在手机本地。高通联合阶跃、无量火、江波龙组生态,打的也是“芯片+模型+存储”的合纵牌。不过端侧30B的实际体验,还要看骁龙8的手机铺开后,开发者愿不愿意真把智能体业务往本地挪——算力边界清楚了,生态愿不愿意跟上,才是端侧AI真正的胜负手。