GLM-5.3-Flash项目配置文件显示,其45层架构中34层采用Kimi路线的KDA线性注意力,11层采用DeepSeek路线的KPool-DSA稀疏注意力,首次在同一模型中实现两种国产大模型注意力机制融合。
该架构中,全局Attention角色正被稀疏注意力接替,Qwen3.8-Flash-Next亦将每四层中的全局Attention改造为Qwen Sparse Attention。混合注意力通过分工降低长序列计算与KV Cache成本。
软盟短评:大模型Attention技术正从路线分流走向零件化重组,国产大模型架构自主创新进入模块化拼装阶段。
软盟资讯 news.softunis.com 7×24小时AI快讯
