2026年9月27日,由清华大学副教授代季峰创办的北京人工智能创业公司NaiveAI开源了核心模型Naive-N0.5-Flash,并在Hugging Face上公开模型卡、权重与推理代码,采用MIT许可证。按官方描述,这是一款总参数约3090亿、推理激活参数约155亿的混合专家(MoE)模型,原生支持100万Token上下文,主打编程与AI研发场景,最高推理速度可达每秒约2000 Token。真正被外界反复提及的,并不只是这组参数,而是它背后那套"让AI模型参与制造AI"的研发模式。

开源MoE大模型架构概念示意图

先核验:这些数字到底说了什么

把公开信息拆开看,Naive-N0.5-Flash的几项关键指标相互印证得较为一致。总参数3090亿、激活约155亿,意味着它是一款"大体量、低激活"的稀疏MoE模型——推理时只调用约5%的参数参与计算,用较小的实际算力换取较大的模型容量,这也是当前头部开源模型普遍采用的降本思路。

更值得注意的是它的注意力设计。官方指出,100万Token的长上下文并非依赖传统的全量注意力(full attention),而是用滑动窗口注意力(SWA)叠加轻量级的DeepSeek稀疏注意力(DSA),两者比例约为5:1,并配合GQA4分组。公开的规格为48层Transformer,其中39层SWA、9层DSA:SWA只关注邻近约128个Token,DSA则从完整历史中筛选出最重要的约2048个Token再做后续计算。换句话说,整个网络保持在局部或稀疏运算,没有任何一层使用全量注意力。这套结构解决的核心问题是长上下文下的计算与显存开销——想要百万级上下文,又不想让注意力把算力和内存吃光。

据相关报道,该模型基于小米MiMo-V2.5基座进行开发,权重与推理代码以MIT许可证开放。MIT属于相当宽松的许可证,允许商用、修改与再分发,对企业和开发者而言意味着较低的使用门槛。

相较头部模型,它处在什么位置

从公开数据判断,Naive-N0.5-Flash的"身位"更接近一款专精型开源模型,而非追求全能的综合旗舰。3090亿总参数、155亿激活的规模,与近期多家国产开源MoE模型处在同一量级,并没有在参数绝对值上制造悬念;它的差异化更多体现在"全稀疏注意力+百万上下文"的架构选择,以及每秒约2000 Token的推理吞吐上。

需要客观说明的是,截至目前,公开信息中缺少该模型在主流权威基准上的横向跑分,也没有与同级别头部模型逐项对比的第三方评测。因此,"性能处于什么位置"更稳妥的回答是:在编程与AI研发这个被官方明确标注的垂直方向上,它具备长上下文和高吞吐两项对工程任务友好的特性;但它是否在综合能力上逼近头部闭源或开源旗舰,现阶段尚无足够可核验的数据支撑,建议以实际测试为准,不宜仅凭发布信息下结论。

"AI开发AI":对开发者意味着什么

NaiveAI真正想展示的,是一套研发流程的改变。按官方说法,研究人员负责确定目标、计算预算、约束条件和评价标准,AI模型则参与写代码、运行实验、分析结果、优化方案,并根据实验结果决定下一步尝试什么。Naive-N0.5-Flash本身就是这样被开发出来的——AI模型参与了混合注意力架构的探索,也参与了训练、推理与部署系统的优化。为支撑这种方式运转,NaiveAI还搭建了一套面向AI研发的基础设施。

对开发者来说,这里有两层信号值得区分。其一,模型本身面向编程和AI研发场景,长上下文意味着可以一次性塞入更完整的代码库、文档或实验日志,高吞吐则有利于批量生成与调试;这是"能用它来做什么"的实用层面。其二,"AI参与研发AI"代表的是一种工程范式的试水——把人类的角色从具体执行上移到目标设定与评价标准制定,由模型承担大量试错性的实验工作。这类模式能否稳定复现、是否真正提升了研发效率,目前主要依据厂商自述,外部还难以独立验证,开发者不妨保持关注但审慎看待。

企业选型:如何看待它的编程/研发定位

对企业技术负责人而言,判断是否引入这类模型,关键不在参数海报,而在它是否贴合自身场景。Naive-N0.5-Flash的卖点清晰:MIT许可降低了合规与商用顾虑,百万上下文适合处理长文档、长代码与复杂上下文任务,稀疏激活与高吞吐则有助于控制推理成本。对于以代码生成、代码理解、研发辅助为主要诉求的团队,它值得纳入候选池做一轮实测。

但选型仍需回到可验证的现实:一是缺少公开权威评测,企业应在自有业务数据上做对比测试,而非直接采信宣传指标;二是开源权重虽可自部署,但3090亿参数级模型的部署与运维对算力和工程能力有要求,需评估总体拥有成本;三是"基于MiMo-V2.5基座"等信息也应结合官方模型卡进一步核实。总体而言,它更适合作为"编程/研发专用"的备选,而非通用业务的默认底座。

【软盟资讯观察】

从趋势看,Naive-N0.5-Flash代表了国产开源的两条正在合流的路线:一是以稀疏MoE加全稀疏注意力压低长上下文成本,让百万Token从"炫技"走向"可用";二是把AI推到研发流程内部,尝试用模型自身加速模型迭代。前者是工程效率的现实红利,后者则是更具想象力的方法论实验。就机会而言,MIT许可与编程研发定位,给中小团队和创业公司提供了低门槛的自部署选项,在代码类场景可能较快跑通价值。就风险而言,当前最大的不确定性是缺乏独立权威评测——"全稀疏注意力不掉点""AI自主研发有效"这类说法,仍需时间和第三方数据检验;"AI开发AI"也带来可解释性、结果可复现与质量兜底的新课题。冷思考一句:参数和上下文长度已不再稀缺,真正值钱的是能被验证的能力与可持续的工程体系,别让范式叙事盖过落地实测。(以上数据以官方模型卡与公开报道为准,建议使用前自行核验。)