当通用大模型还在复杂生成任务上比拼参数与推理深度时,微软在 2026 年 10 月上旬正式推出了一款"不会说话"的模型——Microsoft-Decision-1。根据微软公布的信息,这款模型基于阿里云开放权重模型 Qwen3.5-9B 进行后训练,参数规模约 90 亿,目前已在 Microsoft Foundry 开放公开预览,后续还将通过 OpenRouter 提供服务。它不生成文章、不做翻译摘要,核心能力只有一件事:在固定的备选方案中输出经过校准的决策评分,专为分类、请求分流、优先级排序、结果验证和工作流控制等任务优化。这是一个值得企业选型者认真看待的新品类,但官方亮出的那些漂亮数字,恰恰是最需要冷静核对的地方。

决策模型和通用大模型,到底是两种活
要理解 Decision-1 的价值,先得把它和 GPT、Claude、DeepSeek 这类通用大语言模型区分开。通用模型的工作方式是"生成":你给一个问题,它一个 token 接一个 token 地写出开放式回答,过程中还会"思考"、推理、组织语言。决策模型走的是另一条路——开发者提供问题、相关内容和一组固定答案选项后,模型通过单次前向计算直接返回各选项的概率分数,支持是非判断、多项选择和打分,但不生成任何解释文字。
微软公布的参数里,Decision-1 的上下文窗口为 32768 个 Token,仅支持文本输入。有媒体实测后给出一个很形象的说法:你让它和 DeepSeek"做选择题"其实不公平,DeepSeek 能写出一整段推理过程,Decision-1 连一句话都吐不出来,它们干的是完全不同层面的活。换句话说,决策模型不是来取代通用大模型的,而是补上了智能体和软件工作流里一直缺位的"判断层"——当一个 AI 智能体需要决定下一步是继续执行、重新尝试还是转交人工时,用这类小而专的模型来打分,比动用一个旗舰对话模型划算得多。
微软主打的卖点正是速度和成本。官方口径称,在涵盖近 15 万道题目的 36 项基准测试中,Decision-1 平均准确率达到 83.5%,位居参测模型首位;速度上约为 OpenAI 旗舰对话模型 GPT-6 Sol 的 35 倍,比竞品 Jev 快约 2.8 倍,比榜单第二名 H2O-Lightning-4B 快约 2.5 倍。延迟整体处在数十毫秒量级,远低于让通用模型"先思考再回答"所需的时间。定价方面,每百万输入 token 收费 0.042 美元,输出免费——这个数字和竞品 Jev 一字不差。
哪些场景才真正值得引入这层路由
决策模型的适用边界其实很清晰,它不是万能的提效工具,而是在特定结构下才划算。
高并发分类分流是最直接的场景。一个典型的例子是客服系统:每天要把海量进线消息按意图、优先级、是否需要人工介入做分类。如果用通用大模型逐条处理,无论延迟还是成本都难以承受。有测算指出,假设一条自动化流程每天要分类 100 万条内容,用专用决策模型和用旗舰对话模型,成本差距会被放大到相当夸张的量级——微软就宣称其做文本分类比 GPT-6 Sol 便宜 20 多倍。
多模型调度是第二类场景。当企业内部同时接入多个大模型、面对不同难度的请求时,需要一个前置的"调度员"快速判断该把请求发给哪个模型、是否需要重试、结果是否达标。这个调度员本身必须足够快、足够便宜,否则路由层反而成了瓶颈。决策模型"单次前向、只打分、不解释"的特性,恰好契合这个位置。
第三类是成本敏感的验证与流程控制。比如用一个专用模型去校验另一个生成模型的输出是否合规、是否触发某个后续动作。Vercel 的文档里有一句话被反复引用,大意是:你提供证据、定义每个问题的含义,由应用程序决定这个答案触发什么后果,模型只负责评分、不负责解释原因。这划清了决策模型的职责边界——它是一个高速的判断器件,而不是一个会讲道理的顾问。
采用前必须核对的三条边界
对企业选型者来说,官方数字看方向可以,当判决依据不行。真正决定要不要引入这层路由的,是下面几条需要自己验证的边界。
第一条,基准成绩和真实业务数据之间有鸿沟。需要特别注意的是,微软公布的这些性能数字全部是其自己报告的口径,目前没有第三方复核。83.5% 的平均准确率是在 36 项公开基准上得到的,而这些基准的题目分布、标注标准,和你自己业务里那套意图分类体系很可能对不上。更稳妥的做法是用自己真实的历史数据,构造一个贴合业务的小规模评测集,亲自跑一遍准确率和延迟,再和现有方案对比。
第二条,速度和稳定性要在自己的链路里测。35 倍、2.8 倍这些倍数,对比对象和测试环境都是微软选定的,拿 GPT-6 Sol 这种需要长时间"思考"的旗舰对话模型当参照,差距自然被拉大。你真正该关心的是:在你的网络环境、你的并发压力下,端到端延迟是多少、尾延迟波动大不大。微软还披露了一个稳定性指标——在输入扰动下决策翻转率仅 1.3%,这类抗扰动能力对路由层很重要,但同样建议用自己的脏数据去压测验证。
第三条,集成成本不能只算 token 单价。决策模型目前权重未开源,只能通过 Microsoft Foundry 和 OpenRouter 调用,这意味着你要把一个外部服务嵌进现有调用链路,涉及改造工作量、网络往返开销、服务可用性依赖,以及把判断逻辑从应用层迁移到模型层后的运维成本。此外,在概率校准测试中 Decision-1 得 92.2 分、排名第三,落后于 Jev 的 93.7 分和 Quyet-1.0-Large 的 93.1 分——如果你的业务高度依赖概率分数的可靠性,这个细节也值得纳入对比。
【软盟资讯观察】
从趋势看,决策模型正从一个边缘概念迅速变成巨头必争之地。Jev 一个多月冲上 75 亿美元估值,OpenAI 两周内跟进 Decisions API,微软直接拿阿里 Qwen3.5-9B 做底座、连定价都照抄竞品,这条赛道的"抄作业"速度本身就说明了方向——智能体要规模化落地,就必须有一层又快又便宜的判断器件来降本,而这正是通用大模型做不好的活。
从机会与风险两面看,机会在于高并发分类、多模型调度这类场景的成本结构可能被重写,谁先把路由层跑通,谁就能让智能体应用的边际成本大幅下降;但风险同样明确:当前所有性能数字都是厂商自报、缺乏第三方复核,基准第一不等于你的业务第一。对企业而言,理性姿态不是被 83.5% 和 35 倍直接说服,而是把它当成一个候选项,用自己的真实数据和链路跑一轮验证,把价格账、集成账、准确率账分开算清楚,再决定这层路由值不值得引入。
