先说几个判断:
第一,Decision-1 不是“又一个更聪明的 LLM”,而是一类比大模型更窄、也更便宜的模型被正式命名了:决策评分模型。它不写文章、不做长推理,只干一件事——给固定选项打分(路由、分类、优先级、验证),让软件立刻照办。
第二,“比 GPT-6 Sol 快 35 倍”说的是延迟,不是智商。这个 35 倍只在“结构化决策”这一亩三分地里成立;把它理解成“微软模型全面碾压 GPT-6”是误读。
第三,最该盯的是“输出免费”这套定价。决策评分的输出往往就一个分数或标签,真正的成本在输入的上下文;按输入 token 收费、输出不要钱,正好卡在 workload 的七寸上,把“每次决策”的价格压到几乎可忽略。
第四,微软拿自己内部当成试验田——Xbox 反馈分析降本 200 倍、Copilot 质量管控快 100 倍。这些数字比发布辞更有说服力:在 agent 时代,省成本靠的往往是“小模型干大模型的杂活”,不是一味上更大的模型。
下面把这些点展开。
一、事件描述
微软于 10 月 9 日(美方)/ 10 日前后通过官方博客发布 Microsoft-Decision-1,由微软 CTO 办公室工程副总裁 Achint Srivastava 署名;Satya Nadella 也在 X 上对外公布。多家媒体(搜狐、Windows Report、网易、新浪等)同步报道。
先把关键数字用一张表理清:
| 维度 | 数值 | 口径 |
|---|---|---|
| 模型类别 | 决策评分(decision-scoring)模型 | 官方定义 |
| 基础模型 | Qwen3.5-9B 后训练 | 官方 |
| 速度(vs GPT-6 Sol) | 快约 35 倍(P50 延迟 ~1/35) | 官方 36 基准 |
| 速度(vs Quyet-1.0-Large) | 快 4.5 倍(基准第二) | 官方 36 基准 |
| 基准 | 36 项、近 15 万题,训练期盲测 | 官方 |
| 定价 | 输入 $0.042 / 百万 token,输出免费 | 官方 |
| 上线 | Microsoft Foundry;OpenRouter 计划中 | 官方 |
表:Microsoft-Decision-1 发布要点(来源:微软官方博客,2026-10-09;媒体佐证搜狐/Windows Report/网易/新浪 2026-10-10)
需要标清:35 倍与 4.5 倍均为“结构化决策”场景下的延迟/综合最快结论,非通用推理对比;Xbox 内部“快 14 倍、省 200 倍”、Copilot“快 100 倍”为具体内部用例数字,见下文。
二、它到底是什么:决策评分模型
要理解 Decision-1,得先分清“生成模型”和“决策模型”。大模型擅长写文章、做长链推理,但很多软件每天真正需要的,只是“这条工单归哪类”“这个回复给几分”“下一步继续还是停”。
Decision-1 干的就是后者:对固定选项集(是/否、多选、评分、按 rubric 给智能体行为打分)输出校准过的概率分数,通过一个简单的结构化 API 调用就拿到,软件能立即据此行动。官方把它定位为路由、分类、优先级排序、验证和工作流控制的基础件。
这背后的趋势是“把杂活从大模型手里交给更小的专用模型”:agent 工作流里大量决策是低创造性的、高频的、要快且要便宜的。与其每次都喊一个旗舰 LLM,不如用一个 9B 的决策模型专门拍板。
三、35 倍快,快在哪、不快在哪
速度声明是这次最容易被误读的点。官方口径是:在 36 项基准、近 15 万道题上,Decision-1 整体最快——比第二名的 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 快约 35 倍(P50 延迟约为其 1/35)。
必须说清边界:这是“结构化决策”的延迟比较,不是“谁更聪明”的比较。GPT-6 Sol 仍是更强的通用推理模型,Decision-1 只是在“给固定选项打分”这种高度受限任务上把延迟压到了极低。把 35 倍读成“微软决策模型全面超过 GPT-6”,是张冠李戴。
而且“快”还分场景:Xbox 内部实测比 GPT-6 Sol 快 14 倍,Copilot 质量管控比 GPT5.6 Luna 快 100 倍,科学发现里评分比 LLM 方案快 3 倍。差异说明快多少取决于任务结构——越标准的决策,专用模型优势越大。
四、定价:为什么“输出免费”很关键
Decision-1 的定价是输入每百万 token 0.042 美元、输出免费。这看似大方,其实精确贴着 workload:决策评分的输入是你要分类的上下文(可能很长),输出往往就一个分数、一个标签、几个字。
所以“只收输入、不收输出”等于把计费锚在真正消耗算力的那一侧。对一个每天要拍几百万次板的大系统,这意味着单次决策的成本低到可以不考虑——这也是它内部能跑到“降本 100~200 倍”的前提。便宜不是噱头,是让“每次决策都过模型”这件事在经济上成立。
五、微软拿自己开刀:内部用例才是真信号
发布里最硬的证据,是微软已经把 Decision-1 用在自己身上:
| 内部场景 | 做法 | 结果 |
|---|---|---|
| Xbox Research 反馈分析 | 归类超 1 万条开放反馈到固定主题 | 质量持平 GPT-6 Sol,快 14 倍、省 200 倍 |
| Copilot 质量管控 | 评估聊天/智能体响应质量 | 质量相当 GPT5.6 Luna,快 100 倍 |
| 事件响应 | 跨日志/工单/通话检索知识应对实时事故 | 优于 LLM 且更快 |
| 科学发现 | 自适应重规划中评分 | 一致性高 46 倍、快 3 倍,重规划整体快近 4 倍 |
表:Decision-1 微软内部用例(来源:官方博客)
这些数字的意义,不在“微软又省了钱”,而在验证了一条 agent 时代的成本公式:大量决策类工作,用 9B 专用模型替代旗舰 LLM,质量不掉、速度数量级提升、成本断崖下降。谁能把“拍板”这件事拆出来用小模型做,谁就能把 agent 跑在便宜的量级上。
六、几个还没讲透的边界
回到开头,发布很强,但有几点要等落地看:
- “比 GPT-6 Sol 快 35 倍”的基准构成未公开明细。36 项基准、近 15 万题的选型是否偏袒结构化任务,决定了 35 倍的外推范围;官方称训练期盲测、鲁棒性 8 种扰动仅 1.3% 翻转,是加分项,但第三方复测才作数。
- 底座是 Qwen3.5-9B,不是微软自家模型。官方说将 rebase 到 MAI 与 OpenAI 模型,意味着当前版本是“借底座快速验证品类”,长期归属可能变。
- 输出免费能否持续取决于用量结构;若用户把长输出也塞进决策 API,定价逻辑会受压。
这些不是挑刺,而是说从“发布指标漂亮”到“生产里真扛得住”,还差独立复测与长期定价的检验。
七、结语
微软在 10 月 9 日前后发布决策评分模型 Microsoft-Decision-1:基于 Qwen3.5-9B 后训练,专为路由/分类/优先级/验证等结构化决策设计,在 36 项基准、近 15 万题上比 GPT-6 Sol 快约 35 倍、比 Quyet-1.0-Large 快 4.5 倍,定价输入 $0.042/百万 token、输出免费,已上 Microsoft Foundry、计划接 OpenRouter,并在 Xbox 分析、Copilot 质控、事件响应等内部场景跑出 100~200 倍降本。
真正值得记的,不是“又快又便宜”,而是 agent 时代出现了一类被正名的新模型:把高频、低创造性的“拍板”从旗舰 LLM 手里卸下来,交给小的专用决策模型。35 倍是延迟、不是智商;输出免费是对 workload 的精确定价;内部 200 倍降本才是这套思路成立的最硬证据。至于它能不能从微软自家走向更广的开发者生态,要看 OpenRouter 接入后的第三方口碑与长期定价。