微软Decision-1发布:36项基准83.5%准确率,延迟比GPT-6 Sol快35倍

2026年10月10日,微软正式发布决策模型 Microsoft Decision-1。不同于传统大语言模型生成开放式文本,该模型从预设选项中返回每个答案的校准概率得分,让软件直接依据置信度执行下一步动作。在覆盖近15万道问题的36项权威基准测试中,Decision-1平均准确率达83.5%,中位延迟仅85毫秒,输入定价0.042美元/百万Token,输出完全免费。这让微软在决策模型这条新赛道上,直接站到了TypeSafe Jev、Cloudflare Clef、OpenAI Decisions API的身侧。

什么是决策模型?

决策模型(Decision Model)是近年来快速崛起的一个 AI 细分品类。与标准大语言模型负责「写文本」不同,决策模型专做「结构化判断」:接收一段输入和若干预定义选项,输出每个选项的置信概率,下游软件据此决定执行哪个动作、或是否需要人工介入。

这一品类的核心价值在于「省 latency 省钱」。Satya Nadella 近日在 X 上表示,每增加一步决策操作都会叠加延迟——若一个 AI Agent 工作流包含20步连续决策,每步即使只增加100毫秒,完整流程也已多出2秒。决策模型用专用架构替代通用语言模型生成式开销,把这一步的耗时与成本压缩到传统方案的1/35。

技术架构:基于 Qwen3.5-9B 后训练

Decision-1 基于阿里云通义千问的 Qwen3.5-9B 开源权重构建,经过专项后训练转化为决策评分模型。微软官方透露,未来计划将其迁移至更多基座模型(包括微软自有模型与 OpenAI 模型)。

模型支持 yes/no、多选和评分三种选项类型,也支持对 AI 回答或智能体动作进行评分。上下文窗口为32768个 Token,可通过 Microsoft Foundry 和 OpenRouter 调用,暂不提供开放权重。

基准测试:36项权威测试排名第一

微软在官方博客中公布了内部测试数据。Decision-1 在36项基准测试中平均准确率83.5%,排名第一;置信度校准得分92.2%,排名第二。延迟表现尤为突出:P50中位延迟85毫秒,比 GPT-6 Sol 快35倍,比 Quyet-1.0-Large(排名第二)快4.5倍。

Decision-1 性能基准对比(微软内部测试)
指标 Decision-1 GPT-6 Sol Quyet-1.0-Large
36项基准平均准确率 83.5% — 81.9%
置信度校准得分 92.2% — —
P50 中位延迟 85ms ~3000ms ~380ms
相对延迟(越低越好) 1x 35x 4.5x
输入定价(/百万Token) $0.042 ~$1.5 —
输出定价(/百万Token) 免费 收费 —

内部实测:Xbox 团队10万条反馈分类

Decision-1 并非纸上谈兵。微软多个内部团队已完成实测:

  • Xbox Research 团队:对超过1万条游戏反馈进行分类,质量与 GPT-6 Sol 相当,速度提升14倍,成本降低约200倍。
  • Copilot 团队:用于 AI 回答质量评估任务,性能与 GPT-5.6 Luna 相当,速度提升最高达100倍。
  • on-call 工程师:故障知识检索场景,质量与速度均优于大语言模型基准。
  • Microsoft Discovery:自适应重规划评分,一致性是大语言模型评分的46倍,速度快3倍,端到端重规划快近4倍。

定价:输入0.042美元/百万Token,输出免费

Decision-1 的定价结构在业内极为罕见:输入 Token 收取 $0.042/百万,输出 Token 完全免费。这一策略瞄准的是高频重复判断场景——企业可以将大量结构化判断任务卸载给 Decision-1,无需担心输出 Token 成本膨胀。

竞争格局:超过100个决策模型同台

Decision-1 的发布让这条赛道的竞争进一步加剧。此前,TypeSafe AI 的 Jev(站内相关阅读)已率先获得广泛关注,日处理 Token 数万亿量级;Cloudflare 的 Clef 系列(站内相关阅读)以39毫秒超低延迟著称;OpenAI 也推出了 Decisions API(站内相关阅读),由 GPT-6 Luna 驱动。

微软的差异化策略在于:基于成熟开源权重快速构建产品,而非从零训练。微软表示,未来版本将切换至自有基座与 OpenAI 模型,届时可借助 Azure 的算力优势进一步压低部署成本。值得注意的是,所有性能数据均来自微软内部基准测试,第三方独立验证尚未完成。

常见问题

Decision-1 与普通大语言模型有何不同?
标准大语言模型接收提示词后生成开放式文本;Decision-1 接收输入和预定义选项后,直接输出每个选项的校准概率。例如输入「用户问题属于哪个工单类型」,模型返回各选项的置信分,下游软件据此自动分派,无需再调用一次 LLM 解析回复内容。

Decision-1 的输出能直接作为决策依据吗?
模型返回的置信分代表「校准概率」——置信90%意味着历史上大约90%的情况下该判断是正确的。但模型仍可能出错,尤其在边界样本或训练数据覆盖不足的领域。建议在关键业务流程中设置人工复核阈值,而非完全依赖模型输出。

如何调用 Decision-1?
目前已上线 Microsoft Foundry,OpenRouter 渠道即将开放。暂不提供开放权重下载,需通过 API 调用。微软官方建议从低频、低风险场景开始试点,逐步扩展至高吞吐量的生产工作流。

小结

Microsoft Decision-1 的核心价值在于「又快又准又便宜」:比 GPT-6 Sol 快35倍、输入成本不到其1/35、输出完全免费。基于 Qwen3.5-9B 的策略也侧面印证了国产开源模型已进入全球顶级企业生产系统。决策模型品类正处于「标准未统一、格局未定」的关键窗口期,Decision-1 的入局让这条赛道的竞争正式进入白热化阶段。