微软推出 Decision-1:36 项基准测试准确率全面第一,基于 Qwen3.5-9B

微软近日推出新一代结构化决策模型 Microsoft-Decision-1,基于 Qwen3.5-9B 构建并经专项后训练,在覆盖约 15 万道问题的 36 项权威基准测试中准确率均高居第一。该模型不生成常规文本,而是从预设选项中精准选取最优解并赋予概率评分,可无缝嵌入现有应用程序、AI 代理和工作流系统,适用于路由分发、内容分类等业务场景,大幅提升复杂工作流的自动化决策效率。

技术架构与训练方法

Microsoft-Decision-1 以 Qwen3.5-9B 为底座,经过专项后训练(post-training)优化决策能力。与通用语言模型不同,它专注于结构化决策输出,核心功能是为每个备选答案计算概率置信度,帮助系统在多个候选中快速筛选最优选项。微软透露,未来计划将该模型迁移至更多底座模型之上。

稳定性与安全表现

微软表示,Decision-1 在经历各类扰动处理后决策翻转率极低,表现出较高的鲁棒性,同时在多项安全测试中达到预设标准。该模型现已支持通过 API 集成至第三方应用,开发者无需自行训练即可获得生产级别的结构化决策能力,有望在企业级 AI 工作流中快速落地。与 Jev 等专注决策场景的创业公司模型相比,Microsoft-Decision-1 在基准覆盖面上已实现显著超越,进一步加剧了决策模型赛道竞争。

值得注意的是,这也是微软首次在 Qwen3.5 系列底座上推出自有时决策模型。

相关阅读:Jev 估值百亿美元背后:17 天内 OpenAI、亚马逊、Cloudflare 全部跟进