Microsoft-Decision-1 微软推出的新一代 AI 决策模型
Microsoft-Decision-1是什么
Microsoft-Decision-1是微软推出的新一代快速决策AI模型,专为结构化决策任务设计,可从预设选项中选出最优解并为各备选答案赋予概率评分,供下游应用判断执行、重试或转人工。Microsoft-Decision-1在36项基准测试准确率均列第一,速度达GPT-6 Sol的35倍,输入每百万tokens仅收0.042美元且输出免费。模型基于Qwen3.5-9B构建,已上线Microsoft Foundry。

Microsoft-Decision-1的主要功能
- 最优解选取 :从预设选项中选出最优答案,并输出各备选答案的概率评分。
- 路由分发 :将请求或任务智能分发至合适的下游模块或服务。
- 内容分类 :对文本等内容进行快速归类,如Xbox团队用它分类上万条游戏反馈。
- 任务优先级排序 :为多个待处理任务判定处理顺序。
- 结果验证 :评估AI生成结果的质量,决定是否通过或重试。
- 工作流控制 :作为Agent工作流的编排组件,判断继续执行、重新尝试、升级处理还是转交人工。
Microsoft-Decision-1的技术原理
- 底座架构 :Microsoft-Decision-1基于开源的Qwen3.5-9B模型构建,参数规模适中,兼顾推理速度与部署成本,微软计划未来将其迁移至自研MAI:系列及OpenAI模型等其他底座之上。
- 专项后训练 :模型经过以单次决策评分为核心的专项后训练,针对预设选项的概率化评分,从而将大语言模型改造成结构化的决策引擎。
- 决策机制 :模型对每个决策请求一次性完成评分与选择,相比多轮推理的大语言模型大幅降低延迟;官方称连续20个决策各增加100毫秒的累计延迟问题在此架构下被显著压缩。
- 鲁棒性设计 :针对决策稳定性做专门优化,在同一请求的8种扰动形式下平均决策翻转率仅1.3%,在选项描述改写或顺序颠倒等场景下翻转率为零,确保输入变化不影响决策一致性。
- 安全对齐 :模型经受了涵盖11项基准、5250条请求的安全测试,覆盖有害内容识别、越狱攻击及提示词注入等场景,在拒绝有害请求的同时保持较高的正常任务效用。
如何使用Microsoft-Decision-1
- 接入平台 :通过微软旗下的 AI 开发平台 Microsoft Foundry 向开发者开放使用。
- 定义决策场景 :将任务转化为预设选项 + 选择最优解的结构化决策问题,如路由分发、内容分类、优先级排序等。
- 提交请求 :将待决策内容用结构化格式提交给模型。
- 获取概率评分 :模型返回最优选项及各备选答案的概率评分,而非开放式文本。
- 驱动下游动作 :根据评分结果判断继续执行、重新尝试、升级处理或转交人工审核。
- 嵌入工作流 :可无缝嵌入现有应用程序、AI Agent 及工作流系统,作为编排基础组件。
Microsoft-Decision-1的核心优势
- 速度极快 :P50 延迟是 GPT-6 Sol 的 35 倍、Quyet-1.0-Large 的 4.5 倍,是实测最快的决策模型。
- 准确率领先 :在近 15 万道题目的 36 项基准测试中准确率均排名第一。
- 成本极低 :输入每百万 tokens 仅 0.042 美元且输出免费,内部实测分类任务成本较 GPT-6 Sol 降低约 200 倍。
- 决策可评分 :为各备选答案输出概率评分,方便下游判断执行、重试或转人工,比黑盒式生成更可控。
- 鲁棒性强 :8 种扰动下决策翻转率平均仅 1.3%,选项改写/颠倒场景翻转率为零。
- 安全可靠 :通过 11 项基准、5250 条请求的安全测试,能拒绝有害请求且保持正常使用效用。
Microsoft-Decision-1的项目地址
- 项目官网 :https://commandline.microsoft.com/microsoft-decision-1-model-foundry/
Microsoft-Decision-1的同类竞品对比
对比维度 | Microsoft-Decision-1 | Jev(TypeSafe AI)
| 对比维度 | Microsoft-Decision-1 | Jev(TypeSafe AI) |
|---|---|---|
| 模型品类 | 快速决策模型(结构化决策任务) | 首个 System One 决策模型 |
| 技术底座 | 基于 Qwen3.5-9B 后训练(计划迁移至 MAI/OpenAI 底座) | 自研架构 + 并行采样器,RLCD(校准决策强化学习)训练 |
| 决策速度 | P50 延迟为 GPT-6 Sol 的 35 倍 | 端到端 70–500ms,同任务比 LLM 快 40–200 倍 |
| 准确率 | 36 项基准测试(近15万题)全部第一(微软自测) | JevBench 官方排名第 3(71.49 分),已被广泛实测 |
| 输出形式 | 最优选项 + 各备选答案概率评分 | 带校准概率的类型化答案(Choice/Score/Noul 三种判断) |
| 鲁棒性 | 8 种扰动翻转率 1.3%,选项改写/颠倒场景为零 | 校准性为核心卖点(置信度与准确率对齐) |
| 定价 | 输入 $0.042/百万 tokens,输出免费 | 输入 $0.042/百万 tokens,输出免费 |
| 生态接入 | Microsoft Foundry(OpenRouter 计划中) | 官方 API + SDK,社区生态丰富(路由、分类等开源项目) |
Microsoft-Decision-1的应用场景
- 智能路由分发 :将用户请求或任务流量智能分发至最合适的下游服务、模型或 Agent。
- 内容分类与审核 :对海量用户反馈、评论进行快速分类和有害内容识别。
- 任务优先级排序 :在客服工单、缺陷处理等场景中判定任务处理顺序,实现工作流自动化编排。
- AI 结果验证 :作为 AI 响应评估器,判断生成结果是否合格,决定放行、重试还是升级处理。
- 异常决策与升级 :在事故响应、质量控制等场景中,基于概率评分决定是否转交人工审核,构建人机协同的安全兜底机制。
相关工具
与本文相关的 AI 工具