首页 > 开源 > 微软发布基于 Qwen 后训练的决策模型 “Microsoft-Decision-1”

微软发布基于 Qwen 后训练的决策模型 “Microsoft-Decision-1”

OSChina资讯 2026-10-10 14:51 6 阅读 查看原文

就在 TypeSafe AI 凭决策模型 JEV 拿到 75 亿美元估值的同一天前后,微软也下场了:发布 Microsoft-Decision-1,一款专门的『决策评分』模型,在 Microsoft Foundry 里可用,OpenRouter 即将上线。它的定位和 JEV 高度重合——不给文本,给结构化输出:给定一组答案选项时,模型输出每个选项的校准概率,可直接被软件消费。

技术上最有意思的是底座:微软坦白说是在 Qwen3.5-9B 上做后训练得到快速单程决策评分,后续还会 rebase 到自家 MAI 和 OpenAI 模型上。参数不大、路子专治——这就是决策模型和 LLM 的分野:LLM 为了生成文本无所不包,决策模型只干『分类和决断』这一件事,于是又快又便宜。

官方给的性能数字相当炸。36 个基准、近 15 万道题、全部对训练保持盲测——最高准确率的同时,也是测到最快的:比第二名 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 快 35 倍。P50 延迟约 35 倍于 GPT-6 Sol。鲁棒性测试:同请求做 8 种扰动,平均只有 1.3% 的情况下决策翻转,其中描述换说法、选项乱序时翻转率是 0。安全测试覆盖 5,250 个请求、11 个基准。

最醒目的一组内部用例是 XBOX Research:用 Decision-1 处理一万多条开放式用户反馈、按研究者定的主题归类,质量匹敌 GPT-6 Sol,但快 14 倍、便宜 200 倍。Copilot 团队拿它做聊天和 agentic 响应的质检,报告说比 GPT5.6 Luna 快 100 倍;微软 Discovery 的科研自适应重规划场景里,它比 LLM 打分一致性高 46 倍、速度快 3 倍。

价格直接把决策模型的商业逻辑摊开了:输入 token 每百万 0.042 美元,输出免费。当 agent 在真实世界里开始『做决定』,每个动作前加一次模型判断就是一笔开销——决策模型赌的就是这一跳的成本能被压到几乎可以忽略,从而让『路由、分类、质检、流程控制』这几件 agent 时代最频繁的事变得便宜。

也让一个趋势更清楚了:决策模型正在变成独立于 LLM 的一条赛道。JEV 拿到了市场的钱,微软用 Foundry 兜底,OpenRouter 也接——下一步就有意思了,当模型厂商把『不做决定的语言模型』和『只做决定的评分模型』拆开卖,agent 的成本结构会被重算一轮。

来源: