首页 > 资讯 > Muse Spark 1.3来了,Meta开始拼AI智能体效率

Muse Spark 1.3来了,Meta开始拼AI智能体效率

36氪文章 2026-09-04 07:46 1 阅读 查看原文

美国当地时间9月2日,Meta发布最新模型Muse Spark 1.3。这是Muse Spark系列5个月内的第四次更新,也是目前最强调编码和智能体任务的一版。

Muse Spark系列模型的这次更新主要解决长任务中的实际问题,减少模型完成复杂任务时的无效步骤。

相比Muse Spark 1.2,Muse Spark 1.3在相关任务中平均减少约20%的工具调用,Token使用量减少约25%,同时提升了复杂指令、多任务处理、代码执行和安全决策能力。

Meta首席AI官汪滔认为,Muse Spark 1.3已经具备与Anthropic Claude Fable 5.1竞争的能力,在编码方面也优于OpenAI GPT-5.6 Sol。

第三方测试给出的结果也显示,Muse Spark 1.3已经进入头部模型的竞争范围。Artificial Analysis数据显示,Muse Spark 1.3(xhigh)的Intelligence Index达到61分,与GPT-5.6 Sol(max)、Grok 4.6(high)处于同一档;限量预览的Muse Spark 1.3(max)达到62分,仅落后于Claude Fable 5.1和Claude Opus 5的部分版本。

但这次升级更值得关注的地方,在于Meta对模型使用方式的调整:模型不再只是回答一个问题,而是要在不断变化的任务环境中,持续调用工具、管理上下文、处理多个工作流,并最终把结果交付出来。

01 长任务,跑得更稳

Muse Spark 1.3首先强化的是长任务处理能力。

基准测试显示,在256K至512K上下文测试中,Muse Spark 1.3拿到98.5分,领先第二名GPT 5.6 Sol的91.5分;当上下文扩大到512K至1M时,它仍以98.1分领先第二名的73.8分。

这类能力直接影响智能体能否处理持续时间较长的工作。任务一旦变长,模型需要记住的不只是用户最初的一句话,还包括已经执行过的步骤、工具返回的信息、临时形成的计划以及用户后来增加的新要求。

Meta在官方材料中展示了一种更接近实际工作的使用方式:用户可以在同一个较长的对话线程里同时处理多个任务,在执行过程中修改要求、加入新的问题,甚至直接打断模型正在执行的工作。

Muse Spark 1.3需要判断新的输入对应哪一项任务,再回到正确的执行路径,而不是把不同任务的信息混在一起。

面对开放式目标时,模型还可以主动调用工具,从不同来源获取信息并建立上下文。如果发现原有计划存在缺口,可以调整计划后继续执行;如果指令不明确,则先向用户提出澄清问题;遇到无法解决的问题,可以向用户寻求帮助;涉及重要且不可逆的操作,则需要在执行前确认。

Meta还调整了模型与用户之间的协作方式。对于希望随时掌握进度的用户,模型可以提供更多更新;对于希望模型自行完成任务的用户,则可以减少中途打扰,让任务继续执行。

这些变化共同指向一个问题:模型能不能在一个不断变化的工作环境里保持任务状态。

这与传统问答模型的使用方式并不相同。过去,一个Prompt通常对应一个相对完整的问题,模型生成答案后任务就结束了。智能体任务则更接近真实工作:目标可能并不完整,信息需要自己寻找,执行过程中会出现新的情况,用户也可能随时修改要求。

Meta给出的航空工程流体仿真案例,就是这种能力的集中展示。

模型拿到的是CFD模拟结果和一个STEP格式的CAD模型,需要先整理分析目标、计算域、网格、材料参数和边界条件,再提取峰值轴向速度、最大湍流强度、湍动能和受力等结果,随后分析升力、阻力、激波、流动分离和湍流,最后按照指定结构输出PDF报告。

这里面包含文件读取、数据分析、专业知识处理、结果提取、报告撰写和格式输出多个步骤。

Meta展示的结果显示,Muse Spark 1.3最终完成了这份报告。

这类案例也解释了为什么Meta把长上下文、复杂指令和工具调用放在这次升级的核心位置。模型面对的已从独立题目,转变为一条需要持续执行的工作链。

02 写代码,少绕几步

编码是Muse Spark 1.3强化最明显的另一个方向。

Meta表示,Muse Spark 1.3针对更长时间跨度的编码任务进行了训练。相比Muse Spark 1.2,如果没有必要,模型会减少交互轮次,同时让生成的代码更加简洁。

在DeepSWE测试中,Muse Spark 1.3达到75.4分,排名第一;代码库理解得分59.4,同样领先GPT 5.6 Sol。

Terminal-Bench 2.1中,Muse Spark 1.3(xhigh)达到85%,高于Muse Spark 1.2的80%;GDPval-AA v2达到1709 Elo,Muse Spark 1.2为1615;Tau3-Bench Banking从35%提升至47%。

限量预览的Muse Spark 1.3(max)表现进一步提高,Terminal-Bench 2.1达到86%,GDPval-AA v2达到1754 Elo,Tau3-Bench Banking达到52%,成为该项评估中的第一名。

Meta展示了两个更直观的游戏编程案例。

在RichMan Tycoon中,模型需要处理掷骰、投资、收取租金以及“Server Crash”等随机事件,并持续做出决策,直到其他创始人出局、决出最后赢家。

在即时战略游戏《Psychic Storm(心灵风暴)》中,模型需要控制蓝色突击队采矿、发电、建造步兵和坦克,在战争迷雾下获取信息,并根据资源和战场变化不断调整建造和作战安排,最终歼灭对手。

这两个案例都避开了单次代码生成,直接考察模型在动态变化环境中的持续执行能力。

因此,Meta工程师给出的另一个数据非常关键:完成相关任务时,Muse Spark 1.3平均减少约20%的工具调用,Token使用量减少约25%。这意味着,模型在任务规划、上下文利用和执行路径上的效率提高。

在Meta进行的9项智能体测试中,Muse Spark 1.3拿下5项第一,并且全部进入前二。唯一没有进入前二的是Agent IF Index,得分57.8,排名第三,低于GPT 5.6 Sol和Opus 5。

第三方测试机构Artificial Analysis也给出了类似结论。

Muse Spark 1.3(xhigh)的Intelligence Index达到61分,Muse Spark 1.3(max)达到62分,已经与当前部分头部模型处于同一竞争区间。对于Meta而言,这可能比单项测试拿到第一更加重要。

但与此同时,Muse Spark 1.3并非所有测试都出现上涨。

AA-LCR从83%降至79%,AA-Omniscience的准确率也有所下降。Artificial Analysis认为,Muse Spark 1.3提高了弃权率,在模型不确定时更倾向于不回答,这可能降低幻觉风险,但也会影响部分需要直接作答的测试成绩。

这与Meta强调的另一项变化有关:模型需要更准确地判断自己是否有能力完成当前任务。

Muse Spark 1.3的表现也开始进入开发者和模型研究者的直接比较。

云存储与协作平台Box CEO阿伦·莱维(Aaron Levie)认为,近期AI模型更新非常密集,Muse Spark 1.3又带来了一次重要升级。他特别提到,如果Muse Spark 1.3最终采用开放权重发布,可能改变美国开放权重模型的竞争格局。

AI研究员兼投资者里哈德·亚尔茨(Rihard Jarc)和大模型测试员@kimmonismus均关注Muse Spark 1.3的编码表现。他们认为其定价激进,并指出DeepSWE表现已超过Fable 5和GPT-5.6 Sol。

04 模型更强,价格没有涨

能力提升之外,Meta这次没有同步提高API价格。

Muse Spark 1.3(xhigh)仍按照每百万Token输入1.25美元、输出4.25美元收费,缓存输入为0.15美元,上下文窗口保持在100万Token,并支持文本、图像和视频输入。

Artificial Analysis计算显示,Muse Spark 1.3(xhigh)每项任务的成本约为0.55美元。在Intelligence Index达到59分以上的模型中,这一成本处于较低水平。

与之相比,GPT-5.6 Sol(max)约为0.95美元,Grok 4.6(high)约为0.94美元,Claude Opus 5(high)约为1.23美元。

不过,Muse Spark 1.3的单任务成本其实高于Muse Spark 1.2。原因在于智能体评估中的输入Token增加了约57%,输出Token增加约8%。模型能够减少无效工具调用,但面对更复杂的任务,也需要处理更多上下文。

因此,Meta反复强调的25% Token下降,更多体现的是模型执行过程中的效率变化。对于需要长时间运行的编码和智能体任务,少几次工具调用、少几个无效步骤,最终都会转化成实际的时间和成本。

Muse Spark 1.3目前已经进入Muse Code和Meta Model API,现有推理模式已经开放,max reasoning版本则将在完成额外安全测试后推出。

安全能力也是这次升级的重要组成部分。Meta表示,Muse Spark 1.3增强了对抗性输入和提示注入的抵抗能力,同时改善了复杂智能体任务中的安全判断,以及执行不可逆操作前的确认机制。

汪滔强调,团队在发布前进行了大范围安全测试和安全训练。此前Meta模型在网络安全测试中曾访问互联网并攻击外部服务,这一事件也影响了团队对Muse Spark 1.3安全机制的设计。

至于Muse Spark 1.3是否开放权重,Meta目前还没有最终决定。汪滔确认,Meta仍计划发布Muse Spark 1.2的权重。更大的Watermelon模型也在推进中,但目前没有具体发布时间。

扎克伯格在发布当天明确表示,Muse Spark 1.3是Meta目前在编码和智能体工作上的最大一次跃升,并预告了Watermelon和Muse Spark开放权重版本。

特约编译金鹿对本文亦有贡献

本文来自“腾讯科技”,作者:苏扬,编辑:徐青阳,36氪经授权发布。