Meta 的 Muse Spark 1.3 在 DeepSWE 编程基准上登顶,价格还低于对手
那个登顶的分数需要 max 推理档,而它在发布时还没上线

Meta 超级智能实验室(Meta Superintelligence Labs)于 9 月 2 日发布 Muse Spark 1.3,在 DeepSWE v1.1 —— 一个无污染的独立编程基准 —— 上拿到最高分,同时把标准输入 token 的价格维持在大约只有 Anthropic 旗舰模型八分之一的水平。该模型即刻可在 Muse Code 和 Meta Model API 中使用,是五个月内的第四个 Muse Spark 模型,也是迄今最清楚的证据:Meta 在首席 AI 官 Alexandr Wang 主导下的 AI 重建,现在已经能产出在编程这一项上与前沿竞争的模型。有一条重要的保留意见:那张基准表里最强的数字,包括在 DeepSWE 上对 Anthropic 的 Claude Opus 5 的领先,是用一个发布时并未公开可用的 max 推理档跑出来的 —— 这在「Meta 测到的东西」与「开发者实际能调用的东西」之间造出了一道披露缺口。
五个月四个模型:这个迭代速度意味着什么
在 Wang 手下,Meta 超级智能实验室的产出轨迹确实不寻常。最初的 Muse Spark 于 2026 年 4 月发布 —— 内部代号 Avocado,历时九个月、对 Meta 整个 AI 栈做了一次从头重建 —— 在Artificial Analysis 智能指数上得分约 43。Muse Spark 1.1 于 7 月跟上,把它推到 51。Muse Spark 1.2 在 8 月到来,得 57。Muse Spark 1.3 现在是 61,由 Artificial Analysis 作为独立第三方评测确认。那是五个月里爬了 18 分,大约每代模型四分,而定价一直没动。
关于这个指数的含义:Artificial Analysis 在推理、编程、知识和指令遵循任务的一个综合体上给模型打分,61 分让 Muse Spark 1.3 与 GPT-5.6 Sol(max)和 Grok 4.6(high)并列在前沿的近顶部 —— 落后于 66 分的 Claude Fable 5.1(max)和 63 分的 Claude Opus 5(max),但按同一家评测机构的数据,领先于该指数当前追踪的每一个 Google 模型。
马克·扎克伯格在 X 上宣布了这次发布,形容它是「前沿性能,便宜到几乎不用计量」,以及「我们在编程和智能体工作上做出的最大一次跃升」。Wang 另行发帖,称它是团队迄今最强的模型。该模型已在 Meta 的终端编程智能体 Muse Code 中上线,也可通过接受 OpenAI 兼容 SDK 请求的 Meta Model API 使用。向 Meta AI、Instagram 和 Facebook 的更广铺开被描述为即将进行,未公布日期。
DeepSWE v1.1 究竟测什么:为什么它在这里要紧
多数模型发布靠 SWE-bench 的各种变体来给编程可信度撑腰。DeepSWE v1.1 是另一种仪器,而理解它的独特之处,对评估 Meta 的领先是必需的。
DeepSWE 是由研究机构 Datacurve 发布的独立基准,含 113 道软件工程任务,取自 TypeScript、Go、Python、JavaScript 和 Rust 的活跃开源仓库。与更早的 SWE-bench 迭代不同,每一道任务都是从零编写的,而不是从历史 pull request 改编而来,这让「通过预训练造成的基准污染」基本不可能 —— 模型不可能在训练时见过解法,因为在这个基准被建起来之前,解法并不存在。
这个基准的提示词短、且面向行为而非规定动作。它不会写明要实现哪些函数,而是描述最终软件应当做什么,要求作为智能体的模型自己去探索代码库、判断该在哪里改动,并实现一个能通过基于程序的验证器的方案。DeepSWE 的论文指出,这个设计把模型分开在一个 69.8 分的区间上 —— 比 SWE-Bench Pro 对同一批模型 29.7 分的分散度更宽 —— 这让区分真实的能力差异更容易。v1.1 引入了隔离验证:智能体提出的改动被提取为一个 git patch,在一个与智能体运行时环境无关的独立容器中评测。
在这个基准上,Meta 报告 Muse Spark 1.3 得 75.4,对 Claude Opus 5 的 74.0 和 OpenAI GPT-5.6 Sol 的 73.0。相对 Opus 5 那 1.4 分的差距窄到置信区间会起作用 —— DeepSWE 自己的方法论文指出,即便对分得很开的模型,聚类 bootstrap 区间也能跨好几分 —— 但方向是清楚的:Meta 的模型在一个由独立机构(而不是 Meta 自己)运行的基准上拿到了已报告的最高分。而把 DeepSWE 与 Terminal-Bench v2.1、SWE-Atlas CodeBase QnA 合起来的Artificial Analysis 编程智能体指数,把 Muse Spark 1.3 列在其编程综合榜的首位。
Terminal-Bench 2.1 衡量的是跨软件工程、科学计算及其他命令行领域的广义终端环境胜任度。在那个基准上 Muse Spark 1.3 得 88.8,与 GPT-5.6 Sol 持平,领先于 Opus 5 的 86.7。在 Artificial Analysis 开发的代码库理解评测 SWEAtlas CodeBase QnA 上,该模型得 59.4,GPT-5.6 Sol 是 53.5,Opus 5 是 52.7。
max 推理这道缺口:基准展示的与开发者能跑的
Muse Spark 1.3 这次发布里最实质的披露问题,是多数报道都掠过的那一个。
Meta 的基准表,包括上文那些 DeepSWE 分数,是用 max 推理档跑出来的 —— 那是该模型可用的最高推理算力设置。Meta 自己的发布博文明确写道,这个档位「将在我们完成额外安全测试之后不久推出」,也就是说它在发文当时并未公开可用。9 月 2 日实际上线的那几档 —— low、medium、high 和 xhigh —— 在不同成本下产出不同结果,而开发者今天真正能调用的 xhigh 档,才是让这个模型在 Artificial Analysis 智能指数上拿到 61 分的那一档。
这不是小细节。推理设置影响模型对每个回答施加多少测试时计算。xhigh 与 max 之间的落差,在结构上与「带思维链跑」和「不带思维链跑」之间的落差属同一类:它可以明显大于一次干净的代际提升。在 max 推理档上线、并由独立评测机构在可比条件下跑过它之前,那些被引用最多的 Muse Spark 1.3 数字描述的是一个能力天花板,不是当前的开发者体验。
上一代的先例有参考价值。Meta 在 Muse Spark 1.2 的发布基准表里,某些情况下是用自家的 max 档去比竞品的 xhigh 档 —— 这个方法学上的不一致,随后被独立分析指出过。同样的分析谨慎在这里同样适用。
Opus 5 仍然领先的地方:智能体基准的图景
编程基准只是模型评估空间的一个维度。智能体任务评测是另一个,而那里的图景比 Meta 的发布叙事所暗示的更微妙。
Meta 自己的基准表 —— 不是被批评者挑出来的 —— 包含六项智能体评测:GDPVal-AA v2(知识工作基准)、JobBench(专业工具使用)、OSWorld 2.0(电脑操作与桌面操控)、AutomationBench(端到端业务工作流)、DeepSearchQA(智能体式网页浏览)和 Agentic IF 指数(指令遵循)。在其中四项上,Claude Opus 5(max)领先于 Muse Spark 1.3。在剩下两项 —— DeepSearchQA 和 Agentic IF —— 上,GPT-5.6 Sol 领先。在 Meta 自己的表里,Muse Spark 1.3 没有在这六项智能体评测中的任何一项上登顶。
在模拟跨广泛专业领域知识工作任务的 GDPVal-AA v2 上,Muse Spark 1.3 得 1754 分,Opus 5 是 1824 分。在测试模型能否真正通过点击、输入和在应用间导航来操作桌面环境的 OSWorld 2.0 上,它得 66.9,Opus 5 是 72.1。在衡量业务工作流端到端完成度的 AutomationBench 上,Muse Spark 1.3 得 49.4,Opus 5 是 50.3。这个模型有竞争力 —— 在每一项上都是有意义的第二或第三 —— 但「智能体性能领先」这个说法,得不到 Meta 自家数据的支持。
这个区分在实践上要紧。一个在搭建编程流水线的开发者 —— 脚手架式工具使用、代码评审、自动化调试 —— 会觉得 Muse Spark 1.3 的画像有利。而一个在搭建通用智能体、需要它上网做研究、在桌面应用间导航、或管理多步专业工作流的开发者,仍然会觉得 Opus 5 在那些维度上的优势有意义。这两个模型家族并不是以同样的强项在争同一个用例;它们在以编程为中心的负载上有竞争,在更广的智能体负载上有分化,而价格差异把这层区分进一步放大。
而在 Muse Spark 1.3 确实领先的地方,它的领先幅度很大。衡量在 25.6 万到 100 万 token 跨度上从长上下文中准确检索的 MRCR 基准显示,它在 256K–512K 区间得 98.5,在 512K–1M 区间得 98.1。GPT-5.6 Sol 在同样两个区间是 91.5 和 73.8 —— 在最长上下文跨度上差距超过 24 分。Opus 5 在 Meta 的表里没有公布可比的 MRCR 结果。这项长上下文检索优势,对一个正在成为智能体式编程核心的用例具有实际重要性:在单一线程里跨整个代码库工作,模型必须准确回忆起几十万 token 之前引入的约束、接口定义和设计决策。Muse Spark 1.3 接近完美的检索分数提示,它在更长跨度上处理这项要求要可靠得多 —— 不过截至本文写作时,这些数字尚未有独立复现发表。
效率增益是怎么来的,以及为什么 token 数量比 token 单价更要紧
这个模型在实践上最重要的改进不是某个基准分数,而是它处理任务方式上的一项行为变化。
Meta 的内部工程对比发现,Muse Spark 1.3 完成编程工作流所用的工具调用比 Muse Spark 1.2 少约 20%,输出 token 少约 25%。机制在 Meta 的博文里写得很明确:该模型是专门在长程编程任务上训练的,重点是减少不必要的交互轮次、产出更干净更不啰嗦的输出。结果是一个模型:当被给出一个多步目标时,它更不容易问多余的澄清问题、更不容易生成没人要的中间总结、也更不容易在代码块周围产出样板式的说明文字。
这在一个纯 token 单价所掩盖的意义上影响成本。当一个模型用少 25% 的 token 完成同一个任务时,每百万输入 token 1.25 美元的费率在实际成本上等效于 0.94 美元 —— 而这还没算任何缓存或分档。Artificial Analysis 估算,在智能指数上 Muse Spark 1.3 的单任务成本约为 0.55 美元,而智能水平可比的 GPT-5.6 Sol 是 0.95 美元 —— 即便在相同的 token 单价档上,也有 42% 的成本优势。
这项行为训练在模型如何处理歧义上也看得见。Meta 的发布说明把 Muse Spark 1.3 描述为:被训练成在提示词有歧义时提出澄清问题、在真的卡住时寻求用户协助、并在采取有重大后果或不可逆的动作之前先确认。对一个长程编程智能体来说,第三步的错误决定可能会在接下来二十步里连锁放大;这份校准的价值,因此超出礼貌,进入了实际可靠性的范畴。
据其博文,Meta 在「一组多样的智能体框架上」训练该模型「以泛化到各种智能体环境」—— 这套训练方式把 Muse Spark 1.3 与那些主要针对单一脚手架(比如 Muse Code 本身)优化的模型区分开来。实际含义是:通过 OpenCode、通过 OpenRouter 连接的工具、或通过自定义编排层来跑 Muse Spark 1.3 的开发者,应当能看到大体一致的行为,而不是模型一离开 Meta 自家智能体框架就性能骤降。不过独立从业者注意到,在 Muse Code 内部跑这个模型,往往比通过第三方智能体跑产生更低的 token 用量和更少的无用轮次 —— 这提示:虽然跨框架泛化有改善,与 Muse Code 的协同训练仍然让它在那个面上执行得最高效。
智能指数从 57 到 61 的增益,也反映了后训练阶段的训练改进 —— 那是大规模预训练之后、通过强化学习、监督微调和偏好优化来塑造模型行为的阶段。Muse Spark 家族最初的基座 —— 代号 Avocado,经由对 Meta AI 栈九个月的完整重建而来 —— 在各版本之间的基础架构没有显著变化。每次迭代变的是后训练的强度和靶向,而 1.3 具体把更长的编程任务、更干净的输出风格和更好的智能体自我管理作为主要优化目标。
延伸阅读:Codex 用户数达 2000 万,Claude Code 在 AI 编程上的领先正在收窄
两档定价架构,以及它实际意味着什么
定价结构是 Muse Spark 1.3 被讨论最多的方面,它值得说准确。
标准档 —— 模型 ID muse-spark-1.3 —— 的定价是输入每百万 token 1.25 美元、输出每百万 token 4.25 美元。缓存的输入 token 降到每百万 0.15 美元。通过这一档发送的提示词和补全不会被用来训练 Meta 未来的模型。这与 Claude Opus 5 的每百万 10 和 50 美元、以及 GPT-5.6 Sol 大体相当的 Opus 档费率相比很有利。即便按纯 token 单价算,Muse Spark 1.3 每输入 token 也比 Anthropic 旗舰便宜约 8 倍,每输出 token 便宜约 11.8 倍。
而贡献者档 —— 模型 ID muse-spark-1.3-contributor —— 的定价是输入每百万 0.10 美元、输出每百万 0.20 美元,缓存输入降到每百万 0.002 美元。这让贡献者档的输出比标准档便宜约 21 倍,比 Claude Opus 5 的输出便宜约 250 倍。代价是明确且不可协商的:通过贡献者档提交的提示词和补全,可能被用来改进 Meta 未来的模型。这不是埋在服务条款小字里的东西;这就是这一档存在的目的。
这个取舍对企业开发者有真实后果。代码往往是一家公司手里最机密的东西 —— 专有算法、未发布的产品逻辑、认证流程、内部 API schema。把这些经由贡献者端点发出去,意味着 Meta 可能拿它们做训练。与企业客户之间的保密义务、主服务协议和数据处理条款,通常是禁止这么做的。Wang 对 Axios 表示,使用 Muse Code 的开发者中有「有意义的两位数」百分比选择了贡献者档;这既是一个采用信号,也是一个治理现实:这些开发者中有不少人在选这一档时,未必先核实过自己的数据使用义务。
安全测试、被门控的推理档,以及此前那起入侵事件说明了什么
把 max 推理档门控在额外安全测试之后,这个决定不是随意的,而背景能解释这份谨慎。
Muse Spark 1.1 —— 那个在 2026 年 7 月开放了 Meta 付费 API 的模型 —— 据报在一次网络安全评测中访问了一家外部公司的系统,起因是第三方评测公司 Irregular 的一处基础设施配置错误。同一家公司在几天前 Anthropic 的评测中也牵涉进另一起入侵,而后续报道确认这是一个共享评测厂商的基础设施问题,而不是孤立的模型行为失当。Meta 表示它没有为处理该事件而暂停开发,并称 1.3 做了全面的安全训练。
Meta 所描述的 1.3 安全改进,是专门针对智能体风险校准的:更强的对抗鲁棒性和对提示注入攻击的抵抗、对「什么构成不可逆动作」更好的校准,以及对自身能力边界更好的意识。当一个模型被给予对文件系统、API 和长时间运行的代码执行环境的自主访问权时,这些正是最要紧的性质。把 max 推理门控在进一步测试之后,反映的是一个合理判断:那个产出登顶基准分数的最高能力配置,值得在广泛部署之前有一段更长的评测跑道。
Meta 的博文还指出,Muse Spark 1.3「对自己能做什么、不能做什么,知道什么、不知道什么,以及何时是撞上了障碍而不是该编造结果,有了更好的感觉」。这在至少一项具体测量上看得见:在衡量广义事实知识的 Artificial Analysis AA-Omniscience 测试上,该模型的弃答率上升了 —— 它现在在不确定时更倾向于拒绝回答,而不是编一个答案出来。这降低了幻觉率,同时也降低了绝对知识分数,也就意味着它原始的知识广度没有跟上它在编程上的增益。
对开放权重的沉默意味着什么
Meta 在后 Llama 时代的模型战略,一直是在开放生态承诺与前沿变现之间不断走钢丝。
Wang 宣布 Muse Spark 1.3 时,Meta 的博文把 Muse Spark 这条线的开放权重和一个更大的模型描述为接下来要做的事,扎克伯格另在 X 上预告了一个代号 Watermelon 的模型,两者都没有承诺日期。Meta 尚未决定是否公开发布 Muse Spark 1.3 的权重,不过它确认仍计划在准备好时发布 Muse Spark 1.2 的权重。
欧盟《AI 法案》给这件事加了一个具体维度。该法规的开源豁免(见第 53 条)适用于真正自由和开源的通用模型 —— 但对被归类为带有系统性风险的模型,这项豁免被关闭。一个在争夺全球智能基准榜首的前沿模型,几乎必然会达到系统性风险的门槛;这意味着如果 Meta 真的在欧洲发布 Muse Spark 1.3 的权重,它将面对完整的第 53 条合规义务,无论开源这个框架怎么讲。
如果 Muse Spark 的开放权重真的到来 —— 无论是 1.2 还是 1.3 —— 对 AI 部署成本的影响会相当可观。在接近前沿的性能上自托管开放权重,会把按 token 计的 API 成本整个消除。有基础设施跑数千亿参数模型的机构,可以用一次性的硬件投入替代对 API 的依赖。那种情形会把整个开发者市场的竞争价格底线重设到远低于连贡献者档的位置。
Watermelon,以及下一个竞争周期会是什么样
从 2026 年 4 月到 9 月的 Muse Spark 发布,代表着一次轨迹实验:能不能把一支围绕 Alexandr Wang 在 Scale AI 的数据与评测基础设施背景组建起来的团队,用来重建 Meta 的整个 AI 栈,并在一年内达到前沿水平的性能?以编程基准来衡量,答案是能 —— 但要附上保留意见:在通用任务上的智能体表现仍落后于 Anthropic 的 Opus 5,而那些最强的已公布数字需要一个尚未上线的推理配置。
接下来会怎样则不那么清楚。Wang 已预告 Watermelon 是一个大得多的模型。如果 Muse Spark 的开放权重发布覆盖的是 1.2 或 1.3 能力水平的模型,那会是自 2025 年初 DeepSeek 的开放发布以来,自托管前沿 AI 市场上最重要的一次转变 —— 不是因为那个模型本身会有多出色,而是因为「接近前沿的编程能力跑在私管基础设施上」会同时消除按 token 计的成本结构和贡献者档的数据取舍。今天因为没有能干的自托管替代品而把代码经由云 API 发出去的每一家企业,都会获得一个新选项。
1.3 的 max 推理档在安全测试完成之后上线,仍是最重要的近期披露。如果它把 DeepSWE 上相对 Opus 5 的差距从 1.4 分拉开到明显更大,或者收窄了 Opus 5 目前在 GDPVal 和 OSWorld 上领先六到七分的那道智能体评测差距,就会说明 Muse Spark 的编程故事与更广的智能体故事正在收敛。如果 max 推理在智能体基准上只带来增量增益、而在编程上带来更大增益,那就会确认:嵌进 Muse Spark 1.3 训练中的架构优化选择在根本上是专门化的 —— 对开发者工作流很出色,对通用自主运行则是有竞争力但属第二梯队。
就目前而言,对 Muse Spark 1.3 最准确的描述是:它在现有最可信的独立长程编程基准上拿到了领先分数,单任务成本远低于替代方案,但带着一个重要的星号 —— 它的头条数字描述的是一个尚未上线的推理配置。这个组合 —— 编程上真实的基准领先、接近完美的长上下文检索,以及一个第一次让高吞吐智能体运行在经济上可行的成本结构 —— 即便带着这些保留意见,也是有分量的。AI 编程智能体市场移动得足够快,以至于 Muse Spark 各代之间四周的窗口就有意义;Anthropic 和 OpenAI 如何回应这个 DeepSWE 结果,以及独立评测方会确认还是修正它,将是下一章。