AI++
竞争格局·2026-08-05·7 分钟阅读·AI++ 编辑部

Meta 首款编码 Agent Muse Code 开测:1M 上下文、Contributor 档便宜一个数量级,三项基准全部第二

8 月 5 日,Meta 超级智能实验室发布终端编码智能体 Muse Code 测试版及为其协同训练的 Muse Spark 1.2 模型。模型在 Terminal-Bench 2.1、DeepSWE v1.1 与 Meta 内部编码基准上均排名第二,三项全部落后于 Claude Opus 5。Muse Code 的差异化不在跑分,而在运行时设计:常驻异步后台子智能体、本地追加式事件日志带来可精确重放与崩溃续跑。定价上 Contributor 档比标准档便宜一个数量级,代价是数据可被用于产品改进。

背景:编码 Agent 赛道上,Meta 是最后一个下场的巨头

过去一年,编码智能体这条赛道基本由 Anthropic 的 Claude Code 与 OpenAI 的 Codex 定义,Cursor、Cline、Kilo Code 等产品在其外围快速生长。Meta 一直缺席——今年 4 月首版 Muse Spark 把 Meta 重新推回前沿推理与视觉基准的前五,却在最关键的智能体编码评测上掉队。

8 月 5 日,这个空缺被补上了。Meta 超级智能实验室(由首席 AI 官 Alexandr Wang 领导)同时发布了终端编码智能体 Muse Code 测试版和为它协同训练的 Muse Spark 1.2 模型。扎克伯格在社交平台上亲自宣布,称它能在大型代码库中完成完整的软件工程任务:分析项目、规划修改、编写代码、运行工具、验证结果。

Muse Code 与 Muse Spark 1.2 发布

事实:跑分第二,但架构是另一套思路

按 Meta 官方公布的评测图表,Muse Spark 1.2 在三项编码基准上均为第二名:

  • Terminal-Bench 2.1:82.9%(运行于 Muse Code),高于 GPT-5.6 Terra 在 Codex 中的 81.8% 与 Grok 4.5 在 Grok Build 中的 81.6%,落后于 Claude Opus 5 最大推理档在 Claude Code 中的 86.7%
  • DeepSWE v1.1:59.3%,位列第三,落后于 Opus 5 的 65.0% 与 GPT-5.6 Terra 的 64.8%
  • Meta 内部编码基准:70.6%,高于 GPT-5.6 Terra 的 65.4% 与 Gemini 3.6 Flash 的 63.9%,但仍落后 Opus 5 的 79.4% 近 9 个百分点

口径需要注意:以上均为 pass@1、五次尝试取平均,在隔离的 Daytona 云沙箱中运行;每个模型跑在各自的智能体产品里。Terminal-Bench 2.1 覆盖官方发布的全部 89 项任务,DeepSWE v1.1 含 113 项任务、跨 91 个仓库与五种语言,Meta 内部基准由 440 项真实内部 PR 构建。另有一处需要打折看待——1.1 的分数是在通用 mini-swe-agent 框架里记录的,1.2 跑在 Muse Code 里,代际提升中有一部分归功于新框架而非新模型。

真正的差异化在运行时。Muse Code 采用一个简单的智能体循环,外加一组在整个会话期间常驻的异步后台子智能体——它们不为单个任务临时生成,因而避免了重复的信息收集,可以自主推进后续步骤并自行决定何时向主智能体汇报。任务足够大时,工作会分发给各自隔离 git worktree 中的子智能体并行处理,开发者的工作副本不受影响。

第二个设计是可审计性。每一次模型调用、工具运行、审批和编辑,在执行前都会追加写入本地事件日志。Meta 称这一单一事实来源使运行时具备“精确重放”与“重启安全”特性:一个跑了 20 小时的任务即便崩溃,也能从中断处精确恢复,不丢工作、无需重新提示。

Muse Code 多模态视觉编码演示

模型侧,Muse Spark 1.2 上下文窗口为 1,048,576 token,接受文本、图像、视频与 PDF 输入。Meta 未公布参数量与架构细节。能力提升归因于三点:与 Muse Code 框架协同训练(含拒绝采样的运行轨迹与围绕目标执行、上下文压缩、子智能体的配方优化);面向长时程任务的大规模训练(整仓库生成、大型端到端项目、自动化研究);以及自我改进闭环——用 Muse Spark 1.1 生成高难度编码环境与指令模板,再由模型给候选方案打分,构建出可规模化的 1.2 训练数据。

Meta 最有说服力的演示是一项长时程案例:让 Muse Spark 1.2 在 NVIDIA Hopper 硬件上做 GPU kernel 优化,禁止直接封装第三方 kernel 库,全程用 Triton 编写、编译、profiling,运行超过 1000 次工具调用、时长最长达 24 小时,最终在 KDA 与 MLA kernel 上取得 Meta 所称的“显著改进”,其中包括把门控累积衰减重新中心化到分块中点这类并不直观的优化。扎克伯格写道:“它在初期探索阶段之后,依然持续找到实质性改进。”

影响:定价是这次发布里最锋利的一刀

Muse Code 目前仅支持 macOS 与 Linux,通过一行命令安装,无 Windows 版本,以闭源原生二进制分发,也未提及开放权重。被网友问及是否开源时,扎克伯格只回应“很快会有更多内容分享”——对一家靠 Llama 建立开放形象的公司,这个含糊本身就是信号。

定价分两档,按 model ID 区分:

档位 输入 缓存输入 输出 数据使用
muse-spark-1.2(标准) 1.25 美元/百万 token 0.15 美元 4.25 美元/百万 token 承诺不用于训练
muse-spark-1.2-contributor 0.10 美元/百万 token 0.002 美元 0.20 美元/百万 token 可用于改进产品

Contributor 档按 5 小时滚动窗口内的 token 量限流,而非按请求数计,仅在部分国家可用。两档之间的价差超过一个数量级,本质上是“用数据换算力折扣”。标准档速率上限为每团队每分钟 3000 次请求、400 万 token,Meta 同时开始受理零数据留存请求。

第三方生态的反应几乎是同步的:开源编码智能体 Cline 在 8 月 6 日发布的 v4.1.6 中,已把 meta/muse-spark-1.2-contributor 加入其自有供应商的模型目录。这印证了 Meta 关于“跨多种框架训练、可泛化到其他编码智能体”的说法——模型没有被锁死在自家 harness 里。

对行业而言,这次发布确认了一个趋势:模型与 harness 正在从可分离的两个产品,变成必须一起训练、一起交付的整体。Meta 自己承认其 harness 未必为第三方模型调优过,这也让所有“跑在各自产品里”的横向对比都需要保留一分余地。

来源

编码智能体Muse CodeMuse Spark 1.2Terminal-Bench模型定价