Meta 推出 Muse Code,一款持久化的多智能体,作为 Claude Code 和 Codex 的竞争对手

Mark Zuckerberg 的终端代理使用持久子代理和 Muse Spark 1.2 来规划、编辑和验证代码。

By · Published · Updated

Primary source: X

Why it matters

Muse Code moves Meta from supplying AI models to owning the developer workflow, where persistent agents, audit logs and parallel execution are becoming core infrastructure.

Meta launches Muse Code to run long software tasks across large repositories — Mark Zuckerberg's terminal agent uses persistent subagents and Muse Spark 1.2 to plan, edit and validate code.

Mark Zuckerberg (@finkd) 在 8 月 5 日推出了 Meta 的 Muse Code 公测版,为开发者提供了一个基于终端的代理,旨在在大型代码库中规划、执行和验证软件工程工作。

Muse Code 是围绕 Muse 模型家族构建的 Meta 首个专用编码代理。此次发布将 Meta 从通过 API 出售模型访问权限的做法推进到应用层面,在那里 Anthropic、OpenAI、Google 和 Cursor 正在争夺如何让开发者将工作委派给 AI 的控制权。

Zuckerberg,Meta 的创始人、董事长兼首席执行官,在 X 的一条推文串中表示,Muse Code 由 Muse Spark 1.2 提供支持,Muse Spark 1.2 是对 Muse Spark 1.1 的一项新发布的以编码为重点的更新,Meta 在 7 月 9 日通过公开的 Model API 预览发布了 Muse Spark 1.1。Meta 在 4 月推出最初的 Muse Spark,此前已在 Meta Superintelligence Labs 下重建其 AI 堆栈。根据 Meta 的领导层简介,Zuckerberg 在 Harvard(哈佛大学)学习计算机科学,随后于 2004 年将他创立的 Facebook 迁至 Palo Alto。

对于 Zuckerberg 而言,Muse Code 在他关于 AI 代理将接管更大部分软件生产工作的宏观主张背后放置了一个面向开发者的产品。Meta 正押注于编码市场会奖励那些能够持续工作数小时、协调多个工作者并能从故障中恢复的系统,而不是仅能生成孤立代码建议的助手。

Persistent agents and parallel worktrees

Zuckerberg 表示,Muse Code 在整个会话期间保持专用的后台代理处于活跃状态,允许它们积累上下文,而不是为每个任务重启。对于更大的工作,Muse Code 将任务的各个部分委派给在隔离的 Git 工作树内并行运行的子代理。

该架构与竞争对手的编码产品方向高度一致。OpenAI 的 Codex app 支持在不同工作树中并行工作的代理,而 Cursor 的 background agents 则在远程环境中执行异步编码任务。竞赛已转向编排:一个代理能工作多长时间、它如何有效地划分项目以及开发者多容易检查结果。

Meta 的差异化在于一个本地事件日志,该日志在动作运行之前记录每次模型调用、工具执行和代码编辑,Zuckerberg 表示。Muse Code 可以使用该日志在崩溃后恢复任务,而无需开发者重建会话。该设计还为开发者提供了一份按时间顺序记录的审计记录,用于查看代理尝试了什么和更改了什么。

随着编码代理获得对 shell、凭据和生产库的更广泛访问,这份记录变得重要。长期运行的自主性增加了代理在人工审查前可以更改的代码量,使可追溯性和恢复成为产品的一部分,而不是一个行政特性。

Meta claims gains on long-running coding work

Zuckerberg 表示,Meta 在一个 NVIDIA Hopper 内核优化任务上测试了 Muse Spark 1.2,该任务在 24 小时内进行了超过 1,000 次工具调用。他称该模型在初步探索后仍持续发现改进,尽管 Meta 在推文串中并未发布该任务、代码更改或可独立复现的评估。

Zuckerberg 发布附带的基准图表报告 Muse Code 在 Terminal-Bench 2.1 上得分为 82.9%,低于 Meta 列出的 Anthropic 的 Opus 5 的 86.7%,并高于 Meta 比较中的若干其他配置。第二张图表显示 Muse Code 在 DeepSWE 1.1 上得分为 59.3%,低于 Meta 展示的 Opus 5 和 GPT-5.6 Terra 的结果。同一图表将 Muse Spark 1.1 列为 53%。

这些数据是 Meta 的评估。该公告并未说明每个模型是否获得了等效的工具、推理预算或任务时间分配,而这些变量可能实质性地改变代理基准结果。Meta 的 24 小时内核运行也展示的是持久性,而非最终优化结果的质量或生产价值。

Muse Spark 1.2 延续了 Meta 在 7 月 9 日通过公开 Model API 预览发布的 Muse Spark 1.1。Meta 表示该版本能够管理一百万 token 的上下文窗口、将工作委派给并行子代理并处理规划、工具使用和上下文压缩。Muse Code 将这些底层能力打包成一个开发者可以直接从终端操作的工作流。

Zuckerberg 表示,开发者可以通过一条命令安装 Muse Code 并从贡献者层级开始使用。Meta 将 Muse Code 作为测试版发布,将开发者使用定位为既是该代理的分发渠道也是对下一代 Muse 模型的反馈。Zuckerberg 表示更大的模型正在开发中。

此次发布在使用开源 Llama 模型多年以在其消费应用之外培养采用之后,为 Meta 提供了一条直接进入开发者工作流的路径。Muse Code 遵循更新的 Muse 战略:Meta 控制模型服务,现在也控制运行在其之上的代理。这创造了一个 Meta 可以用使用数据来改进的产品,同时竞争那些正逐渐成为前沿 AI 最明确商业市场之一的工程工作负载。

Reader comments

Conversation for this story loads after sign-in.