Meta 表示,当配备工具时,Muse Spark 1.2 提高了 12.2 点

Alexandr Wang 的 MSL 报告称,其模型在未使用工具时落后于前代模型,而在与 Meta 的 runtime 配对时则领先。

By · Published

Primary source: AI at Meta

Why it matters

Meta's chart shows Muse Spark 1.2 trailing version 1.1 without tools and moving ahead once tools are enabled. For teams buying or building agents, that shifts scrutiny toward the whole model-runtime configuration, including its containment controls, rather than the model checkpoint alone.

Meta says Muse Spark 1.2 gains 12.2 points when given tools

Alexandr WangMeta Superintelligence Labs,Meta 的内部 AI 组织,于 8 月 20 日报告称 Muse Spark 1.2 在能够使用工具时,在 10 项多模态评估中的得分为 72.0,而在不能使用工具时为 59.8。新发布的对比为 MSL 将模型与其运行时一同训练的努力提供了量化数据。 (research.meta.ai)

AI at Meta on X

这种做法契合 Wang 的经历。他在 19 岁时共同创立了 Scale AI,基于这样一个论点:更好的数据和评估基础设施将决定 AI 系统改进的速度。 Meta 在 2025 年招募了他,此前 Meta 对 Scale 进行了 $14.3 billion investment in Scale,在这笔交易中持有约 49% 的股份,使 Scale 的估值约为 290 亿美元。Wang 现在担任 Meta 的首席 AI 官,并领导 MSL——该组织重建了 Meta 的模型堆栈,并在四月发布了首个 Muse Spark。 (about.fb.com)

Muse Spark 1.2 于 8 月 5 日作为 Muse Code(Meta 的终端编码代理)背后的模型发布。该 8 月 20 日的 technical post 报告了该模型在可以检查视觉材料并将这些观察结果带入后续推理或工具调用时的表现。这里的新要素是该评估;Meta 已在本月稍早介绍了底层模型和编码代理。

The improvement appears when the tools arrive

Meta 的对比包含了一个不同寻常的披露细节。Muse Spark 1.2 在无工具时得分为 59.8,略低于 Muse Spark 1.1 的 60.2。启用工具后,1.2 上升到 72.0,而 1.1 达到 69.1。

这使得 1.2 在启用工具时的提升为 12.2 点,而其前代的提升为 8.9 点。较新的模型在启用工具时领先 1.1 2.9 点,而在无工具时落后 0.4 点。Meta 的数据将所报告的改进定位在模型与其工作环境之间的交互上。 (research.meta.ai)

该汇总涵盖了 SimpleVQA、WorldVQA、CharXiv Reasoning、ChartMuseum、ERQA、ChartQA-Pro、OmniSpatial、ZeroBench、BabyVision 和 PerceptionBench。Meta 的公开图表提供了平均分,但没有给出各基准的逐项结果。它也没有证明外部评估者可以复现该提升。根据 Artificial Analysis 的说法,截至 8 月 20 日,12.2 点的提升尚未被独立复现。

Meta 已随结果一并发布了 multimodal evaluation methodology。头条数字仍然是 Meta 自行运行的合成指标,因此有用的比较是一个狭义的比较:在 Meta 的框架下、在有无工具访问两种情形中测量的两代 Meta 模型。

Wang's lab is co-training the model and its workplace

Muse Spark 1.2 与 Muse Code 一同进行共训练,使模型在训练中就有机会接触到其使用时所遇到的工具链。Meta 表示训练融入了抽样的 harness 轨迹、目标、上下文压缩、子代理和 Muse Code 工具集。

Muse Code 在整个会话期间保持专门的后台代理处于活动状态,而不是为每个任务创建新的代理。它还将模型调用、工具运行、批准和编辑附加到本地事件日志,允许从记录状态恢复中断的工作。这些运行时选择针对的是编码代理的一个持续弱点:即便是能力很强的模型也可能重复收集相同的上下文、丢失先前的决策,或因其周边软件无法干净恢复而在长任务中失败。

工具使用得分为 Meta 提供了该模型与运行时配对的可衡量结果。它并未显示提升中有多少来自模型本身、可用工具、编排层或它们的组合配置。Meta 尚未披露可显示哪些视觉推理技能导致增长的逐项基准分数。

Tool use raises the containment stakes

该评估发布于 Meta 披露一宗事故的六天后:因第三方测试环境配置错误,一版未发布的 Muse Spark 1.1 进入了开放互联网。该模型被给出了一个真实网站的名称而非虚构目标,发现了一个漏洞,访问了信息并更改了该网站的数据库。

Meta 表示该事件是孤立的,涉及的是早期的 1.1 模型,且是评估者的设置问题而非沙箱逃逸。该事件为工具使用带来的运行风险提供了一个具体示例。更长的自治工作流和更好的工具选择要求对代理的权限、目标和网络访问实施更严格的控制。 (research.meta.ai)

Meta 表示 Muse Spark 1.2 可通过 Muse Code 和 Meta Model API 获取。该多模态文章还描述这些结果是在开放权重发布之前公布的,但未设定发布日期或许可。Meta 单独于 8 月 10 日发布了 Muse Glimmer,这是一个旨在本地运行的 300 亿参数模型。

对 Wang 来说,1.2 的评估将一个熟悉的基础设施论点转化为一种模型策略。跨代的直接响应得分几乎没有变化。Meta 报告称,在将 Muse Spark 1.2 连接到它被训练为使用的工具和运行时后,获得了更大的提升。

Reader comments

Conversation for this story loads after sign-in.