OpenAI通过保留其记忆将GPT-5.6 Sol的ARC得分提高了三倍

这38.3%的结果使用了一个自定义的公开集测试框架,而Claude Opus 5仍然位居ARC Prize的已验证排行榜首位。

By · Published

Primary source: X - Tibo

Why it matters

OpenAI's result shows that memory and context plumbing can triple an agent's benchmark score, complicating leaderboards and making orchestration a core product advantage.

OpenAI triples GPT-5.6 Sol's ARC score by preserving its memory

OpenAI 核心产品负责人 Thibault "Tibo" Sottiaux (@thsottiaux) 表示,在 OpenAI 更改了模型在动作之间传递推理和上下文的方式后,GPT-5.6 Sol 在 ARC-AGI-3 上达到了最先进的分数。该说法基于对基准公开任务的自定义运行,而非 ARC Prize 的官方验证排行榜;截至 7 月 29 日,Anthropic 的 Claude Opus 5 仍然领先。

在 X 上的一篇帖子 中,Sottiaux 写道,这一改进需要两个设置更改:允许 GPT-5.6 Sol 保留其私有推理,并让它使用 compaction 在多个上下文窗口间工作。OpenAI 在 一篇于 7 月 29 日发布的研究文章 中详细介绍了该实验,报告称模型在公开任务集上的得分从 13.3% 升至 38.3%,同时输出令牌数减少了六倍。 (openai.com)

Sottiaux 于 2024 年加入 OpenAI,此前曾参与 Google Maps 和为 Google DeepMind 系统(包括 AlphaGo)构建基础设施的工作。他现在负责 OpenAI 的核心产品,包括 ChatGPT 和 Codex。这个职责范围在此很重要,因为 OpenAI 表示,经修订的基准 harness 可重现这些产品中已使用的上下文管理技术。该结果为 Sottiaux 的产品论点提供了公开示范:一个代理的外围系统可以决定底层模型的能力有多少到达用户。 (wired.com)

评测框架改变了结果

ARC-AGI-3 于 3 月 25 日发布,为代理提供了陌生的、基于回合的游戏环境,且没有说明、规则或明确目标。代理必须进行试验、识别目标并将学到的内容带入后续关卡。ARC Prize 设计官方 harness 时保持通用性,以便更容易在模型之间进行比较,并揭示模型特定工具可能掩盖的弱点。 (arcprize.org)

OpenAI 表示,该通用设置为 GPT-5.6 Sol 带来了两个问题。官方 harness 在每次游戏动作后都会丢弃模型的私有推理,迫使 GPT-5.6 Sol 从先前动作记录和简短笔记中重建其理解。该 harness 还使用了滚动截断:当历史超过 175,000 个字符时,它会移除最旧的消息。

OpenAI 使用其 Responses API 重建了测试,通过传递先前的 response ID,使 GPT-5.6 Sol 能在动作之间保留推理。随后 OpenAI 用 context compaction 取代了滚动截断,后者是将先前上下文压缩而不是直接丢弃最旧动作。

在这些更改下,OpenAI 表示 GPT-5.6 Sol 在每次决策上花费更少的令牌,能在更长的运行中保留发现并形成更连贯的策略。OpenAI 的实现使用了 175,000 个令牌的限制,而不是官方 harness 的 175,000 字符阈值。在该配置下,模型得分为 38.3%,而在同一公开任务集上使用官方设置时得分为 13.3%。 (openai.com)

这一差距对构建生产代理的团队来说具有实质性意义。长期运行的软件、浏览器和研究代理会反复调用工具、累积观察并接近上下文限制。丢弃代理的推理或早期动作可能导致一个有能力的模型重复失败的计划、丢失中间发现并额外花费令牌来重建状态。

Claude 仍然领先经过验证的排行榜

Sottiaux 的 “SoTA” 描述需要比帖文暗示的更窄的解读。OpenAI 的 38.3% 数据来自其在公开集上的自有 harness。它并未替换 GPT-5.6 Sol 在官方验证结果中的位置。

ARC Prize 的 GPT-5.6 结果,于 7 月 9 日发布,显示 Sol 在公开演示上为 13.33%,在最大推理努力下的半私有 ARC-AGI-3 评估中为 7.78%。ARC Prize 描述 Sol 为首个赢得公开 ARC-AGI-3 游戏的模型,而其在半私有评估中的表现仍为个位数。 (arcprize.org)

Claude Opus 5 的验证结果,于 7 月 24 日发布,在高推理努力下的 ARC-AGI-3 得分为 30.16%。ARC Prize 确认 Claude Opus 5 是该基准上表现最好的已验证模型。 (arcprize.org)

因此,这两个分数回答的是不同的问题。ARC Prize 的排行榜衡量的是模型在其标准化 harness 和半私有任务下的表现。OpenAI 的实验则衡量在公开任务上配合 OpenAI 面向生产的记忆与上下文系统时 GPT-5.6 Sol 的表现。38.3% 的结果展示了巨大的编排收益,但并未确立在排行榜上对 Claude Opus 5 的官方领先地位。

OpenAI 的发现也暴露了模型比较中日益增长的问题。标准化的 harness 提高了可比性,但可能压制提供者认为对其已部署系统至关重要的特性。模型特定的 harness 可以揭示生产性能,同时赋予每个供应商更大的自由去围绕其自身架构调整测试。

对于开发者而言,实际结论更为直接。从排行榜中选择模型只捕捉了代理栈的一个层面。状态保留、compaction、工具历史和上下文限制足以改变性能,进而影响哪个模型看起来最强,以及运行它的成本。

Reader comments

Conversation for this story loads after sign-in.