OpenAI、メモリ保持によりGPT-5.6 SolのARCスコアを3倍に
その38.3%の結果はカスタムの公開セット用ハーネスを使用して得られたもので、Claude Opus 5はARC Prizeの検証済みリーダーボードで依然として首位に立っている。
By Ryan Merket · Published
Primary source: X - Tibo
Why it matters
OpenAI's result shows that memory and context plumbing can triple an agent's benchmark score, complicating leaderboards and making orchestration a core product advantage.

OpenAI core products lead Thibault "Tibo" Sottiaux (@thsottiaux) said GPT-5.6 Sol reached a state-of-the-art score on ARC-AGI-3 after OpenAI changed how the model's reasoning and context were carried between actions. The claim rests on a custom run of the benchmark's public tasks rather than ARC Prize's official verified leaderboard, where Anthropic's Claude Opus 5 remained the leader as of July 29th.
In a post on X, Sottiaux wrote that the improvement required two setting changes: allowing GPT-5.6 Sol to preserve its private reasoning and letting it work across multiple context windows using compaction. OpenAI detailed the experiment in a research post published July 29th, reporting that the model's public-set score rose from 13.3% to 38.3% while consuming six times fewer output tokens. (openai.com)
Sottiaux joined OpenAI in 2024 after working on Google Maps and infrastructure for Google DeepMind systems including AlphaGo. He now oversees OpenAI's core products, including ChatGPT and Codex. That remit matters here because OpenAI says the revised benchmark harness reproduces context-management techniques already used in those products. The result offers a public demonstration of Sottiaux's product thesis: an agent's surrounding system can determine how much of the underlying model's capability reaches users. (wired.com)
ハーネスが結果を変えた
ARC-AGI-3は3月25日に公開され、エージェントに指示やルール、明示された目標のない、未知のターン制ゲーム環境を提示する。エージェントは試行を行い、目的を特定し、後のレベルに学んだことを持ち込む必要がある。ARC Prizeは公式ハーネスを汎用的に設計することで、モデル間の比較を容易にし、モデル固有のツールによって隠されがちな弱点を露呈させることを意図した。 (arcprize.org)
OpenAIは、その汎用的な設定がGPT-5.6 Solに対して二つの問題を生じさせたと述べた。公式ハーネスは各ゲームアクションの後にモデルのプライベートな推論を破棄しており、GPT-5.6 Solは以前の手の記録や短いメモから理解を再構築することを強いられていた。ハーネスはまたローリング切り捨てを使用しており、履歴が175,000文字を超えると最も古いメッセージを削除していた。
OpenAIはテストを自社のResponses APIで組み直し、前のレスポンスIDを渡すことでGPT-5.6 Solがアクション間で推論を保持できるようにした。さらにOpenAIはローリング切り捨てをコンテキスト圧縮に置き換え、最も古いアクションをそのまま捨てるのではなく、前のコンテキストを凝縮するようにした。
これらの変更により、OpenAIによればGPT-5.6 Solは各手を再考するためのトークンを少なく消費し、長い実行にわたって発見を保持し、より一貫した戦略を形成したという。OpenAIの実装では公式ハーネスの175,000文字の閾値ではなく175,000トークンの上限を使用した。その構成下でモデルは38.3%を記録し、同じ公開タスクセットで公式設定を使用した場合の13.3%と比べて大幅に高いスコアとなった。 (openai.com)
Claude が検証済みリーダーボードを依然リード
Sottiauxの「SoTA」という表現は投稿が示すよりも狭い読みが必要だ。OpenAIの38.3%という数字は自社のハーネスでの公開セットに基づくものであり、GPT-5.6 Solの公式な検証済み結果を置き換えたわけではない。
ARC PrizeのGPT-5.6結果、7月9日公開は、Solが公開デモで13.33%、最大推論努力での半プライベートなARC-AGI-3評価で7.78%であることを示している。ARC PrizeはSolを公開ARC-AGI-3ゲームで初めて勝利したモデルと記述した一方で、半プライベート評価でのパフォーマンスは一桁台にとどまっている。 (arcprize.org)
Claude Opus 5の検証済み結果、7月24日公開は、高い推論努力でARC-AGI-3において30.16%を示している。ARC PrizeはClaude Opus 5をベンチマーク上で最も高性能な検証済みモデルとして認定している。 (arcprize.org)
したがって両者のスコアは異なる問いに答えている。ARC Prizeのリーダーボードは標準化されたハーネスと半プライベートなタスクのもとでモデルを測定する。一方でOpenAIの実験は、公開タスクにおいてOpenAIのプロダクション指向のメモリとコンテキストシステムを組み合わせた場合にGPT-5.6 Solがどのように動くかを測っている。38.3%という結果は大きなオーケストレーションの利得を示すが、Claude Opus 5に対する公式なリーダーボード上の優位性を確立するものではない。
OpenAIの発見はモデル比較における増大する問題も浮き彫りにしている。標準化されたハーネスは比較可能性を高める一方で、プロバイダが自身の展開システムにとって基本的だと考える機能を抑制してしまうことがある。モデル固有のハーネスはプロダクションでの性能を明らかにする一方で、各ベンダーに自社のアーキテクチャに合わせてテストを調整するより大きな自由を与えてしまう。
開発者にとって実務的な結論はより直接的だ。リーダーボードからモデルを選ぶことはエージェントスタックの一層しか捉えていない。状態保持、圧縮、ツール履歴、コンテキストの上限は、どのモデルが最も強く見えるか、そしてそれを動かすコストがどれだけかを変えるのに十分なほど性能を動かし得る。