OpenAI triplica la puntuación ARC de GPT-5.6 Sol al preservar su memoria
El resultado del 38.3% utilizó un arnés personalizado para el conjunto público, mientras que Claude Opus 5 sigue siendo el primero en la tabla de clasificación verificada de ARC Prize.
By Ryan Merket · Published
Primary source: X - Tibo
Why it matters
OpenAI's result shows that memory and context plumbing can triple an agent's benchmark score, complicating leaderboards and making orchestration a core product advantage.

OpenAI core products lead Thibault "Tibo" Sottiaux (@thsottiaux) dijo que GPT-5.6 Sol alcanzó una puntuación de última generación en ARC-AGI-3 después de que OpenAI cambiara cómo se llevaba el razonamiento y el contexto del modelo entre acciones. La afirmación se basa en una ejecución personalizada de las tareas públicas del benchmark en lugar de la tabla de posiciones oficial verificada de ARC Prize, donde Claude Opus 5 de Anthropic seguía siendo el líder al 29 de julio.
En una publicación en X, Sottiaux escribió que la mejora requirió dos cambios de configuración: permitir que GPT-5.6 Sol preservara su razonamiento privado y dejar que trabajara a través de múltiples ventanas de contexto usando compactación. OpenAI detalló el experimento en una publicación de investigación publicada el 29 de julio, informando que la puntuación del conjunto público del modelo subió de 13.3% a 38.3% mientras consumía seis veces menos tokens de salida. (openai.com)
Sottiaux se unió a OpenAI en 2024 después de trabajar en Google Maps e infraestructura para los sistemas de Google DeepMind, incluido AlphaGo. Ahora supervisa los productos centrales de OpenAI, incluidos ChatGPT y Codex. Ese encargo importa aquí porque OpenAI dice que el arnés revisado del benchmark reproduce técnicas de gestión de contexto ya usadas en esos productos. El resultado ofrece una demostración pública de la tesis de producto de Sottiaux: el sistema circundante de un agente puede determinar cuánto de la capacidad subyacente del modelo llega a los usuarios. (wired.com)
El arnés cambió el resultado
ARC-AGI-3, lanzado el 25 de marzo, presenta a los agentes entornos de juego por turnos desconocidos sin instrucciones, reglas ni objetivos declarados. Un agente debe experimentar, identificar el objetivo y llevar lo que aprende a niveles posteriores. ARC Prize diseñó el arnés oficial para que fuera genérico, facilitando las comparaciones entre modelos y exponiendo debilidades que las herramientas específicas del modelo podrían ocultar. (arcprize.org)
OpenAI dijo que esa configuración genérica creó dos problemas para GPT-5.6 Sol. El arnés oficial descartaba el razonamiento privado del modelo después de cada acción del juego, obligando a GPT-5.6 Sol a reconstruir su comprensión a partir de un registro de movimientos anteriores y notas breves. El arnés también usaba truncamiento rodante: cuando el historial superaba los 175,000 caracteres, eliminaba los mensajes más antiguos.
OpenAI reconstruyó la prueba con su Responses API, pasando el ID de la respuesta previa para que GPT-5.6 Sol pudiera retener el razonamiento entre acciones. OpenAI luego reemplazó el truncamiento rodante por compactación de contexto, que condensa el contexto previo en lugar de eliminar directamente las acciones más antiguas.
Con esos cambios, OpenAI dice que GPT-5.6 Sol gastó menos tokens en reconsiderar cada movimiento, preservó descubrimientos a lo largo de corridas más largas y formó estrategias más coherentes. La implementación de OpenAI usó un límite de 175,000 tokens en lugar del umbral de 175,000 caracteres del arnés oficial. El modelo logró 38.3% bajo esa configuración, en comparación con 13.3% usando la configuración oficial en el mismo conjunto de tareas públicas. (openai.com)
Esa brecha es material para los equipos que construyen agentes de producción. El software de larga ejecución, los agentes en navegadores y los agentes de investigación llaman repetidamente a herramientas, acumulan observaciones y se acercan a los límites de contexto. El hecho de eliminar el razonamiento de un agente o acciones previas puede hacer que un modelo capaz repita planes fallidos, pierda el rastro de hallazgos intermedios y gaste tokens adicionales reconstruyendo el estado.
Claude sigue liderando la tabla verificada
La descripción "SoTA" de Sottiaux necesita una lectura más restringida de lo que sugiere la publicación. La cifra de 38.3% de OpenAI proviene de su propio arnés en el conjunto público. No ha reemplazado el resultado verificado oficial de GPT-5.6 Sol.
Resultados de GPT-5.6 de ARC Prize, publicados el 9 de julio, muestran a Sol con 13.33% en la demo pública y 7.78% en la evaluación semi-privada ARC-AGI-3 con máximo esfuerzo de razonamiento. ARC Prize describió a Sol como el primer modelo en ganar un juego público de ARC-AGI-3, mientras que su desempeño en la evaluación semi-privada permaneció en un solo dígito. (arcprize.org)
Resultado verificado de Claude Opus 5, publicado el 24 de julio, se sitúa en 30.16% en ARC-AGI-3 con alto esfuerzo de razonamiento. ARC Prize identifica a Claude Opus 5 como el modelo verificado con mejor desempeño en el benchmark. (arcprize.org)
Por lo tanto, las dos puntuaciones responden preguntas diferentes. La tabla de posiciones de ARC Prize mide los modelos bajo su arnés estandarizado y tareas semi-privadas. El experimento de OpenAI mide cómo se desempeña GPT-5.6 Sol en tareas públicas cuando se empareja con el sistema de memoria y contexto orientado a producción de OpenAI. El resultado de 38.3% demuestra una gran ganancia de orquestación, pero no establece un liderazgo oficial en la tabla frente a Claude Opus 5.
Los hallazgos de OpenAI también exponen un problema creciente para las comparaciones de modelos. Un arnés estandarizado mejora la comparabilidad, pero puede suprimir características que los proveedores consideran fundamentales en sus sistemas desplegados. Los arneses específicos por modelo pueden revelar el rendimiento en producción, al mismo tiempo que dan a cada proveedor mayor libertad para ajustar la prueba en torno a su propia arquitectura.
Para los desarrolladores, la conclusión práctica es más inmediata. Elegir un modelo a partir de una tabla de posiciones captura solo una capa de la pila de agentes. La retención de estado, la compactación, el historial de herramientas y los límites de contexto pueden mover el rendimiento lo suficiente como para cambiar qué modelo parece el más fuerte, junto con cuánto cuesta operarlo.