Aparecen en Design Arena los presuntos nombres en clave de OpenAI: Zinc y Magnesium
Los materiales públicos de GPT-5.6 de OpenAI identifican solo Sol, Terra y Luna, dejando las entradas deshabilitadas sin confirmar.
By Ryan Merket · Published
Primary source: X - @Lentils80
Why it matters
If authentic, the entries suggest OpenAI may update models inside its Sol and Terra tiers without waiting for a new GPT generation, accelerating the post-launch model cycle.

Dos entradas deshabilitadas de modelos etiquetadas "Zinc" y "Magnesium" aparecieron en Design Arena el 28 de julio, según el observador de modelos Lentils (@Lentils80), lo que plantea la posibilidad de que OpenAI ya esté probando revisiones de su familia GPT-5.6.
Lentils describió ambas entradas como modelos GPT y sugirió que Zinc podría ser una actualización de GPT-5.6 Sol, mientras que Magnesium podría estar vinculada a GPT-5.6 Terra. La publicación no incluyó resultados de pruebas, identificadores de modelo ni evidencia que conecte los nombres clave directamente con OpenAI. Ninguno de los modelos estaba habilitado para batallas públicas en el momento del avistamiento.
Las entradas permanecen sin confirmar. Los materiales de lanzamiento de GPT-5.6 de OpenAI identifican tres niveles públicos: Sol, el buque insignia; Terra, un modelo de menor costo posicionado frente a GPT-5.5; y Luna, la opción más rápida y menos costosa. Los materiales no identifican a Zinc ni Magnesium.
Sin embargo, OpenAI describió a Sol, Terra y Luna como "niveles de capacidad duradera" que pueden avanzar en calendarios separados. Esa estructura le da a OpenAI margen para actualizar los modelos detrás de esos nombres sin esperar un lanzamiento completo de GPT-5.7. Si las entradas de Design Arena son auténticas, podrían representar nuevas versiones posteriores al entrenamiento, builds de evaluación interna o alias de enrutamiento destinados a permanecer bajo los niveles de producto existentes Sol y Terra.
Una entrada deshabilitada proporciona solo una señal temprana. No establece que alguno de los modelos vaya a enviarse, conserve su nombre clave o se convierta en un producto independiente.
Un benchmark de startup se convierte en una señal de lanzamiento de modelo
La observación coloca a Design Arena en una posición cada vez más influyente entre los laboratorios de modelos de frontera y los usuarios. Grace Li y Kamryn Ohly, compañeras de clase en Harvard que trabajaron previamente en Apple, fundaron la operación de San Francisco en 2025 y la llevaron a través de la cohorte Summer 2025 de Y Combinator.
Li y Ohly construyeron Design Arena en torno a un problema que los benchmarks convencionales de IA en gran medida ignoran: si los sitios web, imágenes, diapositivas y otras salidas creativas generadas realmente se ven bien para las personas. Los usuarios envían un prompt, reciben salidas anónimas de múltiples modelos y las clasifican mediante comparaciones cara a cara. Esos votos alimentan un sistema de clasificación Bradley-Terry, según la metodología publicada de Design Arena.
Ese conjunto de modelos crea un escenario natural para que los laboratorios prueben sistemas no lanzados. Las identidades de los modelos permanecen ocultas durante la votación, y Design Arena dice que se muestrean cuatro modelos activos más un respaldo para cada sesión. Por lo tanto, un modelo puede ser evaluado sin que su nombre comercial aparezca frente a los votantes. Un registro de configuración que salga a la luz antes de la activación puede exponer una etiqueta interna incluso cuando el modelo subyacente no esté disponible.
Design Arena es el producto insignia de The Intelligence Company, la marca pública adoptada por Arcada Labs. The Intelligence Company dice que Design Arena ha superado los 3 millones de usuarios en más de 190 países. La página de lanzamiento de Y Combinator registró un hito mucho antes: 47,000 usuarios en 136 países durante sus primeras cuatro semanas.
El benchmark ya tiene una conexión directa con el despliegue de GPT-5.6. En un análisis del 15 de julio, Design Arena ubicó a GPT-5.6 Sol en primer lugar en su categoría de diseño web no agencial, 18 posiciones por encima de GPT-5.5. Design Arena atribuyó la mejora en parte a que Sol suprimió patrones comunes de diseño generados por IA, como degradados morados, texto principal sobredimensionado y maquetaciones repetitivas estilo bento-box.
Claude Opus 5 aumenta la presión sobre el diseño y el precio
Lentils sugirió que los supuestos modelos podrían ser una respuesta a Claude Opus 5 de Anthropic, lanzado el 24 de julio. La brecha de cuatro días hace que la teoría sea cronológicamente posible, aunque los listados no ofrecen evidencia de una conexión directa.
Anthropic posicionó Opus 5 como un modelo de uso diario con mejor rendimiento en codificación, uso de computadora y salidas visuales. Anthropic lo fijó en $5 por millón de tokens de entrada y $25 por millón de tokens de salida. OpenAI cobra la misma tarifa de $5 por millón de tokens de entrada para GPT-5.6 Sol y $30 por millón de tokens de salida, mientras que Terra cuesta $2.50 por millón de tokens de entrada y $15 por millón de tokens de salida.
OpenAI lanzó GPT-5.6 para disponibilidad general el 9 de julio, menos de tres semanas antes del avistamiento de Zinc y Magnesium. Una actualización tan pronto encajaría con la cadencia más rápida de modelos que el sistema de niveles Sol, Terra y Luna fue diseñado para soportar. También mostraría qué tan rápido se está presionando a los laboratorios de vanguardia para refinar modelos después del lanzamiento, a medida que los competidores atacan la misma combinación de capacidad de codificación, juicio visual, velocidad y costo.
Por ahora, Zinc y Magnesium son etiquetas dentro de un benchmark de terceros en lugar de productos anunciados por OpenAI. Su importancia depende de si entran en el grupo activo de Design Arena y generan suficientes comparaciones públicas para revelar qué, si es que hubo algo, cambió respecto a Sol y Terra.