Altman afirma que la disminución de los costos de la IA es 20 veces más rápida que la ley de Moore.
El CEO de OpenAI hizo la afirmación después de que la compañía informó una reducción del 20% en los costos de servicio y una ganancia de eficiencia por token de más del 15% de GPT-5.6 Sol, mientras transfería parte de los ahorros a los usuarios de Luna y Terra.
By Ryan Merket · Published
Primary source: X
Why it matters
OpenAI is using its flagship model to optimize the infrastructure that serves it, then directing the savings toward cheaper agent workloads while preserving Sol's premium pricing.

Sam Altman (@sama) dijo que los costos de la IA están cayendo más rápido que la ley de Moore mientras amplificaba la última afirmación de eficiencia de OpenAI el 31 de julio. "veo tu ley de Moore y te subo 20x", escribió Altman después de que OpenAI dijera que GPT-5.6 Sol había ayudado a reducir el costo de servirse a sí mismo en 20%.
La frase de Altman capturó la apuesta detrás del anuncio del 30 de julio de OpenAI: modelos cada vez más capaces pueden reducir el costo de construir y operar la siguiente generación de sistemas de IA. El resultado divulgado fue una reducción del 20%, en lugar de una mejora de 20 veces. OpenAI también atribuyó a experimentos realizados con Sol una ganancia superior al 15% en eficiencia de generación de tokens.
OpenAI dijo que GPT-5.6 Sol reescribió y optimizó de forma autónoma kernels de GPU de producción dentro de un proceso de ingeniería dirigido por humanos. OpenAI también encomendó a Sol el diseño y la ejecución de cientos de experimentos, la supervisión de ejecuciones de entrenamiento y la intervención cuando aparecían fallas de hardware o inestabilidad en el entrenamiento.
Esas son las cifras internas de producción de OpenAI. OpenAI no ha publicado la línea base subyacente de costos de servicio ni una evaluación independiente, lo que limita las comparaciones directas con las afirmaciones de eficiencia de otros proveedores de modelos. Aun así, las cifras ofrecen un ejemplo concreto de un modelo de vanguardia realizando trabajo de ingeniería en la infraestructura usada para ejecutar ese mismo modelo.
OpenAI pasa ahorros selectivos a los clientes
OpenAI combinó la divulgación de la infraestructura con fuertes reducciones de precio para los miembros más pequeños de la familia GPT-5.6. El precio de la API de Luna bajó un 80% a $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida. Terra bajó un 20% a $2 por millón de tokens de entrada y $12 por millón de tokens de salida.
Developer Nic Dunz (@nicdunz) dijo que Luna Max igualó a GPT-5.4 Full en un benchmark en aproximadamente una decimotercera parte del precio por token, cuatro meses después. La comparación estrecha no establece paridad en todas las cargas de trabajo, pero ilustra lo rápido que precios más bajos pueden cambiar la economía de un modelo capaz. Otro desarrollador, @signulll, respondió que la caída de precio finalmente había hecho que valiera la pena configurar la API.
El precio estándar de la API de Sol no cambió. En su lugar, OpenAI introdujo un Fast mode que promete velocidades de procesamiento hasta 2.5 veces más rápidas que las solicitudes estándar a doble precio, sin cambiar el modelo subyacente. Fast mode reemplaza la opción Priority Processing de OpenAI, mientras que las solicitudes existentes etiquetadas para priority processing seguirán funcionando.
Los recortes selectivos muestran cómo OpenAI pretende empaquetar sus ganancias de eficiencia. Sol sigue siendo el nivel premium de razonamiento, mientras que la mucho más barata Luna se convierte en el modelo de volumen para trabajo rutinario de agentes, pruebas, clasificación y tareas de implementación bien especificadas. OpenAI puede preservar el precio premium de Sol mientras usa modelos de menor costo para competir por cargas de trabajo donde a los desarrolladores les importa más el rendimiento por unidad y la economía por unidad que el máximo rendimiento de razonamiento.
OpenAI también dijo que los precios más bajos de Terra y Luna reducirán la velocidad a la que los modelos consumen créditos en Codex y ChatGPT Work. Los precios de suscripción y los presupuestos totales de cuota permanecen sin cambios. Esa distinción importa para los desarrolladores que experimentaron GPT-5.6 como una familia de modelos más capaz sin necesariamente recibir más capacidad total de suscripción.
Los recortes llegaron tres semanas después de que OpenAI pusiera GPT-5.6 generalmente disponible. En el lanzamiento el 9 de julio, OpenAI fijó el precio de Luna en $1 por millón de tokens de entrada y $6 por millón de tokens de salida, Terra en $2.50 y $15, y Sol en $5 y $30. OpenAI dijo entonces que el uso interno de tokens por agentes había aumentado aproximadamente 22 veces en los seis meses previos, mientras que la proporción de cómputo de investigación dedicada a la inferencia de codificación interna había crecido 100 veces.
Ese crecimiento interno crea un incentivo financiero directo para mejorar la eficiencia de la inferencia. Cada reducción en el costo de servicio le da a OpenAI más margen para aumentar el uso, bajar precios o proteger márgenes a medida que los agentes se ejecutan por periodos más largos y realizan más llamadas a herramientas. OpenAI decidió invertir gran parte de ese margen en Luna, reposicionando el modelo más pequeño de GPT-5.6 para despliegues de alto volumen.
El momento también presiona a los competidores que venden modelos pequeños y de nivel medio. Axios informó que modelos chinos de pesos abiertos más baratos han obligado a OpenAI y Anthropic a defender la economía de sus ofertas propietarias. La respuesta de OpenAI es un sistema por niveles en el que Sol se encarga de la planificación y la incertidumbre mientras Luna ejecuta pasos más baratos y repetitivos.
La referencia de Altman a la ley de Moore apunta a la afirmación estratégica más amplia. OpenAI quiere que la optimización impulsada por software se compense junto con las ganancias de chips y centros de datos. Si los modelos pueden reducir repetidamente sus propios costos de inferencia bajo supervisión humana, OpenAI puede mejorar su economía entre generaciones importantes de hardware. El resultado inmediato es más limitado: una reducción del 20% en el costo de servicio reportada internamente, una ganancia superior al 15% en eficiencia por token y precios más bajos concentrados en los modelos que OpenAI quiere que los desarrolladores ejecuten con más frecuencia.