OpenAI adelanta GPT-5.6 Sol con hasta 14x la velocidad estándar

El hardware de Cerebras impulsa el nivel de API a 750 tokens de salida por segundo, con acceso restringido a clientes seleccionados mientras la capacidad aumenta.

By · Published · Updated

Primary source: OpenAI on X

Why it matters

OpenAI is making inference speed a distinct API product for voice, coding and operational systems where latency limits usage. Its reach now depends on how quickly Cerebras capacity enters production.

OpenAI previews GPT-5.6 Sol at up to 14x standard speed

OpenAI (@OpenAI) abrió una vista previa limitada de Ultrafast el 13 de agosto, un nuevo nivel de servicio de API que OpenAI dice que puede ejecutar GPT-5.6 Sol hasta 14 veces más rápido que su nivel de procesamiento Standard.

https://x.com/OpenAI/status/2087947721936359705

poster=/api/storage/public-objects/tweet-videos/openai-gpt-5-6-sol-ultrafast-cerebras-preview-poster-38177545.jpg|Video de @OpenAI en X

El anuncio de Ultrafast coloca el modelo insignia de OpenAI en el hardware de inferencia de Cerebras, generando hasta 750 tokens de salida por segundo. OpenAI está empezando con clientes seleccionados y planea ampliar la disponibilidad conforme crezca la capacidad de cómputo.

Ese despliegue convierte la velocidad de inferencia en un nivel de producto separado en lugar de reservar las respuestas más rápidas para modelos más pequeños. OpenAI está posicionando Ultrafast para aplicaciones en las que usuarios o sistemas automatizados están esperando una respuesta: respuesta a incidentes, agentes de voz, investigación financiera, atención al cliente, comercio y trabajo científico interactivo.

La cifra de 750 tokens de OpenAI mide la generación de salida y por sí sola no establece el tiempo necesario para producir el primer token o completar un flujo de trabajo que implique herramientas y sistemas externos. La comparación de 14x también es la medición de OpenAI frente a su propio nivel de procesamiento Standard. Los datos de producción independientes dependerán de los prompts, la configuración de razonamiento, la longitud de la salida y la aplicación circundante.

Cerebras entra en la pila de inferencia de OpenAI

Ultrafast es el primer servicio de API con nombre que surge de un acuerdo de infraestructura mucho más amplio. El 14 de enero, OpenAI dijo que se había asociado con Cerebras para añadir 750 megavatios de capacidad de cómputo de baja latencia a su plataforma en etapas hasta 2028.

Cerebras construye sistemas alrededor de procesadores a escala de oblea que colocan cómputo, memoria y ancho de banda en un solo chip. OpenAI dijo en enero que esta arquitectura se asignaría a cargas de trabajo donde la velocidad de respuesta importa, dándole a OpenAI otra opción de inferencia junto a los clústeres de aceleradores convencionales usados en la industria de IA.

La vista previa de agosto comienza a poner esa capacidad frente a los clientes. También le da a Cerebras, dirigida por el cofundador y CEO Andrew Feldman, una vitrina de producción para la inferencia a escala de oblea en el modelo insignia de OpenAI en lugar de un modelo más pequeño o especializado.

OpenAI reveló originalmente la implementación planificada de Cerebras en su vista previa del 26 de junio de GPT-5.6 Sol, cuando dijo que el servicio de 750 tokens por segundo se lanzaría en julio. GPT-5.6 alcanzó disponibilidad general el 9 de julio, mientras que el nivel respaldado por Cerebras entró en vista previa limitada el 13 de agosto.

Las acciones de Cerebras caen a pesar de la vista previa de OpenAI

Las acciones de Cerebras cotizaron a la baja el 13 de agosto a pesar de que OpenAI pusiera el hardware del fabricante de chips detrás del nuevo nivel Ultrafast. La caída no establece cómo ven los inversionistas la asociación más amplia, particularmente porque OpenAI ya había divulgado tanto el acuerdo de infraestructura como el servicio planeado de 750 tokens por segundo.

El último anuncio marca la vista previa limitada para clientes del servicio en lugar de un nuevo contrato entre las empresas. Su importancia comercial dependerá de una mayor disponibilidad, la adopción por parte de los clientes y la capacidad de Cerebras para llevar capacidad adicional a la pila de inferencia de OpenAI.

OpenAI comienza con flujos de trabajo empresariales

OpenAI nombró a Jane Street, Podium, Basis y Rogo entre los primeros evaluadores de Ultrafast. Esos clientes abarcan asistentes de codificación, sistemas de voz e investigación financiera, áreas donde los retrasos pueden limitar directamente cómo se usa un producto.

Courtland Lykins, líder de producto en Podium, dijo que Ultrafast había sido valioso en su pila de voz porque "la velocidad cambia por completo la experiencia de la llamada" para trabajos complejos. Rogo, que desarrolla software para investigación financiera, dijo a OpenAI que el nivel hacía que el análisis complejo se sintiera más cercano a una interacción en tiempo real.

OpenAI también está probando Ultrafast internamente para respuesta a incidentes e investigación. Los ingenieros lo están usando para examinar registros, trazas y discusiones durante interrupciones, mientras que los investigadores están intentando comprimir ciclos de experimentos que antes corrían durante la noche en iteraciones repetidas durante un día laboral, según OpenAI.

Estos casos explican por qué OpenAI está publicando el nivel primero a través de la API. Los desarrolladores pueden rediseñar una aplicación en torno a una latencia menor, mientras que una respuesta de chat más rápida principalmente cambia cómo se siente una interfaz existente. Los agentes de voz pueden sostener una conversación con menos pausas. Las herramientas de codificación pueden devolver ediciones más grandes mientras un desarrollador se mantiene concentrado en la tarea. Los sistemas de respuesta a incidentes pueden procesar evidencia cambiante antes de que una interrupción pase a su siguiente fase.

El modelo subyacente sigue siendo GPT-5.6 Sol, que soporta una ventana de contexto de 1.05 millones de tokens y hasta 128,000 tokens de salida. OpenAI actualmente lista el precio estándar de la API Sol en $5 por 1 millón de tokens de entrada y $30 por 1 millón de tokens de salida.

El lanzamiento restringido de Ultrafast hace de la capacidad la limitación inmediata. OpenAI dijo que los clientes iniciales ayudarán a determinar dónde la velocidad adicional produce valor medible y cómo deberían usarla los productos futuros. Una distribución más amplia dependerá de la entrada de capacidad de Cerebras en la pila de inferencia de OpenAI, haciendo del despliegue una prueba temprana de si el hardware especializado puede soportar modelos de frontera a escala comercial.

Divulgación: El autor posee acciones de Cerebras.

Reader comments

Conversation for this story loads after sign-in.