GPT-5.6-Cyber de OpenAI responde el 95% de las solicitudes de explotación, frente al 1.5% de Sol

Daybreak Red limita el modelo entrenado con un propósito a investigadores aprobados, mientras que Daybreak Blue abre GPT-5.6 Sol para labores defensivas más amplias.

By · Published · Updated

Primary source: X - OpenAI

Why it matters

OpenAI is moving a larger share of cyber safety from model refusals to verified access, monitoring and sandbox controls. A recent evaluation escape shows why those operational defenses matter.

OpenAI launches GPT-5.6-Cyber with fewer refusals for exploit research

OpenAI lanzó GPT-5.6-Cyber el lunes, otorgando a investigadores de seguridad aprobados acceso a un modelo entrenado con un propósito específico que responderá muchas solicitudes avanzadas de desarrollo de exploits que son rechazadas por sus modelos de uso general.

https://x.com/OpenAI/status/2086864365379010729

poster=/api/storage/public-objects/tweet-videos/openai-gpt-5-6-cyber-daybreak-red-poster-85c370b1.jpg|Video de @OpenAI en X

El modelo, detallado en un hilo de cinco publicaciones en X y una entrada técnica del 10 de agosto, se sitúa dentro de una nueva estructura de dos niveles para la iniciativa de ciberseguridad Daybreak de OpenAI. La estructura separa el trabajo ampliamente defensivo de actividades como pruebas de penetración, validación de exploits y red teaming autorizado.

Daybreak Blue proporciona a los defensores aprobados GPT-5.6 Sol y salvaguardas calibradas para el descubrimiento de vulnerabilidades, revisión segura de código, análisis de malware, respuesta a incidentes y validación de parches. OpenAI dice que Blue elimina las barreras de ciberseguridad a nivel de sistema que pueden bloquear solicitudes defensivas legítimas, aunque el modelo subyacente aún puede rechazar indicaciones de alto uso dual.

Daybreak Red va más allá. Proporciona acceso a GPT-5.6-Cyber, que OpenAI construyó sobre GPT-5.6 Sol y entrenó para reducir los rechazos en investigación de vulnerabilidades autorizada, desarrollo de cadenas de exploits y otras tareas de seguridad de mayor riesgo.

OpenAI reduce la tasa de rechazo

La medida más clara de ese cambio proviene de una evaluación interna de OpenAI que cubre bypass de autenticación, escalada de privilegios, cadenas de exploits y escenarios relacionados. GPT-5.6-Cyber completó el 95% de las solicitudes, según OpenAI, en comparación con el 1.5% para la GPT-5.6 Sol estándar, el 2% para Sol a través de Daybreak Blue y el 57.3% para GPT-5.5-Cyber.

Esas cifras miden si un modelo completa la solicitud, más que si su respuesta es correcta o produce un exploit confiable. La evaluación es interna, y OpenAI dice que GPT-5.6-Cyber generalmente usa un presupuesto de razonamiento mayor y más tokens que GPT-5.6 Sol.

Otras evaluaciones de OpenAI muestran un perfil de rendimiento mixto. GPT-5.6-Cyber superó a GPT-5.6 Sol y a GPT-5.5-Cyber en la implementación de OpenAI de ExploitGym, que prueba si los agentes pueden convertir vulnerabilidades conocidas en exploits funcionales en entornos controlados. El modelo especializado también rindió mejor que Sol en una evaluación interna para encontrar vulnerabilidades novedosas y estimar su severidad.

GPT-5.6-Cyber quedó por detrás de GPT-5.6 Sol en la evaluación de descubrimiento de vulnerabilidades y redacción de informes de OpenAI, donde el modelo especializado a veces produjo informes más cortos y menos detallados. Sol también rindió mejor bajo la configuración estándar de 300 turnos en ExploitBench, una prueba construida alrededor de desarrollar una vulnerabilidad de V8 hasta un exploit completo. La brecha se redujo cuando OpenAI duplicó el límite a 600 turnos.

Los resultados posicionan a GPT-5.6-Cyber como un especialista para trabajo sostenido de exploits en lugar de un reemplazo universal de GPT-5.6 Sol. OpenAI recomienda Daybreak Blue para la mayoría de los profesionales de seguridad y reserva Daybreak Red para flujos de trabajo que requieren desarrollo de exploits o validación ofensiva.

OpenAI probó el modelo en el motor V8 de Chrome

OpenAI dice que sus investigadores usaron GPT-5.6-Cyber para encontrar dos vulnerabilidades previamente desconocidas en V8, el motor de JavaScript que usa Chrome. Según OpenAI, las vulnerabilidades podrían encadenarse para corromper la memoria y escapar del sandbox de heap de V8.

OpenAI informó los hallazgos a Google mediante divulgación coordinada. Google solucionó una de las vulnerabilidades como CVE-2026-15903, dijo OpenAI. La falla implicaba que el compilador optimizador de V8 omitía una verificación de seguridad durante una conversión de enteros, creando una ruta para que un atacante lea o sobrescriba memoria dentro del sandbox de Chrome.

OpenAI también afirma que GPT-5.6-Cyber identificó al menos cinco vulnerabilidades en un sistema operativo móvil no identificado, tres fallas críticas en una base de datos no identificada y más de 400 vulnerabilidades de escalada de privilegios en un kernel de sistema operativo no identificado. OpenAI no ha nombrado los proyectos afectados mientras continúa el trabajo de divulgación y remediación, lo que deja la severidad e impacto práctico de esos hallazgos dependientes del relato de OpenAI.

SpecterOps, SentinelOne y Palo Alto Networks recibieron acceso anticipado. Jared Atkinson, CTO de SpecterOps, dijo en la publicación de lanzamiento de OpenAI que el modelo completó parte del trabajo gobernado de investigación de vulnerabilidades en menos de un día después de que modelos anteriores no hubieran podido resolverlo tras semanas de esfuerzo intermitente.

Las salvaguardas se trasladan a la cuenta y al entorno

El acceso a ambos niveles de Daybreak requiere la aprobación de OpenAI. La solicitud de Trusted Access solicita identidad, experiencia profesional y casos de uso previstos. OpenAI dice que también empleará seguridad de cuenta, monitoreo, restricciones de uso y atestaciones legales para controlar el acceso.

A los usuarios individuales de Daybreak se les exigirá usar llaves de seguridad de hardware a partir del 1 de septiembre. OpenAI también está alentando a los usuarios de Codex a ejecutar agentes cibernéticos en modo de revisión automática, que verifica las acciones que requieren permisos elevados antes de su ejecución. Sus guías de despliegue piden sandboxes aislados, límites de autorización explícitos y monitoreo humano de las acciones de los agentes.

Esos controles cobran mayor peso después de que OpenAI divulgara el 21 de julio que GPT-5.6 Sol y un prototipo de investigación interno con rechazos cibernéticos reducidos salieron de un entorno de evaluación y comprometieron la infraestructura de Hugging Face. OpenAI dijo que los modelos encontraron una vulnerabilidad previamente desconocida en un proxy de registro de paquetes, obtuvieron acceso a internet y encadenaron debilidades y credenciales adicionales para alcanzar sistemas de Hugging Face.

OpenAI dijo explícitamente que GPT-5.6-Cyber no estuvo involucrado en ese incidente. El episodio aun así estableció el riesgo detrás del diseño de Daybreak: reducir los rechazos puede dar a los investigadores legítimos una herramienta más útil al mismo tiempo que convierte la verificación de identidad, el sandboxing y el monitoreo en parte del límite de seguridad efectivo del modelo.

OpenAI evaluó GPT-5.6-Cyber como "High" para capacidad de ciberseguridad bajo su Preparedness Framework, por debajo del umbral "Critical" del marco. Con Daybreak Red, OpenAI está colocando un modelo entrenado para cruzar sus habituales límites de rechazo en un uso profesional controlado y apostando a que los controles de acceso pueden mantener esas capacidades enfocadas en sistemas autorizados.

Reader comments

Conversation for this story loads after sign-in.