OpenAI pausa parte del trabajo con Astra mientras evalúa capacidades cibernéticas críticas

El modelo no lanzado de OpenAI mostró un fuerte desempeño en ciberseguridad, lo que provocó pruebas en aislamiento y monitoreo universal mientras OpenAI continúa su evaluación.

By · Published

Primary source: CNBC

Why it matters

Astra tests whether a frontier AI developer can slow work, isolate testing and restrict deployment while a potentially dangerous capability assessment remains unresolved.

Illustration of OpenAI's unreleased Astra model depicted as a large machine being powered down with warning lights and caution symbols.

OpenAI, dirigida por el cofundador y CEO Sam Altman (@sama), suspendió algunas actividades internas relacionadas con Astra después de que evaluaciones preliminares dejaron al desarrollador de IA sin poder descartar un nivel de capacidad cibernética Critical según su marco de seguridad.

OpenAI dio a conocer la decisión el 7 de agosto. Astra, un modelo no lanzado, mostró un desempeño lo suficientemente sólido en evaluaciones preliminares como para que OpenAI no pudiera descartar el umbral Critical. CNBC informó el 10 de agosto que OpenAI detuvo algunas actividades internas mientras continuaba probando el modelo.

OpenAI dijo que trasladó las pruebas de Astra a entornos aislados e implementó monitoreo universal para acciones riesgosas y desalineación en las aplicaciones con capacidad de agencia del modelo, incluyendo entrenamiento y evaluación. OpenAI también está añadiendo capacidades de monitoreo y detección para modelos de mayor capacidad.

La divulgación deja a Astra en un estado operacional inusual: el desarrollo se ha ralentizado, parte del trabajo se ha detenido y OpenAI está aplicando controles asociados con un nivel de capacidad que aún no se ha resuelto. OpenAI no ha dicho qué actividades internas pausó ni cuánto tiempo permanecerán las restricciones.

Qué significaría una evaluación Critical

El Marco de Preparación de OpenAI describe la capacidad cibernética Critical como la habilidad para realizar ciberataques contra defensas sofisticadas de forma autónoma, sin que un usuario proporcione instrucciones detalladas.

Esa descripción define el umbral que OpenAI está evaluando. No es una conclusión de que Astra haya demostrado cada capacidad o haya llevado a cabo un ataque. La posición de OpenAI es más limitada: los resultados preliminares de Astra fueron lo bastante sólidos como para que la empresa no pueda descartar el nivel Critical mientras continúa la evaluación comparativa.

OpenAI dijo que estaba aplicando controles de seguridad más estrictos mientras proseguía esa evaluación comparativa. La empresa no ha revelado si Astra finalmente alcanzará el umbral Critical.

La distinción importa para el despliegue. Un modelo capaz de encontrar vulnerabilidades y ejecutar trabajo técnico a largo plazo podría ayudar a los equipos de seguridad a identificar y corregir fallas graves. El acceso amplio a las mismas capacidades podría reducir la experiencia y supervisión necesarias para atacar objetivos reforzados. OpenAI no ha divulgado la arquitectura de Astra, la forma de producto prevista, clientes, precios, fecha de lanzamiento ni la política de acceso eventual.

Axios informó el 7 de agosto que OpenAI ampliaría las pruebas de seguridad, ralentizaría el desarrollo de Astra y pondría salvaguardas antes de cualquier lanzamiento. El momento de un lanzamiento ya era incierto, y Axios dijo que las restricciones podrían retrasarlo.

Los controles de OpenAI dejan abiertas las opciones de despliegue

Las pruebas aisladas y el monitoreo universal le dan a OpenAI formas de observar a Astra mientras limita dónde puede actuar. La divulgación pública no explica los límites de esos entornos, quién puede autorizar excepciones ni si evaluadores externos probarán de forma independiente las capacidades cibernéticas del modelo.

OpenAI tampoco ha dicho si Astra podría ofrecerse eventualmente de forma amplia, limitarse a organizaciones evaluadas o reservarse para investigación interna. Anthropic, otro desarrollador de IA de frontera, ofrece una comparación a través de Claude Mythos 5, su modelo de investigación cibernética de acceso restringido.

Anthropic dice que socios de su programa Project Glasswing encontraron más de 10,000 vulnerabilidades de alta o Critical severidad. La cifra es el propio recuento de Anthropic, pero el programa muestra cómo un desarrollador puede dar acceso a organizaciones de seguridad seleccionadas a capacidades cibernéticas avanzadas sin ofrecer el modelo de forma amplia. OpenAI no ha indicado si Astra usará una estructura similar.

La evaluación de Astra es independiente de los incidentes de evaluación por terceros que involucraron otros modelos y entornos de prueba. OpenAI dijo a Axios que Astra no estuvo involucrada en el incidente anterior de Hugging Face.

Altman ha pasado una década argumentando que una IA cada vez más capaz puede distribuirse para un beneficio amplio, una posición reflejada en el anuncio de fundación de OpenAI. Astra crea una prueba concreta de esa postura: si OpenAI puede mantener un control efectivo de un modelo no lanzado mientras determina qué puede hacer y quién, si es que alguien, debería poder usarlo.

Reader comments

Conversation for this story loads after sign-in.