Anthropic recorta los mecanismos de respaldo biológicos de Fable 5 mientras mantiene los límites de investigación
La reescritura del clasificador apunta a consultas cotidianas de salud y consultas clínicas, mientras que virología, toxicología y diseño molecular siguen dirigidas a Opus 5.
By Ryan Merket · Published
Primary source: Anthropic
Why it matters
Anthropic is turning safety classifiers into a distribution system for frontier capability. The unanswered question is whether fewer false alarms came without more dangerous requests getting through.
En su anuncio sobre salvaguardas biológicas, Anthropic, liderada por los cofundadores Dario Amodei y Daniela Amodei, dijo que había restringido los filtros biológicos en Claude Fable 5. El cambio reduce la cantidad de preguntas legítimas que se redirigen a un modelo menos capaz mientras conserva las restricciones sobre investigaciones que podrían ayudar al desarrollo de armas biológicas.
Anthropic dice que la actualización del clasificador redujo las redirecciones relacionadas con la biología en aproximadamente un 85% en sus pruebas. Los usuarios deberían encontrar menos conmutaciones de Fable 5 a Opus 5 al preguntar sobre resultados de laboratorio, síntomas, material educativo y parte del trabajo clínico. Anthropic continúa redirigiendo solicitudes relacionadas con virología, toxicología y diseño molecular a Opus 5, dejando a Fable 5 indisponible para gran parte de la investigación biológica profesional y el desarrollo de fármacos.
El tema está cerca del propio trasfondo de investigación de Dario Amodei. Antes de Anthropic, Amodei ayudó a dirigir investigaciones asociadas con GPT-2 y GPT-3 en OpenAI, según el perfil de la Hertz Foundation. La última decisión de producto de Anthropic se sitúa dentro del problema para el que sus fundadores crearon la organización: distribuir modelos cada vez más útiles sin dar a todos los usuarios acceso irrestricto a sus habilidades más peligrosas.
Del freno de lanzamiento al ajuste del producto
Anthropic lanzó Claude Fable 5 el 9 de junio con clasificadores amplios que cubrían biología, química, ciberseguridad y destilación de modelos. Anthropic dijo en el lanzamiento que casi todas las consultas de biología recurrirían a un modelo Opus porque su prioridad era poner en circulación general las demás capacidades de Fable 5 sin esperar semanas o meses por controles de biología más finos.
Ese enfoque impuso un impuesto intencional al producto. Un clasificador de seguridad es un sistema automatizado más pequeño que inspecciona una solicitud y, en este caso, decide si Fable 5 puede responderla. Anthropic estableció el límite inicial lo suficientemente amplio como para atrapar preguntas que probablemente eran inofensivas. El resultado fue un asistente pensado para trabajos profesionales complejos que con frecuencia se volvía menos capaz en cuanto la conversación tocaba la biología.
En las últimas semanas, Anthropic dice que reescribió las reglas del clasificador, recopiló retroalimentación de expertos internos y externos, construyó nuevos datos de entrenamiento, volvió a entrenar el clasificador y probó si éste seguía activándose con solicitudes de investigación dañinas y de uso dual.
La revisión muestra cómo Anthropic está intentando enviar modelos de vanguardia antes de que cada salvaguarda esté terminada. Fable 5 se lanzó con un límite conservador, generando evidencia del mundo real sobre falsos positivos mientras Anthropic trabajaba en un reemplazo más específico. Esa secuencia da a los usuarios acceso anticipado y permite a Anthropic refinar los controles con base en el uso real. También convierte a los clientes en participantes del período de ajuste, con trabajo legítimo degradado hasta que los clasificadores se pongan al día.
La cifra del 85% deja una laguna crítica en la medición
La mejora reportada por Anthropic se basa en sus propias pruebas. El anuncio del 7 de agosto no proporciona el tamaño de la muestra, el conjunto de prueba, la distribución de prompts ni la tasa de falsos negativos detrás de la reducción del 85%. Esa última medida es la que más importa: reducir los falsos positivos solo es útil si el clasificador revisado sigue detectando solicitudes peligrosas.
Anthropic dice que probó si el nuevo clasificador seguía activándose con contenido biológico de investigación dañino y de uso dual. Eso no establece con qué frecuencia se filtraron prompts prohibidos, cómo se comportaron los controles frente a la evasión deliberada ni si evaluadores independientes probaron el sistema revisado.
El detalle faltante es especialmente importante porque Anthropic describe a Fable 5 como capaz de superar a expertos en algunos trabajos biológicos complejos y de proporcionar asistencia operativa en otras tareas. Anthropic dice que esas capacidades podrían ayudar a los investigadores a desarrollar tratamientos médicos a la vez que ofrecen una mejora significativa a un actor malicioso que desarrolla un arma biológica. Ese riesgo de uso dual es la razón por la que Anthropic lanzó Fable 5 con casi todas las consultas de biología bloqueadas.
Un artículo de 2025 de Roger Brent y T. Greg McKelvey Jr. argumentó que las evaluaciones comunes de riesgo biológico pueden subestimar la ayuda que la IA proporciona tanto a usuarios inexpertos como a especialistas entrenados. Esa investigación precede a Fable 5, pero agudiza el estándar que debe cumplir el nuevo clasificador de Anthropic. Los prompts benignos necesitan pasar sin convertir la salvaguarda en un límite predecible que actores sofisticados puedan sortear.
Anthropic fundamenta su cautela en parte en la Evaluación Anual de Amenazas 2026 de la Comunidad de Inteligencia de EE. UU., que advierte que la biología sintética y la edición genómica podrían crear nuevas amenazas biológicas y dice que algunos estados adversarios probablemente mantienen programas ofensivos de armas químicas y biológicas. La evaluación de inteligencia establece el entorno de amenazas. No valida el clasificador de Anthropic ni sus afirmaciones de rendimiento.
El acceso confiable se está convirtiendo en la línea divisoria comercial
La estrategia más amplia de Anthropic separa la asistencia biológica común de la capacidad de investigación de vanguardia. Los usuarios generales reciben Fable 5 con controles de clasificador. Se espera que organizaciones de investigación seleccionadas reciban acceso a través de programas gobernados donde las salvaguardas biológicas puedan retirarse mientras otros controles permanecen.
OpenAI ha adoptado un enfoque similar. La compañía lanzó GPT-Rosalind en abril a través de un programa de acceso confiable para organizaciones calificadas en EE. UU., con requisitos de elegibilidad, gestión de acceso y gobernanza. Anthropic dice que planea cerrar la brecha mediante vías de acceso confiable para capacidades biológicas de frontera, pero su anuncio del 7 de agosto no define la elegibilidad ni proporciona un cronograma de solicitud.
Lo que está en juego va más allá de la política de seguridad. Los desarrolladores de fármacos y las instituciones de investigación necesitan sistemas que puedan trabajar a través de literatura, datos experimentales, herramientas científicas y flujos de trabajo de larga duración. Un asistente general que repetidamente recurre a alternativas alrededor del diseño molecular no puede competir por el trabajo más valioso en ese mercado. La reescritura del clasificador de Anthropic hace que Fable 5 sea más útil para la atención médica y la educación, mientras que el nivel de investigación restringido es donde Anthropic puede buscar una adopción científica más profunda.
El cambio de Anthropic en biología sigue a una suspensión en junio de controles de exportación que temporalmente dejó a Fable 5 fuera de línea a nivel mundial tras el escrutinio de un bypass de la salvaguarda de ciberseguridad. Anthropic restauró el acceso el 1 de julio después de que se levantaran los controles, según su anuncio de reimplementación.
Para los fundadores de Anthropic, la biología ofrece una prueba directa de la proposición fundacional de la compañía. Las solicitudes útiles y peligrosas a menudo dependen del mismo conocimiento, terminología y técnicas de laboratorio. Anthropic ha hecho que el límite orientado al consumidor sea menos restrictivo. Su siguiente tarea es demostrar, con mediciones que terceros puedan examinar, que una mayor utilidad no amplió la vía hacia el uso indebido.