Anthropic dice que 354 diseños de proteínas de Claude se unieron en pruebas de laboratorio
Anthropic publicó las indicaciones y los datos detrás de 1,440 diseños, aunque ninguno de ellos fue probado en cuanto a función biológica ni se resolvió estructuralmente.
By Ryan Merket · Published · Updated
Primary source: Anthropic
Why it matters
Anthropic is testing whether a general frontier agent can operate specialist scientific workflows. The open release gives labs a reproducible protocol, while the missing functional evidence keeps the drug-discovery implications in check.

Dario Amodei and Daniela Amodei's Anthropic sent Claude into protein engineering, where its agents ran autonomous design campaigns that yielded 354 proteins with measured binding across 15 interpretable targets.
Anthropic describió los resultados en una publicación en X el martes y publicó un informe técnico de 29 páginas. Anthropic también liberó los prompts, las estructuras predichas, los registros de procedencia y las mediciones experimentales para los 1,440 diseños en Hugging Face.
El trabajo devuelve a Amodei a sus raíces científicas. Antes de Google Brain, OpenAI y Anthropic, obtuvo un doctorado en física por Princeton estudiando circuitos neuronales y trabajó en Stanford en proteomas celulares y biomarcadores de cáncer. Daniela Amodei aportó experiencia en operaciones y seguridad desde Stripe y OpenAI cuando los hermanos fundaron Anthropic con excolegas de OpenAI en 2021.
Su tesis fundacional se centró en incorporar seguridad en los modelos de vanguardia desde el inicio. El proyecto de proteínas extiende esa tesis hacia una pregunta práctica: ¿puede un agente de IA de propósito general asimilar el conocimiento operativo de un especialista, operar software científico y producir candidatos físicos que valga la pena probar?
Amir Shanehsazzadeh, investigador de Anthropic y único autor listado en el informe, diseñó el experimento en torno a esa pregunta. Escribió un prompt de protocolo de aproximadamente 16,000 palabras que cubría el conocimiento científico y operativo necesario para ejecutar una campaña de ligantes. Claude se encargó de las decisiones de diseño individuales.
Lo que Claude hizo realmente
Anthropic ejecutó Claude Opus 4.8 y Mythos Preview como agentes contra 16 objetivos proteicos. Los modelos investigaron cada objetivo, seleccionaron regiones y sitios de unión, instalaron software de diseño y predicción de estructuras de código abierto, generaron candidatos, los optimizaron computacionalmente y devolvieron 30 diseños clasificados por objetivo.
Claude no recibió ningún epítopo, andamio o secuencia proteica predeterminada. Anthropic seleccionó los objetivos, proporcionó cuentas de GPU en la nube, fijó los presupuestos y los límites de tiempo, aprobó solicitudes de acceso no científicas y encargó las proteínas resultantes para su síntesis. Los humanos interpretaron los resultados experimentales al finalizar las campañas.
Las ejecuciones de objetivo único recibieron 24 horas y un presupuesto de cómputo de $10,000. Las ejecuciones de múltiples objetivos recibieron 48 horas y $50,000. Claude tuvo que instalar y validar las herramientas científicas por sí mismo, luego gestionar equipos de subagentes mientras mantenía el trabajo dentro de esas restricciones.
Esa distinción define la contribución técnica. Anthropic no introdujo ningún modelo especializado de generación de proteínas. Claude coordinó sistemas de código abierto existentes, incluidos generadores de armazón (backbone) de proteínas, herramientas de diseño de secuencias y predictores de estructuras. El informe es evidencia de agentes de vanguardia como operadores científicos, más que evidencia de que Anthropic ha construido una plataforma de diseño de fármacos.
La misma estrategia de orquestación atraviesa el empuje de producto más amplio de Anthropic. Más temprano el martes, RuntimeWire informó que Anthropic abrió Claude Cowork a todos los planes pagos, extendiendo un agente diseñado para trabajar en archivos y aplicaciones. Claude Science aplica la idea subyacente a entornos de investigación con software especializado, cómputo en la nube y artefactos auditables.
El 27% viene con un denominador
Adaptyv Bio y Twist Bioscience, dos organizaciones de investigación por contrato pagadas, sintetizaron los diseños y midieron su unión. Un objetivo, la GDF-8 madura, se agregó durante las pruebas, dejando 1,320 diseños en 15 objetivos con mediciones interpretables.
De esos, 354 se unieron, lo que da una tasa de aciertos reportada del 26.8%. Claude produjo al menos un ligante contra 14 de los 15 objetivos interpretables. El 49% de los diseños que ocuparon el primer lugar en sus respectivas campañas de objetivo mostraron unión.
El desempeño varió notablemente según el objetivo. Claude produjo 72 ligantes de 90 diseños contra TREM2 y 54 de 90 contra VEGF-A. Produjo tres ligantes débiles contra el beta-barrel sintético BBF-14 y ninguno de 90 diseños contra maltose-binding protein. Las puntuaciones de confianza computacional dieron poca advertencia de que esas campañas fracasarían.
Las campañas de objetivo único de 24 horas de Mythos Preview registraron una tasa de aciertos del 35.1%, comparadas con 26.7% para su campaña de múltiples objetivos y 22.6% para la ejecución multiojetivo de Opus 4.8. El formato de objetivo único también recibió 2.8 veces más cómputo por objetivo, por lo que el experimento no puede aislar si la diferencia fue causada por el enfoque, el presupuesto o el comportamiento del modelo.
La comparación más fuerte se dio en RBX1. Veintiocho de los 90 diseños de Claude se unieron, comparado con nueve de 245 entradas en una competencia abierta reciente. El diseño de RBX1 más fuerte reportado por Anthropic produjo una constante de disociación aparente de 3.9 nanomolar cuando se probó en la misma placa que el ganador de la competencia, que midió 45 nanomolar.
Ese resultado merece atención, aunque no es un ensayo limpio humano contra agente. Anthropic no ejecutó una campaña emparejada en la que expertos humanos recibieran las mismas herramientas, cómputo y tiempo. Resultados de cuatro de las seis competencias abiertas usadas como comparaciones estuvieron disponibles para Claude durante el proceso de diseño.
El laboratorio húmedo todavía tiene el voto final
La limitación más aguda del informe es biológica. Anthropic midió la unión, un punto de control temprano en la ingeniería de proteínas. Ninguna de las proteínas diseñadas se probó por actividad biológica, y ningún complejo proteína-objetivo se resolvió estructuralmente. Cada pose de unión en el informe sigue siendo una predicción computacional.
La tasa de aciertos principal también cuenta variantes de secuencia del mismo armazón proteico subyacente como diseños separados. Cuando Anthropic contó solo la secuencia mejor clasificada de cada uno de los 809 armazones generados, 200 se unieron, produciendo una tasa del 24.7%. Las mediciones de afinidad para cinco objetivos oligoméricos fueron valores aparentes, y cada combinación de modelo, formato de campaña y objetivo generalmente se ejecutó una sola vez.
Esas salvedades ponen distancia entre este experimento y un programa terapéutico. Empresas como Latent Labs, Manifold Bio y Generate:Biomedicines están construyendo modelos especializados, sistemas de cribado o pipelines de fármacos alrededor de la ingeniería de proteínas. AlphaProteo de Google DeepMind ha combinado la generación de ligantes con validación estructural y funcional en objetivos seleccionados.
La oportunidad inmediata de Anthropic se sitúa un nivel por encima de esos sistemas. Claude puede elegir entre herramientas científicas, instalarlas, gestionar el cómputo y preservar un registro de sus decisiones. Un laboratorio podría adaptar el protocolo liberado sin construir su propio marco de agentes desde cero.
Publicar el conjunto completo de diseños hace que la liberación sea más útil que una tabla de ejemplos exitosos. El repositorio de Hugging Face incluye campañas fallidas, candidatos de menor rango, mediciones de unión en bruto y los registros necesarios para inspeccionar qué herramientas produjeron cada diseño. Los datos están licenciados bajo CC BY 4.0, mientras que los scripts liberados usan la licencia MIT.
Según el informe, Shanehsazzadeh también usó Claude Science para el análisis posterior a la campaña, las figuras y la redacción del manuscrito. Verificó los análisis con los datos liberados y asumió la responsabilidad del artículo. Anthropic ha publicado efectivamente un experimento dirigido por IA y un relato asistido por IA de ese experimento, con suficiente material subyacente para que investigadores externos cuestionen ambos.
Claude no produjo un fármaco. Demostró que un agente general podría ejecutar la mayor parte de una campaña computacional de diseño de proteínas, entregar candidatos físicos que se unieron en pruebas independientes y exponer su trabajo para replicación. Los pasos restantes — estructura, función, seguridad y eficacia — son donde la biología deja de comportarse como un benchmark de software.