Anthropic supuestamente rebajó las salvaguardas de la IA para contratos de gran gasto, dice un exempleado.

En un hilo en X del 26 de julio, el exintegrante del personal de Anthropic Adi Baradwaj afirma que la compañía cambió la seguridad por ingresos y señala que la mayoría de los hackers de sombrero negro usan suscripciones estándar de Claude Code.

By · Published

Primary source: X

Why it matters

If true, the trade‑off between safety and revenue could expose enterprise customers to higher risk of AI misuse and trigger regulatory scrutiny.

Illustration of a compromised industrial data lock labeled "Claude", representing Anthropic and its alleged weakening of AI safeguards for large contracts.

Claim from a former Anthropic employee

El exingeniero de Anthropic Adi Baradwaj publicó un hilo de tres tuits en X el 26 de julio de 2026, alegando que la startup de IA "reducía las salvaguardas a cambio de contratos con un gran compromiso de gasto." Baradwaj escribió que observó múltiples instancias en las que Anthropic redujo las restricciones de seguridad en sus modelos Claude para clientes que firmaron acuerdos de uso de gran volumen. El hilo se puede leer completo aquí.

Baradwaj también afirmó que "la mayoría de los hackers black‑hat usan suscripciones estándar de Claude Code/Codex para hacking, mientras que los defensores white‑hat ..." y citó a un segundo participante que dijo que "las salvaguardas no son suficientes para detener a un actor moderadamente dedicado." Ningún otro empleado o portavoz de Anthropic ha corroborado estas declaraciones, y la compañía no ha emitido una respuesta pública.

Anthropic's publicly stated safety posture

Anthropic, fundada en 2020 por exinvestigadores de OpenAI, ha construido su reputación sobre un enfoque "Constitutional AI" que incorpora directrices éticas directamente en el proceso de toma de decisiones del modelo. La compañía comercializa su serie Claude como una alternativa más segura frente a modelos de lenguaje grandes competidores, enfatizando "robustos frenos" y un "ciclo de desarrollo iterativo que prioriza la seguridad" en su sitio oficial.

En 2023, Anthropic publicó un libro blanco de seguridad y políticas de IA que describía un sistema por capas de filtros de contenido, mecanismos de rechazo y una constitución de seguridad actualizada de forma continua. El documento reconocía la tensión entre la capacidad del modelo y la seguridad, señalando que "los despliegues de mayor riesgo pueden requerir configuraciones de seguridad personalizadas negociadas con el cliente."

La acusación de Baradwaj sugiere que, en la práctica, esa negociación pudo haber cruzado una línea desde la personalización hasta la reducción directa de salvaguardas, presumiblemente para satisfacer la presión comercial de contratos empresariales de gran tamaño.

Enterprise contracts and the economics of safety

El modelo de ingresos de Anthropic depende en gran medida de precios basados en uso para su API, con niveles de descuento para empresas que se comprometen a gastos elevados y multianuales. Los analistas de la industria estiman que un solo contrato empresarial puede alcanzar decenas de millones de dólares anuales, especialmente cuando el cliente integra Claude en aplicaciones orientadas al cliente, bases de conocimiento internas o flujos de generación de código.

Si la afirmación es precisa, el supuesto intercambio implicaría que Anthropic ha priorizado los ingresos de estos contratos por encima de los estándares de seguridad uniformes que promueve al mercado en general. Tal movimiento podría crear un régimen de seguridad de dos niveles: una línea base más estricta para usuarios de bajo gasto y un conjunto relajado de salvaguardas para clientes de alto valor.

The broader AI‑security landscape

La observación de Baradwaj de que "la mayoría de los hackers black‑hat usan suscripciones estándar de Claude Code/Codex" se alinea con investigaciones recientes de seguridad que muestran que las claves de API disponibles públicamente se reutilizan con frecuencia para actividades ilícitas, desde phishing automatizado hasta inyección de código. Un informe de 2025 del Center for AI Safety documentó docenas de intentos de jailbreak dirigidos a Claude, a menudo aprovechando el endpoint de generación de código del modelo para producir scripts maliciosos.

Por el contrario, ese mismo informe señaló que los investigadores de seguridad éticos y los red‑teamers con frecuencia dependen de los mismos niveles de suscripción para probar defensas, subrayando una línea borrosa entre el trabajo legítimo de seguridad y el abuso.

La afirmación de que "las salvaguardas no son suficientes para detener a un actor moderadamente dedicado" subraya una tensión de larga data en el despliegue de IA: ningún conjunto de filtros puede prevenir por completo que un usuario determinado induzca a un modelo a comportarse de manera no permitida. Sin embargo, el núcleo de la acusación es que Anthropic pudo haber debilitado intencionalmente esos filtros para un subconjunto de clientes.

Potential implications for customers and the market

Si Anthropic realmente ofrece contratos con salvaguardas reducidas, los compradores empresariales podrían enfrentar una mayor exposición al uso indebido del modelo, escrutinio regulatorio y riesgo reputacional. Las organizaciones que dependen de Claude para chatbots de servicio al cliente, asistencia en código o generación de contenido podrían necesitar implementar monitoreo adicional a posteriori, incrementando la carga operativa.

Los reguladores en la UE y EE. UU. han comenzado a redactar marcos de riesgo de IA que podrían considerar las reducciones de salvaguardas como un cambio material en el perfil de riesgo, lo que potencialmente desencadenaría obligaciones de reporte bajo las próximas disposiciones del AI Act. Los inversores también podrían volver a evaluar la prima de valoración que Anthropic ostenta como una marca enfocada en la seguridad.

Verification challenges and next steps

El hilo de Baradwaj no ofrece evidencia directa: no hay extractos de contratos, memorandos internos ni capturas de pantalla de configuraciones de modelos alteradas. La falta de testimonios corroboratorios de otros empleados de Anthropic, clientes o auditorías de terceros significa que la afirmación sigue sin verificarse.

Los observadores de la industria probablemente buscarán verificación independiente mediante análisis a nivel de código de las respuestas de la API de Claude bajo diferentes condiciones contractuales, o a través de divulgaciones de denunciantes. Hasta que surja tal evidencia, la historia se mantiene como una acusación seria que se suma a los debates en curso sobre las presiones comerciales que moldean la seguridad en IA.

Context for readers

El enfoque de Anthropic hacia la seguridad ha sido un diferenciador en un mercado de IA generativa saturado dominado por OpenAI, Google y Microsoft. La reciente ronda Series C de Anthropic por $4 mil millones en 2024, liderada por Andreessen Horowitz y Sequoia, enfatizó su "enfoque de seguridad a largo plazo" como una propuesta de valor central. La afirmación de Baradwaj, de ser cierta, representaría un marcado contraste con esa narrativa y podría influir en cómo inversores, compradores empresariales y reguladores evalúan los trade‑offs entre rendimiento, costo y seguridad en los servicios de IA.

Reader comments

Conversation for this story loads after sign-in.