La marca de agua invisible de Claude de Anthropic genera escrutinio por la detección cerrada

Anthropic promete detección por terceros más adelante, dejando el despliegue inicial dependiente de detalles técnicos que aún no ha publicado.

By · Published

Primary source: X

Why it matters

Closed detection gives Anthropic outsized control over whether writing is labeled as Claude-processed, while the mark can attach to human-authored text sent through Claude for editing.

A conceptual depiction of an invisible digital watermark embedded within a data stream, under scrutiny for detection. (Isotype infographic poster with mid-century pictogram style.)

El plan de Anthropic de incrustar marcas de agua invisibles en el texto generado por Claude fue objeto el miércoles de un ataque por parte del veterano inversor de capital de riesgo Bill Gurley (@bgurley), quien argumentó que Anthropic controlaría tanto el sistema de marcado como los medios para identificar su salida.

"Esto solo es identificable por Anthropic", escribió Gurley el 12 de agosto. "Una vez más son juez, jurado y fiscal." Respondía a Steven Sinofsky (@stevesi), el exjefe de Microsoft Windows y actual board partner en Andreessen Horowitz.

Gurley pasó décadas en Benchmark e hizo una de las inversiones definitorias de la firma en Uber. Antes de entrar en capital de riesgo, trabajó como ingeniero de diseño en Compaq y cubrió empresas de computadoras personales como analista en Wall Street, incluyendo el papel de analista principal en la oferta pública inicial de Amazon. Su crítica se centra en una implementación técnica con consecuencias directas para desarrolladores, editores y empresas que usan Claude para redactar o editar material.

Lo que Anthropic está desplegando

Anthropic documentó el sistema de marcado el 11 de agosto como parte de su cumplimiento con la AI Act de la Unión Europea. Según Anthropic, los modelos Claude lanzados el 2 de agosto o después admiten el marcado desde su lanzamiento. Los modelos publicados antes de esa fecha están sujetos a un período de transición, y Anthropic dice que está trabajando para añadir compatibilidad a esos modelos.

Esa distinción significa que las afirmaciones de que todas las respuestas actuales de Claude ya contienen una marca de agua van más allá de la documentación de Anthropic. El sistema se aplica a la salida de los modelos compatibles.

Para el texto, Anthropic dice que el modelo entreteje una marca imperceptible en el lenguaje generado. La marca permanece cuando el texto se copia y pega y puede sobrevivir a algunas ediciones. Anthropic dice que opera a nivel de modelo en Claude, Claude Code, Claude Cowork, Claude Tag y la Claude API, incluidos los modelos compatibles a los que se accede a través de AWS, Google Cloud y Microsoft Foundry. Anthropic planea aplicar el sistema a nivel mundial.

Los archivos reciben un tipo de marcado separado. Los archivos SVG, PNG y JPG compatibles llevarán metadatos de procedencia firmados basados en C2PA, un estándar abierto de la industria. Esos metadatos pueden indicar que Claude procesó un archivo y si fue alterado posteriormente.

Anthropic no ha publicado el método técnico usado para marcar con watermarks el texto ni ha liberado una herramienta pública de detección. Su documentación dice que las herramientas para usuarios y terceros están en camino. Eso deja a Anthropic como la autoridad inicial capaz de explicar cómo funcionan sus marcas de texto y con qué fiabilidad pueden detectarse, el problema de control que señaló Gurley.

Una marca no establece autoría

Las propias limitaciones de Anthropic reducen lo que cualquier detector eventual puede probar. Una marca detectada indica que el contenido pudo haber sido procesado por Claude. No establece que Claude haya escrito el material original.

Una persona podría escribir un documento, pasarlo por Claude para corrección, traducción o formato, y recibir texto que lleve la marca. Los pasajes marcados también pueden editarse, extractarse o combinarse con escritura humana. Eso crea una distinción material entre "Claude procesó este texto" y "Claude fue el autor de este texto", especialmente en escuelas, lugares de trabajo y sistemas editoriales que pueden usar los resultados de detección para hacer cumplir políticas sobre IA.

El inverso es igualmente importante. Anthropic dice que la ausencia de una marca no prueba la autoría humana. La detección puede fallar cuando el texto es corto, está fuertemente editado, parafraseado, traducido o mezclado con otro material. La salida de modelos más antiguos o no compatibles también puede carecer de la señal.

El Artículo 50 de la Unión Europea exige a los proveedores de sistemas de IA generativa que hagan que el texto, audio, imágenes y video sintéticos sean legibles por máquina y detectables como generados o manipulados artificialmente. Las obligaciones entraron en vigor el 2 de agosto, mientras que los sistemas ya en el mercado recibieron un período de transición hasta el 2 de diciembre. El código de transparencia de la Comisión Europea pide métodos de marcado y detección que sean eficaces, interoperables, fiables y tan técnicamente robustos como sea factible.

Anthropic firmó ese código voluntario como una vía para demostrar el cumplimiento de los requisitos vinculantes de la AI Act. Su decisión de desplegar las marcas a nivel mundial evita mantener un comportamiento de modelo distinto para Europa, aunque también extiende un sistema de cumplimiento impulsado por la UE a los usuarios de Claude en Estados Unidos y otros mercados.

La crítica de Gurley llega antes de que usuarios externos puedan probar las afirmaciones centrales: precisión de detección, tasas de falsos positivos, resiliencia ante la edición y cualquier efecto en la calidad de la salida. Anthropic dice que la marca de agua no cambia el significado, la calidad ni la legibilidad de los textos de Claude. La documentación técnica necesaria para examinar de forma independiente esa afirmación sigue sin publicarse.

Reader comments

Conversation for this story loads after sign-in.