Todo lo que sabemos sobre cómo el Project Panama de Anthropic escaneó millones de libros

Los registros judiciales detallan millones de descargas pirata, millones de libros impresos comprados, un flujo de trabajo de escaneo destructivo y el acuerdo de 482,460 títulos que siguió.

By · Published · Updated

Primary source: X - Ole Lehmann

Why it matters

The case gives AI developers a working legal boundary: model training and internal scanning of purchased books may qualify as fair use, while pirated acquisition can create billion-dollar liability.

Illustration of Anthropic's Project Panama scanning stacks of books into digital files while court papers and a gavel loom in the background.

El Project Panama de Anthropic fue un esfuerzo interno para construir una gran biblioteca digital de libros comprando copias impresas, quitando sus encuadernaciones, escaneando las páginas en PDFs buscables y descartando los originales en papel. Registros judiciales expusieron la operación junto a una vía separada de adquisición de libros que, en última instancia, le costó al desarrollador de IA 1,500 millones de dólares: descargas de más de 7 millones de copias pirateadas.

Un juez federal aprobó el acuerdo el 20 de julio, resolviendo reclamaciones vinculadas a 482,460 libros obtenidos de Library Genesis y Pirate Library Mirror. El fallo no rechazó el método de escaneo físico de Anthropic. En cambio, trazó una línea legal entre digitalizar libros que la empresa había comprado y retener libros adquiridos sin pago.

Esto es lo que muestran los registros judiciales sobre por qué la compañía de Dario y Daniela Amodei creó Project Panama, cómo funcionó la operación, las cifras detrás de la colección de libros de Anthropic y qué cubre y no cubre el acuerdo.

The numbers behind Anthropic's book collection

Las dos vías de adquisición de Anthropic operaron en escalas diferentes y conllevaban distintos riesgos legales:

  • El cofundador Ben Mann (@8enmann) descargó al menos 5 millones de libros de LibGen en junio de 2021.
  • Anthropic descargó al menos 2 millones más de libros de Pirate Library Mirror en julio de 2022.
  • La compañía había adquirido previamente 196,640 títulos de Books3.
  • El juez William Alsup determinó que Anthropic pirateó más de 7 millones de copias de libros en total.
  • Posteriormente Anthropic gastó millones de dólares comprando millones de libros físicos, muchos de ellos usados, para escanearlos.
  • El acuerdo cubre 482,460 libros obtenidos de LibGen y Pirate Library Mirror.
  • Autores y editoriales reclamaron intereses en 440,490 de esas obras, o el 91.3% de la lista del acuerdo, al 16 de abril.
  • El acuerdo de 1,500 millones de dólares representa un pago estimado de aproximadamente $3,000 por libro cubierto antes de los ajustes finales de asignación.

Las más de 7 millones de copias pirateadas y los 482,460 libros cubiertos por el acuerdo no son cifras intercambiables. La cifra mayor describe las descargas de bibliotecas pirata de Anthropic. La lista del acuerdo identifica las obras incluidas en las reclamaciones resueltas.

Why Anthropic wanted a book library

Los fundadores de Anthropic concluyeron al principio del desarrollo de la compañía que los libros estaban entre las fuentes más rentables para construir un modelo de lenguaje grande competitivo. Anthropic, fundada en 2021 y dirigida por los hermanos Dario y Daniela Amodei, describió públicamente su misión como crear sistemas de IA que fueran "controlables, interpretables y robustos", según su anuncio de la Serie A.

Los registros judiciales muestran que satisfacer los requisitos de datos del desarrollo de modelos de frontera se convirtió en un desafío operacional aparte. Anthropic inicialmente ensambló una biblioteca digital central a partir de Books3, LibGen y Pirate Library Mirror. La compañía conservó esa biblioteca para investigación general, incluidos libros que había decidido no usar para el entrenamiento de modelos, conforme a una orden judicial del 23 de junio de 2025.

Esa distinción importó en los tribunales. La exposición de Anthropic no dependía únicamente de si ciertos libros entraron en un corpus de entrenamiento. Alsup trató la creación y retención de una biblioteca central no pagada como un uso separado.

How Project Panama worked

Anthropic cambió su estrategia de adquisición cuando sus abogados se mostraron preocupados por entrenar con material pirateado. En febrero de 2024, la compañía contrató a Tom Turvey, quien había liderado asociaciones para el proyecto de escaneo de libros de Google, y le encomendó obtener una colección comprensiva de libros mientras limitaba el trabajo legal y comercial asociado con su adquisición.

Turvey abordó brevemente a editoriales sobre licenciar libros para entrenamiento de IA, según la orden judicial. Anthropic luego siguió compras al por mayor a través de distribuidores y minoristas de libros.

El flujo de trabajo físico fue destructivo por diseño:

  1. Anthropic compraba libros impresos al por mayor, incluidas copias usadas.
  2. Contratistas removían la encuadernación de cada libro y cortaban sus páginas.
  3. Las páginas se escaneaban y se convertían en archivos PDF buscables.
  4. Las copias físicas se descartaban en lugar de conservarse junto con los escaneos.
  5. Anthropic conservaba las copias digitales resultantes para uso interno.

Un documento de planificación interna llamó al esfuerzo Project Panama y dijo que Anthropic quería "escanear de forma destructiva todos los libros del mundo." El documento también indicó que la compañía no quería que el esfuerzo fuera de conocimiento público, según The Washington Post. Una publicación del 27 de julio en X de Ole Lehmann (@itsolelehmann) recirculó posteriormente lenguaje del documento.

Los registros disponibles describen millones de dólares gastados en millones de libros físicos, pero no proporcionan un total más preciso para las compras o escaneos de Project Panama.

Why the physical scans received different treatment

Alsup sostuvo que entrenar modelos de lenguaje con libros con derechos de autor constituía un uso transformador (fair use). Encontró por separado que convertir un libro impreso comprado legalmente en una copia digital interna era uso justo cuando Anthropic destruía el original y no distribuía la versión digital.

El proceso físico preservó una relación uno a uno entre un libro comprado y su reemplazo interno: Anthropic compró una copia, destruyó esa copia durante el escaneo y conservó el archivo resultante. Por lo tanto, el fallo trató el escaneo como un cambio de formato en lugar de la creación de una copia adicional no pagada para distribución.

Las descargas de bibliotecas pirata no recibieron esa protección. Alsup determinó que Anthropic había adquirido esos archivos sin pagar y los retuvo en una biblioteca de investigación de propósito general. Construir esa biblioteca constituyó un uso separado, no transformador, incluso si el entrenamiento del modelo en sí mismo podría calificar como uso justo.

Esa separación explica por qué el flujo de compra-y-escaneo de Project Panama sobrevivió al escrutinio legal mientras que Anthropic enfrentó posibles daños estatutarios por sus descargas anteriores.

What the $1.5 billion settlement covers

La orden de aprobación final cubre 482,460 libros adquiridos de LibGen y Pirate Library Mirror. A aproximadamente $3,000 por libro antes de los ajustes de asignación, el acuerdo resuelve reclamaciones derivadas de la adquisición y copia pasadas de las obras cubiertas.

Anthropic debe destruir los archivos originales descargados de LibGen y Pirate Library Mirror, así como las copias derivadas de esos repositorios, sujeto a requisitos de preservación de pruebas.

El acuerdo no es una resolución general de toda disputa potencial entre Anthropic y los autores. Su liberación cubre reclamaciones derivadas de adquisición y copia hasta el 25 de agosto de 2025. No libera reclamaciones basadas en resultados de modelos ni en la conducta futura de Anthropic.

Anthropic ha sostenido que los conjuntos de datos pirata no se usaron para entrenar ningún modelo lanzado comercialmente. La subdirectora de asesoría general Aparna Sridhar dijo a la Associated Press que el fallo de junio de 2025 estableció el entrenamiento de IA con libros como uso justo y que la compañía se preparaba para cerrar el asunto.

El caso produjo en última instancia dos resultados distintos. Los fundadores de Anthropic obtuvieron apoyo judicial para entrenar con libros y para digitalizar internamente copias compradas legalmente bajo el proceso usado para Project Panama. Pero la decisión de la compañía de construir y retener una biblioteca a partir de repositorios pirata generó un acuerdo de 1,500 millones de dólares y la obligación de destruir los archivos cubiertos.

Reader comments

Conversation for this story loads after sign-in.