关于 Anthropic 的 Project Panama 如何扫描数百万本书,我们所知道的一切
法院记录详细记载了数以百万计的盗版下载、数以百万计购买的印刷书籍、一次具有破坏性的扫描工作流程,以及随后达成的包含482,460部书目的和解。
By Ryan Merket · Published · Updated
Primary source: X - Ole Lehmann
Why it matters
The case gives AI developers a working legal boundary: model training and internal scanning of purchased books may qualify as fair use, while pirated acquisition can create billion-dollar liability.

Anthropic 的 Project Panama 是一项内部计划,通过购买印刷书籍、拆掉其装订、将页面扫描为可搜索的 PDF,然后丢弃纸质原件,来建立大型数字图书馆。法庭记录披露了这一行动,以及最终耗资该 AI 开发者 15 亿美元的另一路购书途径:下载了超过 700 万本的盗版副本。
联邦法官在 7 月 20 日批准了该和解,解决了与从 Library Genesis 和 Pirate Library Mirror 获取的 482,460 本书相关的索赔。裁决并未否定 Anthropic 的实体扫描方法。相反,它在公司将购买的书籍数字化与保留未付费获取书籍之间划定了法律界限。
以下是法庭记录显示的关于 Dario 和 Daniela Amodei 的公司为何创建 Project Panama、该行动如何运作、Anthropic 图书收藏背后的数字以及和解所涵盖和不涵盖内容的详细信息。
Anthropic 图书收藏的数字
Anthropic 的两条获取路径在规模上不同,且承担的法律风险不同:
- 联合创始人 Ben Mann (@8enmann) 在 2021 年 6 月从 LibGen 下载了至少 500 万本书。
- Anthropic 在 2022 年 7 月又从 Pirate Library Mirror 下载了至少 200 万本书。
- 公司此前已从 Books3 获得了 196,640 个书目。
- 法官 William Alsup 认定 Anthropic 总共盗版了超过 700 万本书副本。
- Anthropic 随后花费数百万美元购买了数百万本实体书,许多为二手书,用于扫描。
- 和解涵盖了从 LibGen 和 Pirate Library Mirror 获得的 482,460 本书。
- 截至 4 月 16 日,作者和出版商对这些作品中的 440,490 部声称拥有权益,占和解名单的 91.3%。
- 这笔 15 亿美元的和解代表了大约每本被涵盖书籍在最终分配调整前约 3,000 美元的估算付款。
超过 700 万本的盗版副本与和解所涵盖的 482,460 本并非可互换的数字。较大的数字描述了 Anthropic 的盗版库下载量。和解名单则标识了解决索赔所包含的作品。
Anthropic 为什么要做图书馆
Anthropic 的创始人早期就在公司发展过程中得出结论:书籍是构建有竞争力的大型语言模型最具成本效益的来源之一。Anthropic 成立于 2021 年,由兄妹 Dario 和 Daniela Amodei 领导,根据 其 A 轮公告,公司公开描述其使命是创建“可操纵、可解释且稳健”的 AI 系统。
法庭记录显示,满足前沿模型开发的数据需求成为了另一项运营挑战。Anthropic 最初从 Books3、LibGen 和 Pirate Library Mirror 组建了一个中央数字图书馆。公司保留了该图书馆用于一般研究,包括那些公司决定不用于模型训练的书籍,依据 2025 年 6 月 23 日的法庭命令。
这一区别在法庭上很重要。Anthropic 的法律风险并不单纯取决于特定书籍是否进入训练语料库。Alsup 将创建并保留一个未付费的中央图书馆视为一种独立的用途。
Project Panama 的运作方式
随着律师对在盗版材料上进行训练的担忧增加,Anthropic 改变了其获取策略。2024 年 2 月,公司雇佣了曾领导 Google 书籍扫描项目合作事务的 Tom Turvey,委托他在限制与获取相关的法律和商业风险的同时,获得一套全面的图书收藏。
根据法庭命令,Turvey 曾短暂地接触出版商,讨论为 AI 训练许可书籍。随后 Anthropic 通过图书分销商和零售商进行批量购买。
该实体工作流程从设计上就是破坏性的:
- Anthropic 批量购买印刷书籍,包括二手书。
- 承包商移除每本书的装订并将其页面切开。
- 页面被扫描并转换为可搜索的 PDF 文件。
- 实体书籍在扫描后被丢弃,而不是与扫描件一同保留。
- Anthropic 保留所得的数字副本供内部使用。
一份内部规划文件将该行动称为 Project Panama,并表示 Anthropic 想要“破坏性地扫描世上所有书籍”。该文件还表明公司不希望该行动为公众所知,依据 The Washington Post。一篇由 Ole Lehmann (@itsolelehmann) 于 7 月 27 日在 X 上发布的帖子随后再次传播了文件中的表述(见 7 月 27 日在 X 上的帖子)。
现有记录描述了在数百万本实体书上花费数百万美元,但并未提供 Project Panama 购买或扫描的更精确总额。
为什么实体扫描受到不同对待
Alsup 认定,在受版权保护的书籍上训练语言模型构成了变革性合理使用(transformative fair use)。他另行认定,当 Anthropic 购买的纸质书被销毁且数字版未被分发时,将合法购买的纸质书转换为内部数字副本属于合理使用。
这一物理流程在购买的书与其内部替代品之间保留了一对一的关系:Anthropic 购买一册,扫描时销毁该册,并保留所得文件。因此裁决将扫描视为格式转换,而非为分发而创建的额外未付费副本。
盗版库下载则未获得该保护。Alsup 发现 Anthropic 未付费获取这些文件并将其保留在一个通用研究图书馆中。构建该图书馆是一种独立的、非变革性的用途,即便模型训练本身可能符合合理使用。
这种区分解释了为什么 Project Panama 的购买并扫描工作流程在法律审查中幸存下来,而 Anthropic 早期的下载则可能面临法定损害赔偿。
15 亿美元和解涵盖的内容
最终批准令 涵盖了从 LibGen 和 Pirate Library Mirror 获取的 482,460 本书。按大约每本在分配调整前约 3,000 美元的估算,该协议解决了由 Anthropic 过去获取和复制这些受涵盖作品所引发的索赔。
Anthropic 必须销毁从 LibGen 和 Pirate Library Mirror 下载的原始文件,以及源自这些仓库的副本,但须遵守保留证据的要求。
该和解并非对 Anthropic 与作者之间每一项潜在争议的全面解决。其释放(release)仅涵盖截至 2025 年 8 月 25 日通过获取和复制产生的索赔。其不包括基于模型输出或 Anthropic 未来行为的索赔。
Anthropic 一直坚持认为,这些盗版数据集并未用于训练任何已商业发布的模型。副总法律顾问 Aparna Sridhar 告诉 Associated Press,2025 年 6 月的裁决确立了在书籍上进行 AI 训练属于合理使用,公司正在准备结案。
该案最终产生了两个截然不同的结果。Anthropic 的创始人赢得了法庭对在书籍上进行训练以及按照 Project Panama 使用的流程对合法购买副本进行内部数字化的支持。但公司决定从盗版库构建并保留图书馆却导致了 15 亿美元的和解以及销毁被涵盖文件的要求。