Amazon 购买并销毁印刷书籍以获取 AI 训练数据

一个藏在大约1,000本书订单中的追踪器将404 Media引到了拉斯维加斯的一个地点,工人在那里切开装订并扫描书页。

By · Published

Primary source: 404 Media

Why it matters

Amazon is turning the used-book market into private AI data infrastructure, showing how a routine purchase can produce permanent model-training material without a bespoke content license.

Amazon buys and destroys printed books for AI training data — A tracker hidden in a roughly 1,000-book order led 404 Media to a Las Vegas site where workers cut bindings and scan pages.

Amazon 正通过商业市场购买印刷书籍,剪去其装订、扫描页面以用于 AI 开发并销毁实体副本,根据 8月17日由 404 Media 进行的调查

404 Media 联合创始人 Emanuel Maiberg 通过追踪一本书在美国境内的行踪,确认了这项行动。一位书商通过 Biblio 收到了一笔异常大的订单,约有 1,000 册图书,Biblio 是一家对卖家隐瞒买家身份的市场。书商在发货前在其中一本书内放入了 404 Media 提供的 Apple AirTag。

调查发现,被追踪的图书从加利福尼亚以空运离开,出现在 Milwaukee Mitchell International Airport 附近,随后在威斯康星州 Kenosha 市外的一个配送仓库停留了大约两周。它后来由卡车向西行驶,在 Colorado 的 Grand Junction 附近过夜停留,最终抵达位于拉斯维加斯、标识为 LAS8 的 Amazon 仓库。

LAS8 设有若干业务。追踪器将 Maiberg 带到用于 VGT3 的北部区域,VGT3 是 Amazon 的一个部门,其标志为一只手持打开书本的 Tyrannosaurus rex。Amazon 员工在内部论坛讨论 VGT3 时描述了接收大量书籍、移除装订并扫描页面的情况。切开书脊使散页能快速通过工业扫描仪,从而使印刷本无法再被使用。

Amazon 承认购买书籍,但未指明使用所得数据的产品或模型。“Amazon 通过商业渠道购买书籍,以帮助开发和改进客户使用的产品和服务,”一位 Amazon 发言人对 404 Media 说。

该声明未说明扫描文本的去向。Amazon 通过 AWS 开发 Nova 系列基础模型,并已将在零售业务中广泛部署生成式 AI,包括 Alexa for Shopping。Amazon 的 生成式 AI 开发披露 将训练来源描述为若干大类,包括经许可的、专有的、公开的和开源的数据,但并未列出具体数据集或购书渠道。

为什么 AI 开发者想要印刷书籍

书籍包含经过编辑的、结构化的文本,这些文本可能从未在线发布过。较早的版本也早于大量机器生成文章和书籍的广泛出现,为模型开发者提供了一种可与网络上越来越多的合成文本区分开的人类书写材料来源。

这种区分很重要,因为不加区分地将模型生成的材料投入后续训练运行,可能会削弱最终系统的性能。研究人员记录了这种过程,称为 模型崩溃,在该过程中递归训练的模型会丧失关于原始数据分布的信息。

批量购买的模式并不限于被追踪到拉斯维加斯的那批货。2026 年 1 月,图书分销商 Ingram 告知出版商,AI 开发者正越来越多地购买实体书籍和其他媒体,可能是为了扫描并将其纳入模型训练。Ingram 向出版商提供了在已知卖给 AI 开发者的销售中选择退出的途径,同时警告其并不总能识别买家或用途。

实体书在合同约束上也有别于电子书。电子书买家通常获得限制复制和再分发的许可。买家通常拥有所购的印刷本,可以处置该实物,尽管创建和使用数字复制品会引发独立的版权问题。

经法院检验的获取方法

Amazon 的行动与在针对 Anthropic 的版权诉讼中披露的一项图书数字化项目高度相似。2025 年 6 月 23 日的一项联邦法院命令记录了 Anthropic 花费数百万美元购买了数百万册印刷书籍。供应商剥离装订、切割纸张、将其扫描为可搜索文件并丢弃纸质原件。

美国地方法院法官 William Alsup 裁定,Anthropic 将合法购买的印刷书籍转换为内部数字替代品,在本案事实下构成合理使用。该命令强调,每一册实体副本都被一份内部数字副本所替代,且这些文件未在 Anthropic 外部分发。Alsup 对 Anthropic 从盗版图书馆下载的数百万册书籍则得出了不同的结论。

该裁决针对 Anthropic 的具体行为,但它为 AI 开发者购买实体书籍而非获取未授权数字副本建立了明确激励。商业购买确立了出处,而破坏性扫描则在不让纸质和数字图书副本同时流通的情况下,产生可搜索的文本。

Amazon 的仓库为该市场增加了一个重要的新参与者。404 Media 追踪的那批货显示,传统的二手书订单如何可能在卖家不知买家身份或用途的情况下进入私人 AI 数据供应链。一旦被扫描,文本可以在未来的模型开发项目中持续有用。实体书籍则无法回到书商、图书馆或收藏家手中。

Amazon 尚未将 VGT3 与某个已命名的模型挂钩,也未披露在那里处理的书籍数量。该行动仍然揭示了其基本策略:Amazon 正将商业采购能力和仓库劳动力转化为专有训练材料,而竞争对手无法仅通过从开放网络抓取来获得这些材料。

Reader comments

Conversation for this story loads after sign-in.