AmazonはAIのトレーニングデータのために印刷された書籍を購入して破棄する
約1,000冊の注文に隠されていた追跡装置が404 Mediaを、作業員が背表紙を切りページをスキャンしているラスベガスの施設へと導いた。
By RuntimeWire Staff · Published
Primary source: 404 Media
Why it matters
Amazon is turning the used-book market into private AI data infrastructure, showing how a routine purchase can produce permanent model-training material without a bespoke content license.

Amazonは商業マーケットプレイスを通じて印刷された書籍を購入し、それらの製本を切断してページをスキャンしてAI開発に利用し、物理的なコピーを破棄していると、8月17日の404 Mediaの調査が報じている。
404 Mediaの共同創設者Emanuel Maibergは、本を追跡することでこの作業を特定した。ある古書店がBiblioを通じて約1,000冊という異常に大きな注文を受けた。Biblioは売り手に対して買い手の身元を秘匿するマーケットプレイスである。古書店は404 Mediaが提供したApple AirTagを1冊の本の中に入れてから注文を発送した。
追跡されたその本はカリフォルニアを航空便で出発し、Milwaukee Mitchell International Airport付近に現れ、その後Kenosha(ウィスコンシン州)郊外の流通倉庫で約2週間過ごしたと調査は示している。その後トラックで西へ移動し、Colorado州Grand Junction付近で一晩停泊し、Las VegasのLAS8と特定されたAmazonの倉庫に到着した。
LAS8にはいくつかの作業部門がある。トラッカーはMaibergをVGT3が使用する北側の区画へ導いた。VGT3は開いた本を持つTyrannosaurus rexで表現されているAmazonの部門である。従業員フォーラムでVGT3について議論しているAmazonの従業員は、大量の書籍の入荷を受け取り、製本をはがしてページをスキャンしていると述べていた。背表紙を切断すると、綴じられていないページが産業用スキャナーを高速で通過できるようになり、印刷された本は再利用不可能になる。
Amazonは、生成されたデータを使用する製品やモデルを特定せずに書籍を購入していることを認めた。「Amazon purchases books through commercial channels to help develop and improve the products and services our customers use」とあるAmazonの広報は404 Mediaに述べた。
この声明はスキャンされたテキストの行き先を明示していない。AmazonはAWSを通じてNovaファミリーのfoundation modelsを開発しており、Alexa for Shoppingを含め小売業務全体に生成AIを配置している。Amazonのgenerative AI development disclosureは、個別のデータセットや書籍取得経路を列挙することなく、ライセンスされたデータ、独自データ、公開データ、オープンソースデータといった広範なカテゴリで訓練ソースを説明している。
AI開発者が紙の本を求める理由
書籍には編集された構造化されたテキストが含まれており、それがオンラインに投稿されたことがない場合もある。古い版はまた、機械生成された記事や書籍が広く生産される以前に作られているため、開発者にとっては、人間が書いた資料を、ウェブ上の増加する合成テキストの量から切り離して利用できる供給源となる。
その区別は重要である。生成された素材を無差別に後続の学習に取り込むと、結果として得られるシステムの性能が劣化する可能性があるからだ。研究者たちは、再帰的に訓練されたモデルが元のデータ分布に関する情報を失う過程であるmodel collapseを記録している。
大量購入のパターンはLas Vegasへ追跡された出荷にとどまらない。2026年1月、書籍流通業者Ingramは出版社に対して、AI開発者が物理的な書籍やその他の媒体をますます購入している、おそらくそれらをスキャンしてモデル訓練に取り込むためであると伝えた。Ingramは、AI開発者への既知の販売を出版社がオプトアウトする手段を提供したが、買い手や意図された用途を常に特定できるわけではないと注意を促した。
物理的な書籍はまた、電子書籍とは異なる契約上の制約を伴う。電子書籍の購入者は通常、コピーや再配布を制限するライセンスを受け取る。購入された印刷本は一般に購入者が所有し、その物理的オブジェクトを処分することができるが、デジタル複製を作成・使用することは別個の著作権の問題を生じさせる。
裁判で試された取得方法
Amazonの作業は、Anthropicに対する著作権訴訟で開示された書籍のデジタル化プログラムとよく似ている。2025年6月23日の連邦裁判所の命令は、Anthropicが数百万ドルを費やして数百万冊の印刷書籍を購入したことを記録している。販売業者は製本をはがし、ページを切断し、検索可能なファイルにスキャンし、紙の原本を破棄していた。
米国地方裁判所判事William Alsupは、法的に購入された印刷書籍を社内のデジタル置換物に変換した行為は、裁判で示された事実関係の下ではフェアユースに該当すると判断した。命令は、各物理的コピーが1つの社内デジタルコピーで置き換えられ、そのファイルがAnthropicの外部に配布されていないことを強調していた。Alsupは、Anthropicが海賊版ライブラリからダウンロードした数百万冊については異なる結論に達した。
この判決はAnthropicの行為に特有のものであったが、AI開発者が無許可のデジタルコピーを入手するのではなく物理書籍を購入する明確なインセンティブを確立した。商業的な購入は出所を確立し、破壊的なスキャンは物理的・デジタルの両方の図書館コピーを流通させることなく検索可能なテキストを生み出す。
Amazonの倉庫はその市場にとって重要な新規参加者を追加する。404 Mediaが追跡した出荷は、従来の中古本の注文が売り手が買い手の身元や目的を知らないままプライベートなAIデータサプライチェーンに入る様子を示している。一度スキャンされると、そのテキストは将来のモデル開発プロジェクトにわたって有用なままであり、物理的な巻は古書店、図書館、収集家のもとへ戻ることはできない。
AmazonはVGT3を特定の名前付きモデルに結びつけたり、そこで処理された書籍の数を公表したりしていない。それでもこの作業は根底にある戦略を明らかにしている:Amazonは商業的な購買力と倉庫の労働力を、競合他社が単にオープンウェブからスクレイピングできない独自の訓練素材へと変換している。