ホーム / ニュース / 裁断して学習へ:希少本がAIの燃料になる法的抜け穴の内幕
AI学習データ

裁断して学習へ:希少本がAIの燃料になる法的抜け穴の内幕

2026年7月29日6 分で読了
裁断して学習へ:希少本がAIの燃料になる法的抜け穴の内幕

カラム概要

この物語の中心には、奇妙な静けさがある。抗議活動もなく、記憶に残る見出しもなく、バイラルな怒りのサイクルもない――あるのはトラック、倉庫、そして人間が読める速度よりも速く本の背を切断する機械だけだ。その静寂の中で、希少本を購入し、ページをスキャンし、残りを破壊するというビジネスモデルが形成されている。連邦判事はすでにこれが合法であると述べている。購入を行っている企業は、厳密に言えば隠れてはいないが、宣伝もしていない。そして、私たちがこれについて知ることになった理由は、古書店の一店舗がついに記者に対して何かを語ったからに他ならない。

非常に効率的な消去の仕組み

プロセス自体はほぼ臨床的である。高速スキャン装置は、本の装丁を破壊して処理するように設計されている――背を切り離すことで、ページがバラ紙のように流れるように通過するため、本をそのままにしてページごとに撮影するよりも劇的に速い。その後に残るのはもはや本ではない。束ねて元に戻す計画は最初からなかったため、残されたものはバラの葉っぱであり、パルプ化されたり廃棄されたりしている。

ISBNdbというサービスがこの中間に位置し、大口注文の仲介を行っている――報告によると一度に最大100万冊――買い手の身元を匿名のままに保っている。この匿名性がここで大きな役割を果たしている。それは、18世紀の農業書などの在庫を一括で売却しようとする図書館や希少本専門店、コレクターが、自分の在庫が棚ではなくシュレッダーに向かっていることに気づかないことを意味する。また、公衆にとって、すでにパイプラインを通り過ぎた取り返しのつかない巻物がどれほどあるかを追跡するための明確な方法もない。

破壊が目的であり、副作用ではない

ここが、二度読みしてようやく完全に理解するのに時間がかかった部分だが、破壊は法的議論に付随するものではなく、それ自体が議論の核心なのだ。連邦判事は、原本を排除することで作品のコピーが常に一つしか存在しないことを保証するため、この行為がフェアユースに該当すると判断した。つまり、コピーと原本が共存しないようにすれば、著作権で保護された本を実質的に複製しても訴えられることはないのだ。スキャンして粉砕し、法的には何もコピーされていない――単に紙からデータへ変換されただけなのである。

これは著作権法に対する巧妙な解釈であり、なぜ買い手が約2022年以前に出版された本を望むのかを理解するのは容易だ。それより古いものは、AI生成テキストが含まれていないことが保証されており、機械生成のプロザを最近の印刷部数からスクレイピングして誤ってモデルに食べ込ませるのではなく、本物の人間の執筆に基づいてモデルを訓練しようとする場合、それは極めて重要である。この枠組みにおいて、2022年以前の本は単なる歴史的遺物ではない。それらはクリーンなデータなのである。

見出しにならないように構築されたビジネス

ウェブサイトからのスクレイピング、シャドウライブラリからのトーレンティング、ストリーミングプラットフォームからの音声抽出など、過去数年間のAIトレーニング論争とは異なり、ISBNdb自身のマーケティングは、これがどのように見えるかがどれほど悪いかを正確に理解しているようだ。404 Mediaによる報道では、同社のサイト上の言語が、「AI企業が200万冊の本を破壊」という見出しが同情を生み出さないことをほぼそのまま認めていることが浮き彫りにされた。それでもなお、ビジネスは存続しており、NDA(秘密保持契約)を標準機能とし、「シュレッディング」を「デジタル保存」へと置き換える好ましい語彙を中心に構築されている。

「デジタル保存」という言葉は、その不誠実さにおいてほとんど驚くべき働きをしている。保存とは通常、未来のために何らかのものを守り続けることを意味する。ここではその逆を意味している:物理的な物体は意図的に破壊され、生き残るのは純粋にトレーニング素材として存在するデジタルコピーであり、意味のある形で人間によって再び読まれることはおそらくないだろう。404 Mediaに話したある古書店員は、他の場所で生存個体がほとんどない巻物を送り込む様子を、戦争、火災、洪水、そして数百年の通常の放置を経てきたものが、スピードのために作られたスキャン装置によって運命づけられるまで描写した。

スクレイピングは元に戻せる。これは戻せない。

AI企業がオープンウェブページをスクレイピングしたり、海賊版の書籍コレクションから引き出したりする話はたくさん読んでおり、そこには常に「少なくともどこかにまだ残っているはずだ」という安心感があった。ウェブサイトは再アップロードできる。ベストセラーは何度でも再印刷できる。倫理的には複雑であっても、トーレントされたアーカイブでさえ、元のテキストが存在から消滅させるわけではない――どこかの誰かが、まだコピーを持っている。

希少本にはそのような安全網がない。植物調査や地域史の特定の版が世界に3部しか残っておらず、そのうちの1部がスキャナーに送られて粉砕された場合、生存個体の数は永久に2つになる。再印刷はなく、バックアップサーバーもなく、第二のソースもない。これは、補償モデルだけでなく、原材料自体が犠牲となる最初のAIトレーニング論争に出会ったものである。

また、これは大規模なトレーニングデータの取得に関する広範な業界対話にも新たな圧力をかけている。Anthropicを含む企業は、トレーニング目的での包括的な書籍アクセスを追求するために、Google Booksの元パートナーシップ責任者など、主要なデジタル化取り組みからシニア人材を採用したと報告されている。「世界中のすべての本」を実用的なデジタル形式に変えるという野心は新しいものではない。Google自身、数百万の巻物をスキャンするためにほぼ20年間を費やした。新しいのは、物理的な原本を残さないで行うことである。

合法であり、効率的であり、考える価値がある

これらすべてに悪役は必要ない。誰も法律を破っていない。裁判所はこの実践を検討し、不快ではあるものの公平な使用と呼ぶための合理的な根拠を見出した。ISBNdbは自分が存在することを隠していない。買い手はおそらく、 genuineなデータ問題(クリーンでAI以前のテキストは真の希少性であり、モデルを適切に訓練することは真の技術的課題である)を解決していると見なしている。

しかし、合法性と快適さは同じものではなく、私たちが実際に議論しているのがどちらなのかについて正直である価値がある。不可逆的な破壊をコピーが許容される条件として扱う判決は、それが存続する限り行動を形作るであろう。そして、その行動が形作られているのは、物理的な希少性の大量購入――一度失われると交換できない本――である。これはスクレイピングされたウェブページや絶版ペーパーバックとは異なる種類の損失であり、特定のテキストが消え、存在しないコピーを探しに行くようになったときにのみ理解される傾向があるようなものだ。

AI学習データ本の保存