粉碎以训练:揭秘将珍稀书籍转化为AI燃料的法律漏洞

专栏概述
这个故事的核心有一种奇怪的寂静。没有抗议,没有引人注目的头条新闻,也没有病毒式的愤怒循环——只有卡车、仓库和比任何人类阅读速度都快得多的切脊机器。在那份寂静中,一种商业模式正在形成:收购珍稀书籍,扫描其页面,然后销毁剩余部分。一位联邦法官已经认定这是合法的。这家收购公司并没有刻意隐藏,但也没有大肆宣传。而我们之所以知道这一切,是因为一位二手书商终于向记者透露了情况。
一种极其高效的抹除机制
这一过程几乎可以说是临床般的冷酷。高速扫描设备专为破坏书籍装订而设计——书脊被切断,书页像散纸一样送入,这比保持书籍完整逐页拍照要快得多。事后剩下的不再是书。它是散页,被粉碎或丢弃,因为重新组装从来不在计划之中。
一个名为ISBNdb的服务处于这一流程的中心,代理大宗订单——据报道一次多达一百万本书——同时保持买家身份匿名。这种匿名性在这里起到了关键作用。这意味着图书馆、珍书店或收藏家在出售大量18世纪农业文献时,根本不知道他们的库存是走向碎纸机而不是书架。这也意味着公众无法清晰地追踪有多少不可替代的卷册已经通过了这一流水线。
为何销毁是核心,而非副作用
这里有一个需要再读一遍才能完全吸收的部分:销毁并非法律论证的附带结果,它本身就是论证的核心。一位联邦法官裁定,这种做法属于合理使用,正是因为消除原件确保了在任何给定时间只有一份作品副本存在。换句话说,如果你确保副本和原件从不共存,你就不会因为有效复制受版权保护的书籍而被起诉。扫描它,粉碎它,在法律上,没有什么被复制——只是从纸张转换为了数据。
这是对版权法的一种巧妙解读,很容易理解为什么买家想要大约2022年之前出版的书籍。任何更早的作品都保证不含AI生成的文本,这对于试图在真实的人类写作基础上训练模型的人来说至关重要,否则可能会不小心喂给模型一堆从更近期的印刷品中抓取到的机器生成文本的循环。在这种框架下,2022年之前的书籍不仅仅是历史文物。它们是干净的数据。
建立在避免成为头条之上的商业
这与过去几年AI训练争议的不同之处在于——抓取网站、盗版影子图书馆、从流媒体平台提取音频——ISBNdb自身的营销似乎完全明白这看起来有多糟糕。404 Media的报道揭示了该公司网站上近乎逐字承认的内容:“AI公司销毁两百万本书”并不是一个能引发同情心的标题。然而,这项业务依然存在,它以保密协议(NDA)为标准配置,并使用一套偏好词汇,将“粉碎”美化为“数字保存”。
短语“数字保存”在欺骗性方面做得近乎令人印象深刻。保存通常意味着为未来保护某物。在这里,它的含义恰恰相反:物理对象被故意销毁,幸存下来的是一个纯粹作为训练材料的数字化副本,很可能再也不会有人以有意义的方式去阅读它。一位向404 Media透露情况的书商描述道,他们输入了一些在其他地方几乎没有幸存副本的卷册——这些书籍已经经历了战争、火灾、洪水以及数百年的普通忽视,却最终在一台为速度而非关怀而设计的扫描设备中终结。
抓取是可逆的。这不是。
我读过许多关于AI公司抓取开放网页或从盗版图书集合中提取内容的故事,其中总有一种隐含的安慰:“至少它还在某个地方存在。”一个网站可以重新上传。一本畅销书可以无限期重印。即使是一个道德上混乱的种子档案,也不会让原始文本从存在中消失——某处仍有人拥有副本。
珍稀书籍没有这样的安全网。如果某本植物调查或区域历史的特定版本世界上只剩下三本幸存副本,而其中一本被送入扫描仪并被粉碎,那么幸存副本的数量就永久变成了两本。没有重印,没有备份服务器,没有第二来源。这是我遇到的第一个AI训练争议,其中原材料本身成为了受害者,而不仅仅是围绕它的补偿模式。
这也给更广泛的行业关于大规模获取训练数据的对话带来了新的压力——据报道,包括Anthropic在内的多家公司聘请了来自主要数字化项目的高级人才,包括谷歌图书的前合作伙伴负责人,专门追求全面的书籍访问权限以用于训练目的。将“世界上所有的书”转化为可用数字形式的野心并不新鲜;谷歌自己花了近二十年扫描数百万卷书籍。新之处在于,这样做不会留下物理原件。
合法、高效,且值得深思
这一切都不需要一个反派。没有人违法。法院审视了这一做法,发现了一个合理但不安的基础来称其为合理使用。ISBNdb并没有隐藏它的存在。买家显然认为自己在解决一个真正的数据问题——干净的、前AI时代的文本是一种真实的稀缺资源,而很好地训练模型是一个真实的技术挑战。
但合法性和舒适度不是一回事,我们有必要诚实地讨论我们实际上在谈论哪一个。一项将不可逆的毁灭视为使复制变得可接受之条件的裁决,将在其存续期间塑造行为,而它所塑造的行为是对物理稀缺性的批量收购——一旦消失就无法替代的书籍。这与被抓取的网页或绝版平装书不同类别的损失,这是一种往往只有在事后才会被理解的事情,当特定的文本消失,有人去寻找不再存在的副本时。