Anthropic、亚马逊雇佣外部公司订购书籍
旨在规避版权诉讼并获取纯净文本
为提高扫描效率还切除书脊

调查显示,亚马逊、Anthropic等全球大型科技企业在二手书市场大量收购珍稀书籍和绝版书,用于训练人工智能模型后,长期将原书粉碎处理。

为帮助理解报道而利用人工智能制作的图片。ChatGPT供图

为帮助理解报道而利用人工智能制作的图片。ChatGPT供图

View original image

据《福布斯》17日(当地时间)报道,美国科技媒体404 Media披露,大型科技企业在大批订购纸质书后,运营专用的大型设施拆解装订、高速扫描并废弃书籍。


此前,在作家针对人工智能开发商Anthropic提起的版权侵权诉讼过程中,一份名为“巴拿马项目”的内部规划文件被公开,令这一疑虑浮出水面。


根据公开文件,Anthropic购买了数百万册实体纸质书,随后通过外包商切除书脊,再将书页送入高速扫描设备进行数字化处理,并立即粉碎原件。据悉,被粉碎的对象不仅包括畅销书,还大量涵盖珍本、古籍和绝版图书等具有较高实体保存价值的书籍。

在书中放入AirTag追踪后发现……终点是亚马逊仓库

此前,二手书市场一直质疑称,“2022年以前出版的纸质书大宗采购订单激增”,怀疑人工智能企业正秘密主导大规模收购。


对此,美国科技媒体404 Media展开实地追踪采访,证实了上述疑虑。该媒体与一名收到约1000册纸质书订单的匿名珍本书卖家合作,在待寄送书籍中放入苹果AirTag定位设备后追踪其运输路线。


这批货物从加利福尼亚州出发,途经密尔沃基和科罗拉多斯普林斯,最终抵达一座由亚马逊拥有的专用物流仓库。该建筑入口处悬挂着一只霸王龙吞食摊开书本造型的标志;调查显示,内部员工全天都在进行纸质书扫描工作。

旨在规避法律风险并获取“纯净数据”

人工智能企业不惜投入大量成本和精力收购实体纸质书后再将其粉碎,主要有两大原因:规避法律责任,以及获取未受污染的高质量训练数据。


若企业擅自使用被称为“影子图书馆”的非法复制网络档案,将可能面临作家、出版社及媒体机构等提起的天价版权诉讼。相比之下,如合法购买实体纸质书,根据美国版权法中的“首次销售原则”,购买者可行使所有权,即便粉碎原件也可避免受到法律处罚。此外,企业认为,将购得的印刷书转换为用于内部模型训练的数字文件,也可能被认定为“转换性合理使用”。


从数据质量角度看,纸质书同样是不可替代的资源。目前互联网上传播的信息已受到人工智能生成的低质量文本污染,若再次利用这些内容进行训练,模型性能可能下降。相比之下,2022年以前出版的纸质书由人类直接撰写并经过精细编辑,因此被视为具备逻辑推理结构的顶级训练资料。

藏书爱好者强烈反弹……担忧珍稀文化遗产消失

“数百万册珍本,追踪后震惊”……人工智能企业令人不寒而栗的“巴拿马项目” View original image

目前尚无法准确掌握有多少书籍以这种方式被毁。不过,Anthropic的内部文件写道:“计划通过单一外包合同,对至少50万册、最多200万册书籍进行破坏性扫描。”据悉,每笔非公开的大宗订单涉及书籍数量从1000册至最多100万册不等。美国、英国及欧洲的二手书店表示,“以数百至数千册为单位购买非虚构类和绝版图书的匿名交易,已成常态。”


尤其是Anthropic内部文件中写有,“巴拿马项目旨在扫描全世界所有书籍”,“希望这项工作不为外界所知并秘密推进”,由此持续引发争议。



上述事实曝光后,人工智能怀疑论者和藏书爱好者将这种行为称为“恶魔化身”,并予以强烈谴责。《福布斯》指出:“企业连世上所剩无几的珍本和绝版图书也加以粉碎,书籍承载的历史价值也随之消失,这才是问题所在。”


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。

不容错过的热点