AirTag追踪揭示:亚马逊销毁稀有书籍训练AI

AirTag追踪揭示:亚马逊销毁稀有书籍训练AI
一则调查披露,亚马逊内部团队为训练AI,系统性地将稀有书籍扫描后销毁。调查者在书箱中放置AirTag,意外追踪到了这一行为。亚马逊相关团队甚至以“霸王龙吞噬书籍”作为标志。此举引发关于版权、文化保护与AI数据伦理的激烈争论。

据Ars Technica报道,一名独立调查人员通过苹果AirTag追踪设备,意外发现亚马逊内部存在一个隐秘计划:为了训练人工智能模型,亚马逊的一个团队正在系统性地销毁大量稀有和珍贵的书籍。这一发现迅速引发科技界与文化界的热议。

一次意外追踪

调查人员最初只是在一批旧书箱中放置了一枚AirTag,想追踪旧物流链的流向。然而,信号最终指向了亚马逊位于俄勒冈州的一座仓储设施。透过废弃包装和工作人员透露的信息,一个名为“Corpus Cleanup”的项目浮出水面。该项目专门负责将图书馆淘汰的实体书进行扫描和数字化,但在完成数据提取后,这些纸质书往往会被当作废品处理,而其中不乏稀有的初版书、限量印刷品甚至带有作者手写批注的珍藏本。

消息人士称,销毁流程非常高效:先由机械臂扫描每一页,然后将书本送至粉碎机。整个过程只需数分钟,但处理的书籍往往需要数十年才能被重新发现。

为什么是稀有书籍?

在AI行业,训练大语言模型需要海量的文本数据。相比网络抓取,从实体书中获得的内容更干净、更系统,也避开了许多网站的反爬虫限制。稀有书籍通常具有独特的语言风格和历史信息,对提升模型的语义理解有特殊价值。然而,将这些书籍彻底销毁,意味着人类永远失去了物理载体。这些书无法再被借阅、研究和传承。

谷歌和互联网档案馆多年前就开始大规模扫描图书,但通常会保留原始纸质版。亚马逊选择直接销毁,一方面可能是为了降低成本,另一方面也与其数字优先的战略有关。一位不愿透露姓名的前亚马逊工程师告诉Ars Technica:“团队领导认为,模型训练完成后,原始书籍只是多余的库存。”

版权与伦理的灰色地带

这一做法在法律层面也极具争议。许多稀有书籍仍受版权保护,亚马逊未经授权扫描并用于商业AI训练,可能构成侵权。更重要的是,销毁实体书籍等同销毁公共文化财富。图书馆和藏书家表示,亚马逊的行为“比盗版更恶劣”。

“你可以训练一个模型,但你不应该烧掉’母本’。”一位图书史学者评论道。

近年来,AI公司因版权纠纷频繁被告,从《纽约时报》诉OpenAI到作家群体集体诉讼,科技公司对创作者版权的漠视已成为公愤。亚马逊作为科技巨头,此举无疑将加剧这种矛盾。

霸王龙标志的隐喻

最令人震惊的是,亚马逊这个团队竟然将自己的logo设计为一只张开血盆大口的霸王龙,正准备一口吞下一本书。这个商标似乎是某种内部幽默,但在外界的眼中,它成了傲慢与破坏的象征。一位设计师讽刺道:“他们知道自己正在吃掉书籍,只是觉得这很有趣。”

编者按

AI的发展需要数据,但数据的获取不能以牺牲人类文化遗产为代价。实体书不仅是信息的载体,更是文明记忆的实体。即便数字扫描可以保存文本内容,物理书籍本身的历史气息、装帧艺术与读者的情感联结,都是无法被复制的。亚马逊作为一个以“地球上最大的书店”起家的公司,理应成为知识的守护者,而不是毁灭者。我们呼吁AI企业建立更负责任的训练数据政策,在技术进步与人文遗产之间找到平衡。

本文编译自Ars Technica