为训练AI,亚马逊销毁稀有书籍?

为训练AI,亚马逊销毁稀有书籍?
亚马逊为训练大语言模型,竟将仓库中的稀有书籍进行破坏性扫描并销毁。随着网络数据被模型耗尽,罕见文本成为新的数据金矿。这一做法引发学界和藏书家谴责,认为亚马逊背叛了其卖书起家的初心,也反映出AI行业数据短缺的严峻现实,以及科技巨头为获取数据不惜牺牲文化遗产的争议。

据TechCrunch报道,亚马逊正在销毁一些极其珍贵的稀有书籍,而目的仅仅是为了获取训练人工智能模型的语料。这则新闻听起来颇有几分魔幻现实感——一家以卖书起家的公司,如今却亲手毁掉书籍,这恐怕是整个AI浪潮中最具讽刺意味的场景之一。

稀有书籍为何成为AI的新宠?

正如TechCrunch在报道摘要中指出的:“稀有书籍对于训练大语言模型来说价值极高,因为这些模型已经吸收了互联网上一切可用的公开文本。”确实,在短短几年间,ChatGPT、Claude、Gemini等大模型几乎把整个公开互联网“吞”了下去。从维基百科到Reddit论坛,从学术论文到广告文案,凡是能抓取的文本都被用于机器学习。如今,高质量的自然语言数据正变得日趋枯竭。

在这种背景下,未经数字化、只存在于实体世界的稀有书籍,成了AI行业眼中的“新油田”。这些书籍往往包含独特的叙事方式、历史语料、边缘知识和小众行业的术语,是网上找不到的宝贵样本。对于提升模型的语义理解、多语言能力乃至文化素养,它们拥有不可替代的作用。亚马逊显然看到了这一点,并试图利用自身庞大的图书库存作为独家的数据护城河。然而,令人震惊的是,他们选择了“销毁”这种极端方式。

报道中没有详细描述“销毁”的具体过程,但据推测,很可能包括快速扫描技术对书籍造成的物理损伤,甚至是在完成扫描后直接将原始文本废弃。这种做法的背后,是一种冰冷的实用主义逻辑:一旦内容被数字化,原始实体就失去了价值。可他们忘了,稀有书籍的价值远不止内容本身,它们的版本、装帧、批注都有各自的文明印记。

争议与批评:背叛与短视

消息一出,学术界、图书馆和珍本收藏家们深感愤怒。一位古籍研究者表示,这不仅仅是商业行为,更是对文化遗产的破坏。稀有书籍往往是孤本,一旦损坏,人类将要永久失去那份原本的“在场感”。更疯狂的是,亚马逊当年建立电商帝国,恰恰靠的是“地球上最大的书籍选择”这一招牌。今天,它们却为了训练AI模型而将这些“选择”化为纸浆。

这并非孤立事件。随着网络文本被吃干榨净,AI公司们正疯狂寻找新的数据源。OpenAI、谷歌等已相继卷入了关于版权内容的诉讼,如今亚马逊直接下手“实体火化”,可谓是把数据攫取推向了新的极端。业界评论指出,这是一种极其短视的行为:即便从工具理性角度看,破坏原始版本也会影响未来的二次挖掘。万一扫描件损坏或格式过时,原始书籍或许会成为最后的“备份”。

编者按:当文明的知识变成AI的训练燃料,我们是否正在用大火烧掉自己的图书馆?

编者按:AI的数据饥渴与文化遗产的冲突

AI的发展离不开数据,但数据并非凭空产生。人类几千年来积累的书籍、档案、手稿,都是文明的结晶。当科技公司为了一座“数据矿山”而炸掉整座金字塔,我们得到的也许是一个更聪明的模型,失去的却是一部分不可复原的记忆。

当然,我们也不应全盘否定数字化的意义。让古籍被扫描、被识别,从而让更多学者和公众能查阅,本身是功在千秋的好事。问题在于是以什么样的方式“采掘”这些资源。亚马逊完全可以采用无损扫描技术,并在完成后将原书妥善保存或赠予图书馆。然而,它选择了最粗暴、最具破坏性的路径,这暴露了AI大厂在数据竞争中的焦虑与傲慢。

这件事给整个行业敲响了警钟:AI的数据饥渴或许永远不会满足,但我们必须学会在技术的狂热与文化伦理之间,找到一个更为平衡的支点。否则,未来的模型或许能写出关于人类文明的论文,而我们却再也找不到它引用的那本书。

本文编译自TechCrunch