Anthropic销毁珍稀书籍训练Claude模型 文化破坏争议持续发酵

2026年7月29日多条推文曝光Anthropic通过第三方渠道批量购入珍稀古籍,切脊粉碎后扫描提取文本用于Claude模型训练,引发文化破坏与技术进步的对立辩论。法庭文件显示该项目自2022年起持续至2023年底,涉及数百万册实体书。竞争对手OpenAI已与出版社达成版权合作,Meta推出开放数据联盟。事件已获多家媒体报道,事实基础可靠。

2026年7月29日曝光的推文显示,Anthropic通过第三方供应商从书店和批发商处购入数百万本实体书,覆盖小说、学术著作和专业教材等类别,经光学字符识别技术扫描提取文本后,对所有实体书籍进行统一销毁,仅保留标准化处理后的训练文本片段。

该流程形成采购、数字化提取、载体数据销毁的完整链路。内部文件指出,公开网络文本数据质量参差且版权风险较高,而书籍内容权威性与结构化程度更高,能提升模型推理能力和知识准确性。项目至少从2022年启动,持续到2023年底,主要在美国境内开展,扫描工作由合作技术服务商负责。

运作机制与商业逻辑

Anthropic成立于2021年,由前OpenAI员工创办,2023年估值约150亿美元,核心产品为Claude系列大模型。选择实体书数据销毁方式,试图弱化复制行为的版权属性,以规避直接获取授权的高昂成本与复杂流程。相比之下,OpenAI在2023年与企鹅兰登书屋、哈珀柯林斯等出版社达成版权合作,从源头获得合法授权;Google DeepMind在2024年3月发布训练数据透明度白皮书,详细列出数据来源及授权情况。

ISBNdb等公司提供批量书籍服务,声称拥有世界最大图书数据库,包含1.11亿条记录,并提供稀有专业卷册目录。书商反馈显示,单周销量从约20本跃升至数百本,主要是难以找到的绝版书。

产业影响分析

对竞争格局而言,此事件凸显数据获取方式的差异。Anthropic的做法引发X平台反弹,Michael Burry称其为“邪恶的化身”,Elon Musk要求SpaceX AI团队以非破坏方式扫描书籍,David Sacks指出其在训练免费与IP保护上的双重标准。OpenAI与Meta的合规路径则形成对比,Meta在2024年6月推出开放数据联盟,联合出版社和学术机构搭建合法训练数据共享平台。

对上下游影响,欧洲和美国书商接收到来自新加坡等地的3000册英文稀有书订单,部分古董书商担忧uncommon书籍被纸浆化。欧盟AI法案于2024年5月生效,要求开发者披露训练数据来源及版权状态,违规者最高面临全球营业额4%的罚款。麦肯锡2024年AI数据伦理报告显示,68%的AI企业存在数据来源不透明问题,32%涉及潜在版权风险。

对开发者和企业用户,合规路径虽成本较高,但可降低诉讼风险。Anthropic已同意支付15亿美元和解涉及数十万盗版书籍的集体诉讼,这是美国历史上最大版权和解案。法官认定转换性使用受合理使用保护,但此案未解决所有争议。

战略判断

基于现有事实,接下来最可能出现更多针对类似数据销毁实践的诉讼。