2026年7月29日曝光的推文显示,Anthropic通过第三方供应商从书店和批发商处购入数百万本实体书,覆盖小说、学术著作和专业教材等类别,经光学字符识别技术扫描提取文本后,对所有实体书籍进行统一销毁,仅保留标准化处理后的训练文本片段。
该流程形成采购、数字化提取、载体数据销毁的完整链路。内部文件指出,公开网络文本数据质量参差且版权风险较高,而书籍内容权威性与结构化程度更高,能提升模型推理能力和知识准确性。项目至少从2022年启动,持续到2023年底,主要在美国境内开展,扫描工作由合作技术服务商负责。
运作机制与商业逻辑
Anthropic成立于2021年,由前OpenAI员工创办,2023年估值约150亿美元,核心产品为Claude系列大模型。选择实体书数据销毁方式,试图弱化复制行为的版权属性,以规避直接获取授权的高昂成本与复杂流程。相比之下,OpenAI在2023年与企鹅兰登书屋、哈珀柯林斯等出版社达成版权合作,从源头获得合法授权;Google DeepMind在2024年3月发布训练数据透明度白皮书,详细列出数据来源及授权情况。
ISBNdb等公司提供批量书籍服务,声称拥有世界最大图书数据库,包含1.11亿条记录,并提供稀有专业卷册目录。书商反馈显示,单周销量从约20本跃升至数百本,主要是难以找到的绝版书。
产业影响分析
对竞争格局而言,此事件凸显数据获取方式的差异。Anthropic的做法引发X平台反弹,Michael Burry称其为“邪恶的化身”,Elon Musk要求SpaceX AI团队以非破坏方式扫描书籍,David Sacks指出其在训练免费与IP保护上的双重标准。OpenAI与Meta的合规路径则形成对比,Meta在2024年6月推出开放数据联盟,联合出版社和学术机构搭建合法训练数据共享平台。
对上下游影响,欧洲和美国书商接收到来自新加坡等地的3000册英文稀有书订单,部分古董书商担忧uncommon书籍被纸浆化。欧盟AI法案于2024年5月生效,要求开发者披露训练数据来源及版权状态,违规者最高面临全球营业额4%的罚款。麦肯锡2024年AI数据伦理报告显示,68%的AI企业存在数据来源不透明问题,32%涉及潜在版权风险。
对开发者和企业用户,合规路径虽成本较高,但可降低诉讼风险。Anthropic已同意支付15亿美元和解涉及数十万盗版书籍的集体诉讼,这是美国历史上最大版权和解案。法官认定转换性使用受合理使用保护,但此案未解决所有争议。
战略判断
基于现有事实,接下来最可能出现更多针对类似数据销毁实践的诉讼。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接