谷歌败诉仍不放弃用DMCA阻击AI爬虫,专家称其怪异

谷歌败诉仍不放弃用DMCA阻击AI爬虫,专家称其怪异
尽管在法庭上败诉,谷歌与Reddit仍坚持使用《数字千年版权法案》(DMCA)来对抗AI网络爬虫,专家认为这种做法极不寻常。原本用于保护版权的DMCA,如今被用来阻止AI公司抓取公开数据用于训练,引发了关于数据开放与版权保护边界的新一轮争议。本文编译自Ars Technica,深度解析这场怪异战争的背后逻辑与潜在影响。

一场奇怪的DMCA战争

2026年7月,美国联邦法院驳回了谷歌和Reddit联合提起的一项诉讼,该诉讼试图依据《数字千年版权法案》(DMCA)阻止一家AI公司大规模抓取其网站公开内容用于模型训练。法院认为,DMCA的立法初衷并非用于限制搜索引擎或AI爬虫对公开可访问数据的合理抓取,因此驳回了禁令请求。然而,谷歌和Reddit并未就此收手,反而表示将继续上诉,并寻求其他法律途径。

法庭败诉后的坚持

据Ars Technica报道,谷歌在判决后发布的声明中强调:“我们仍然认为,未经授权的大规模抓取和商业化使用公共数据,损害了内容创作者和平台运营者的权益。我们有责任保护用户生成内容免受剥削。”Reddit方面则更为直接,称AI公司“搭便车”行为不可接受,并准备以数据滥用为由发起新一轮诉讼。这种坚持让许多法律专家感到困惑——因为DMCA原本设计用于打击盗版和侵犯版权的行为,比如未经授权复制音乐或电影。而公共网站上帖子、评论等内容,往往已经授权给平台方,但其版权归属并不明确。

“用DMCA来对抗AI爬虫,就像用锤子去拧螺丝——虽然能凑合,但根本不是正确工具。” ——斯坦福大学互联网法律研究员

专家分析:为何这种策略被视为怪异?

知识产权律师指出,DMCA的第512条要求服务商在收到侵权通知后“通知-删除”内容,但并未禁止机器人访问网站本身。试图通过DMCA来禁止爬虫,相当于要求互联网服务商监控所有访问意图,这超出了法律框架。更关键的是,AI公司抓取的数据通常不构成对原作品的“复制”或“传播”,而是在训练过程中转化为抽象参数,两者性质不同。资深科技评论员John Gruber表示:“谷歌自己就是靠爬虫起家的,如今却想用版权法封住后来者的路,这种双重标准实在讽刺。”

行业影响:AI数据封锁与开放之争白热化

谷歌和Reddit的强硬态度反映了互联网行业日益尖锐的矛盾:一边是AI公司对海量公开数据的饥渴需求,另一边是平台方担心自身价值被架空。据透露,谷歌内部已组建专门团队,研究如何用技术手段(如robots.txt扩展、动态IP封禁)配合法律手段拦截AI爬虫。而Reddit则计划对API调用全面收费,并限制非授权抓取。与此同时,一批AI创业公司联合向国会请愿,要求明确数据抓取的合法性边界,避免被平台单方面“掐断粮道”。这场战争最终可能催生新的数字版权规则。

编者按: 谷歌和Reddit的“怪战”背后,是旧时代法律工具与新时代数据经济的碰撞。DMCA诞生于1998年,那时谁也没预料到AI会成为数据消耗大户。用20世纪的法律规范21世纪的行业,难免别扭。或许,比起纠缠于诉讼,更值得做的是推动立法更新,为AI训练数据的合理使用划定明确界限——否则,这场战争只会越来越奇怪。

本文编译自Ars Technica