近日,Reddit在其与Perplexity AI的法律纠纷中再度加码,将一场围绕DMCA(数字千年版权法)的战争推向新高度。据Ars Technica报道,Reddit已继续推进诉讼,指控Perplexity AI与网络爬虫提供商共谋,故意绕过技术保护措施,获取Reddit用户生成内容,用于训练和运行AI模型。这场诉讼的独特之处在于,Reddit不仅追究未经授权的抓取行为,还试图借助DMCA通知机制,要求Google移除与Perplexity服务相关的搜索结果。
数据开放与版权红线的碰撞
Reddit长期以来被视为互联网上最具价值的数据源之一。其海量、实时、多主题的讨论内容,对于训练大语言模型具有不可替代的吸引力。然而,Reddit在签署授权协议的同时,也对未授权抓取保持高度警惕。2024年,Reddit曾更新robots.txt,并公开声明将阻止未经授权的爬虫。但Perplexity AI似乎找到了绕过的方法。Reddit在诉讼中声称,Perplexity与某爬虫服务商达成默契,后者使用大量住宅IP地址和浏览器指纹模拟技术,让Reddit难以识别并拦截抓取流量。
更重要的是,Reddit指控这种合谋并非简单的技术规避,而是有组织的商业行为。Perplexity希望通过获取Reddit内容来增强其AI回答的实时性和上下文能力,从而在竞争激烈的AI搜索市场中占据优势。而Reddit则坚持认为,在未获授权的前提下,任何使用其内容的行为都构成版权侵权。
DMCA与Google搜索结果之争
本案中最引人注目的环节,是Reddit利用DMCA通知来管控搜索引擎的结果。DMCA通常被视为版权人要求在线平台删除侵权内容的工具,但Reddit将其用在了搜索引擎索引层面:向Google发送删除通知,要求不再索引Perplexity生成的相关页面。Reddit认为,这些页面本质上是基于Reddit版权内容生成的衍生品。
然而,这一做法引发了激烈争议。Perplexity方面反驳称,Reddit的投诉属于滥用DMCA流程,试图以版权之名打压竞争产品。Perplexity还声称,其抓取行为符合公开网络惯例,且已经采取了合理的“不跟随”指示。然而,Reddit在诉讼中指出,Perplexity故意规避robots.txt中声明禁止的路径,甚至通过代理服务隐藏了真实抓取来源,这已经超出了合理使用的范畴。
法律战背后的行业趋势
这场诉讼并不是孤立的。过去一年间,多家内容平台与AI公司之间已经爆发了多起诉讼。从《纽约时报》对OpenAI的起诉,到新闻集团与各AI企业的授权谈判,内容所有者正以前所未有的力度捍卫自己的数据权利。Reddit与Perplexity的案例,则首次将DMCA流程与搜索引擎排名绑定在一起,使原本适用于传统版权的规则被投入到全新的AI语境中。
有法律专家指出,如果Reddit的诉讼主张获得法院支持,将可能为内容平台提供一种全新的威慑手段:不再仅仅通过Robots协议来声明底线,而是通过搜索结果层面的法律制裁来限制AI公司的数据使用行为。这将对搜索引擎算法和AI服务形态产生深远影响。
编者按:版权与AI的灰色地带
Reddit与Perplexity的纠纷,折射出当前AI发展进程中的一个核心矛盾:数据如何被公平合规地使用。从技术层面看,公共互联网上的信息是否可以被爬虫获取,以及robots.txt是否具有法律约束力,这些问题至今没有明确的法律判例。DMCA规则本身是针对传统数字内容设计的,用于处理音乐、视频和软件盗版,其与AI模型训练和内容生成的关系仍在探索之中。
更值得深思的是,搜索引擎已成为AI服务的重要入口。Reddit选择从Google搜索结果这一侧发起反击,实际上是对AI公司内容获取模式的釜底抽薪。无论最终判决如何,双方的攻防策略都将成为未来内容授权与AI训练边界的重要参考。
目前,Google尚未公开回应Reddit的删除通知要求,Perplexity也未发表进一步声明。可以预见的是,这场诉讼的每一个转折,都会在科技圈和法务界引发持续关注。而对普通网民来说,最直接的影响或许是:未来你在Reddit上的一次普通发帖,是否以及如何被AI引用,将变得更加清晰明确。
本文编译自Ars Technica
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接