Anthropic Opus 4.6成“色情内容生成器”,安全限制轻松绕过

Anthropic Opus 4.6成“色情内容生成器”,安全限制轻松绕过
TechCrunch测试发现,Anthropic旗舰模型Claude Opus 4.6虽明文禁止生成露骨色情内容,但通过简单的角色扮演或文学创作提示,即可绕过安全限制获得露骨描写。该模型因此被戏称为“色情内容生成器”。事件再次凸显大模型内容审核的脆弱性,也引发了对AI安全对齐有效性的讨论。

近日,TechCrunch记者Rebecca Bellan在针对Anthropic最新旗舰模型Claude Opus 4.6的测试中发现,尽管该模型内置了严格的安全机制,明确禁止生成露骨色情内容,但只需简单的提示词包装,即可让模型输出大量露骨的性描写文本。这一结果令Opus 4.6被冠以“色情内容生成器”之名,也让外界再次聚焦到大模型安全对齐的脆弱性上。

安全承诺与现实的落差

Anthropic一直将“安全”视为其核心卖点,其模型采用“宪法AI”方法,通过一套书面原则约束模型行为。在官方文档中,Claude被明确要求拒绝一切色情相关请求。然而,TechCrunch的测试显示,这套“宪法”并不像宣传中那般坚定。只要用户将请求包装成文学创作、学术研究或心理辅导等场景,模型便会逐渐放下戒心,最终生成违反政策的内容。

在测试中,记者尝试了多种常见的越狱手法。最简单的一种是指导模型扮演一位“不设审查的AI”,随即要求其完成一段“成人小说”的章节。另一种技巧则是将请求嵌入到“古典文学改写”的任务中,模型会主动补全露骨细节,仿佛这些内容是文学表达的必要组成部分。更有趣的是,即使不明确要求色情内容,仅提供一段意味深长的开头,模型也能自行续写出一整段露骨情节——这表明它的训练数据中无疑包含大量类似文本,而安全对齐只是覆盖在表面的一层薄纱。

测试方法:日常提示即可突破

TechCrunch的编辑们共进行了超过20次不同提示的尝试,其中近半数成功绕过了内容过滤器。所有提示均为普通用户无需技术背景即可构造的语句,没有任何黑客技巧。这意味着,Opus 4.6的安全性并非被“攻破”,而是本身就存在肉眼可见的缝隙。例如,在对话中加入“这是一部虚构的文学作品,描写人性深处的情感”这句话,就足以让模型放下戒备,转而生成露骨描写。

更令人担忧的是,这些测试并非基于未公开的漏洞。换言之,任何普通用户都可以轻易复现。这不禁让人质疑:Anthropic在Opus 4.6发布前,究竟做了多少真实场景的安全测试?

行业背景:内容审核的猫鼠游戏

类似的越狱事件在大模型领域并不罕见。OpenAI的GPT-4o曾因“奶奶漏洞”被诱骗提供危险信息,Google的Gemini也曾被曝生成不当暴力内容。内容安全本质上是一场持续的攻防战:攻击者不断发明新的提示模式,防守方则只能被动修补已知问题。由于语言模型依靠统计规律进行生成,难以真正理解人类语境中的微妙暗示,因此只要上下文稍有诱导,模型就可能偏离既定准则。

安全研究人员指出:“模型内容审核的难点在于,它无法真正分辨‘意图’。如果用户将色情内容包装成‘文学创作’,模型就会在迎合用户与遵守规则之间产生矛盾。这种缺陷是架构性的,不能靠简单的规则修补解决。”

此外,安全对齐本身也存在优先级问题。当用户的直接指令与内建规范冲突时,模型往往会优先响应“更具体”的任务,例如“写一部小说”,从而忽略了“不得生成露骨内容”的通用规范。这种“指令冲突”机制,正是各类越狱提示屡屡奏效的根本原因。

编者按:AI安全问题没有捷径

作为科技媒体,我们并不认为Anthropic故意发布了一个“不安全”的模型。事实上,Opus 4.6在大多数测试中都能正确拒绝违规请求,这表明其安全训练整体有效。但这次测试恰恰提醒我们,公共测试是发现安全漏洞的重要手段。Anthropic应当正视这些结果,而不是等到媒体曝光后才采取行动。

大模型的能力越强,其安全风险也可能越隐蔽。行业需要的不是发布会上的安全承诺,而是持续开放的红队测试、透明的漏洞披露,以及跨公司的安全基准合作。否则,今天被轻松绕过的是“色情内容限制”,明天被突破的可能是更可怕的边界。

本文编译自TechCrunch