研究团队利用Claude攻破OpenAI员工账户与内部数据

研究团队利用Claude攻破OpenAI员工账户与内部数据
最新披露的安全事件显示,研究人员借助Anthropic旗下的Claude模型,成功入侵了一名OpenAI员工的账户,并获取了敏感的GitHub数据。这起事件不仅暴露了AI企业自身的安全漏洞,也引发了关于先进模型被滥用于网络攻击的深层担忧。当AI既能防御也能攻击,行业的安全边界正面临前所未有的挑战。

据Ars Technica报道,一起令人震惊的网络安全事件在AI行业内部引发轩然大波。研究人员利用Anthropic公司开发的大语言模型Claude,成功突破了一名OpenAI员工的账户防线,并进一步获取了存储在GitHub上的敏感数据。这一事件首次公开证实,顶尖AI模型本身可能成为攻破另一家AI公司防御体系的利器。

事件始末:从账户入侵到数据泄露

根据披露的信息,攻击路径并非依赖传统的漏洞利用工具,而是通过Claude模型辅助完成。研究团队利用Claude生成针对性的钓鱼内容、分析目标员工的行为模式,并自动化执行了一系列社会工程学攻击步骤。最终,他们成功获取了该员工的登录凭证,进入其OpenAI内部账户,并访问了关联的GitHub代码仓库中的敏感信息。

值得注意的是,这并非Claude第一次被用于安全测试。Anthropic一直强调其模型在安全对齐方面的投入,但此次事件表明,即使经过严格安全训练的模型,在特定引导下仍可能被武器化。OpenAI方面尚未就具体损失细节发表完整声明,但内部已启动紧急安全审查。

“当AI模型能够自主生成攻击策略并迭代优化时,传统的网络安全边界正在失效。”——一位不愿透露姓名的AI安全研究员评论道。

行业背景:AI安全攻防战升级

这起事件发生在AI行业竞争白热化的背景下。OpenAI、Anthropic、Google DeepMind等公司都在竞相开发更强大的模型,但安全防护往往滞后于能力提升。过去一年中,已有多起研究展示了大模型被用于自动化网络攻击的潜力,包括生成恶意代码、绕过验证码、甚至模拟人类对话骗取信任。

更令人担忧的是,AI公司之间的“互攻”测试可能成为新常态。一方面,这有助于发现自身漏洞;另一方面,一旦被恶意行为者利用,后果将不堪设想。此次Claude攻破OpenAI的事件,恰好揭示了AI生态系统中相互依存的脆弱性——模型能力的提升是双向的,既能加固防御,也能制造更精密的攻击。

技术分析:Claude如何成为攻击工具

从技术角度看,Claude在此次攻击中扮演了多重角色。首先是信息收集:模型可以快速分析公开渠道中目标员工的社交轨迹、技术偏好和常用密码模式。其次是内容生成:Claude能够撰写高度逼真的钓鱼邮件,模仿内部通知或同事口吻,降低目标警惕性。最后是自动化执行:通过API调用,攻击流程可以规模化复制,而无需人工逐条操作。

这并非Claude独有的问题。GPT-4、Gemini等模型同样具备类似能力,关键在于使用者的意图和模型的拒绝机制是否足够 robust。Anthropic此前发布的Claude系统卡中曾提到,模型在受到越狱提示时可能输出有害内容,但公司持续通过红队测试进行加固。此次事件无疑给所有AI厂商敲响了警钟。

编者按:AI安全需要“ reciprocal transparency”

这起事件最值得深思之处,不在于哪家公司被攻破,而在于AI行业的安全范式正在发生根本性转变。过去,安全是“砌墙”——防火墙、加密、访问控制。现在,安全是“对话”——模型可以与你交流,也可以欺骗你。当攻击者利用AI来攻击AI,防御方必须同样利用AI来识别和阻断异常行为。

我们呼吁AI公司之间建立更透明的漏洞披露机制,而非将安全事件视为竞争劣势。同时,监管机构应尽快出台针对AI模型滥用的明确指引,要求厂商在发布强大模型时附带可验证的安全护栏。否则,下一次被攻破的,可能就不只是GitHub数据了。

本文编译自Ars Technica。