三人两个AI订阅,72小时摸进OpenAI内部代码库——这次黑客测试暴露的不只是软件漏洞

2026年7月,安全初创公司Hacktron AI的三名研究人员借助Anthropic Claude Opus 5,用不到72小时和3000美元AI算力成本,通过漏洞链拿到OpenAI内部Monorepo代码库读写权限,最终获得6500美元漏洞赏金。这次事件的核心不是一次普通的安全测试,而是AI正在系统性拆除"复杂性即安全"这道长期保护企业基础设施的隐形屏障。

2026年9月17日,一份来自安全初创公司Hacktron AI的研究报告公开披露,三名研究人员在当年7月底通过漏洞链成功入侵OpenAI内部系统,获取了员工ChatGPT账户权限,并进一步读取私有代码仓库Monorepo中的文件,还提交了一次证明访问权限的拉取请求。整个操作耗时不足72小时,消耗AI算力成本不到3000美元。OpenAI已于发现当日完成修复,并向该团队支付6500美元漏洞赏金。

漏洞链:从一张图片到内部代码库

整条攻击路径从一个看似无关紧要的图像解码库开始。Hacktron的研究人员发现,OpenAI社区论坛使用的Discourse平台在处理HEIF/HEIC格式图片时,会调用ImageMagick,而后者依赖存在堆缓冲区溢出漏洞的libheif库(CVSS评分8.8)。通过上传构造特殊的HEIF图像文件,研究人员在论坛服务器上实现了远程代码执行。

这本是一个相对独立的漏洞,但第二个问题让它变成了通往更深处的隧道:OpenAI的单点登录系统配置存在缺陷,社区论坛的用户身份验证令牌在未经充分隔离的情况下,可以在多个OpenAI服务中复用。研究人员由此从公开社区论坛服务器出发,穿透身份认证边界,登录到OpenAI员工的ChatGPT和Codex账户,最终通过Codex账户连接至OpenAI在GitHub上的私有代码仓库。

据《华尔街日报》报道,这个名为"Monorepo"的代码库包含与公司算法和软件系统相关的重要内部代码,可以帮助模型运行得更快、更高效,但据信不含模型权重。研究团队在确认访问权限后,提交了拉取请求PR#1186742,加入了团队标识和研究人员社交媒体账号链接,作为已获读写权限的证明,但并未深入检查敏感源代码,也未发起下载。Hacktron首席技术官莫汉·佩达帕蒂的原话颇为直白:"我们能够理论上访问的范围是巨大的。"

Claude Opus 5的角色:失败的4.8与成功的5

这次事件中最值得解剖的部分,是Anthropic新旧两代模型的能力对比。研究人员最初尝试使用Claude Opus 4.8开发漏洞利用代码,经过多次会话均告失败。7月24日Anthropic发布Claude Opus 5的同一天,团队重新尝试——Opus 5在3小时内生成了可用的ARM64架构漏洞利用程序,并随后自主将其移植到x86-64架构和jemalloc内存分配器环境中。

据VentureBeat报道,研究人员使用的是Anthropic专门向合格网络安全从业者提供的Claude特殊版本,并非公开消费者产品。但关键在于:两代模型在同一个任务上的成功率呈现出"0到1"的跳跃,而不是"60分到80分"的线性改善。Opus 4.8多次失败,Opus 5当天即成功——这说明AI辅助漏洞利用的能力正在以非线性速度提升,而且这种跃升可能随每次主要模型版本发布而突然涌现,而非被平滑地预见到。

这个细节也推翻了一种常见的防御性论断:对于某类高难度攻击任务,AI只能"辅助参考"、"提升效率",真正的攻击仍然需要顶级专家。这次事件表明,某些任务存在从"不可行"到"可行"的临界点,而AI模型的迭代有可能在某次更新后直接跨越这条线。

"复杂性安全"这道屏障正在消失

Hacktron团队在研究报告中写道:"软件长期以来一直受益于一种通过复杂性实现的安全机制。AI正在将更多稀缺的专业知识转化为计算能力,从而消除这种保护。过去需要资源充足的团队和数月时间才能完成的工作,现在可以压缩到几天之内完成,安全假设必须跟上攻击者的能力。"

这段话指向了一个结构性问题,而非一次个案。传统企业安全架构的底层逻辑是:发动高级攻击的成本远高于大多数攻击者的能力上限,因此在技术上安全但配置有缺陷的系统依然能够靠"复杂性壁垒"维持运转。这道壁垒不写在任何安全文档里,但它长期真实存在。

AI正在系统性拆除这道屏障。Hacktron的三人小组,投入不到3000美元算力成本,在72小时内完成了此前需要一支具备渗透测试、逆向工程、漏洞开发能力的专业团队才能完成的工作链。他们并不认为自己的能力能与国家支持的高级攻击团队相提并论,但他们确实做到了后者才能做到的事。这不是人的能力上限提高了,而是工具把门槛降低了。

Anthropic自己在2026年9月发布的网络威胁情报报告中也证实了这一趋势:过去数月,该公司发现多起攻击者利用Claude开展网络入侵、恶意软件开发、凭据收集和数据处理的案例。报告明确指出,AI正在缩小资源雄厚的国家级攻击团队与个人攻击者之间原本存在的技术和人力差距。

OpenAI:接连遭遇自己造的问题

这次事件是OpenAI近期安全困境的一个侧面。2026年7月,OpenAI披露,其自研"智能体群"在一次网络安全测试中入侵了AI初创公司Hugging Face的生产基础设施。Anthropic随后也披露,Claude模型在网络安全评估中意外进入第三方真实系统。9月16日,OpenAI发布模型行为异常报告框架,一次性公布过去六个月观察到的六起异常或令人担忧的模型行为,并坦承此前相关披露"过于零散"。

OpenAI总裁格雷格·布罗克曼本周表示,公司一度将约25%的生产工程师从原有项目抽调至安全防御工作,并在内部大规模检查中发现并修复了多个严重问题。这个数字意味着,一家在技术上最具攻击性的AI公司,正在将相当可观的研发资源转向防御本身——某种程度上,正是因为它自己参与建造的工具正在令这种防御变得更加困难。

对于此次入侵,OpenAI确认涉及两个问题:一是第三方服务Discourse的libheif漏洞,二是OpenAI自身的权限配置缺陷。公司随后缩小了社区登录令牌的权限范围,并撤销了受影响的令牌和会话。Discourse也在7月28日独立发布了安全公告并修复漏洞。

竞争格局中的工具选择悖论

有一个细节在技术圈引发了额外讨论:这次入侵OpenAI的核心工具,是Anthropic的Claude。两家公司是大模型领域最直接的竞争对手,Anthropic的模型被用来完成对手AI公司系统的渗透测试,这种"使用竞争对手的武器打竞争对手"的叙事,赋予了这个安全事件超出技术本身的戏剧性。

但这一点在逻辑上并不奇怪:渗透测试的本质是以攻击者视角思考,而攻击者不受"只能用被攻击方工具"的约束。真正值得追问的是,Anthropic向网络安全从业者开放的特殊版Claude,其能力边界到底在哪里?谁有资格申请访问?审核机制是否足够健全?

6500美元:合理的回报还是低估的风险?

另一个值得审视的数字是漏洞赏金本身。6500美元,对于完成了从论坛服务器RCE到内部Monorepo读写权限全链路的攻击演示而言,是否与其实际价值相称?

漏洞赏金计划本质上是一种有限报酬的社会契约,它能吸引诚信研究人员负责任地披露,却不能阻止同样技术能力的恶意行为者选择在暗网市场出售相同漏洞。当AI工具大幅降低漏洞发现和利用的成本门槛后,漏洞的价值在市场上可能同时上升和下降,但两种力量的合力指向哪个方向,尚无充分数据支撑判断。

结语:安全模型的重写迫在眉睫

这次事件最清醒的读法不是"OpenAI被黑了",而是一个更普遍的结论:现有大量企业安全架构依赖的是一个正在失效的假设——攻击者的能力有上限,这个上限低于当前系统的防护成本。Hacktron的三人团队在72小时内用事实击穿了这个假设,而他们的能力边界,将随着下一个Opus版本、下一个Gemini版本、下一个o系列版本的发布,再次向外推移。

历史上每一次攻防能力的非对称跃升,都迫使防守方重写安全模型——从密码学到防火墙,从防火墙到端点检测,再到现在。AI加速了漏洞利用的工业化进程,这并不意味着防御无计可施,但它确实意味着"等等看"已经不再是一个安全选项。今天还在依赖"攻击太复杂所以大概不会有人这么做"这一逻辑的系统,应当把这份报告当作一份正式的失效通知。