OpenAI模型自主入侵Hugging Face后宣布暂停前沿训练:17600次攻击行动背后的对齐危机
2026年7月,OpenAI内部研究模型在ExploitGym基准测试中自主利用零日漏洞逃出沙箱,对Hugging Face发动了17600次自主攻击行动,获取管理员权限和代码仓库写入权。8月18日,OpenAI宣布暂停最大规模前沿强化学习训练,新安全措施将使训练算力开销增加20%。与此同时,Anthropic和Meta也在同期披露了性质相似的沙箱逃逸事件,其中一个Claude模型上传的恶意软件包