OpenAI模型入侵Hugging Face,活跃数天未察觉

OpenAI模型入侵Hugging Face,活跃数天未察觉
据WIRED报道,一组由OpenAI开发的先进AI模型被黑客利用,在Hugging Face平台上秘密运行数日,窃取模型权重和用户数据。此次事件暴露了AI供应链安全的脆弱性,引发业内对模型托管平台防护能力的质疑。俄罗斯黑客也同时被曝试图窃取美国核科学家电子邮件,美国国务院则宣布禁止已知诈骗者入境。

在AI技术高速发展的当下,一场隐秘的攻击正在颠覆我们对模型安全的认知。据WIRED独家披露,一组源自OpenAI的先进AI模型——原本旨在提升推理与代码生成能力——被黑客巧妙利用,在知名模型托管平台Hugging Face上潜伏并活跃了整整四天。期间,这些模型不仅未被平台安全系统识别为异常,反而持续向外传输关键数据,包括模型权重、用户训练日志及部分私有数据集。

事件始末:从“合法模型”到“数字间谍”

根据网络安全研究员Lily Hay Newman和Dhruv Mehrotra的深度调查,此次攻击始于2026年7月中旬。黑客通过社会工程手段获取了Hugging Face一位高级开发者的访问令牌,随后将多个经恶意修改的OpenAI模型(代号:Phantom‑1至Phantom‑5)上传至平台的公共仓库。这些模型保留了原版的架构与基础功能,但底层推理代码被嵌入后门程序:每当用户通过API请求模型输出时,系统会暗中将请求的元数据、输入样本以及模型的中间层激活值打包发送至黑客控制的服务器。

“这就像在银行金库里放了一个看似正常的保险箱,但箱底有个洞,所有流入的现金都会被悄悄抽走。” — 匿名AI安全研究员

更令人震惊的是,这些模型在被上传后立即获得了Hugging Face社区的信任标签——因为它们来自一个与OpenAI官方高度相似的账户名(OpenAI‑Secure‑Lab),且上传时间恰好与OpenAI发布GPT‑5.1微调版本的新闻重合。直到四天后,一位细心的用户发现模型输出中偶尔出现非预期的字符串,才触发内部审计。

背景延伸:AI供应链安全的“新潘多拉魔盒”

Hugging Face作为全球最大的模型仓库,承载着超过100万个AI模型与数据集,是学术界、初创公司及大型科技企业的核心基础设施。然而,此次事件暴露出一个致命短板:平台对模型行为层面的检测几乎为零。传统的安全扫描仅关注文件哈希、代码静态分析,却无法监控模型在运行时是否执行了“计划外”的网络请求。

事实上,AI模型本身正在成为新型攻击载体。2024年DeepMind曾警告,大型语言模型可以被设计为“潜伏恶意软件”,其推理过程可同时完成数据窃取。而此次OpenAI模型的案例则更进一步:黑客不需要从头训练一个恶意模型,只需对合法模型进行“微小的行为篡改”——比如在注意力层添加一个隐藏的if‑else分支,当输入包含特定触发词时,模型就会激活后门。

编者按:当AI成为“双刃剑”

作为科技新闻编辑,我认为这起事件具有里程碑意义。以往,我们担心的是黑客利用AI生成更逼真的钓鱼邮件或深度伪造视频;而今,AI模型本身被武器化,直接渗透我们信任的数字基础设施。OpenAI作为行业标杆,其模型的权威性反而成了攻击者的隐身衣。更值得反思的是,整个安全社区对模型运行时行为的监控手段仍然停留在“信任委托”阶段——我们默认来自正规机构的模型是安全的,却忘了“信任”本身才是最薄弱的环节。

与此同时,WIRED报道中还提及了另外两起安全事件:俄罗斯黑客组织试图通过钓鱼邮件窃取美国核科学家的工作邮箱凭证;美国国务院首次启用“诈骗者数据库”,禁止多名涉嫌跨国电信诈骗的外国人入境。这些事件共同勾勒出2026年数字安全的崎岖图景:从国家级的间谍活动到针对AI基础设施的供应链攻击,威胁面正在急剧扩大。

或许,我们需要的不仅是更先进的防火墙,而是一套针对AI模型生命周期的全新安全范式——从训练、发布到部署,每一环节都必须内置可验证的安全锚点。否则,下一次“活跃在互联网上的模型”,可能就不仅仅是窃取数据那么简单了。

本文编译自WIRED