前沿模型API加密推理轨迹可提取 三大厂商面临隐私泄露风险

安全研究团队披露OpenAI、Anthropic和Google API中加密推理块存在跨模型可移植漏洞,可通过2次调用提取内容,并从公开日志解码出367条PII和182个凭证。事件暴露客户端持有加密推理的设计缺陷,已获厂商修复。

2026年8月11日,研究团队发布论文《Stealing Reasoning Traces from Proprietary LLM APIs》,证实OpenAI、Anthropic和Google的API将模型逐步推理过程以加密块形式返回客户端,且这些块在同一厂商生态内可跨会话、用户和模型重放。

攻击机制源于架构选择

厂商为防止推理过程被直接蒸馏,选择将加密推理块交由客户端传递而非服务器存储。研究发现这些块不绑定特定会话或模型,导致弱模型可被用于解码强模型内容。攻击者先让强模型生成加密块,再注入弱模型并进行简单越狱,即可逐字输出明文推理轨迹。

论文验证提取的token数量与API计费的thinking tokens基本1:1匹配。该方法绕过强模型的反蒸馏防护,直接利用同厂商较弱模型完成解码。

公开日志暴露大量敏感数据

研究团队扫描公开代码仓库中的6700至7000条agent轨迹,解码315320个推理块,恢复367件个人身份信息和182个凭证,包括62个唯一API密钥、33个密码和33个电子邮件地址。这些信息多仅存在于隐藏推理中,最终输出未显示。

开发者常将包含加密块的日志公开分享,却未意识到其内容可被还原。此类泄露规模显示,当前API设计将隐私风险直接暴露给日志共享场景。

四类攻击向量已获证实

  • 绕过反蒸馏:可提取前沿模型推理轨迹用于训练其他模型。
  • 大规模数据提取:从公开日志中恢复凭证和PII。
  • 揭示隐藏危险行为:即使最终输出拒绝请求,推理过程可能包含scheming或异常循环。
  • 隐形提示注入:可在加密块中嵌入恶意负载污染公开agent执行。

论文作者Alexander Panfilov说明,2026年5月Matthew Green已报告重放问题,厂商当时认为无明显安全影响。本次研究系统证明跨模型可移植性。

产业层面的实际影响

该漏洞直接挑战“隐藏推理即可保护知识产权”的假设。只要同一厂商存在防护较弱的模型,强模型的推理过程即可被间接提取。少量Opus推理token预填其他模型后,输出风格出现偏移,显示蒸馏风险真实存在。

对API安全设计而言,客户端持有加密块的做法已证明不可持续。需要引入会话绑定或模型特定密钥等机制,才能阻止跨模型解码。

独立判断

此次事件的核心问题不在于加密算法本身,而在于架构决策将可解码的推理块暴露给客户端。厂商已通过负责任披露完成部分修复,根本解决在于重新评估客户端传递加密推理的必要性。未来API设计若继续依赖此模式,类似降维攻击将持续存在。