研究人员读取Anthropic等模型加密推理 安全机制漏洞暴露

研究人员开发出新方法,已成功读取Anthropic、OpenAI和Google模型的加密内部推理,并绕过反蒸馏保护。实验室在数月前收到通知。该事件揭示安全机制存在漏洞,并伴随凭证泄露风险。X平台和媒体对此表达担忧,安全倡导者呼吁提高透明度。事实显示前沿模型的对齐防护仍依赖特定设计假设,长期影响需进一步观察。

一项新技术已成功读取Anthropic、OpenAI和Google模型的加密内部推理,并绕过反蒸馏保护。实验室在数月前收到通知。

事件核心事实

该方法直接访问模型内部推理过程,暴露了安全机制的具体实现细节以及部分凭证。相关实验室已提前数月获知技术细节,截至2026年8月前未公开具体修复方案。

异常信号的深层机制

当前模型安全设计多依赖加密和蒸馏限制来阻止外部复制推理路径。新方法证明这些限制可被系统性绕过,原因在于加密层与实际推理逻辑之间存在可被利用的映射关系。安全机制原本假设外部无法重建内部状态,但该假设在面对针对性读取技术时失效。

安全倡导者指出,模型对齐脆弱性源于对防护机制的过度信任,而非对攻击面的全面覆盖。

行业方担忧技术细节外泄会加速针对性攻击工具的出现。两者分歧集中在是否应立即公开更多内部信息。

产业影响路径

模型提供方需重新评估现有防护的实际边界。相同效果下,增加加密强度会直接提高推理成本,而不改变底层逻辑映射则无法根除读取风险。开发者在API调用稳定性和功能实现之间面临更严格的权衡。

  • 加密内部状态的方案已显示出可被绕过的迹象。
  • 反蒸馏保护未能阻止推理路径的重建。
  • 凭证泄露事件进一步放大了信任链断裂的后果。

这些变化直接影响下游应用对模型输出的依赖程度。

独立判断

该事件表明,当前前沿模型的安全机制仍以特定假设为前提,一旦假设被突破,防护效果会快速下降。未来改进需转向可验证的逻辑隔离,而非单纯增加加密或限制措施。短期内,模型提供方应优先验证现有防护在已知攻击下的实际表现。