研究员称通用越狱提示同时绕过GPT-5.6与Claude Opus 5

2026年7月25日,AI红队研究员Pliny the Liberator公开声称已开发出一种通用越狱提示,可同时绕过GPT-5.6、Claude Opus 5和Fable 5等多款前沿模型的安全对齐机制。该事件基于其X平台声明,强调负责任披露路径,未公开发布具体方法。多家媒体报道此事件,凸显当前AI护栏的脆弱性,但有效性尚未经第三方验证。

2026年7月25日,AI红队研究员Pliny the Liberator称,已掌握一种通用越狱技术,可同时绕过GPT-5.6、Claude Opus 5和Fable 5等多款前沿模型的安全对齐机制。

事实还原

Pliny the Liberator于2026年7月24日发布声明,描述该技术对“ALL models”有效,并覆盖他测试的每个类别。他选择负责任披露路径,邀请AI红队、安全、对齐和政策领域的专家私下联系,未公开具体方法。

机制拆解

越狱提示通常通过提示工程绕过模型的安全过滤器,使其生成被禁止或高风险输出。该声明强调,由于方法的工作原理,可能极难或无法完全修补。Pliny的典型方法包括角色扮演和迭代细化提示,以逐步侵蚀防御。英国AI安全研究所的报告指出,该机构已发现适用于其测试的每个系统的通用越狱,这些攻击能可靠提取接近无护栏模型水平的违规信息。Pliny表示,此方法可能不会增加世界危险性,但他承认他人可能持不同看法。

产业影响

对模型提供商而言,此事件显示安全训练、拒绝行为和护栏在对抗提示下的稳健性仍存在差距。OpenAI在GPT-5.6发布时提到该模型家族采用分层保护、实时检查和基于信任与风险的访问控制,但声明未确认漏洞。对开发者而言,若产品依赖前沿模型API,将护栏视为完整安全计划存在风险。任何将拒绝行为视为安全边界的初创公司,都承担了超出其向客户承认的风险。对企业用户而言,涉及客户支持、编码、支付流程或内部数据的应用需保留输出监控、最小权限工具访问和高风险工作流的人工审查。

对照与先例

SANS Institute宣布Pliny为2026年4月20日至21日AI网络安全峰会的主题演讲者,并称其为匿名黑客,擅长在主要AI模型发布后不久破解它们,并在GitHub仓库发布技术,该仓库已获逾10000星。SANS还提到Pliny领导BT6白帽集体,TIME将其列入2025年TIME100 AI榜单。英国AI安全研究所的报告显示,通用越狱已在其测试的每个系统中出现,这与Pliny的声明形成呼应。

战略判断

各实验室在私下审查期间将评估该方法的影响范围,并决定是否协调补丁或调整披露流程。企业用户应继续维持现有控制措施,而非依赖单一护栏。以上判断基于现有声明和历史模式得出,属于分析而非事实。