GPT-6 Astra宣称91.5%越狱抵抗率,发布24小时内被Task-in-Prompt攻击突破
2026年9月3日,OpenAI发布GPT-6 Astra,官方测试显示对已知越狱攻击的拒绝率达91.5%,是前代GPT-5.6 Sol的59%的大幅提升。然而发布不到24小时,一名研究者即通过Task-in-Prompt扩展攻击组合多种方法成功突破。安全研究数据同时揭示,当攻击者跨多轮对话动态调整策略时,Astra的防护率降至约67%。这一事件暴露了"实验室防护基准"与"实战攻击场景"之间的系统