GPT-6 Astra:99.9%基准破纪录,OpenAI首触网络安全危急红线

OpenAI于2026年9月3日发布GPT-6 Astra,在ARC-AGI-3基准测试中以调优配置取得99.9%高分,标准测试为62.7%。Astra同时成为OpenAI历史上首个被内部评定为网络安全"危急"等级的模型——能够在无人引导的情况下独立发现并利用未知零日漏洞。Greg Brockman宣称"AGI时代已经开始",但多项独立指标显示Astra在推理可解释性上出现明显退步。

2026年9月3日,OpenAI发布GPT-6 Astra。官方将其定义为“迄今为止最智能、最对齐的模型”,OpenAI总裁Greg Brockman在发布前的媒体简报中直接宣告:“认为我们现在已进入AGI时代,这并不是不合理的判断。”与此同时,OpenAI在发布前一天确认,Astra是其Preparedness Framework中首个在任何领域达到“危急(Critical)”风险等级的模型——触发这一评级的,正是网络安全能力。

这两个事实并列出现,构成了这次发布的核心张力:最对齐,同时也最危险。

ARC-AGI-3的99.9%:一个需要解读的数字

ARC-AGI-3测试的99.9%得分是本次发布被传播最广的数字,但这个数字有前提条件。据Vellum.ai的基准分析报告,OpenAI使用的是Responses API专属测试框架,并调整了两项默认参数,才取得了这一成绩。在标准测试条件下,同一模型的得分为62.7%。

系统卡片中有明确披露。但62.7%与99.9%之间超过37个百分点的差距,说明测试框架本身对最终数字的影响已经不可忽视。这代表“Astra在最优配置下能够实现的上限”,而非“开发者调用API时的平均表现”。

参照系同样重要:ARC-AGI-2排行榜上,GPT-6 Astra以95%位居第一,而排在其后的Claude Opus 5仅为30.2%。同一测试族系下如此悬殊的差距,是Astra在通用推理能力上真实领先的信号。

基准的全貌:领先在哪,落后在哪

在自动化和专业工作任务上,Astra的优势最为显著。据Vellum.ai整理的数据,AutomationBench测试中,Astra得分41.4%,而上一代旗舰GPT-5.6 Sol仅为18.1%,差距超过一倍。计算机操作基准OSWorld 2.0中,Astra以72.6%领先Sol的65.7%,且每项任务平均完成速度快47%。FrontierMath Tier 4数学基准,Astra得分97.6%,Anthropic的Claude Fable 5.1为87.8%。

网络安全方面,OpenAI报告Astra在ExploitBench漏洞利用开发测试中取得100%满分,Sol的对应成绩为78.5%。内部V8引擎漏洞测试中,Astra成功率39%,Sol仅为5.5%。正是这组数字触发了“危急”定级。

但Astra也有明确的软肋。代码能力上,Astra在DeepSWE基准中得分74.1%,被Meta的Muse Spark 1.3以75.4%小幅压过。独立评测机构Artificial Analysis的综合指数中,Claude Fable 5.1以65.7%领先Astra的61.2%。Humanity's Last Exam(HLE)测试里,Astra得57.2%,同样落后于Fable 5.1的65%。

“最对齐”与“最危险”:并不矛盾,但需要辨清

OpenAI CEO Sam Altman在接受Fox Business采访时称Astra是“有史以来最对齐的模型”,并表示这也是模型发布花费时间较长的原因。OpenAI总部的官方立场是:更高的能力必须配套更严格的对齐工作,Astra代表着这一工作的新高标准。

系统卡片显示,Astra在ExploitGym蜜罐测试中得分0.0%,而Sol的对应得分为48.2%——这意味着Astra几乎不会试图在测试中作弊,这是对齐质量上的真实改进。

然而同一份系统卡片中有一条措辞被广泛注意:Astra的推理过程“比Sol更难监控”。这不是外部批评者的猜测,而是OpenAI自己披露的内部发现。能力越强、推理链条越复杂,可解释性反而下降——这是当前前沿模型训练中一个尚未解决的系统性矛盾。

据CSO Online报道,OpenAI对Astra最先进的网络安全能力实施了访问限制,仅对特定测试合作伙伴开放,并在发布前数周推迟了部分开发进程以强化防护机制。

OpenAI的自述:Astra“在配备正确工具和访问权限的情况下,可以在无需人工逐步引导的情况下,发现此前未知的安全漏洞,并在大量受到良好防护的系统中开发新的利用方式。”——OpenAI官方声明

AGI宣言:边界在哪里

Greg Brockman的“AGI时代”表述触发了行业内一轮密集的定义之争。OpenAI对AGI的官方定义是“能够在大多数具有经济价值的工作中超越人类的高度自主系统”。按照这一标准,Astra在部分垂直任务上确实已达到或超过人类水平——AutomationBench 41.4%的得分绝非全能,但在它覆盖的办公自动化场景里,效率提升幅度是数量级的。

但“AGI时代”的宣告,和“Astra是AGI”之间仍有距离。OpenAI自己在博客文章中的措辞刻意保守:Astra是“我们迄今为止广泛部署的最强大模型”,而非“最先进模型”。

Humanity's Last Exam基准的57.2%得分,提供了一个反向校准:这项测试由数千名学科专家设计,涵盖物理学、法律、哲学等领域的极端难题,Astra尚落后于竞争对手。通用推理能力的边界依然清晰。

定价与竞争格局:溢价能否站稳

GPT-6 Astra的API定价为每百万输入token 10美元、每百万输出token 50美元。这是前代旗舰GPT-5.6 Sol当前优惠价格的2.5倍,与Anthropic Claude Fable 5.1齐平,但约是谷歌Gemini 3.1 Pro(2美元/12美元)的5倍。

OpenAI的定价逻辑是:更高的单价会被更少的token消耗和更少的重试次数抵消,最终“每项任务的实际成本”不一定更高。Greg Brockman在发布会上也强调了同一观点。这个逻辑在特定自动化任务场景下具有合理性,但如emergent.sh的分析所指出,目前发布的数据过于粗粒度,无法做精确的任务级成本核算。溢价是否值得,开发者需要在自己的实际工作负载上验证。

值得注意的是,Astra目前没有类似GPT-5系列的多档位模型(Sol/Nova等分层结构),只有标准版和Pro版。这意味着对于不需要顶级能力的任务,开发者没有价格梯度可以选择,要么付全价,要么用上一代。

独立判断

GPT-6 Astra是一次真实的技术跃升。ARC-AGI-2的95%、FrontierMath Tier 4的97.6%、AutomationBench超过Sol一倍的得分,这些数字在多个独立来源中得到交叉印证。

但这次发布同时暴露了一个结构性问题:随着模型能力边界被推得越来越远,可解释性反而在下降,OpenAI自己也在系统卡片里承认了这一点。能力与可监控性之间的反向关系,是当前主流训练范式的内生矛盾,不是Astra独有的问题,但Astra是第一个把这个矛盾推向“危急”等级的公开部署模型。

99.9%的ARC-AGI-3分数会成为这次发布被记住的数字,但那是调优条件下的上限表现。对于大多数使用场景,62.7%的标准测试成绩和40美元/百万token的实际净成本差,才是真正需要计算的基线。Greg Brockman宣告AGI时代来临,这句话最诚实的解读方式是:不是人类从此可以退场,而是AI第一次在某些任务维度上让人类成为可选项,而非必须项。