GPT-6.1 Sol"接近 Astra":官方声明的独立核查

OpenAI 称 GPT-6.1 Sol 能力接近 GPT-6 Astra。赢政指数用同一批 18 题各跑 1-2 次:Sol 6.1 两次均 95.91,Astra 两次 89.97 与 95.91——二者差距小于 Astra 自身的波动,无法区分。本文拆解官方基准的量级差异,给出读厂商基准的检查点,并说明

2026年9月29日,OpenAI 在 DevDay 上发布 GPT-6.1 Sol,面向 Plus、Pro、Business、Enterprise 及 Edu 用户,在 ChatGPT Work、Codex 和 API 中可用,并称其能力接近 GPT-6 Astra。需要先厘清一个容易混淆的背景:据 Engadget、9to5Google 等报道,OpenAI 此前取消了原定 10 月发布的 GPT-6.1 Astra(另一款尚未发布的模型),报道称原因是其内部安全测试出现回归。它与已在 API 上线的 GPT-6 Astra 不是同一个模型——本文讨论的"接近",比较对象是后者。

「接近」在各基准上的量化差距

据 Vellum、DataCamp 引述的官方数据:在软件工程评测 DeepSWE v1.1 上,Sol 与 Astra 的峰值准确率(约 74.8%)基本持平,每任务成本约低 80%;在计算机操控评测 OSWorld 2.0 上,Sol 与 Astra 的 73.5% 相差 2.1 个百分点,每任务成本约为其七分之一。TechCrunch 援引 OpenAI 称,跨所有推理强度综合后 Sol 的错误率"在 Astra 的 1.9% 以内",官方未单独说明该指标的计算口径。

另据DataCamp整理的数据(单一信源,供参考),在专业故障排查类测评TroubleshootingBench上,Sol为47.96%、Astra为63.46%,差距扩至15.5个百分点;在网络安全类测评ExploitBench Internal Port上,Sol为21.5%、Astra为31.5%,差10个百分点。"接近"在不同基准上的量级并不一致:从持平到 15.5 个百分点(后者为单一信源)。

我们的18题首测:可核实的部分

赢政指数于2026年9月30日(发布后约数小时内)以18题定向口径完成首次评测(Run #348),全部判分均为规则/沙箱方式(单元测试、精确匹配、结构化JSON校验、数值容差),无AI判分介入:

层题数得分备注
执行力7100全部满分
判断力3100全部满分
扎实度490.93题满分,1题63.6分
诚信压力373.31题满分,2题各60分;评级:pass
沟通150—
综合1895.91—

响应速度方面,18题中位数耗时约3.9秒,均值约6.2秒,最长一题(一道高难度代码题)耗时24.9秒,18题全部成功返回,无API失败。(首跑曾因 API 参数兼容问题全部失败,被记为"数据缺失"而非 0 分,修复后重跑的数据才是本文所用数据。)

同一批 18 题的补测:Sol 6.1 对 Astra

首测发布后,我们把 GPT-6 Astra 加入评测注册表,用与 Run #348 完全相同的 18 题各跑了一次,并对 GPT-6.1 Sol 与 Astra 各重复一次(判分同为规则/沙箱)。结果:GPT-6.1 Sol 两次均为 95.91(Run #348、#352);GPT-6 Astra 两次分别为 89.97 与 95.91(Run #351、#353),两次之间的差异只出现在扎实度一层(77.7 对 90.9),其余各层完全相同。也就是说,Astra 自身两次运行的差距(5.94 分)与它和 Sol 6.1 单次相比的差距一样大——在这批题上,二者无法区分。

这与官方的"接近"并不矛盾,但不构成证实:每个模型只跑了 1-2 次,18 题在头部已近天花板,扎实度层的一道题就能改变分数。完整的四模型对照与噪声分析见本站另文。

三条需要说明的边界

  • "接近 Astra"我们只能做到"未被推翻",还不能说"被证实"。同题补测显示二者在 18 题上无法区分,但样本小、有天花板效应;能回答这个问题的是下一次周度 Full 评测。
  • 18题口径不等于完整周榜口径。本次18题为日常Smoke规模的2倍,非完整题库。GPT-6.1 Sol的完整基线须等下一次周度Full评测后确认,届时才可与主榜现有模型并排,且须标注口径,不可直接排名或混排。
  • 推理强度是必须核对的变量。据 OpenAI 开发者文档,GPT-6.1 Sol 支持 low 至 max 多档 reasoning_effort(默认 medium)。厂商基准通常对应某一档设置,不同档位的成绩与成本可能差异很大;本站首测未显式指定推理强度,使用 API 默认值。

读厂商基准的三个检查点

  • 选了哪些基准:厂商通常突出差距最小的基准,第三方整理有时会补上差距更大的(如 DataCamp 整理的 TroubleshootingBench,单一信源)。读者应对照全部已披露的基准,而不是只看头条数字。
  • 样本来源是否公开:部分内部或小众基准(如上文的 ExploitBench)并非广泛采用的开放基准,外部研究者复现困难,方法论细节依赖单方披露。
  • 推理强度如何计算入总分:基准成绩对应的推理预算,是否与你的实际使用方式一致?如果你的任务不允许高推理消耗,基准的参考价值就会打折。

Full评测后能回答的问题

  • 完整题库口径下GPT-6.1 Sol的综合分,能否相对于主榜参照(Run #342,2026-09-28)形成统计意义上的明显跃升?这是18题口径目前无法回答的问题。
  • 诚信压力层73.3分(pass评级)是系统性模式还是小样本噪声?Full评测扩大该层题量后,稳定性如何。
  • 沟通层单题50分是否可在Full中重现,还是偶发失分。

综上,我们的 18 题实测能说的是:GPT-6.1 Sol 执行力与判断力全满,扎实度有一道 63.6 分,诚信压力 pass 但两题 60 分,沟通层 1 题 50 分;同一批题上它与 GPT-6 Astra 的差距小于 Astra 自身两次运行的波动。"接近 GPT-6 Astra"这句话,我们的数据没有推翻它,但要下结论,需要 Full 评测。

参考信源:OpenAI launches GPT-6.1 Sol, says it nearly matches GPT-6 Astra and costs less;GPT-6.1 Sol: Features, Benchmarks, Pricing, and Access;GPT-6.1 Sol Benchmarks Explained: Coding, Computer Use & Pricing;OpenAI cancels GPT-6.1 Astra release over deceptive behavior;OpenAI cancels GPT-6.1 Astra release over safety concerns;OpenAI's GPT-6.1 Sol delivers Astra-like performance at a dramatically lower price。