GPT-o3以91.29分居首:2026-07-27 Smoke快测数据简报

2026-07-27 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 91.29 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。

当日排名

排名模型主榜代码执行材料约束诚信
#1GPT-o391.299784.3pass
#2Gemini 3.1 Pro89.049779.3pass
#3GPT-5.586.299773.2pass
#4DeepSeek V4 Pro85.6910068.2pass
#5豆包 Pro84.949770.2pass
#6Gemini 2.5 Pro84.2895.870.2pass
#7Claude Sonnet 4.680.449760.2pass
#8GLM-4.675.697280.2warn
#9Grok 475.1579.270.2pass
#10Claude Opus 4.766.044789.3pass
#11Qwen3 Max62.0759.565.2pass

数据解读

今日赢政指数Smoke快测显示,头部模型在代码执行与材料约束的搭配上各有侧重。GPT-o3主榜91.29,代码执行97、材料约束84.3,两种能力相对均衡;Gemini 3.1 Pro主榜89.04,代码执行97、材料约束79.3,同样依靠高代码执行得分;DeepSeek V4 Pro代码执行100、材料约束68.2,主榜85.69,体现代码执行优势明显而材料约束偏弱的结构;GPT-5.5与豆包Pro均代码执行97,材料约束分别为73.2和70.2,整体主榜位居前列。

显著变化中,GPT-5.5主榜+26.5分、代码执行+52.5分,GPT-o3主榜+21.8分、代码执行+52.5分,Qwen3 Max主榜+18.9分、代码执行+40分,Claude Sonnet 4.6主榜+15.7分、代码执行+52.5分,这些提升伴随材料约束不同程度下降。异常信号包括GPT-o3材料约束暴跌-15.7分、DeepSeek V4 Pro材料约束暴跌-31.8分、豆包Pro材料约束暴跌-17分、Claude Sonnet 4.6材料约束暴跌-29.3分、Grok 4材料约束暴跌-29.8分,以及GLM-4.6诚信评级降为warn,可能源于题目抽样波动或真实退化,需后续run复核确认。Smoke为小样本单日信号,相关解读保持克制。

主要变化

  • GPT-5.5:主榜上升26.5分,代码执行+52.5分,材料约束-5.2分
  • GPT-o3:主榜上升21.8分,代码执行+52.5分,材料约束-15.7分
  • Qwen3 Max:主榜上升18.9分,代码执行+40分,材料约束-6.8分
  • GLM-4.6:主榜上升18.5分,代码执行+27.5分,材料约束+7.4分,诚信fail→warn
  • Claude Sonnet 4.6:主榜上升15.7分,代码执行+52.5分,材料约束-29.3分

需要关注的信号

  • GPT-o3:材料约束暴跌 -15.7 分
  • DeepSeek V4 Pro:材料约束暴跌 -31.8 分
  • 豆包 Pro:材料约束暴跌 -17 分
  • Claude Sonnet 4.6:材料约束暴跌 -29.3 分
  • GLM-4.6:诚信评级降为 Fail (fail→warn)
  • Grok 4:材料约束暴跌 -29.8 分

读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。


数据来源:赢政指数 (YZ Index) | Run #248 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!