2026-08-24 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 3.1 Pro 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。
当日排名
| 排名 | 模型 | 主榜 | 代码执行 | 材料约束 | 诚信 |
|---|---|---|---|---|---|
| #1 | Gemini 3.1 Pro | 96.98 | 94.5 | 100 | pass |
| #2 | Gemini 2.5 Pro | 92.16 | 94.5 | 89.3 | pass |
| #3 | GLM-4.6 | 87.54 | 86.1 | 89.3 | warn |
| #4 | Grok 4 | 87.09 | 86.1 | 88.3 | pass |
| #5 | 豆包 Pro | 86.54 | 94.5 | 76.8 | warn |
| #6 | GPT-o3 | 83.23 | 69.5 | 100 | pass |
| #7 | Claude Opus 4.7 | 82.98 | 77.8 | 89.3 | pass |
| #8 | DeepSeek V4 Pro | 80.46 | 94.5 | 63.3 | pass |
| #9 | Qwen3 Max | 71.73 | 77.8 | 64.3 | pass |
| #10 | GPT-5.5 | 64.66 | 44.5 | 89.3 | pass |
| #11 | Claude Sonnet 4.6 | 58.23 | 44.5 | 75 | pass |
数据解读
今日赢政指数Smoke快测中,Gemini 3.1 Pro以代码执行94.5、材料约束100的搭配取得主榜96.98,Gemini 2.5 Pro代码执行94.5、材料约束89.3对应主榜92.16,GLM-4.6代码执行86.1、材料约束89.3获得主榜87.54,显示头部模型在代码执行与材料约束两项上的强弱组合差异明显。豆包Pro代码执行94.5但材料约束76.8,主榜86.54;GPT-o3代码执行69.5、材料约束100,主榜83.23,此类结构呈现一端突出另一端受限的特点。
与上一同口径run相比,GLM-4.6主榜+64.1分、代码执行+69.4分、材料约束+57.6分,Gemini 2.5 Pro主榜+28.9分、代码执行+25分、材料约束+33.6分,GPT-o3主榜+27.7分、代码执行+19.5分、材料约束+37.6分,Grok 4主榜+22.8分、代码执行+19.4分、材料约束+26.9分,Gemini 3.1 Pro主榜+18.5分、材料约束+37.6分,这些升幅反映单日分数结构的变化。
DeepSeek V4 Pro材料约束暴跌-18.4分,属于异常信号,可能源于题目抽样波动或真实退化,需后续run复核确认。Smoke快测为小样本单日信号,以上解读仅基于今日数据,未做长期判断。
主要变化
- GLM-4.6:主榜上升64.1分,代码执行+69.4分,材料约束+57.6分
- Gemini 2.5 Pro:主榜上升28.9分,代码执行+25分,材料约束+33.6分
- GPT-o3:主榜上升27.7分,代码执行+19.5分,材料约束+37.6分
- Grok 4:主榜上升22.8分,代码执行+19.4分,材料约束+26.9分
- Gemini 3.1 Pro:主榜上升18.5分,材料约束+37.6分
需要关注的信号
- DeepSeek V4 Pro:材料约束暴跌 -18.4 分
读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。
数据来源:赢政指数 (YZ Index) | Run #292 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接