2026-07-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。
当日排名
| 排名 | 模型 | 主榜 | 代码执行 | 材料约束 | 诚信 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 100 | 100 | 100 | pass |
| #2 | 豆包 Pro | 83.73 | 75 | 94.4 | pass |
| #3 | GPT-o3 | 82.7 | 75 | 92.1 | pass |
| #4 | Gemini 3.1 Pro | 81.93 | 75 | 90.4 | pass |
| #5 | Grok 4 | 80.81 | 75 | 87.9 | warn |
| #6 | DeepSeek V4 Pro | 80.27 | 75 | 86.7 | warn |
| #7 | GPT-5.5 | 79.91 | 75 | 85.9 | pass |
| #8 | Gemini 2.5 Pro | 69.98 | 50 | 94.4 | pass |
| #9 | Qwen3 Max | 67.31 | 65.6 | 69.4 | warn |
| #10 | Claude Sonnet 4.6 | 64.39 | 71.9 | 55.2 | pass |
| #11 | GLM-4.6 | 58.75 | 25 | 100 | warn |
数据解读
今日主榜前四模型中,Claude Opus 4.7 以代码执行 100 和材料约束 100 取得主榜 100,显示两者均衡高位;豆包 Pro 主榜 83.73 来自代码执行 75 与材料约束 94.4 的搭配,GPT-o3 主榜 82.7 对应代码执行 75、材料约束 92.1,Gemini 3.1 Pro 主榜 81.93 则为代码执行 75、材料约束 90.4,此类结构体现材料约束相对更强的组合在当前样本下贡献了较高整体得分。
豆包 Pro 主榜较前次同口径 run 上升 34.5 分,主要来自代码执行上升 50 分;GLM-4.6 主榜上升 27.3 分伴随材料约束上升 60.7 分;Gemini 3.1 Pro 主榜上升 25.5 分对应代码执行上升 25 分与材料约束上升 26.1 分。异常信号方面,Gemini 2.5 Pro 代码执行出现暴跌 -24.6 分,Qwen3 Max 主榜暴跌 -14.9 分,Claude Sonnet 4.6 主榜暴跌 -25.6 分,这些单日变化可能源于题目抽样波动,也可能是模型真实表现退化,需后续同口径 run 复核确认。
Smoke 测试为小样本单日信号,以上观察仅反映当日数据分布,未对模型长期稳定性作出判断。
主要变化
- 豆包 Pro:主榜上升34.5分,代码执行+50分,材料约束+15.6分
- GLM-4.6:主榜上升27.3分,材料约束+60.7分
- Claude Sonnet 4.6:主榜下降25.6分,代码执行-27.3分,材料约束-23.6分
- Gemini 3.1 Pro:主榜上升25.5分,代码执行+25分,材料约束+26.1分
- DeepSeek V4 Pro:主榜上升17.3分,代码执行+25分,材料约束+7.9分,诚信pass→warn
需要关注的信号
- Gemini 2.5 Pro:代码执行暴跌 -24.6 分
- Qwen3 Max:主榜暴跌 -14.9 分
- Claude Sonnet 4.6:主榜暴跌 -25.6 分
读这类 Smoke 简报时,重点应放在两个问题上:第一,某个模型是否连续多日暴露同一类弱点;第二,诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化,可能来自题目抽样,也可能是真实退化的早期信号,需要后续 run 复核。
数据来源:赢政指数 (YZ Index) | Run #238 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接