Claude Opus 4.7 周均 82.3 分波动仅 20.7,DeepSeek V4 Pro 下跌 16.8 分

2026-08-10 至 2026-08-16 的 Smoke 评测中,Claude Opus 4.7 以 82.3 的周均分、20.7 的波动值位居所有模型首位,且首日 72.3 分至末日 86.25 分呈现持续上升。

上升模型的执行表现对比

Claude Opus 4.7 全周均值 82.3 分,波动 20.7,趋势 +14。GPT-o3 均值 74.8 分,波动 57.2,趋势 +15。GPT-5.5 均值 72.1 分,波动 42.9,趋势 +27.9。Claude Sonnet 4.6 均值 75.9 分,波动 36.5,趋势 +19.7。Qwen3 Max 均值 69.2 分,波动 28.2,趋势 +10。Grok 4 均值 79.4 分,波动 41,趋势 +12.7。

Claude Opus 4.7 的低波动与高均值结合,表明其每日 10 题回答的一致性最强。GPT-5.5 虽然趋势最大,但均值仅 72.1 分,说明其上升主要来自低基数回升,而非整体能力跃升。

下降模型的数据事实

DeepSeek V4 Pro 首日 87.2 分、末日 70.44 分,趋势 -16.8,均值 64.2,波动 88。Gemini 2.5 Pro 首日 72.86 分、末日 54.38 分,趋势 -18.5,均值 62.1,波动 66.3。GLM-4.6 首日 61.25 分、末日 48.75 分,趋势 -12.5,均值 56.9,波动 57.1。

DeepSeek V4 Pro 的 88 波动值在所有模型中最高,说明其每日得分差异极大,单日高分后易出现大幅回落。Gemini 2.5 Pro 下降幅度最大,末日得分已低于周均值 7.72 分。

波动大的模型成因分析

豆包 Pro 首日 0 分、末日 70.44 分,趋势 +70.4,均值 49.2,波动 78.4。DeepSeek V4 Pro 波动 88。Gemini 2.5 Pro 波动 66.3。GLM-4.6 波动 57.1。

高波动通常源于 Smoke 每日 10 题中执行维度得分不稳定。DeepSeek V4 Pro 与豆包 Pro 的波动值均超过 78,意味着其代码执行或材料约束表现每日差异显著,无法维持稳定输出质量。

诚信评级变化的独立信号

GLM-4.6 在 7 天内出现 pass→fail→pass 的诚信评级波动。豆包 Pro 前两日无评级记录,后五日转为 pass。其他模型诚信评级全程保持 pass,未出现 fail。

GLM-4.6 的 fail 日出现在趋势下降期间,表明其材料约束或任务表达出现明显问题,直接拉低周均分至 56.9。豆包 Pro 的诚信记录缺失前两日,可能与初期未完整参与评测有关。

对使用者的具体含义

重代码执行的团队应优先 Claude Opus 4.7,其 82.3 均分与 20.7 波动提供最高一致性保障。依赖材料忠实度的场景需避开 GLM-4.6,因其诚信评级曾出现 fail,存在输出不可靠风险。

追求性价比的开发者可关注 Qwen3 Max,其 69.2 均分、28.2 波动在上升模型中成本控制较好。波动超过 70 的模型如 DeepSeek V4 Pro 与豆包 Pro,不适合需要每日稳定输出的生产环境。

战略判断

Claude Opus 4.7 的低波动高均值组合在当前数据中最为突出,适合作为基准模型长期观察。DeepSeek V4 Pro 与 Gemini 2.5 Pro 的双双大幅下降,显示其在连续 7 天小样本测试中执行维度持续走弱。

GPT-5.5 的 27.9 趋势虽大,但均值仍低于 Claude Opus 4.7 10.2 分,说明其上升空间尚未转化为领先优势。GLM-4.6 的诚信评级反复,是本周唯一明确出现 fail 的模型,需在下期数据中重点验证其材料约束维度是否已恢复稳定。


数据来源:赢政指数 (YZ Index) | Run #280 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!