7天Smoke数据:Claude Opus 4.7趋势25.2分最高,Gemini 3.1 Pro跌26.9分

根据2026-09-21至2026-09-27的Smoke评测数据,Claude Opus 4.7在7天内从70.77分上升至96.01分,趋势达到25.2,均值87.8为所有模型最高。

稳步上升模型分析

Claude Opus 4.7首日70.77分、末日96.01分,趋势25.2,均值87.8,波动26。该模型7天得分持续上行,末日已与GPT-o3并列96.01分。GPT-o3首日81.44分、末日96.01分,趋势14.6,均值84.3。Qwen3 Max首日72.25分、末日86.44分,趋势14.2,均值76.3。GPT-5.5首日76.44分、末日78.8分,趋势2.4,均值83.1。Grok 4首日95.44分、末日97.66分,趋势2.2,均值82.7。

这些上升趋势最可能源于代码执行与材料约束两个主榜维度的稳定提升。Claude Opus 4.7均值最高,说明其在连续10题快测中,执行准确率与 grounding 一致性均保持较高水平。

对正在选型的企业而言,Claude Opus 4.7适合重代码执行且需要高材料忠实度的场景。依赖该模型的开发者可优先考虑将其用于需要连续多天稳定输出的工作流。

战略判断:Claude Opus 4.7均值87.8明显高于其他上升模型,当前数据支持其被低估的结论。

明显滑坡模型分析

Gemini 3.1 Pro首日95.19分、末日68.26分,趋势-26.9,均值80.2,波动26.9。DeepSeek V4 Pro首日95.01分、末日69.31分,趋势-25.7,均值76.2,波动29。Gemini 2.5 Pro首日85.63分、末日69.91分,趋势-15.7,均值78.5,波动27.4。豆包 Pro首日90.62分、末日83分,趋势-7.6,均值84.3,波动19.4。

滑坡最可能由 grounding 维度得分下降导致。Gemini 3.1 Pro首日仍处高位,末日已跌至68.26,7天内连续走低,显示材料约束能力出现系统性回落。

对对材料忠实度敏感的场景,重度使用Gemini 3.1 Pro的团队需重新评估风险。依赖该模型的开发者应准备切换方案,以避免输出质量波动影响业务。

战略判断:Gemini 3.1 Pro与DeepSeek V4 Pro趋势均低于-25,当前数据支持两者被高估的结论。

高波动模型重点关注

GLM-4.6首日0分、末日57.01分,趋势57,均值31.1,波动73.9。Claude Sonnet 4.6首日72.5分、末日92.19分,趋势19.7,均值79.8,波动45.1。Grok 4波动36.4,Qwen3 Max波动31.1。

高波动直接反映模型回答一致性较低。GLM-4.6标准差导致稳定性仅31.7分,多次回答同类题目时分数差异巨大。Claude Sonnet 4.6波动45.1,同样显示执行与 grounding 维度得分起伏明显。

对需要稳定输出的企业,重代码执行的团队应避免将GLM-4.6用于生产环境。依赖该模型的开发者需增加人工校验环节,以应对单日得分剧烈变化。

战略判断:GLM-4.6与Claude Sonnet 4.6波动远超其他模型,当前数据支持其一致性不足的结论,下期需验证是否能降低标准差。

诚信评级变化信号

Grok 4诚信评级从warn转为pass后保持稳定。GLM-4.6诚信评级出现warn后恢复pass,期间有空白记录。

诚信评级是准入门槛,Grok 4从warn转为pass,说明其回答诚信问题得到改善。GLM-4.6评级反复,提示早期可能存在材料引用不规范风险。

对选型企业,优先选择诚信评级稳定的模型可降低合规风险。依赖GLM-4.6的开发者需额外核对输出来源。

战略判断:Grok 4诚信评级改善与得分上升同步,当前数据支持其整体可靠性提升的结论。

综合7天数据,Claude Opus 4.7均值与趋势均最优,Gemini 3.1 Pro与DeepSeek V4 Pro跌幅最大,GLM-4.6与Claude Sonnet 4.6波动最剧烈,诚信评级变化仅出现在Grok 4与GLM-4.6两模型。


数据来源:赢政指数 (YZ Index) | Run #340 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!