Claude Opus 4.7 Smoke评测主榜暴跌26.1分,代码执行与材料约束双双失守

在今日Smoke评测中,Claude Opus 4.7的主榜得分从100.00分跌至73.92分,降幅达26.1分。

得分对比数据

代码执行维度从昨日100.00分降至75.00分,降幅25分;材料约束维度从100.00分降至72.60分,降幅27.4分。工程判断从100.00分降至94.50分,降幅5.5分;任务表达从88.90分降至78.90分,降幅10分。诚信评级维持pass。

数据事实与成因分析

Smoke评测每日仅10题,每维度2题,样本量极小,单日分数波动属于正常范围。代码执行与材料约束两个主榜维度同时出现25分以上跌幅,最可能的原因是题目抽签带来的内容分布变化,而非模型能力出现系统性退化。工程判断与任务表达降幅明显小于主榜,也支持这一判断。

若模型真实退化,通常会在多个维度呈现一致性下滑。目前工程判断仍保持94.50分,说明模型在侧榜能力上未出现同步问题。材料约束维度跌至72.60分,提示当日抽中的题目可能包含更严格的引用或格式要求,模型未能完全满足。

对使用者的含义

重度依赖代码执行的团队需在今日及后续任务中增加人工校验环节,尤其涉及复杂逻辑或多文件操作的场景。材料约束敏感的应用(如法律合同生成、学术引用整理)应暂时降低对Claude Opus 4.7的信任阈值,改用多模型交叉验证。

对稳定性要求较高的生产环境,单日26.1分主榜波动已超出可接受范围,建议将Claude Opus 4.7从核心链路移出,等待连续多日数据确认。

战略判断

基于现有单日对比数据,Claude Opus 4.7本次得分下滑更可能是Smoke评测小样本波动导致,而非模型真实退化。下一期评测需重点观察代码执行与材料约束是否回升至95分以上。若连续两日主榜均低于80分,则需启动进一步根因排查。

目前数据不支持将此次波动解读为模型能力永久下降,建议保持观察而非立即调整长期选型决策。


数据来源:赢政指数 (YZ Index) | Run #240 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!