在今日Smoke评测中,Claude Opus 4.7的主榜得分从100.00分跌至73.92分,降幅达26.1分。
得分对比数据
代码执行维度从昨日100.00分降至75.00分,降幅25分;材料约束维度从100.00分降至72.60分,降幅27.4分。工程判断从100.00分降至94.50分,降幅5.5分;任务表达从88.90分降至78.90分,降幅10分。诚信评级维持pass。
数据事实与成因分析
Smoke评测每日仅10题,每维度2题,样本量极小,单日分数波动属于正常范围。代码执行与材料约束两个主榜维度同时出现25分以上跌幅,最可能的原因是题目抽签带来的内容分布变化,而非模型能力出现系统性退化。工程判断与任务表达降幅明显小于主榜,也支持这一判断。
若模型真实退化,通常会在多个维度呈现一致性下滑。目前工程判断仍保持94.50分,说明模型在侧榜能力上未出现同步问题。材料约束维度跌至72.60分,提示当日抽中的题目可能包含更严格的引用或格式要求,模型未能完全满足。
对使用者的含义
重度依赖代码执行的团队需在今日及后续任务中增加人工校验环节,尤其涉及复杂逻辑或多文件操作的场景。材料约束敏感的应用(如法律合同生成、学术引用整理)应暂时降低对Claude Opus 4.7的信任阈值,改用多模型交叉验证。
对稳定性要求较高的生产环境,单日26.1分主榜波动已超出可接受范围,建议将Claude Opus 4.7从核心链路移出,等待连续多日数据确认。
战略判断
基于现有单日对比数据,Claude Opus 4.7本次得分下滑更可能是Smoke评测小样本波动导致,而非模型真实退化。下一期评测需重点观察代码执行与材料约束是否回升至95分以上。若连续两日主榜均低于80分,则需启动进一步根因排查。
目前数据不支持将此次波动解读为模型能力永久下降,建议保持观察而非立即调整长期选型决策。
数据来源:赢政指数 (YZ Index) | Run #240 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接