Claude Opus 4.7在今日Smoke评测中主榜得分83.24分,较昨日93.54分下降10.3分,核心原因是代码执行维度从97.00分跌至75.00分。
得分拆解与直接证据
主榜仅由代码执行与材料约束两个维度加权构成。昨日代码执行97.00分、材料约束89.30分,今日代码执行75.00分、材料约束93.30分。代码执行单维度下跌22分,直接拉低主榜10.3分;材料约束反而上升4分,部分抵消了跌幅。工程判断维持100.00分不变,任务表达从78.90分升至90.00分,诚信评级仍为pass。
成因分析:抽签波动还是能力退化
Smoke评测每日仅2题/维度,共10题。代码执行维度2题失分即可造成22分级别的单日波动,这与测试规模直接相关。材料约束维度同期得分上升,说明模型在同一批题目中并非整体状态下滑。现有数据仅显示代码执行2题表现异常,无法支持“模型真实退化”的结论,更可能是题目抽签带来的随机波动。
对使用者的具体含义
重度依赖代码执行的团队需在今日测试后增加本地验证环节,75.00分意味着该维度2题中至少一题出现明显错误。材料约束得分上升的开发者可继续保持对Claude Opus 4.7的材料忠实度信任。任务表达维度升至90.00分,对需要结构化输出的场景影响较小。
战略判断
单日22分级别的代码执行波动在10题测试中属于正常范围,不构成持续关注信号。若下一期评测中代码执行维度仍维持75分左右,则需启动多日连续追踪;目前仅凭一日数据,Claude Opus 4.7主榜表现仍处于正常波动区间。
数据来源:赢政指数 (YZ Index) | Run #299 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接