Claude Opus 4.7代码执行75.00分 材料约束100.00分 主榜反升3.7

Claude Opus 4.7在今日Smoke评测中代码执行得分从昨日99.60分降至75.00分,材料约束得分从61.70分升至100.00分,主榜得分从82.55分升至86.25分。

得分变化的直接事实

代码执行维度出现-24.6分跌幅,工程判断维度出现-11.1分跌幅,任务表达维度维持91.70分不变。材料约束维度出现+38.3分涨幅。主榜得分因此净增3.7分。诚信评级维持pass。

抽样波动与模型退化的区分

Smoke评测每日仅2题代码执行、2题材料约束。单日10题总量下,题目抽签差异足以造成20分以上波动。代码执行从99.60分到75.00分的跌幅,与材料约束从61.70分到100.00分的涨幅同时出现,显示当日题目在两个维度上呈现相反难度分布,而非模型在单一能力上出现系统性退化。

工程判断从86.10分降至75.00分,跌幅小于代码执行,任务表达零变化,进一步支持波动源于题目而非模型参数或推理链路出现永久性改变。

对重代码执行团队的影响

依赖代码执行准确性的开发者在今日看到75.00分表现,低于昨日99.60分。需要为生产环境准备回退方案或人工校验环节。材料约束满分100.00分则表明该模型在严格遵循用户提供的材料方面表现稳定,适合需要高忠实度输出的文档生成或知识提取场景。

对选型企业的战略含义

主榜86.25分高于昨日82.55分,显示综合能力未因单一维度下跌而受损。企业若同时使用代码执行与材料约束两个维度,应在代码执行场景增加测试用例覆盖,而非整体下调Claude Opus 4.7优先级。工程判断75.00分低于昨日86.10分,对需要工程决策辅助的团队需额外验证。

稳定性信号的判断

单日代码执行-24.6分、材料约束+38.3分的对冲变化,在每日仅4题的抽样下属于正常范围。当前数据不支持模型真实退化的结论。下一期评测若代码执行持续低于85分,或材料约束回落至70分以下,再进行退化确认。

代码执行75.00分与材料约束100.00分同时出现,说明当日题目难度在两个维度上存在互补,而非模型能力出现结构性下滑。

基于现有得分对比,Claude Opus 4.7主榜排名因材料约束满分而获得提升,代码执行的单日低分更可能是抽样波动的结果。重代码执行的团队需增加验证步骤,对材料约束敏感的场景可继续使用该模型。


数据来源:赢政指数 (YZ Index) | Run #280 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!