Claude Opus 4.7主榜暴跌8.2分,材料约束单日掉12.1

Claude Opus 4.7在今日Smoke评测中主榜从98.35分跌至90.16分,跌幅8.2分,主要由材料约束从100.00降至87.90(-12.1)以及代码执行从97.00降至92.00(-5)共同导致。

数据拆解:主榜跌幅的直接来源

主榜仅由代码执行与材料约束两个维度加权构成。今日材料约束单日损失12.1分,占主榜跌幅的绝大部分;代码执行损失5分,贡献剩余部分。工程判断维持75.00分不变,任务表达从66.70降至56.70,但这两个维度属于侧榜,不计入主榜。

Smoke评测每日仅2题/维度,样本量极小,单日波动本身属于正常范围。然而材料约束跌幅超过10分,在历史同类快测中属于较大幅度变化。

成因分析:题目抽签还是模型真实退化

从维度构成看,材料约束主要考察模型对给定材料的事实忠实度与边界遵守。今日87.90分意味着至少一题出现了明显越界或事实偏离。代码执行降至92.00,同样指向具体题目中出现了执行错误或格式违规。

由于每日仅抽取2题,极有可能出现“硬题集中”情况:两道材料约束题目均要求严格边界控制,而模型在其中一题出现了约束松动。另一种可能是模型在连续多轮对话或长指令下的材料忠实度出现随机波动。

当前数据仅支持“抽签波动”这一解释。单日对比无法证明模型参数或对齐策略发生系统性退化,因为工程判断未变,且诚信评级仍为pass。

对使用者的具体含义

对重度依赖材料约束的场景(如法律合同抽取、内部知识库问答、合规内容生成),Claude Opus 4.7今日表现提示需增加人工复核环节。材料约束87.90分意味着在严格忠实指令的场景下,出错概率已明显上升。

对代码执行要求较高的开发者团队,92.00分仍属可用区间,但需注意格式与边界错误率上升。工程判断维持75.00分,说明在需要工程权衡的非确定性任务中,模型表现相对稳定,可继续使用。

任务表达降至56.70分,对需要清晰任务拆解的提示工程场景影响有限,因为该维度不进入主榜。

战略判断:是否需要持续关注

基于单日数据,Claude Opus 4.7主榜跌幅主要源于材料约束维度在极小样本下的剧烈波动。建议下一期Smoke评测重点观察材料约束是否回升至95分以上。若连续两日材料约束均低于90分,则需考虑模型在该维度出现短期退化。

目前仅凭今日数据,尚不足以判定模型被高估或低估。值得下期验证的信号是:材料约束是否能在更大样本下稳定在95分以上,以及代码执行能否回到96分区间。

对选型企业而言,短期内可继续使用Claude Opus 4.7,但应在材料约束敏感场景设置额外校验节点,避免单日波动直接影响输出质量。


数据来源:赢政指数 (YZ Index) | Run #286 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!