Claude Opus 4.7在今日Smoke评测中,材料约束得分从昨日的80.20分跌至64.30分,主榜整体从91.09分降至83.94分。
核心维度拆解
代码执行维度保持100.00分零波动,材料约束维度出现-15.9分跌幅。主榜仅由这两项可审计维度构成,因此材料约束的单日下滑直接拉低整体排名。工程判断侧榜从100.00分降至75.00分,任务表达侧榜则从63.90分升至80.60分。
波动成因分析
Smoke评测每日仅10题,2题对应材料约束维度。64.30分意味着该维度两题平均得分显著低于昨日。可能原因包括题目抽签带来的内容难度差异,也可能是模型在材料忠实度上出现临时性不一致。代码执行维度两题均保持满分,说明模型在该能力上未受同类波动影响。
工程判断侧榜的-25分跌幅与材料约束同步下滑,提示模型在需要结合外部材料进行工程决策的场景中表现下降。任务表达侧榜的+16.7分上升则显示模型在任务描述清晰度上有所提升,两者变化方向相反,进一步支持本次波动集中在材料处理环节。
对使用者的具体含义
重度依赖材料约束的团队,例如需要模型严格引用给定文档或代码库的RAG应用,今日数据表明Claude Opus 4.7在单日测试中已出现明显偏差。代码执行稳定的团队可继续使用该模型处理纯编程任务,但需额外人工校验材料引用准确性。
对材料忠实度敏感的场景,如法律合同审查、产品规格对齐,64.30分水平意味着每两题中至少一题出现明显偏离。开发者应在生产流程中增加材料约束校验步骤,而非直接采纳模型输出。
战略判断
基于现有得分对比,材料约束-15.9分跌幅在单日10题框架下更可能源于题目抽签波动,而非模型真实退化。代码执行维度零变化印证了模型核心能力未整体下滑。诚信评级维持pass,未触发准入门槛问题。
若下一期Smoke评测材料约束仍维持在65分以下区间,则需将该信号视为模型一致性下降的初步证据。目前单日数据不足以判定模型被高估或低估,建议将Claude Opus 4.7的材料约束表现列入下期重点追踪列表。
主榜从91.09分降至83.94分,主要由材料约束贡献。代码执行保持满分的事实,说明Claude Opus 4.7在可审计能力上仍具备竞争力,但材料约束的波动已对整体可用性产生可测量影响。
数据来源:赢政指数 (YZ Index) | Run #324 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接