Claude Sonnet 4.6 Smoke评测主榜暴跌17分,代码执行从100降至50

Claude Sonnet 4.6在今日Smoke评测中,主榜得分从89.52分降至72.50分,降幅达到17分,代码执行维度从100.00分直接跌至50.00分。

维度拆解:主榜下跌的直接来源

主榜仅由代码执行与材料约束两个维度加权构成。昨日代码执行100.00分、材料约束76.70分,今日代码执行50.00分、材料约束100.00分。代码执行单维度下跌50分,直接拉低主榜17分,材料约束的23.3分回升未能完全抵消这一损失。

侧榜数据显示,工程判断从50.00分升至83.30分,任务表达从95.80分降至65.00分。诚信评级维持pass,未触发门槛问题。

成因分析:2题抽签波动最可能解释

Smoke评测每日仅2题/维度,样本量极小。代码执行维度从满分跌至50分,最直接的机制是一道题目完全失分,另一道部分得分。材料约束同时升至满分,说明当日抽到的材料类题目难度或约束要求低于昨日。工程判断上升33.3分、任务表达下降30.8分,进一步印证不同维度题目难度分布不均,而非模型整体能力退化。

若为真实退化,通常会伴随多个维度同步下滑,且材料约束与代码执行同属核心能力,难以出现一升一降50分的极端反向变化。因此,题目抽签波动是当前数据支持的最可能成因。

对使用者的具体含义

重度依赖代码执行的团队需在生产环境额外增加代码生成专项测试。Claude Sonnet 4.6在Smoke评测中代码执行出现50分级波动,意味着单次2题测试结果不能直接外推至长代码库或复杂算法任务。

对材料忠实度敏感的场景(如合同抽取、合规审查),今日100.00分表现可作为参考,但仍需观察连续多日材料约束是否稳定在高位。

工程判断与任务表达的较大波动,提示在需要结构化输出或多轮对话的场景中,单日成绩参考价值有限。

战略判断:需持续跟踪下一期数据

基于现有得分对比,Claude Sonnet 4.6主榜17分下跌主要由代码执行单维度极端波动驱动,而非多维度同步退化。下一期Smoke评测若代码执行回升至80分以上,则可判定本次为抽签异常;若继续维持50分左右,则需进一步验证模型在代码任务上的稳定性。

目前数据不支持“模型退化”的结论,但支持“单维度高波动”的观察。选型企业应将Claude Sonnet 4.6的代码执行能力单独列为验证项,而非直接采用今日主榜72.50分作为最终参考。


数据来源:赢政指数 (YZ Index) | Run #332 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!