Claude Sonnet 4.6代码执行暴跌22分 材料约束反升25.7分

Claude Sonnet 4.6 在今日 Smoke 评测中,代码执行维度得分从昨日的97.00分降至75.00分,降幅达到22分。

得分对比事实

材料约束维度得分从60.20分升至85.90分,升幅25.7分。工程判断(侧榜,AI 辅助评估)从94.50分降至75.00分,任务表达(侧榜,AI 辅助评估)从95.00分降至90.00分。主榜得分从80.44分微降至79.91分,降幅仅0.5分。诚信评级维持pass。

波动成因分析

Smoke 评测每日仅10题,每维度2题,单日分数标准差天然较大。代码执行与材料约束两个主榜维度出现方向相反的剧烈变化,最可能的原因是题目抽签带来的样本波动,而非模型能力真实退化。代码执行题目若涉及复杂多步推理或边缘用例,模型一次失误即可拉低22分;材料约束题目若转向简单事实核对,模型即可获得高分。工程判断侧榜同步下跌19.5分,进一步指向本次抽签中推理类题目占比偏高。

对使用者的含义

重度依赖代码执行的团队在今日及未来数日内需对Claude Sonnet 4.6的输出进行额外人工校验,尤其在多文件重构、算法优化场景。材料约束得分大幅上升,表明该模型在严格遵循用户指令、避免幻觉方面的表现有所提升,对需要高忠实度输出的文档生成、合同审查场景反而更有利。主榜仅降0.5分,说明综合能力仍处于可用区间,但单一维度22分波动已超过多数企业可接受的稳定性阈值。

战略判断

当前数据不支持“模型退化”的结论,因为材料约束的同步大涨与代码执行的暴跌形成镜像,典型特征为题目方差而非系统性能力下降。建议下一期Smoke 评测重点关注代码执行维度是否回升至90分以上;若连续两日维持75分左右,则需启动更长周期的稳定性验证。工程判断侧榜的19.5分跌幅也值得并行跟踪,以排除模型在复杂推理链上的潜在一致性问题。

对于正在选型的企业,Claude Sonnet 4.6仍可作为材料约束要求较高的场景首选,但代码执行密集型项目应准备备选模型或增加测试用例覆盖。开发者依赖该模型进行自动化代码生成时,今日数据提示需提高单元测试比例,以对冲单维度波动风险。


数据来源:赢政指数 (YZ Index) | Run #250 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!