在今日Smoke评测中,Claude Sonnet 4.6的代码执行得分从100.00分下降至75.00分,下降幅度达到25分,主榜整体从80.52分回落至75.00分。
得分变化拆解
主榜仅包含代码执行与材料约束两个维度。今日代码执行75.00分、材料约束75.00分,两者平均后形成主榜75.00分。昨日材料约束仅56.70分,今日上升18.3分,部分抵消了代码执行的下滑。工程判断从100.00分降至60.50分,任务表达从65.80分升至70.00分,这两个侧榜维度不计入主榜排名。
可能成因分析
Smoke评测每日仅10题,2题对应一个维度。代码执行维度今日失分较多,最可能源于题目抽签带来的难度分布变化,而非模型能力出现系统性退化。材料约束得分同步上升,也指向当日题目在不同维度上的随机分配,而非模型在单一方向上出现一致性问题。诚信评级维持pass,未出现新增违规迹象。
对使用者的具体含义
重度依赖代码执行的开发团队,在调用Claude Sonnet 4.6处理复杂算法或多步推理任务时,需增加人工复核环节。材料约束得分回升至75.00分,表明该模型在遵循用户提供的上下文材料方面表现稳定,适合对忠实度要求较高的文档生成或知识提取场景。
战略判断
单日25分波动在10题快测中属于正常范围,目前数据不足以判定模型出现真实退化。建议持续跟踪后续三日同一维度的得分标准差,若连续出现代码执行低于85分的情况,再考虑调整选型优先级。工程判断(侧榜,AI辅助评估)的大幅回落可作为次要参考信号,但不改变主榜判断。
整体来看,Claude Sonnet 4.6今日主榜75.00分与材料约束75.00分的匹配,显示其在代码与材料两个核心维度上已趋于均衡。企业选型时可将其视为中高水平选项,但需通过多日数据确认稳定性。
数据来源:赢政指数 (YZ Index) | Run #280 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接