在今日Smoke评测中,Qwen3 Max的代码执行得分从94.00分跌至70.00分,主榜从84.51分降至77.16分。
得分变化细节
代码执行维度出现-24分的大幅回落,材料约束维度则从72.90分升至85.90分,涨幅13分。工程判断从11.30分升至36.80分,任务表达从63.90分升至75.60分。诚信评级保持pass。
主榜构成与波动来源
主榜仅由代码执行与材料约束两个维度加权形成。代码执行-24分直接拉低主榜7.4分,材料约束+13分部分抵消了这一影响。工程判断与任务表达属于侧榜,AI辅助评估,不计入主榜排名。
可能原因分析
Smoke评测每日仅10题,2题/维度,样本量小,题目抽签波动是首要可能因素。代码执行题目难度或类型变化可能导致得分剧烈起伏,而非模型能力本身出现系统性退化。材料约束得分上升,显示模型在约束遵循方面并未同步走弱。
若为真实退化,代码执行与材料约束通常会呈现同向变化,但本次两维度方向相反,支持波动解释。工程判断与任务表达的上升也未显示整体能力下滑信号。
对使用者的含义
重代码执行的团队需注意,Qwen3 Max在Smoke评测中的代码执行得分已降至70.00分,单日表现可能低于此前94.00分水平。依赖材料忠实度的场景则可参考其85.90分的新高。
开发者在选型时,应将代码执行70.00分与材料约束85.90分同时纳入考量,避免仅依据主榜77.16分做出判断。
战略判断
本次代码执行-24分更可能源于题目抽签波动,而非模型真实退化。主榜77.16分仍处于可用区间,但需下一期数据验证一致性。工程判断36.80分与任务表达75.60分上升,未改变主榜核心结论。
若后续多期代码执行得分持续低于80分,则需重新评估其在代码密集场景中的适用性。目前数据仅支持关注波动,不支持断定能力退化。
数据来源:赢政指数 (YZ Index) | Run #354 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接