Qwen3 Max代码执行暴跌24分 主榜下滑7.4分

在今日Smoke评测中,Qwen3 Max的代码执行得分从94.00分跌至70.00分,主榜从84.51分降至77.16分。

得分变化细节

代码执行维度出现-24分的大幅回落,材料约束维度则从72.90分升至85.90分,涨幅13分。工程判断从11.30分升至36.80分,任务表达从63.90分升至75.60分。诚信评级保持pass。

主榜构成与波动来源

主榜仅由代码执行与材料约束两个维度加权形成。代码执行-24分直接拉低主榜7.4分,材料约束+13分部分抵消了这一影响。工程判断与任务表达属于侧榜,AI辅助评估,不计入主榜排名。

可能原因分析

Smoke评测每日仅10题,2题/维度,样本量小,题目抽签波动是首要可能因素。代码执行题目难度或类型变化可能导致得分剧烈起伏,而非模型能力本身出现系统性退化。材料约束得分上升,显示模型在约束遵循方面并未同步走弱。

若为真实退化,代码执行与材料约束通常会呈现同向变化,但本次两维度方向相反,支持波动解释。工程判断与任务表达的上升也未显示整体能力下滑信号。

对使用者的含义

重代码执行的团队需注意,Qwen3 Max在Smoke评测中的代码执行得分已降至70.00分,单日表现可能低于此前94.00分水平。依赖材料忠实度的场景则可参考其85.90分的新高。

开发者在选型时,应将代码执行70.00分与材料约束85.90分同时纳入考量,避免仅依据主榜77.16分做出判断。

战略判断

本次代码执行-24分更可能源于题目抽签波动,而非模型真实退化。主榜77.16分仍处于可用区间,但需下一期数据验证一致性。工程判断36.80分与任务表达75.60分上升,未改变主榜核心结论。

若后续多期代码执行得分持续低于80分,则需重新评估其在代码密集场景中的适用性。目前数据仅支持关注波动,不支持断定能力退化。


数据来源:赢政指数 (YZ Index) | Run #354 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!