Qwen3 Max代码执行暴跌21.7分 材料约束反涨20.4分

Qwen3 Max在今日Smoke评测中代码执行得分从96.70分降至75.00分,材料约束得分从48.80分升至69.20分,主榜得分从75.15分降至72.39分。

数据事实:维度得分对比

代码执行维度出现-21.7分变化,材料约束维度出现+20.4分变化,工程判断从36.10分升至47.20分,任务表达从60.00分降至41.70分,诚信评级从pass转为warn。主榜仅下降2.8分。

成因分析:抽签波动还是真实退化

Smoke评测每日仅10题,每维度2题,样本量极小。代码执行与任务表达同时出现大幅下降,材料约束与工程判断同时上升,表明题目抽签带来的难度分布变化是主要驱动因素。主榜得分仅微降2.8分,说明两个核心维度的反向变动相互抵消,尚未形成一致性退化信号。

诚信评级转为warn是本次变化中唯一需要额外关注的点。该评级直接影响模型准入资格,其触发机制与代码执行和任务表达的低分直接相关,但目前仍处于warn而非fail区间。

对使用者的含义

重度依赖代码执行场景的团队需在今日后增加人工复核环节。代码执行75.00分已低于材料约束69.20分,意味着该模型在需要精确计算或结构化输出的任务中稳定性下降。材料约束69.20分提升则对需要严格遵循输入约束的场景形成正面影响。

工程判断47.20分与任务表达41.70分的分差显示,模型在工程决策类问题上的表现相对优于开放式表达任务。依赖任务表达的开发者应暂时降低对Qwen3 Max的预期。

战略判断

本次变化最可能由题目抽签波动导致,而非模型能力退化。主榜仅下降2.8分且两个核心维度反向变动,符合小样本快测的正常范围。诚信评级warn是唯一需要下期验证的信号,若下一期评测中代码执行与任务表达仍维持低位,则需考虑模型真实一致性问题。

当前数据不支持将Qwen3 Max判定为高估或低估,仅提示单日波动已触及诚信门槛。建议在下期Smoke评测中重点观察代码执行与诚信评级两项指标的恢复情况。


数据来源:赢政指数 (YZ Index) | Run #309 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!