Qwen3 Max主榜暴跌8.4分 材料约束单日掉16.5

Qwen3 Max在今日Smoke评测中主榜得分从昨日95.34分跌至86.98分,降幅8.4分。

得分明细对比

代码执行维度从97.00分降至95.30分,降幅1.7分。材料约束维度从93.30分降至76.80分,降幅16.5分。工程判断侧榜从63.90分降至36.10分,降幅27.8分。任务表达侧榜从70.60分降至30.00分,降幅40.6分。诚信评级维持pass。

数据事实拆解

主榜仅由代码执行与材料约束两个维度加权构成。今日主榜跌幅8.4分中,材料约束贡献了绝大部分。代码执行仅小幅回落,说明模型在代码生成与执行环节仍保持较高水准。材料约束的大幅下滑直接拉低主榜均值。

成因分析

Smoke评测每日仅10题,每维度2题,样本量极小,题目抽签波动是首要可能原因。材料约束维度今日可能抽中了对指令遵循与上下文忠实度要求极高的题目,导致得分从93.30分直接跌至76.80分。工程判断与任务表达侧榜跌幅更大,也印证了当日题目可能集中暴露了模型在复杂约束下的不稳定输出。

另一种可能是模型在材料约束场景下的真实能力波动。单日16.5分跌幅已远超正常抽签范围,提示Qwen3 Max在处理长上下文材料时,可能出现指令忽略或内容篡改的概率上升。

对使用者的含义

重度依赖材料约束的场景,例如合同审核、报告生成与知识库问答,今日数据表明Qwen3 Max输出可靠性已出现明显下降。开发者若将模型用于需要严格忠实原文的任务,需增加人工校验环节。

代码执行任务受影响较小,依赖代码生成与调试的团队仍可继续使用,但需关注材料约束相关的二次处理环节。

战略判断

基于今日数据,Qwen3 Max在材料约束维度已出现值得关注的异常波动。单日16.5分跌幅与侧榜40.6分跌幅共同指向模型在约束遵循上的一致性不足,而非单纯题目运气。下一期评测需重点观察材料约束是否回升至90分以上,若持续低位,则需下调其在材料敏感场景的优先级。

目前判断为需要关注,但尚未构成全面退化。代码执行维度仍维持95.30分,说明核心能力未崩。建议企业在选型时,将Qwen3 Max与材料约束得分更稳定的模型并行测试,降低单一模型波动带来的风险。


数据来源:赢政指数 (YZ Index) | Run #283 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!