GLM-4.6在今日Smoke评测中代码执行维持50.00分不变,材料约束从46.10分升至74.30分,主榜因此从48.25分升至60.94分,诚信评级从fail升至pass。
数据事实拆解
对比昨日与今日得分,代码执行维度完全持平50.00分,材料约束维度单日增加28.2分。工程判断从64.60分降至25.00分,任务表达从50.00分降至25.00分。主榜整体上升12.7分,核心驱动为材料约束的提升。
成因分析
Smoke评测每日仅10题,2题/维度,样本量极小,题目抽签波动是得分变化的最直接机制。材料约束维度得分大幅上升,表明今日抽中的2题在材料忠实度要求上模型表现更好。工程判断与任务表达两个侧榜维度同时出现-39.6分和-25分的下降,说明抽中题目可能对工程决策和任务表述要求更高,导致模型在这些侧榜题目上失分增加。诚信评级从fail转为pass,反映模型在今日抽签题目中未触发诚信扣分项。
材料约束74.30分 vs 工程判断25.00分,同一模型在同一日不同维度出现38.3分差距,指向题目抽签而非模型架构退化。
对使用者的含义
重材料约束场景的开发者可考虑在当日高分模型上执行需要严格忠实原文的任务。重工程判断的团队需注意侧榜25.00分可能带来决策不一致风险,建议在关键工程环节增加人工复核。依赖任务表达的场景同样面临25.00分水平,输出结构化程度可能降低。
战略判断
主榜60.94分改善完全由材料约束单维度驱动,代码执行维持50.00分不变,表明模型核心执行能力未发生系统性变化。工程判断与任务表达两个侧榜同时大幅下降,属于典型小样本抽签结果,暂无证据支持模型真实退化。诚信评级转为pass属于正面信号,但侧榜剧烈波动提示下一期Smoke评测需持续观察工程判断维度是否回升至60分以上。
本次评测再次验证Smoke每日10题设计下,侧榜分数标准差容易超过30分,主榜相对稳定。选型企业应以连续3日主榜均值作为参考,而非单日数据。
数据来源:赢政指数 (YZ Index) | Run #308 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接