GLM-4.6在今日Smoke评测中主榜得分79.38分,代码执行维度62.50分,材料约束维度100.00分,诚信评级从fail转为pass。
得分对比事实
昨日代码执行75.00分、材料约束78.30分、工程判断75.00分、任务表达20.00分,主榜74.00分。今日代码执行62.50分、材料约束100.00分、工程判断75.00分、任务表达41.70分,主榜79.38分。代码执行单日下降12.5分,材料约束上升21.7分,任务表达上升21.7分。
波动成因分析
Smoke评测每日仅10题,每维度2题,题目抽签随机性直接影响得分。代码执行从75.00降至62.50,最可能源于今日抽中对代码正确性要求更高的题目,材料约束则抽中更容易满足约束的题目。工程判断保持75.00分不变,说明该维度题目难度相对稳定。诚信评级从fail转为pass,同样指向单日题目抽签变化,而非模型参数或训练数据出现系统性问题。
若模型出现真实退化,通常会在多个维度同时出现持续性下降。今日代码执行下降的同时,材料约束和任务表达均大幅上升,主榜整体提升5.4分,这一模式更符合随机抽签结果,而非模型能力退化。
对使用者的具体含义
重代码执行的团队在选用GLM-4.6时,需为单次回答波动预留验证环节。材料约束场景下,今日100.00分表现显示该模型在严格遵循输入材料方面具备优势,适合需要高忠实度的文档处理任务。任务表达从20.00升至41.70,说明在需要清晰输出结构的场景中,今日抽签题目下表现改善。
开发者依赖GLM-4.6生成代码时,应增加单元测试覆盖率,以应对代码执行维度可能的单日波动。企业选型时,诚信评级转为pass意味着该模型已通过基础诚信门槛,可进入下一阶段评估。
战略判断
基于今日数据,GLM-4.6代码执行62.50分与材料约束100.00分的反向变化,最可能由题目抽签波动造成,而非模型真实退化。主榜79.38分较昨日提升,表明整体能力未出现系统性下滑。下一期评测需观察代码执行是否回升至75.00附近,若连续两日维持低位,再考虑进一步验证。
目前无需对GLM-4.6启动额外稳定性测试,保持常规监控即可。工程判断保持75.00分、诚信评级转为pass这两项信号,均不支持模型能力下降的结论。
数据来源:赢政指数 (YZ Index) | Run #275 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接