今日Smoke评测中,GLM-4.6材料约束得分从75.00分降至47.70分,主榜得分从46.29分升至76.47分。
得分对比事实
代码执行从22.80分升至100.00分,材料约束从75.00分降至47.70分,工程判断从100.00分降至63.90分,任务表达从66.70分降至50.00分,主榜从46.29分升至76.47分,诚信评级从pass转为warn。
维度构成与波动机制
主榜仅由代码执行与材料约束两个维度组成。今日材料约束下降27.3分,但代码执行上升77.2分,两者平均后主榜仍上涨30.2分。Smoke评测每日仅10题,2题/维度,单日抽签波动属于正常范围。材料约束得分下降最可能源于当日抽中对材料忠实度要求更高的题目,而非模型整体能力退化。
代码执行100.00分与材料约束47.70分的组合,直接拉高主榜至76.47分。
成因分析
材料约束维度侧重模型对给定材料的忠实度。得分从75.00分降至47.70分,说明当日题目中模型出现较多偏离材料内容的回答。代码执行维度从22.80分升至100.00分,显示模型在代码相关题目上表现稳定且正确。工程判断与任务表达两个侧榜维度同步下降,分别降36.1分和16.7分,进一步印证当日题目难度分布与昨日不同。诚信评级从pass转为warn,表明模型在部分回答中出现可被记录的诚信问题。
对使用者的含义
重代码执行的团队可继续使用GLM-4.6,因为代码执行维度已达100.00分。对材料忠实度敏感的场景需提高警惕,47.70分的材料约束得分意味着模型更易生成与给定材料不一致的内容。依赖工程判断与任务表达的开发者需额外人工校验输出,因为这两个侧榜维度均出现明显下滑。
战略判断
主榜得分上涨主要由代码执行单维度拉动,材料约束的27.3分跌幅已抵消部分优势。诚信评级转为warn是本次评测中唯一需要持续跟踪的信号。下一期Smoke评测若材料约束仍低于60分,则需判断模型是否存在真实退化;若材料约束回升至70分以上,则本次波动更可能归因于题目抽签。
本次评测数据仅反映单日10题表现,无法支持连续退化结论。选型企业应在材料约束维度恢复至75分以上后再评估GLM-4.6的整体稳定性。
数据来源:赢政指数 (YZ Index) | Run #256 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接