GLM-4.6 Smoke评测5维度数据全缺 API故障致未上榜

GLM-4.6在今日Smoke评测中出现execution、grounding、judgment、integrity、communication五维度数据完全缺失,已进入自动补跑,本期不参与排名。

数据事实

得分对比表格中,代码执行、材料约束、工程判断、任务表达、主榜全部显示为“- → -(-)”。Smoke评测每日10题,单日波动正常,但本次并非分数波动,而是全部维度记录为空。

成因分析

题目抽签波动通常只会造成单题得分起伏,不会导致整个维度记录缺失。模型真实退化会表现为分数连续下降或特定维度下滑,而非API返回超时或故障。本次异常明确标注为API故障/超时,因此最可能原因是接口层连接中断,而非模型参数或推理能力变化。

执行维度和材料约束维度同时缺失,进一步指向调用链路问题,而非模型内部判断或表达能力退化。

使用者含义

重代码执行的团队在调用GLM-4.6时,需增加API超时重试和备用模型切换机制,避免单次Smoke级快测异常影响生产任务。

对材料忠实度敏感的场景,开发者应在关键流程中加入人工抽检或二次验证,防止API层故障导致的输出截断。

工程判断和任务表达依赖稳定的API响应,当前故障提示这些侧榜能力暂时不可用,选型时需准备降级方案。

战略判断

本次异常由API故障直接导致,与模型真实能力无关,无需对GLM-4.6核心性能产生担忧。下一期Smoke评测若恢复正常得分记录,即可确认本次事件为孤立技术问题。

建议持续观察自动补跑结果,仅当补跑后仍出现多维度缺失时,才需进一步排查模型服务端稳定性。


数据来源:赢政指数 (YZ Index) | Run #322 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!