GLM-4.6 Smoke测试材料约束71.90分 代码执行与诚信维度双缺

GLM-4.6在今日Smoke评测中材料约束得分71.90分、工程判断63.90分、任务表达50.00分,代码执行与诚信两个维度因API故障或超时完全缺失,主榜不参与排名。

数据事实

对比昨日,今日仅保留三个侧榜或部分维度得分,执行维度与诚信评级直接为空。Smoke评测每日固定10题,2题对应一个维度,单日标准差较大属于已知特征,但本次缺失并非分数下降,而是整维度数据未返回。

成因分析

缺失的执行与诚信维度对应题目通常需要模型完成代码片段或严格遵循材料指令,API超时最可能发生在这些需要多轮交互或较长上下文的请求上。材料约束71.90分与工程判断63.90分仍能返回,说明模型基础生成能力未完全中断,问题集中在接口稳定性而非模型参数层面退化。任务表达50.00分偏低可能与题目抽签中包含较多开放式表达要求有关,但缺乏执行维度数据,无法判断是否为系统性下滑。

API故障导致的维度缺失与模型真实能力退化是两个不同机制,前者可通过补跑恢复,后者需多日连续数据才能确认。

对使用者的含义

重度依赖代码执行场景的企业需立即检查GLM-4.6 API调用日志,重点关注超时与重试率。若日常工作流包含材料忠实度要求,71.90分仍可作为参考基准,但执行维度缺失意味着无法验证模型在代码生成任务上的实际表现。开发者应在下一轮补跑结果出来前,暂缓将GLM-4.6作为核心代码执行节点。

战略判断

本次异常主要由API层面引起,而非模型能力崩塌,值得持续关注接口稳定性而非立即下结论模型退化。建议下一期Smoke评测重点核对执行维度是否恢复,以及诚信评级是否重新出现;若补跑后执行维度仍持续缺失,则需进一步排查API限流或服务端配置问题。

单日10题测试本身波动正常,本次事件更像是运行信号而非能力信号。企业选型时应将API可用性作为独立考察项,与主榜分数并列评估。


数据来源:赢政指数 (YZ Index) | Run #264 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!