GLM-4.6代码执行58.30分材料约束100分 Smoke测试API故障暴露异常

GLM-4.6在今日Smoke评测中代码执行得分58.30分,材料约束得分100.00分,工程判断得分75.00分,主榜得分74.00分,因API故障/超时导致integrity与communication维度缺失,已进入自动补跑且本期不参与排名。

数据事实:单日10题下的维度得分分布

Smoke评测每日固定2题/维度,共10题。本期GLM-4.6仅三个维度有得分:代码执行58.30分、材料约束100.00分、工程判断75.00分。任务表达维度因API超时完全缺失。主榜由代码执行与材料约束加权得出74.00分。以上全部数据均来自今日单次运行。

成因分析:API故障与题目抽签波动的区分

代码执行58.30分与材料约束100.00分形成明显反差。材料约束满分说明模型在严格遵循给定材料时表现稳定,题目本身难度或约束强度未超出模型能力。代码执行58.30分则显著偏低,结合官方明确标注的“API故障/超时”,最可能的原因是API连接中断导致代码生成或执行环节直接失败,而非模型本身对代码逻辑的理解退化。

工程判断75.00分处于中等区间,同样受API不稳定影响,但未跌至代码执行同等低位。题目抽签波动在每日10题测试中属正常现象,但本次同时出现API超时记录,且导致两个维度数据缺失,指向外部服务层问题而非随机题目难度变化。

对使用者的含义

重度依赖代码执行场景的开发者需立即评估GLM-4.6在本期Smoke测试中的表现。58.30分意味着在需要生成可运行代码或进行多步调试的任务中,成功率可能明显低于其他模型。材料约束100.00分则显示,在严格RAG或文档忠实度要求高的场景下,该模型仍可提供可靠输出。

对选型企业而言,API稳定性已成为当前使用GLM-4.6的首要风险点。工程判断75.00分提示在需要权衡技术方案的场景中,模型仍能给出中等水平建议,但整体可靠性因API问题被削弱。

战略判断

基于今日得分与API故障记录,GLM-4.6代码执行58.30分最可能由服务层超时导致,而非模型能力真实退化。材料约束满分证明其在约束遵循维度仍保持高水准。建议下期重点验证自动补跑后的完整数据,若API问题持续出现,则需考虑将代码执行密集任务切换至其他可用模型。

本次异常已明确记录为API故障,因此不构成模型能力评估的常规样本。企业用户应将GLM-4.6当前主榜74.00分视为受外部因素干扰的临时值,待补跑完成后再做最终判断。


数据来源:赢政指数 (YZ Index) | Run #368 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!