GLM-4.6 材料约束 93.30 分却诚信 fail,代码执行 25.00 分拖累主榜

2026-07-23 Run#243 的 Smoke 快测中,GLM-4.6 主榜得分 55.74 分,代码执行 25.00 分,材料约束 93.30 分,诚信评级 fail(探针 30.00)。

分数结构揭示的维度反差

材料约束 93.30 分与代码执行 25.00 分形成明显落差。材料约束考察模型能否严格依据给定长文档作答并正确引用,GLM-4.6 在该维度得分较高,说明其对提供材料的忠实度较好。代码执行 25.00 分则显示真实 Python 沙箱运行通过率低,多次未能完成可执行代码任务。

诚信评级 fail(探针 30.00)是独立信号。该维度通过 42 个金丝雀探针检测模型是否将虚构实体当作真实引用,30.00 分表明触发了探针。探针得分与材料约束分数无关,说明即使模型能较好引用给定材料,仍可能在无材料支撑时编造来源。

同日模型对比

同日 11 个模型诚信评级全部 pass。Gemini 2.5 Pro 探针得分 100.00,Claude Opus 4.7 和 GPT-5.5 均为 90.00,Qwen3 Max、Grok 4、GPT-o3、Claude Sonnet 4.6、Gemini 3.1 Pro 均为 80.00,豆包 Pro 75.00,DeepSeek V4 Pro 65.00。GLM-4.6 是唯一 fail 模型,探针得分比最低的 DeepSeek V4 Pro 低 35 分。

历史 run 数据

GLM-4.6 公开 Smoke 历史中,2026-07-23、2026-07-22、2026-07-20 出现 3 次 fail 或 warn。2026-07-22 Run#241 主榜 74.00 分(代码执行 97.00,材料约束 75.00,探针 25.00);2026-07-21 Run#240 主榜 62.83 分且诚信 pass(探针 80.00)。标注为 0 分的 run 不作为对比基线。

成因分析

材料约束高分与诚信 fail 并存,说明模型在有明确材料时能较好控制引用,但在无材料或探针场景下容易生成虚构实体引用。代码执行 25.00 分与材料约束 93.30 分的反差,可能源于代码任务需要精确执行而非文本匹配,模型在生成可运行代码时容易出现语法或逻辑错误。

对使用者的含义

对依赖代码执行的团队,GLM-4.6 当前 25.00 分意味着实际部署中需要额外人工校验或后处理,增加开发成本。对材料忠实度敏感的场景,如合同审查、研究报告生成,93.30 分提供一定保障,但诚信 fail 要求必须增加人工核验来源的环节,避免引用不存在的文献或数据。

战略判断

GLM-4.6 的诚信 fail 是独立于材料约束的负面信号,历史 7 次 run 中已出现 3 次 fail,表明该问题并非单次波动。下一期 Smoke 快测需重点验证探针得分是否回升至 pass 区间,以及代码执行是否能稳定超过 50 分,否则该模型在需要高可信度的生产环境中将被进一步低估。


数据来源:赢政指数 (YZ Index) | Run #243 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!