GPT-5.5 Smoke评测主榜暴跌12.5分 代码执行单日跌28分

GPT-5.5在今日Smoke评测中主榜得分从91.32分降至78.80分,降幅12.5分,主要由代码执行维度从100.00分跌至72.00分导致。

得分变化拆解

代码执行维度单日下降28分,材料约束维度从80.70分升至87.10分,工程判断维度维持100.00分不变,任务表达维度从87.50分升至100.00分。诚信评级保持pass。Smoke评测每日仅2题/维度,共10题,单日波动属正常范围。

可能成因分析

代码执行维度2题得分拉低整体,材料约束与任务表达维度得分上升,说明模型在不同题目类型上的表现差异明显。题目抽签随机性是首要解释:当2道代码执行题目涉及复杂多步推理或边缘用例时,模型输出易出现执行错误,导致该维度分数大幅下滑。材料约束维度得分上升,显示模型在引用约束方面的表现未同步退化。

真实能力退化的可能性较低。工程判断维度保持满分,任务表达维度提升12.5分,表明模型在侧榜能力上未出现系统性下降。若为真实退化,通常会伴随多个维度同步走低,而非单一维度极端波动。

对使用者的含义

重度依赖代码执行的开发者团队需提高警惕。Smoke评测中代码执行2题失分,意味着在生成可运行脚本或处理多文件交互场景时,模型输出稳定性可能出现间歇性下降。材料约束维度得分回升,对需要严格引用来源的文档生成场景影响较小。

对选型企业而言,GPT-5.5在工程判断维度持续满分,适合需要高一致性判断的任务。任务表达维度升至100.00分,适合生成结构化输出或多轮对话的场景。

战略判断

本次主榜下跌主要反映单日题目抽签波动,而非模型能力系统性退化。代码执行维度28分跌幅超出日常波动区间,建议下一期Smoke评测继续追踪该维度得分。若连续两日代码执行得分低于85分,则需启动更长周期的10题以上评测验证真实稳定性。

当前数据不支持将GPT-5.5整体能力下调判断。材料约束与任务表达维度的同步上升,显示模型在约束遵循和表达清晰度上仍有优势。开发者可继续使用,但对代码执行密集场景应增加人工复核环节。


数据来源:赢政指数 (YZ Index) | Run #340 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!