GPT-5.5在今日Smoke评测中主榜得分从91.32分降至78.80分,降幅12.5分,主要由代码执行维度从100.00分跌至72.00分导致。
得分变化拆解
代码执行维度单日下降28分,材料约束维度从80.70分升至87.10分,工程判断维度维持100.00分不变,任务表达维度从87.50分升至100.00分。诚信评级保持pass。Smoke评测每日仅2题/维度,共10题,单日波动属正常范围。
可能成因分析
代码执行维度2题得分拉低整体,材料约束与任务表达维度得分上升,说明模型在不同题目类型上的表现差异明显。题目抽签随机性是首要解释:当2道代码执行题目涉及复杂多步推理或边缘用例时,模型输出易出现执行错误,导致该维度分数大幅下滑。材料约束维度得分上升,显示模型在引用约束方面的表现未同步退化。
真实能力退化的可能性较低。工程判断维度保持满分,任务表达维度提升12.5分,表明模型在侧榜能力上未出现系统性下降。若为真实退化,通常会伴随多个维度同步走低,而非单一维度极端波动。
对使用者的含义
重度依赖代码执行的开发者团队需提高警惕。Smoke评测中代码执行2题失分,意味着在生成可运行脚本或处理多文件交互场景时,模型输出稳定性可能出现间歇性下降。材料约束维度得分回升,对需要严格引用来源的文档生成场景影响较小。
对选型企业而言,GPT-5.5在工程判断维度持续满分,适合需要高一致性判断的任务。任务表达维度升至100.00分,适合生成结构化输出或多轮对话的场景。
战略判断
本次主榜下跌主要反映单日题目抽签波动,而非模型能力系统性退化。代码执行维度28分跌幅超出日常波动区间,建议下一期Smoke评测继续追踪该维度得分。若连续两日代码执行得分低于85分,则需启动更长周期的10题以上评测验证真实稳定性。
当前数据不支持将GPT-5.5整体能力下调判断。材料约束与任务表达维度的同步上升,显示模型在约束遵循和表达清晰度上仍有优势。开发者可继续使用,但对代码执行密集场景应增加人工复核环节。
数据来源:赢政指数 (YZ Index) | Run #340 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接