GPT-5.5在今日Smoke评测中代码执行得分从94.50降至72.00,降幅22.5分,同时材料约束从71.40升至100.00,升幅28.6分,主榜得分仅从84.11升至84.60。
数据事实:两个维度的剧烈反向移动
Smoke评测每日仅2题/维度,代码执行维度昨日94.50今日72.00,材料约束维度昨日71.40今日100.00。工程判断保持100.00不变,任务表达从81.70升至91.70。诚信评级维持pass。主榜加权结果仅上升0.5分。
成因分析:抽签波动概率更高
代码执行维度单日掉22.5分,最可能源于2道题目中至少1道难度或类型突变。材料约束维度同时升28.6分并达到满分,说明模型在约束遵循类题目上本次抽中较易得分题目。两个维度同时出现极端移动,且方向相反,指向题目抽签随机性,而非模型参数级退化。
若为真实退化,通常会伴随多个维度同向下降或主榜明显回落。本次主榜仅+0.5,工程判断零变化,进一步支持波动解释。
对使用者的含义
重度依赖代码执行的团队需在生产流程中增加人工校验环节,尤其在Smoke评测显示单维度波动超过20分时。材料约束满分对需要严格遵循指令的场景有利,但不能抵消代码执行不稳定带来的风险。
开发者在选型时应把代码执行维度历史标准差纳入考量,而非仅看单日得分。
战略判断
本次变化最可能由题目抽签造成,暂不需要对GPT-5.5整体能力下调结论。下一期Smoke评测若代码执行回升至90分以上,则可确认本次为孤立波动;若持续低于80分,则需启动更长周期的稳定性追踪。
目前数据不支持“模型退化”判断,建议将GPT-5.5代码执行维度视为高波动项,在关键任务中保留人工兜底。
数据来源:赢政指数 (YZ Index) | Run #317 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接