GPT-5.5 Smoke评测主榜暴跌9.1分 材料约束单日掉16.5

GPT-5.5在今日Smoke评测中主榜得分从95.01降至85.93,下降9.1分。

得分明细与核心驱动因素

代码执行从100.00降至97.00,下降3分;材料约束从88.90降至72.40,下降16.5分。工程判断从75.00升至100.00,上升25分;任务表达保持90.00不变。主榜仅包含代码执行与材料约束两个维度,材料约束16.5分的跌幅直接造成主榜9.1分净损失。

题目抽签波动还是模型真实退化

Smoke评测每日仅10题,2题/维度,单日波动本属正常。材料约束失分集中,而工程判断同时大幅上升,说明当日抽到的材料约束题目可能难度更高、约束更严,工程判断题目则相对宽松。这种跨维度反向波动更符合题目抽签随机性,而非模型能力整体退化。代码执行仅降3分,幅度有限,进一步支持波动解释。

对使用者的具体含义

重材料约束的场景(如长文档事实核对、引用生成、企业知识库问答)需提高警惕,今日72.40分已低于昨日88.90分,单日可用性出现明显下滑。依赖代码执行的团队受影响较小,97.00分仍属高位。工程判断100.00分虽高,但属于侧榜(AI辅助评估),不直接影响主榜排名。

战略判断

材料约束单日16.5分跌幅已超过正常波动阈值,值得下期继续追踪。若下期材料约束回升至85分以上,则可判定为抽签波动;若持续低于80分,则需考虑模型在该维度的真实稳定性下降。当前数据不支持“模型整体退化”结论,仅支持“材料约束维度出现异常波动”的判断。

诚信评级维持pass,未触发准入门槛问题。稳定性维度未在本期数据中提供,无法直接评估一致性。


数据来源:赢政指数 (YZ Index) | Run #298 | 查看原始数据

本文来自 Winzheng Index 博客,赢政天下(winzheng.com)进行了全文翻译。 点击这里查看原文 如果转载中文,请注明出处,谢谢支持!