Gemini 3.1 Pro 在今日 Smoke 评测中主榜得分从 80.99 分跌至 72.50 分,降幅达到 8.5 分。
核心维度得分变化
代码执行维度从昨日 75.00 分降至今日 50.00 分,降幅 25 分;材料约束维度则从 88.30 分升至 100.00 分,增幅 11.7 分。工程判断(侧榜,AI 辅助评估)从 100.00 分降至 75.00 分,任务表达(侧榜,AI 辅助评估)从 76.70 分降至 66.70 分。诚信评级维持 pass。
波动成因分析
Smoke 评测每日仅 10 题,每维度 2 题,样本量极小。代码执行维度单日 25 分跌幅,最可能源于抽签题目难度上升或模型在特定代码场景下输出不一致。材料约束维度同时升至满分,说明模型在引用约束方面的表现并未系统性退化,两维度反向变动指向题目抽签波动而非模型整体能力退化。
工程判断(侧榜,AI 辅助评估)与任务表达(侧榜,AI 辅助评估)同步下滑,反映模型在需要工程权衡与任务表述的题目上得分波动加大。稳定性维度公式 max(0, 100-stddev×2) 已提示该模型同类题目得分标准差较大,此次单日多维度波动与稳定性 31.7 分的信号一致。
对使用者的具体含义
重代码执行的团队在选用 Gemini 3.1 Pro 时需增加冗余验证环节,单日 50.00 分意味着两道代码题可能均未达标。依赖材料忠实度的场景则可继续使用,今日 100.00 分显示约束能力仍处于高位。
需要同时调用工程判断与任务表达的混合流程,建议在生产环境增加人工复核节点,避免 75.00 分与 66.70 分带来的输出偏差。
战略判断
基于现有得分对比,Gemini 3.1 Pro 代码执行能力被单日抽签放大,真实退化证据不足,但连续两日代码执行低于 60 分则需下期重点验证。材料约束保持满分,说明该维度仍是模型相对优势。主榜 72.50 分已低于昨日,选型时应以多日平均分而非单日结果为准。
数据来源:赢政指数 (YZ Index) | Run #232 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接