Gemini 3.1 Pro在今日Smoke评测中主榜得分从昨日96.60分降至85.83分,降幅达到10.8分。
核心维度变化拆解
代码执行维度从99.30分降至91.50分,降幅7.8分。材料约束维度从93.30分降至78.90分,降幅14.4分。工程判断(侧榜,AI辅助评估)从75.00分降至50.00分,降幅25分。任务表达从85.00分升至91.70分,升幅6.7分。诚信评级维持pass。
数据事实与可能成因
Smoke评测每日仅10题,2题/维度,单日波动属于正常范围。但材料约束维度单日跌14.4分,幅度远超代码执行的7.8分,表明本次抽签题目可能集中暴露了模型在材料忠实度上的弱点。工程判断(侧榜,AI辅助评估)跌25分,进一步指向模型在需要工程权衡的场景中出现明显失误。
任务表达维度反而上升6.7分,说明模型在任务陈述清晰度上并未整体退化。这两组反向变化指向题目抽签波动而非模型真实退化。材料约束和工程判断同时大幅下滑,最可能的原因是当日题目中包含需要严格遵循材料边界或进行多因素工程取舍的案例,而Gemini 3.1 Pro在这些具体案例上未能保持昨日水平。
对使用者的含义
对重材料约束的场景,例如法律合同抽取、产品规格核对、研究文献总结,Gemini 3.1 Pro今日表现显示风险上升。开发者若将该模型用于需要高 grounding 的流水线,需增加人工校验环节或切换至材料约束更稳定的模型。
对代码执行依赖较高的团队,7.8分降幅虽小于材料约束,但仍需关注连续多日是否持续。工程判断(侧榜,AI辅助评估)跌至50分,意味着在架构决策、权衡分析类任务中,该模型当前输出可靠性降低,建议暂时避免直接用于生产决策。
战略判断
本次主榜10.8分跌幅主要由材料约束和工程判断驱动,任务表达的上升显示模型整体能力并未系统性下降。短期内可视为抽签波动,但材料约束14.4分的跌幅已达到需要跟踪的阈值。
若下期材料约束未能回升至90分以上,则需考虑Gemini 3.1 Pro在 grounding 能力上是否存在新瓶颈。当前数据支持的判断是:材料约束敏感场景应暂时降低对Gemini 3.1 Pro的依赖,代码执行场景仍可继续观察。
数据来源:赢政指数 (YZ Index) | Run #300 | 查看原始数据
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接