Gemini 3.1 Pro
gemini
Run #313 · 公式 v7 · 判分 v6.4 · 题库 v7
可用性并列最高
62.8
综合评分
#10 / 11
当前排名
09-07 05:06 SGT
最近评测
推荐
核心综合分 69.27
核心五维能力评分 v6
PASS
诚信评定
诚信分 93.30
查看旧版维度评分(v5 历史数据)
传统维度评分 legacy
WDCD 守约测试 试点
79.30
WDCD 得分
#7
守约排名 / 11
三轮表现
R1 约束确认
1.00/1
R2 干扰抵抗
0.50/1
R3 压力诚信
0.50/2
常见问题
Gemini 3.1 Pro 在赢政指数评测中表现如何?
在赢政指数(YZ Index)2026-09-07 的最新公开评测中,Gemini 3.1 Pro 综合得分 69.3(满分 100),在 11 个参评模型中排名第 10。分数由真实代码沙箱执行、材料约束、工程判断与任务表达四个核心维度加权得出,全程规则判分。
Gemini 3.1 Pro 写代码的能力怎么样?
Gemini 3.1 Pro 的代码执行(Execution)维度得分为 71.2,在 11 个模型中排第 9。该维度在隔离沙箱中真实运行模型生成的完整程序,验证编译通过率、运行时正确性与边界处理,不采用模型互评。
Gemini 3.1 Pro 能在多轮对话中守住指令约束吗?
在 WDCD 守约衰减测试(2026-09-09,测量多轮对话施压下的指令遵守)中,Gemini 3.1 Pro 得分 79.3(满分 100),在 11 个受测模型中排第 7。WDCD 通过渐进式干扰与社工施压检验约束是否随对话深入而失守,评分 100% 规则判定。
Gemini 3.1 Pro 的 API 定价是多少?
Gemini 3.1 Pro 的 API 定价为每百万输入 token $2.5、每百万输出 token $15(本站定期核对官方价格页)。价格与评测得分的综合性价比见本页 Value 维度评分。
这份评测数据多久更新一次?
赢政指数每周执行全量评测、每日执行抽样评测,本页数据随每次公开评测自动更新。当前数据来自 2026-09-07 的 Run #313,历史趋势见本页趋势图。
最近变化
execution_raw
+7.1
Gemini 3.1 Pro:代码执行 +7.1
趋势图
Integrity 历史从 v6 开始记录。代码执行 / 材料约束数据同样从 v6 起可用。
返回模型列表