YZ Index
AI模型本周升降榜
机器跑分 · 机器算变化 · 每周自动更新
基准: Run #313 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-07 05:06 SGT
当前: Run #323 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-14 05:06 SGT
主变化 综合实力 core_overall
Grok 4
+2.4
77.2 → 79.6
Claude Sonnet 4.6
+2.1
74.7 → 76.8
Gemini 3.1 Pro
+1.4
69.3 → 70.7
Gemini 2.5 Pro
-7.9
73.2 → 65.3
GPT-o3
-5.1
81.7 → 76.6
豆包 Pro
-3.7
75.7 → 72.0
Claude Opus 4.7
-2.6
82.6 → 80.1
DeepSeek V4 Pro
-1.8
71.6 → 69.9
Qwen3 Max
-1.6
71.6 → 70.0
GPT-5.5
-1.3
79.1 → 77.8
侧榜变化 判断力 / 表达力
DeepSeek V4 Pro
+18.0
表达力: 58.3 → 76.3
Gemini 2.5 Pro
+17.6
判断力: 58.9 → 76.5
Gemini 2.5 Pro
+15.0
表达力: 65.8 → 80.8
Grok 4
+14.4
表达力: 71.4 → 85.8
DeepSeek V4 Pro
+10.0
判断力: 72.8 → 82.8
Gemini 3.1 Pro
+10.0
判断力: 77.8 → 87.8
Claude Sonnet 4.6
+3.7
表达力: 76.7 → 80.4
GPT-o3
+2.5
表达力: 78.3 → 80.8
豆包 Pro
-7.5
表达力: 93.3 → 85.8
Qwen3 Max
-5.5
表达力: 53.3 → 47.8
Claude Sonnet 4.6
-4.0
判断力: 83.8 → 79.8
Grok 4
-2.9
判断力: 63.2 → 60.3
Claude Opus 4.7
-2.5
表达力: 75.3 → 72.8
Qwen3 Max
-1.1
判断力: 41.7 → 40.6
运行信号变化 稳定性 / 可用性 / 性价比
GLM-4.6
+36.1
稳定性: 38.9 → 75.0
DeepSeek V4 Pro
+4.1
可用性: 86.5 → 90.6
Gemini 3.1 Pro
+1.9
稳定性: 24.2 → 26.1
Claude Sonnet 4.6
+1.1
稳定性: 31.9 → 33.0
Gemini 2.5 Pro
+1.1
可用性: 90.9 → 92.0
GLM-4.6
-67.5
可用性: 67.5 → 0.0
GLM-4.6
-38.5
性价比: 38.5 → 0.0
豆包 Pro
-8.2
稳定性: 42.9 → 34.7
Claude Opus 4.7
-5.6
稳定性: 40.5 → 34.9
GPT-o3
-5.2
稳定性: 37.3 → 32.1
GPT-5.5
-4.8
稳定性: 40.7 → 35.9
Gemini 2.5 Pro
-3.5
稳定性: 32.4 → 28.9
DeepSeek V4 Pro
-2.9
稳定性: 44.3 → 41.4
Gemini 2.5 Pro
-1.9
性价比: 36.5 → 34.6
DeepSeek V4 Pro
-1.7
性价比: 43.6 → 41.9
豆包 Pro
-1.6
性价比: 94.8 → 93.2
Grok 4
-1.5
稳定性: 31.2 → 29.7
Qwen3 Max
-1.5
性价比: 47.0 → 45.5
豆包 Pro
-1.0
可用性: 98.9 → 97.9
Qwen3 Max
-1.0
稳定性: 23.6 → 22.6
GPT-5.5
-0.6
性价比: 19.4 → 18.8
GPT-o3
-0.5
性价比: 9.7 → 9.2
查看旧版维度变化(v5 向后兼容数据)
3
上升
8
下降
0
稳定
11
模型
本周上升
本周下降
GPT-o3
-12.5
GPT-o3:任务表达 -12.5
communication_raw
Claude Opus 4.7
-9.8
Claude Opus 4.7:代码执行 -9.8
execution_raw
Qwen3 Max
-8
Qwen3 Max:任务表达 -8
communication_raw
Gemini 2.5 Pro
-7.8
Gemini 2.5 Pro:工程判断 -7.8
judgment_raw
豆包 Pro
-7.7
豆包 Pro:代码执行 -7.7
execution_raw
GPT-5.5
-7.2
GPT-5.5:材料约束 -7.2
grounding_raw
Grok 4
-4.8
Grok 4:代码执行 -4.8
execution_raw
Gemini 3.1 Pro
-4.1
Gemini 3.1 Pro:工程判断 -4.1
judgment_raw