YZ Index
AI模型本周升降榜
机器跑分 · 机器算变化 · 每周自动更新
基准: Run #216 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-07-06 08:00 SGT
当前: Run #230 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-07-13 04:59 SGT
主变化 综合实力 core_overall
Gemini 3.1 Pro
+4.8
69.3 → 74.1
豆包 Pro
+3.9
74.3 → 78.2
Grok 4
+1.8
80.4 → 82.2
Claude Opus 4.7
-5.2
88.2 → 83.0
Claude Sonnet 4.6
-5.0
79.5 → 74.5
GLM-4.6
-3.6
63.4 → 59.8
Qwen3 Max
-3.1
72.1 → 69.0
Gemini 2.5 Pro
-2.9
75.8 → 72.8
GPT-o3
-1.8
78.9 → 77.1
DeepSeek V4 Pro
-1.1
81.7 → 80.6
1 个模型表现稳定
GPT-5.5 (78.8)
侧榜变化 判断力 / 表达力
Qwen3 Max
+8.0
表达力: 47.8 → 55.8
Claude Sonnet 4.6
+6.1
判断力: 85.4 → 91.5
Grok 4
+5.5
判断力: 64.2 → 69.7
Gemini 3.1 Pro
+5.0
判断力: 72.8 → 77.8
GPT-5.5
+2.2
判断力: 87.8 → 90.0
DeepSeek V4 Pro
+2.1
表达力: 93.3 → 95.4
GLM-4.6
-23.8
判断力: 68.8 → 45.0
Claude Sonnet 4.6
-4.6
表达力: 85.0 → 80.4
GLM-4.6
-4.2
表达力: 72.5 → 68.3
Claude Opus 4.7
-2.9
表达力: 67.8 → 64.9
Gemini 2.5 Pro
-2.5
表达力: 68.3 → 65.8
Gemini 2.5 Pro
-2.2
判断力: 70.7 → 68.5
Claude Opus 4.7
-1.7
判断力: 83.9 → 82.2
DeepSeek V4 Pro
-1.6
判断力: 85.7 → 84.1
GPT-o3
-0.8
判断力: 86.7 → 85.9
诚信评级变化 integrity_label 转变
GLM-4.6
诚信警告
✔ pass →
⚠ warn
运行信号变化 稳定性 / 可用性 / 性价比
Gemini 3.1 Pro
+6.7
稳定性: 22.3 → 29.0
豆包 Pro
+5.0
可用性: 95.0 → 100.0
DeepSeek V4 Pro
+2.0
可用性: 96.0 → 98.0
Grok 4
+2.0
稳定性: 30.1 → 32.1
Gemini 3.1 Pro
+1.7
性价比: 23.7 → 25.4
Grok 4
+1.1
性价比: 25.2 → 26.3
豆包 Pro
+1.0
性价比: 92.8 → 93.8
Gemini 2.5 Pro
+0.9
可用性: 94.0 → 94.9
DeepSeek V4 Pro
+0.5
性价比: 45.3 → 45.8
GLM-4.6
-12.3
可用性: 83.0 → 70.7
豆包 Pro
-6.4
稳定性: 43.0 → 36.6
GLM-4.6
-6.3
稳定性: 36.1 → 29.8
DeepSeek V4 Pro
-6.1
稳定性: 49.5 → 43.4
Claude Opus 4.7
-5.9
稳定性: 44.4 → 38.5
GLM-4.6
-4.5
性价比: 37.0 → 32.5
Claude Sonnet 4.6
-4.2
稳定性: 34.3 → 30.1
Gemini 2.5 Pro
-4.0
稳定性: 34.3 → 30.3
GPT-o3
-1.8
稳定性: 36.4 → 34.6
Qwen3 Max
-1.8
稳定性: 23.6 → 21.8
Gemini 2.5 Pro
-0.8
性价比: 38.0 → 37.2
Claude Sonnet 4.6
-0.6
性价比: 26.3 → 25.7
Qwen3 Max
-0.6
性价比: 46.5 → 45.9
查看旧版维度变化(v5 向后兼容数据)
1
上升
10
下降
0
稳定
11
模型
本周上升
本周下降
GPT-5.5
-30.2
GPT-5.5:代码执行 -30.2
execution_raw
文心一言 4.5
-15
文心一言 4.5:代码执行 -15
execution_raw
Qwen3 Max
-14.3
Qwen3 Max:代码执行 -14.3
execution_raw
GPT-o3
-13.9
GPT-o3:代码执行 -13.9
execution_raw
豆包 Pro
-11.4
豆包 Pro:代码执行 -11.4
execution_raw
Grok 4
-9.7
Grok 4:任务表达 -9.7
communication_raw
Gemini 2.5 Pro
-8.9
Gemini 2.5 Pro:代码执行 -8.9
execution_raw
Claude Sonnet 4.6
-8.8
Claude Sonnet 4.6:任务表达 -8.8
communication_raw
DeepSeek V4 Pro
-6.1
DeepSeek V4 Pro:代码执行 -6.1
execution_raw
Claude Opus 4.7
-1.4
Claude Opus 4.7:代码执行 -1.4
execution_raw