YZ Index
AI模型本周升降榜
机器跑分 · 机器算变化 · 每周自动更新
基准: Run #303 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-31 05:05 SGT
当前: Run #313 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-07 05:06 SGT
主变化 综合实力 core_overall
GPT-5.5
+3.0
76.1 → 79.1
Gemini 3.1 Pro
+2.7
66.6 → 69.3
Claude Opus 4.7
+1.8
80.9 → 82.6
GPT-o3
+1.6
80.2 → 81.7
DeepSeek V4 Pro
+1.4
70.3 → 71.6
Gemini 2.5 Pro
+1.3
71.9 → 73.2
Grok 4
-4.4
81.6 → 77.2
豆包 Pro
-4.1
79.8 → 75.7
GLM-4.6
-2.5
66.5 → 64.0
Qwen3 Max
-1.3
72.9 → 71.6
1 个模型表现稳定
Claude Sonnet 4.6 (74.7)
侧榜变化 判断力 / 表达力
豆包 Pro
+5.1
判断力: 84.9 → 90.0
Grok 4
+3.9
判断力: 59.3 → 63.2
GPT-o3
+1.9
判断力: 80.7 → 82.6
Qwen3 Max
+0.6
判断力: 41.1 → 41.7
GLM-4.6
-26.9
判断力: 50.0 → 23.1
Claude Opus 4.7
-12.1
表达力: 87.4 → 75.3
Grok 4
-11.9
表达力: 83.3 → 71.4
Gemini 2.5 Pro
-9.0
判断力: 67.9 → 58.9
DeepSeek V4 Pro
-5.0
判断力: 77.8 → 72.8
Claude Sonnet 4.6
-3.7
表达力: 80.4 → 76.7
Claude Sonnet 4.6
-3.3
判断力: 87.1 → 83.8
GPT-o3
-2.5
表达力: 80.8 → 78.3
Claude Opus 4.7
-2.0
判断力: 84.5 → 82.5
诚信评级变化 integrity_label 转变
GLM-4.6
诚信恢复
⚠ warn →
✔ pass
运行信号变化 稳定性 / 可用性 / 性价比
GLM-4.6
+8.4
稳定性: 30.5 → 38.9
GPT-5.5
+6.5
稳定性: 34.2 → 40.7
Gemini 3.1 Pro
+3.7
稳定性: 20.5 → 24.2
Claude Opus 4.7
+2.8
稳定性: 37.7 → 40.5
Gemini 2.5 Pro
+1.9
可用性: 89.0 → 90.9
Qwen3 Max
+1.8
稳定性: 21.8 → 23.6
豆包 Pro
+1.3
稳定性: 41.6 → 42.9
豆包 Pro
+1.0
可用性: 97.9 → 98.9
Gemini 3.1 Pro
+1.0
性价比: 23.2 → 24.2
GPT-o3
+1.0
可用性: 97.0 → 98.0
DeepSeek V4 Pro
+0.8
可用性: 85.7 → 86.5
GPT-5.5
+0.7
性价比: 18.7 → 19.4
DeepSeek V4 Pro
+0.4
稳定性: 43.9 → 44.3
DeepSeek V4 Pro
+0.4
性价比: 43.2 → 43.6
GPT-o3
+0.4
稳定性: 36.9 → 37.3
GLM-4.6
-9.2
可用性: 76.7 → 67.5
Gemini 2.5 Pro
-2.8
稳定性: 35.2 → 32.4
GLM-4.6
-0.9
性价比: 39.4 → 38.5
查看旧版维度变化(v5 向后兼容数据)
6
上升
5
下降
0
稳定
11
模型