跳到主要内容
YZ Index

AI模型本周升降榜

机器跑分 · 机器算变化 · 每周自动更新

基准: Run #303 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-31 05:05 SGT 当前: Run #313 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-09-07 05:06 SGT

主变化 综合实力 core_overall

GPT-5.5 +3.0
76.1 → 79.1
Gemini 3.1 Pro +2.7
66.6 → 69.3
Claude Opus 4.7 +1.8
80.9 → 82.6
GPT-o3 +1.6
80.2 → 81.7
DeepSeek V4 Pro +1.4
70.3 → 71.6
Gemini 2.5 Pro +1.3
71.9 → 73.2
Grok 4 -4.4
81.6 → 77.2
豆包 Pro -4.1
79.8 → 75.7
GLM-4.6 -2.5
66.5 → 64.0
Qwen3 Max -1.3
72.9 → 71.6
1 个模型表现稳定
Claude Sonnet 4.6 (74.7)

侧榜变化 判断力 / 表达力

豆包 Pro +5.1
判断力: 84.9 → 90.0
Grok 4 +3.9
判断力: 59.3 → 63.2
GPT-o3 +1.9
判断力: 80.7 → 82.6
Qwen3 Max +0.6
判断力: 41.1 → 41.7
GLM-4.6 -26.9
判断力: 50.0 → 23.1
Claude Opus 4.7 -12.1
表达力: 87.4 → 75.3
Grok 4 -11.9
表达力: 83.3 → 71.4
Gemini 2.5 Pro -9.0
判断力: 67.9 → 58.9
DeepSeek V4 Pro -5.0
判断力: 77.8 → 72.8
Claude Sonnet 4.6 -3.7
表达力: 80.4 → 76.7
Claude Sonnet 4.6 -3.3
判断力: 87.1 → 83.8
GPT-o3 -2.5
表达力: 80.8 → 78.3
Claude Opus 4.7 -2.0
判断力: 84.5 → 82.5

诚信评级变化 integrity_label 转变

GLM-4.6 诚信恢复
⚠ warn✔ pass

运行信号变化 稳定性 / 可用性 / 性价比

GLM-4.6 +8.4
稳定性: 30.5 → 38.9
GPT-5.5 +6.5
稳定性: 34.2 → 40.7
Gemini 3.1 Pro +3.7
稳定性: 20.5 → 24.2
Claude Opus 4.7 +2.8
稳定性: 37.7 → 40.5
Gemini 2.5 Pro +1.9
可用性: 89.0 → 90.9
Qwen3 Max +1.8
稳定性: 21.8 → 23.6
豆包 Pro +1.3
稳定性: 41.6 → 42.9
豆包 Pro +1.0
可用性: 97.9 → 98.9
Gemini 3.1 Pro +1.0
性价比: 23.2 → 24.2
GPT-o3 +1.0
可用性: 97.0 → 98.0
DeepSeek V4 Pro +0.8
可用性: 85.7 → 86.5
GPT-5.5 +0.7
性价比: 18.7 → 19.4
DeepSeek V4 Pro +0.4
稳定性: 43.9 → 44.3
DeepSeek V4 Pro +0.4
性价比: 43.2 → 43.6
GPT-o3 +0.4
稳定性: 36.9 → 37.3
GLM-4.6 -9.2
可用性: 76.7 → 67.5
Gemini 2.5 Pro -2.8
稳定性: 35.2 → 32.4
GLM-4.6 -0.9
性价比: 39.4 → 38.5

查看旧版维度变化(v5 向后兼容数据)
6 上升
5 下降
0 稳定
11 模型

本周上升

本周下降