跳到主要内容
YZ Index

AI模型本周升降榜

机器跑分 · 机器算变化 · 每周自动更新

基准: Run #282 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-17 05:04 SGT 当前: Run #293 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-24 05:05 SGT

主变化 综合实力 core_overall

Gemini 3.1 Pro +3.3
66.7 → 70.0
Qwen3 Max +0.7
73.3 → 74.0
GLM-4.6 -11.3
64.5 → 53.3
Grok 4 -6.1
80.1 → 74.0
GPT-5.5 -4.1
80.6 → 76.5
DeepSeek V4 Pro -3.3
70.8 → 67.5
Claude Opus 4.7 -3.2
85.8 → 82.6
Claude Sonnet 4.6 -2.6
80.1 → 77.5
GPT-o3 -1.6
79.8 → 78.1
豆包 Pro -1.4
79.7 → 78.3
1 个模型表现稳定
Gemini 2.5 Pro (71.3)

侧榜变化 判断力 / 表达力

GLM-4.6 +30.8
表达力: 37.5 → 68.3
Gemini 2.5 Pro +17.5
表达力: 68.3 → 85.8
Gemini 3.1 Pro +12.5
表达力: 63.3 → 75.8
GLM-4.6 +12.2
判断力: 26.7 → 38.9
GPT-o3 +10.0
表达力: 80.8 → 90.8
Claude Sonnet 4.6 +5.6
判断力: 77.6 → 83.2
GPT-o3 +3.3
判断力: 79.5 → 82.8
GPT-5.5 +2.2
判断力: 87.8 → 90.0
Claude Opus 4.7 +1.7
判断力: 83.3 → 85.0
Gemini 2.5 Pro +1.1
判断力: 66.8 → 67.9
Grok 4 -20.0
判断力: 80.3 → 60.3
Grok 4 -17.5
表达力: 88.3 → 70.8
DeepSeek V4 Pro -14.7
判断力: 77.9 → 63.2
DeepSeek V4 Pro -10.0
表达力: 68.3 → 58.3
Claude Sonnet 4.6 -9.9
表达力: 89.9 → 80.0
Gemini 3.1 Pro -2.8
判断力: 77.8 → 75.0
Qwen3 Max -2.5
表达力: 47.8 → 45.3
豆包 Pro -2.2
判断力: 88.9 → 86.7
Qwen3 Max -1.1
判断力: 41.7 → 40.6

运行信号变化 稳定性 / 可用性 / 性价比

Gemini 2.5 Pro +5.1
稳定性: 35.6 → 40.7
GLM-4.6 +4.6
稳定性: 35.2 → 39.8
Qwen3 Max +3.7
稳定性: 22.1 → 25.8
Gemini 3.1 Pro +3.6
稳定性: 20.2 → 23.8
豆包 Pro +3.0
可用性: 97.0 → 100.0
GPT-o3 +2.0
可用性: 97.0 → 99.0
Gemini 2.5 Pro +1.0
可用性: 90.0 → 91.0
Gemini 3.1 Pro +0.9
性价比: 23.0 → 23.9
Gemini 2.5 Pro +0.5
性价比: 36.3 → 36.8
豆包 Pro +0.4
性价比: 94.1 → 94.5
Grok 4 -11.2
稳定性: 39.4 → 28.2
DeepSeek V4 Pro -6.0
可用性: 88.0 → 82.0
豆包 Pro -4.0
稳定性: 48.2 → 44.2
DeepSeek V4 Pro -3.8
稳定性: 47.9 → 44.1
GLM-4.6 -3.8
可用性: 66.3 → 62.5
Claude Opus 4.7 -3.1
稳定性: 44.4 → 41.3
GPT-5.5 -3.0
稳定性: 40.7 → 37.7
Claude Sonnet 4.6 -2.9
稳定性: 38.5 → 35.6
Grok 4 -2.8
性价比: 26.1 → 23.3
DeepSeek V4 Pro -2.1
性价比: 43.0 → 40.9
GLM-4.6 -1.9
性价比: 37.7 → 35.8
GPT-5.5 -0.6
性价比: 19.3 → 18.7
Claude Sonnet 4.6 -0.5
性价比: 26.3 → 25.8

查看旧版维度变化(v5 向后兼容数据)
4 上升
7 下降
0 稳定
11 模型

本周上升

本周下降