跳到主要内容
YZ Index

AI模型本周升降榜

机器跑分 · 机器算变化 · 每周自动更新

基准: Run #259 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-03 05:03 SGT 当前: Run #273 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-08-10 05:05 SGT

主变化 综合实力 core_overall

Claude Opus 4.7 +4.9
82.6 → 87.5
GLM-4.6 +2.9
53.1 → 56.1
Grok 4 +2.8
76.4 → 79.2
GPT-o3 +2.2
76.7 → 78.9
Gemini 2.5 Pro -6.8
70.0 → 63.2
Qwen3 Max -3.9
71.5 → 67.6
Gemini 3.1 Pro -3.8
70.8 → 66.9
Claude Sonnet 4.6 -2.1
72.9 → 70.8
2 个模型表现稳定
DeepSeek V4 Pro (78.8) GPT-5.5 (75.9)

侧榜变化 判断力 / 表达力

Claude Opus 4.7 +15.0
表达力: 70.3 → 85.3
Gemini 2.5 Pro +10.0
表达力: 65.8 → 75.8
Gemini 2.5 Pro +4.9
判断力: 67.9 → 72.8
Qwen3 Max +2.5
表达力: 47.8 → 50.3
Claude Sonnet 4.6 +1.2
判断力: 82.5 → 83.7
Claude Opus 4.7 +1.1
判断力: 85.0 → 86.1
DeepSeek V4 Pro +0.8
判断力: 84.9 → 85.7
GLM-4.6 -33.6
判断力: 55.0 → 21.4
GLM-4.6 -12.5
表达力: 50.0 → 37.5
Grok 4 -12.2
判断力: 71.4 → 59.2
Gemini 3.1 Pro -7.2
判断力: 80.0 → 72.8
GPT-o3 -4.4
判断力: 85.7 → 81.3
Grok 4 -2.3
表达力: 80.8 → 78.5
GPT-5.5 -2.2
判断力: 90.0 → 87.8

诚信评级变化 integrity_label 转变

GLM-4.6 诚信警告
✔ pass⚠ warn

运行信号变化 稳定性 / 可用性 / 性价比

豆包 Pro +36.1
稳定性: 38.9 → 75.0
Claude Opus 4.7 +9.0
稳定性: 36.4 → 45.4
GPT-o3 +2.1
稳定性: 34.0 → 36.1
DeepSeek V4 Pro +2.0
可用性: 97.0 → 99.0
GLM-4.6 +1.1
性价比: 31.6 → 32.7
Claude Opus 4.7 +0.4
性价比: 5.5 → 5.9
豆包 Pro -81.5
性价比: 81.5 → 0.0
豆包 Pro -69.0
可用性: 69.0 → 0.0
GLM-4.6 -7.5
稳定性: 31.7 → 24.2
Gemini 2.5 Pro -3.6
稳定性: 34.8 → 31.2
Gemini 3.1 Pro -3.2
稳定性: 23.4 → 20.2
DeepSeek V4 Pro -2.8
稳定性: 40.2 → 37.4
Claude Sonnet 4.6 -2.6
稳定性: 32.2 → 29.6
GLM-4.6 -2.4
可用性: 69.5 → 67.1
Gemini 2.5 Pro -1.7
性价比: 35.6 → 33.9
Qwen3 Max -1.7
性价比: 46.0 → 44.3
Gemini 3.1 Pro -1.5
性价比: 24.3 → 22.8
Grok 4 -0.6
稳定性: 29.4 → 28.8

查看旧版维度变化(v5 向后兼容数据)
4 上升
7 下降
0 稳定
11 模型

本周上升

本周下降