跳到主要内容
YZ Index

AI模型本周升降榜

机器跑分 · 机器算变化 · 每周自动更新

基准: Run #216 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-07-06 08:00 SGT 当前: Run #230 · 公式 v7 · 判分 v6.4 · 题库 v7 · 2026-07-13 04:59 SGT

主变化 综合实力 core_overall

Gemini 3.1 Pro +4.8
69.3 → 74.1
豆包 Pro +3.9
74.3 → 78.2
Grok 4 +1.8
80.4 → 82.2
Claude Opus 4.7 -5.2
88.2 → 83.0
Claude Sonnet 4.6 -5.0
79.5 → 74.5
GLM-4.6 -3.6
63.4 → 59.8
Qwen3 Max -3.1
72.1 → 69.0
Gemini 2.5 Pro -2.9
75.8 → 72.8
GPT-o3 -1.8
78.9 → 77.1
DeepSeek V4 Pro -1.1
81.7 → 80.6
1 个模型表现稳定
GPT-5.5 (78.8)

侧榜变化 判断力 / 表达力

Qwen3 Max +8.0
表达力: 47.8 → 55.8
Claude Sonnet 4.6 +6.1
判断力: 85.4 → 91.5
Grok 4 +5.5
判断力: 64.2 → 69.7
Gemini 3.1 Pro +5.0
判断力: 72.8 → 77.8
GPT-5.5 +2.2
判断力: 87.8 → 90.0
DeepSeek V4 Pro +2.1
表达力: 93.3 → 95.4
GLM-4.6 -23.8
判断力: 68.8 → 45.0
Claude Sonnet 4.6 -4.6
表达力: 85.0 → 80.4
GLM-4.6 -4.2
表达力: 72.5 → 68.3
Claude Opus 4.7 -2.9
表达力: 67.8 → 64.9
Gemini 2.5 Pro -2.5
表达力: 68.3 → 65.8
Gemini 2.5 Pro -2.2
判断力: 70.7 → 68.5
Claude Opus 4.7 -1.7
判断力: 83.9 → 82.2
DeepSeek V4 Pro -1.6
判断力: 85.7 → 84.1
GPT-o3 -0.8
判断力: 86.7 → 85.9

诚信评级变化 integrity_label 转变

GLM-4.6 诚信警告
✔ pass⚠ warn

运行信号变化 稳定性 / 可用性 / 性价比

Gemini 3.1 Pro +6.7
稳定性: 22.3 → 29.0
豆包 Pro +5.0
可用性: 95.0 → 100.0
DeepSeek V4 Pro +2.0
可用性: 96.0 → 98.0
Grok 4 +2.0
稳定性: 30.1 → 32.1
Gemini 3.1 Pro +1.7
性价比: 23.7 → 25.4
Grok 4 +1.1
性价比: 25.2 → 26.3
豆包 Pro +1.0
性价比: 92.8 → 93.8
Gemini 2.5 Pro +0.9
可用性: 94.0 → 94.9
DeepSeek V4 Pro +0.5
性价比: 45.3 → 45.8
GLM-4.6 -12.3
可用性: 83.0 → 70.7
豆包 Pro -6.4
稳定性: 43.0 → 36.6
GLM-4.6 -6.3
稳定性: 36.1 → 29.8
DeepSeek V4 Pro -6.1
稳定性: 49.5 → 43.4
Claude Opus 4.7 -5.9
稳定性: 44.4 → 38.5
GLM-4.6 -4.5
性价比: 37.0 → 32.5
Claude Sonnet 4.6 -4.2
稳定性: 34.3 → 30.1
Gemini 2.5 Pro -4.0
稳定性: 34.3 → 30.3
GPT-o3 -1.8
稳定性: 36.4 → 34.6
Qwen3 Max -1.8
稳定性: 23.6 → 21.8
Gemini 2.5 Pro -0.8
性价比: 38.0 → 37.2
Claude Sonnet 4.6 -0.6
性价比: 26.3 → 25.7
Qwen3 Max -0.6
性价比: 46.5 → 45.9