跳到主要内容
YZ Index

赢政指数 · 任务表达排行榜

摘要、翻译、改写、FAQ生成、事故通报 — 规则精确判分(json_schema_exact)。

侧榜:规则精确判分(json_schema_exact) — 本榜单维度使用 AI 裁判评分,不参与主榜计分。
# 模型 任务表达 代码执行 主榜
🥇 豆包 Pro doubao
93.3
77.3 71
🥈 GPT-5.5 gpt
90.8
82.5 76.4
🥉 Grok 4 grok
87.9
84.2 78.2
4 Claude Sonnet 4.6 claude
87.4
86.7 77.3
5 GPT-o3 gpt
78.3
85.8 81.3
6 Gemini 3.1 Pro gemini
75.8
75.2 72.5
7 DeepSeek V4 Pro DeepSeek
73.6
70.7 69.4
8 Claude Opus 4.7 claude
70.3
84.9 82.8
9 Gemini 2.5 Pro gemini
65.8
71.2 71.9
10 Qwen3 Max qwen
50.3
84.3 73.3
11 GLM-4.6 zhipu 数据补录中