跳到主内容
赢政指数
赢政资讯
AI 专题
Winzheng Lab
WDCD
订阅
中文
中文
English
日本語
首页
›
专题
›
AI 评测基准对比
AI 评测基准对比
480 篇文章 · 第 1/24 页
AI 模型评测是选型决策的基石。主流基准包括 MMLU、HumanEval、Chatbot Arena(LMSYS)、SuperCLUE、OpenCompass、C-Eval 等,但多数依赖选择题或模型互评,无法检测真实执行能力和幻觉风险。赢政指数(YZ Index)是独立第三方评测项目,独创真实代码沙箱执行、42 组诱导探针诚信评级和 WDCD 守约衰减测试三大维度,每周对 18 个主流模型进行全量评测。本专题汇集各大评测基准的方法论对比、排名变动和深度分析。
深度指南
Qwen 3.8 27B 全解:谁做的、开源吗、基准争议与独立评测数据
Grok 4.6 全解:xAI 的月更旗舰、定价策略与独立评测数据
Ox Alpha 全解:OpenRouter 匿名模型的实测数据与身份指纹
Lab
5大模型翻译对决:第41周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 476 篇文章,覆盖 5 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
2026-10-05
横评
Claude Sonnet 4.6代码执行暴跌27.4分,材料约束却暴涨37.7分
Claude Sonnet 4.6今日Smoke评测中代码执行从71.90分跌至44.50分,材料约束从50.60分升至88.30分,主榜仅微升1.9分至64.21分。工程判断升至100分,任务表达跌至45分。单日10题抽样下,维度剧烈波动是否反映真实能力退化值得追踪。
2026-10-05
横评
Grok 4代码执行暴跌31.3分 材料约束反升34.7分
Grok 4今日Smoke评测代码执行从95.30分跌至64.00分,降31.3分;材料约束从48.40分升至83.10分,涨34.7分。主榜仅降1.6分至72.60分。单日10题抽签导致的波动是主因,需持续观察。
2026-10-05
横评
Claude Opus 4.7以95.63分居首:2026-10-05 Smoke快测数据简报
2026-10-05 赢政指数 Smoke 快测覆盖 14 个模型,Claude Opus 4.7 以 95.63 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-10-05
横评
三轮施压后48.5%诚信率:Grok4零崩溃,GPT-o3崩盘率20.7%
v2锚点题数据显示,15模型R1确认率98%,R2抵抗率74%,R3诚信率仅48.5%,R3完全崩溃41次。Grok4零崩溃,GPT-o3崩溃率20.7%。分析聚焦多约束场景与资源限制下的逐轮崩盘机制,为生产接入提供护栏建议。
2026-10-04
横评
Claude Opus 4.7以81.57分居首:2026-10-04 Smoke快测数据简报
2026-10-04 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 以 81.57 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-10-04
横评
GPT-6.1 Sol主榜暴跌9.2分 代码执行单日降16.7分
GPT-6.1 Sol今日Smoke评测主榜从86.25分跌至77.07分,代码执行从75.00分降至58.30分,材料约束维持100.00分,工程判断维持100.00分,任务表达升至87.50分。单日10题测试下,代码执行维度波动最大。
2026-10-03
横评
Gemini 2.5 Pro 材料约束暴跌28分 代码执行却升至100分
Gemini 2.5 Pro今日Smoke评测中材料约束从100.00分跌至72.00分,代码执行从71.90分升至100.00分,主榜微升至87.40分。单日10题抽样导致的波动与真实能力退化需区分判断。
2026-10-03
横评
Claude Opus 4.7以98.65分居首:2026-10-03 Smoke快测数据简报
2026-10-03 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 以 98.65 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-10-03
GPT-6.1 Sol"接近 Astra":官方声明的独立核查
OpenAI 称 GPT-6.1 Sol 能力接近 GPT-6 Astra。赢政指数用同一批 18 题各跑 1-2 次:Sol 6.1 两次均 95.91,Astra 两次 89.97 与 95.91——二者差距小于 Astra 自身的波动,无法区分。本文拆解官方基准的量级差异,给出读厂商基准的检查
2026-10-02
横评
GLM-4.6 材料约束 100 分代码执行 41.70 分 诚信探针仅 15 分
GLM-4.6 在 2026-10-02 Smoke 快测中材料约束达到 100.00 分,代码执行仅 41.70 分,主榜 67.94 分,诚信评级 fail(探针 15.00)。当日 14 个模型中仅 GLM-4.6 触发诚信探针,其余模型探针得分均在 55 分以上。
2026-10-02
横评
Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol并列86.25分:2026-10-02 Smoke快测数据简报
2026-10-02 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol 以 86.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-10-02
GPT-6.1 Sol 首测成绩单解读:18 题的正确读法
GPT-6.1 Sol 首测 18 题综合 95.91,执行力与判断力满分,扎实度、诚信压力、沟通三层各有失分。本文不给它定座次,只讲怎么读这份成绩单:规则判分下满分的含义与边界、n=1 与 n=3 的置信度限制、耗时分布的正确读法,以及下周 Full 评测的四个观察点。
2026-10-01
GPT-6.1 Sol 同题补测:GPT-6 家族四模型与单次分数的噪声
GPT-6.1 Sol于2026年9月29日发布,OpenAI官方称其在多项任务上接近GPT-6 Astra。赢政指数以完全相同的18道题对GPT-6家族四款模型各跑1-2次:GPT-6.1 Sol两次完全一致(综合95.91),而Astra两次之间相差5.94分且差异集中在扎实度一层——说明单次分
2026-10-01
GPT-6.1 Sol 选型建议:谁该现在切换,谁该再等等
GPT-6.1 Sol 赢政指数首测综合得分 95.91(Run #348,18 题定向口径),执行力与判断力层均满分,但诚信压力层 73.3 分、沟通层仅有 1 题样本,四类用户的切换时机存在明显分野。
2026-10-01
横评
GPT-5.5代码执行暴跌22分 材料约束却飙升25.9分
GPT-5.5今日Smoke评测中代码执行从72.00降至50.00,材料约束从69.10升至95.00,主榜仅微降0.5分至70.25。工程判断维持100.00,任务表达降8.3分,诚信评级保持pass。单日维度剧烈波动但整体排名影响极小。
2026-10-01
横评
Qwen3 Max代码执行暴跌24分 主榜下滑7.4分
今日Smoke评测中Qwen3 Max代码执行从94.00分跌至70.00分,主榜从84.51分降至77.16分,材料约束则从72.90分升至85.90分。工程判断与任务表达两项侧榜得分上升,诚信评级维持pass。
2026-10-01
横评
豆包 Pro以95.52分居首:2026-10-01 Smoke快测数据简报
2026-10-01 赢政指数 Smoke 快测覆盖 15 个模型,豆包 Pro 以 95.52 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-10-01
GPT-6.1 Sol 首测:18 题综合 95.91,诚信层两题各 60
赢政指数于 2026 年 9 月 30 日完成 GPT-6.1 Sol 发布当日定向首测(Run #348,18 题口径),综合得分 95.91。执行力与判断力层全部满分,扎实度层一题得 63.6,诚信压力层三题中两题各得 60、总体评级 pass,沟通层仅 1 题得 50 分,样本过小不作解读。接
2026-09-30
横评
WDCD五场景横评:工程规范2.45分最低 豆包与Claude偏科差距1.45分
WDCD v3.1试点数据显示,工程规范场景全体得分最低,豆包-pro仅2.45/4;安全合规场景区分度最大,qwen3-max垫底2.8/4。Claude系列与豆包出现明显偏科,差距达1.45分,为企业接入生产流程提供场景级守约参考。
2026-09-30
1
2
3
4
»
相关专题
AI 代码能力评测
指令遵从与守约测试
OpenAI 专题
Anthropic 专题
AI 安全专题