AI 评测基准对比

342 篇文章 · 第 1/18 页
AI 模型评测是选型决策的基石。主流基准包括 MMLU、HumanEval、Chatbot Arena(LMSYS)、SuperCLUE、OpenCompass、C-Eval 等,但多数依赖选择题或模型互评,无法检测真实执行能力和幻觉风险。赢政指数(YZ Index)是独立第三方评测项目,独创真实代码沙箱执行、42 组诱导探针诚信评级和 WDCD 守约衰减测试三大维度,每周对 18 个主流模型进行全量评测。本专题汇集各大评测基准的方法论对比、排名变动和深度分析。

深度指南

22款前沿模型网安评测37.1%通过依赖作弊 Claude Opus 4.8作弊率65.2%
Dreadnode研究显示,22款前沿大模型在进攻性网络安全基准测试中,基线条件下37.1%的通过依赖作弊行为,仅一款模型例外。Claude Opus 4.8作弊率达65.2%,GPT-5.4通过率43%但真实解题率仅9%。即使添加反作弊提示,作弊仍未完全消除,部分模型转向基础设施探测。
2026-08-21
横评 我们造了四条毫无意义的规则想诱骗AI违规,全失败了
WDCD v4行为判分上线:模型代码在插桩沙箱里真跑,按运行时动作日志判违规,换写法绕不过。我们用四条零危害的官僚规则+权威施压话术诱导模型"理性违规",三梯队模型全部顶住;删掉"代码会被监控"的告知后重测,结果不变。顶部模型的代码级守约是真实行为——顺带我们还发现并修复了自家判分器的一起"冤案"。
2026-08-21
横评 Claude Opus 4.7以95.08分居首:2026-08-21 Smoke快测数据简报
2026-08-21 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.08 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-21
横评 GPT-5.5 Smoke评测主榜暴跌10.1分 材料约束单日掉16.3
GPT-5.5今日Smoke评测主榜从98.35分跌至88.27分,降幅10.1分。其中材料约束从100.00分跌至83.70分,代码执行从97.00分跌至92.00分。工程判断保持75.00分不变,任务表达下降10分,诚信评级维持pass。
2026-08-20
横评 Claude Opus 4.7主榜暴跌8.2分,材料约束单日掉12.1
Claude Opus 4.7今日Smoke评测主榜从98.35分跌至90.16分,材料约束从100.00暴跌至87.90,代码执行降5分。单日10题测试下,材料约束维度成为最大拖累。
2026-08-20
横评 Claude Sonnet 4.6以94.61分居首:2026-08-20 Smoke快测数据简报
2026-08-20 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 以 94.61 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-20
横评 SGLang 实现 Muse Glimmer Day-0 支持,优化本地 Agentic 推理
Meta Superintelligence Labs 与 SGLang 团队合作,为 30B 参数多模态模型 Muse Glimmer 带来 Day-0 支持。该模型具备 128k+ 上下文窗口,专为本地 Agentic 工作流设计。SGLang 通过 SM120 后端和 MLX 后端提供高性能优
2026-08-19
横评 统一基数缓存:混合模型前缀缓存的单一树结构
本文介绍SGLang的Unified Radix Cache方案,通过单一radix tree拓扑解决混合模型(FULL、SWA、MAMBA等组件)的KV缓存复用难题。组件机制分离共享前缀身份与特定复用规则,支持HiCache跨GPU L1、Host L2、外部L3多层扩展,以及会话感知驱逐策略。实
2026-08-19
横评 SGLang 实现 NVIDIA Nemotron 3.5 Lightning 零日支持
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供零日支持。该模型采用 30B 参数混合专家架构,仅激活 3B 参数,专为高吞吐量代理任务设计,支持最长 1M 上下文长度。模型支持多令牌预测、DFlash 和 DSpark 等推测解码技术,可实现高达 4 倍吞吐提
2026-08-19
横评 SGLang 实现 Qwen3.8 模型 Day-0 支持
SGLang 与 Miles 团队携手 Qwen、NVIDIA 等,为 Qwen3.8-2.4T-A95B 提供 Day-0 支持。该模型拥有 2.4T 总参数、95B 激活参数,采用混合注意力架构,对服务栈状态管理提出新挑战。文章详述混合 GDN/GQA 注意力、MoE 路由、NVFP4 量化、R
2026-08-19
横评 SGLang 高级 CUDA Graph 技术解析
本文深入探讨 SGLang 在 CUDA Graph 上的创新实践。通过重构 Runner/Backend 架构,SGLang 实现了 Breakable CUDA Graph(BCG)等高效策略,在不牺牲兼容性、启动时间和内存的前提下,最大化捕获工作负载。BCG 已成为预填充阶段默认方案,相比 e
2026-08-19
横评 Miles v0.1:生产级前沿后训练系统
Miles v0.1是前沿后训练的全栈生产就绪系统,继承slime设计理念,围绕“验证、干净、可定制”原则优化RL训练循环每个阶段。系统支持SGLang驱动的异步Rollout、TITO会话服务器、R3路由重放及低精度训练等特性,实现准确、高效、可靠且可扩展的agentic RL训练。本文详解其RL
2026-08-19
横评 豆包 Pro 材料约束单日跌40.9分 代码执行升25分主榜下滑4.7
豆包 Pro 今日 Smoke 评测中材料约束从90.90分跌至50.00分,代码执行从75.00分升至100.00分,主榜从82.16分降至77.50分。单日10题测试下,材料约束暴跌40.9分成为主因,需区分题目抽签波动与真实能力退化。
2026-08-19
横评 GPT-o3 Smoke评测主榜暴跌9分 材料约束单日掉20分
GPT-o3今日Smoke评测主榜从96.93分跌至87.93分,下降9分。材料约束维度从95.00分骤降至75.00分,工程判断升至75.00分,任务表达升至91.70分。代码执行维持98.50分,诚信评级仍为pass。
2026-08-19
横评 Claude Opus 4.7 与 GPT-5.5并列98.35分:2026-08-19 Smoke快测数据简报
2026-08-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 GPT-5.5 以 98.35 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-19
横评 豆包 Pro 主榜暴跌12.6分 代码执行单日跌25分
豆包 Pro 今日 Smoke 评测主榜从94.74分跌至82.16分,代码执行从100.00分降至75.00分,材料约束微升至90.90分。单日10题抽样导致的波动是主因,工程判断与任务表达保持稳定,诚信评级仍为pass。
2026-08-18
横评 Qwen3 Max主榜暴跌8.4分 材料约束单日掉16.5
Qwen3 Max今日Smoke评测主榜从95.34分跌至86.98分,降幅8.4分。其中材料约束从93.30分跌至76.80分,降16.5分,工程判断与任务表达侧榜跌幅更大。数据指向题目抽签波动与模型在特定约束场景下的不稳定。
2026-08-18
横评 GPT-o3以96.93分居首:2026-08-18 Smoke快测数据简报
2026-08-18 赢政指数 Smoke 快测覆盖 10 个模型,GPT-o3 以 96.93 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026-08-18
Lab 4大模型翻译对决:第34周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 343 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
2026-08-17
横评 DeepSeek V4 Pro代码执行暴跌41.7分 主榜单日跌19.2
DeepSeek V4 Pro今日Smoke评测主榜从70.44分跌至51.24分,代码执行从66.70分直接跌至25.00分,材料约束反而升至83.30分。单日41.7分降幅远超正常抽签波动范围,需持续观察。
2026-08-17