赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
▲ Gemini 2.5 Pro +15 · ▼ GLM-4.6 -30.8
·
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
▲ Gemini 2.5 Pro +15 · ▼ GLM-4.6 -30.8
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →AI紧急关闭法案引发热议 行政权力与技术黑箱矛盾凸显
美国国会审议AI紧急关闭法案,授权总统及国土安全部长在AI系统对国家安全或经济稳定构成威胁时下令关闭。法案因多起失控事件提出,定义涵盖绕过安全协议等行为,行业担忧权力滥用并游说增加验证缓冲期,监管与创新平衡成为焦点。
二十余家科技企业签署公开信 呼吁保护开放权重AI模型
二十多家公司与组织签署公开信,呼吁美国政策制定者保护开放权重AI模型。Meta、Microsoft、Nvidia、IBM等参与其中,信件强调维护此类模型的开放性,相关讨论聚焦开源与封闭路径的行业走向。
Claude Sonnet 4.6 与 Grok 4并列96.98分:2026-07-25 Smoke快测数据简报
2026-07-25 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 96.98 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
MLPerf Tiny:超低功耗AI的关键基准
随着AI从数据中心走向门铃、助听器、工业传感器和可穿戴设备,如何公平衡量毫瓦级设备的性能与能效成为关键问题。MLPerf Tiny通过统一模型、任务、精度目标和能耗测量方法,为TinyML硬件与软件栈提供可比较的标准。
MLPerf Inference迈向智能体时代:新增多轮Agentic Inference基准
MLCommons提出Agentic Inference基准,将多轮智能体推理纳入MLPerf Endpoints框架。新基准覆盖编码助手与企业工作流两类真实轨迹,重点衡量长上下文、KV-cache复用、可变输出长度和闭环多轮依赖下的端到端
MLPerf v6.1征集边缘Agentic推理基准结果
MLCommons Edge LLM Taskforce宣布在MLPerf Inference v6.1中引入Edge Agentic Inference基准,聚焦设备端Agentic LLM在单边缘加速器上的工具调用准确率与单用户延迟表现
MedPerf接入Google Cloud机密计算:为脑肿瘤AI评测加密护航
MLCommons与Google Cloud在Google Cloud Next 2026展示MedPerf接入Confidential Space,用于脑肿瘤MRI分割模型的联邦基准评测。该方案在不迁移患者数据的前提下,同时保护模型权重、
Netpreme X-Mem 加速 SGLang HiCache:TTFT 最高提升 6.7 倍
随着长上下文、Agent 和推荐类 LLM 工作负载增长,Prefix caching 的瓶颈正从命中率转向 KV Cache 搬运带宽。Netpreme X-Mem™ 为 SGLang HiCache 增加高带宽专用 KV 内存层,在前缀
DSpark接入SGLang:用置信度驱动可变长度验证
DSpark 将半自回归 block drafter 与基于置信度的可变验证窗口结合,缓解 Speculative Decoding 在高并发下验证成本膨胀的问题。SGLang 已支持该机制,并通过 ragged CUDA graph、ov
DeepSeek-V4 Flash强化学习登陆AMD MI355X
AMD与Miles团队宣布,DeepSeek-V4 Flash RL已在搭载ROCm的AMD Instinct MI355X GPU上跑通。团队解决了SGLang与Megatron策略对齐、量化权重在线更新和多节点并行稳定性等关键问题,并通
SGLang 两周优化 GLM-5.2:8×B300 上突破 500 TPS
SGLang Team 披露了 GLM-5.2-NVFP4 在 Blackwell B300 上的两周优化成果:通过 Spec V2、IndexShare MTP、TopK-V2、Indexer Prologue Fusion 与 BF16
SGLang 与 Miles 首日支持 Inkling:975B 多模态前沿模型上线
SGLang、Miles 与 Thinking Machines Lab 合作,为 975B 参数多模态模型 Inkling 提供 Day-0 支持。新版本围绕 ShortConv、相对位置注意力和 shared-expert sink M
深度横评
查看全部 →Claude Sonnet 4.6 与 Grok 4并列96.98分:2026-07-25 Smoke快测数据简报
2026-07-25 赢政指数 Smoke 快测覆盖 11 个模型,Claude Sonnet 4.6 与 Grok 4 以 96.98 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
MLPerf Tiny:超低功耗AI的关键基准
随着AI从数据中心走向门铃、助听器、工业传感器和可穿戴设备,如何公平衡量毫瓦级设备的性能与能效成为关键问题。MLPerf Tiny通过统一模型、任务、精度目标和能耗测量方法,为TinyML硬件与软件栈提供可比较的标准。
MLPerf Inference迈向智能体时代:新增多轮Agentic Inference基准
MLCommons提出Agentic Inference基准,将多轮智能体推理纳入MLPerf Endpoints框架。新基准覆盖编码助手与企业工作流两类真实轨迹,重点衡量长上下文、KV-cache复用、可变输出长度和闭环多轮依赖下的端到端
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.8
#2
GLM-4.6
92
#3
DeepSeek V4 Pro
90.9
#4
GPT-o3
87.1
#5
Gemini 3.1 Pro
86.6
#6
Claude Opus 4.7
85.8
#7
Claude Sonnet 4.6
81.5
查看完整守约排行 →
Research Lab
WDCD Run #242: Grok 4 and GLM-4.6 Hold Zero Instruction Decay as Gemini 3.1 Pro Collapses at -100%
WDCD Run #242 (2026-07-22) evaluated 11 models across three-round multi-turn dialogues, recording an
4大模型翻译对决:第30周质量评测,claude-sonnet-4.6 以 8.5 分领跑
本周共翻译 368 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(8.5/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #233: GPT-o3 Leads with Zero Instruction Decay, Gemini 3.1 Pro Collapses Completely
WDCD Run #233 (2026-07-15) evaluated 11 frontier models on multi-turn commitment integrity, recordin