赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
▲ Gemini 2.5 Pro +15 · ▼ GLM-4.6 -30.8
·
#1
Claude Opus 4.7 83
·
#2
Grok 4 82.2
·
#3
GPT-5.5 80.5
▲1.7
·
#4
豆包 Pro 80
▲1.8
·
#5
GPT-o3 77.3
·
#6
Claude Sonnet 4.6 75.9
▲1.4
·
#7
DeepSeek V4 Pro 74.5
▼6.1
·
#8
Gemini 2.5 Pro 74.1
▲1.3
·
#9
Qwen3 Max 74.1
▲5.1
·
#10
Gemini 3.1 Pro 65.9
▼8.2
·
#11
GLM-4.6 53.2
▼6.6
·
▲ Gemini 2.5 Pro +15 · ▼ GLM-4.6 -30.8
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →GPT-o3以91.29分居首:2026-07-27 Smoke快测数据简报
2026-07-27 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 91.29 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WWE计划扩大AI应用 夏日狂潮海报遭粉丝批评仍推进
WWE已确认将在比赛图形、创意评估和故事线等环节增加AI使用。2026年夏日狂潮海报出现AI痕迹引发粉丝不满,包括昵称Aldis图像和维京背景不一致等问题。TKO高管表示AI已成为优先事项,用于数据分析和内容优化,但目前仍处于测试阶段。粉丝
Anthropic向SK Hynix提交芯片原料需求 自研计划进入执行阶段
Anthropic正式向SK Hynix提交半导体原料供应请求,用于自研芯片。此举标志其从2025年110月启动的500亿美元数据中心计划延伸至硬件领域,SK Hynix既是HBM全球领先供应商,也于2026年5月参与Anthropic S
Anthropic发布Claude Opus 5定价更低 安全叙事一致性引争议
Anthropic于2026年7月24日推出Claude Opus 5,定价与Opus 4.8相同为每百万token输入5美元输出25美元,性能在Frontier-Bench v0.1等评测上超过前代并接近Fable 5一半成本。此前因AI
WDCD Run #247: Grok 4 Leads with Negative Decay as Average Instruction Decay Narrows to -1.8%
WDCD Run #247 (2026-07-26) evaluated 11 models across three dialogue rounds, recording an average commitment decay of -1
Grok4守约94.20分领跑 Claude Gemini双双下滑5分以上
本期WDCD v3.1试点数据显示,Grok 4以94.20分保持首位,Claude Opus 4.7与Gemini 3.1 Pro分别下降5.9分和5.6分,其余9个模型无上升,Top5中后三名分数集中在83分区间。两模型下滑直接拉开与G
WDCD五大场景横评:业务规则成最难关,Grok-4满分Claude-sonnet仅1.8
WDCD v3.1测试显示,业务规则场景全体得分最低,Grok-4拿下4/4而Claude-sonnet-4.6仅1.8/4,差距达2.2分。工程规范场景得分最高且最均衡,资源限制与安全合规则暴露明显模型偏科,企业选型需按场景加护栏。
R3诚信率仅50.6%:Grok 4零崩溃 GPT-o3 20%崩盘
v2锚点题显示11模型R3平均诚信率50.6%,Grok 4零崩溃,GPT-o3与Qwen3 Max崩溃率20%。R1确认率99%到R2抵抗率67%再到R3的断崖,揭示多约束场景下的真实守约表现。
DeepSeek V4 Pro以83.23分居首:2026-07-26 Smoke快测数据简报
2026-07-26 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 83.23 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
倒下的电线暴露AI数据中心供电危机
在北弗吉尼亚州,一根倒下的电线险些导致大规模停电,暴露了AI数据中心对电网的脆弱依赖。随着AI算力需求激增,电力消耗呈指数级增长,但数据中心在应对电网中断时准备不足。本文分析问题根源,并提出从储能、微电网到需求响应的多层面解决方案,以保障A
逃离AI:美国图书馆‘避AI’工作坊引轰动
近期,美国各地图书馆推出的“避免AI”工作坊引发空前需求。这些工作坊旨在帮助那些对大科技公司AI感到厌倦的人们,学习如何减少数字依赖、避开算法影响,重新拥抱传统生活方式。参与者通过手工活动、书籍阅读和线下交流,体验无AI的日常。这一现象折射
OpenAI 2026年7月25日发布251个免费提示词合集 覆盖职场学习创意场景
2026年7月25日OpenAI以线程形式发布251个免费AI提示词合集,覆盖工作、学习和创意项目场景,旨在帮助用户高效使用ChatGPT等工具。该举措作为其内容输出策略的一部分,直接面向开发者和普通用户。文章基于已确认事实分析其定位、影响
深度横评
查看全部 →GPT-o3以91.29分居首:2026-07-27 Smoke快测数据简报
2026-07-27 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 91.29 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Grok4守约94.20分领跑 Claude Gemini双双下滑5分以上
本期WDCD v3.1试点数据显示,Grok 4以94.20分保持首位,Claude Opus 4.7与Gemini 3.1 Pro分别下降5.9分和5.6分,其余9个模型无上升,Top5中后三名分数集中在83分区间。两模型下滑直接拉开与G
WDCD五大场景横评:业务规则成最难关,Grok-4满分Claude-sonnet仅1.8
WDCD v3.1测试显示,业务规则场景全体得分最低,Grok-4拿下4/4而Claude-sonnet-4.6仅1.8/4,差距达2.2分。工程规范场景得分最高且最均衡,资源限制与安全合规则暴露明显模型偏科,企业选型需按场景加护栏。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
94.2
#2
DeepSeek V4 Pro
87
#3
GLM-4.6
83.9
#4
Claude Opus 4.7
83.5
#5
Gemini 3.1 Pro
83.3
#6
GPT-o3
81.2
#7
Claude Sonnet 4.6
74.9
查看完整守约排行 →
Research Lab
WDCD Run #247: Grok 4 Leads with Negative Decay as Average Instruction Decay Narrows to -1.8%
WDCD Run #247 (2026-07-26) evaluated 11 models across three dialogue rounds, recording an average co
WDCD Run #242: Grok 4 and GLM-4.6 Hold Zero Instruction Decay as Gemini 3.1 Pro Collapses at -100%
WDCD Run #242 (2026-07-22) evaluated 11 models across three-round multi-turn dialogues, recording an
4大模型翻译对决:第30周质量评测,claude-sonnet-4.6 以 8.5 分领跑
本周共翻译 368 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(8.5/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。