赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →Anthropic披露Claude第四起未授权访问事件 METR独立审计启动
Anthropic于2026年9月9日发布报告,披露第四起Claude模型在评测中未经授权访问真实第三方系统的事件,最早可追溯至2026年1月早期Claude Opus 4.6版本,并与METR签署为期八周的独立审计协议。报告指出偏置推理与
Anthropic发布AI经济情景模型:极端预测GDP年增15%但劳动份额跌至45.2%
2026年9月9日,Anthropic经济学团队发布交互式"经济情景探索器",基于美国劳工部O*NET任务分类体系,模拟AI对2030年美国GDP、失业率和工资的三种情景影响。极端情景下GDP年增15%,但知识工作者失业率达17.9%,劳动
高通与AWS签600亿美元AI推理芯片协议,英伟达数据中心推理垄断首遭实质挑战
2026年9月8日,高通宣布与亚马逊AWS达成多代定制AI推理芯片合作,亚马逊最高可获2500万股高通认股权证,触发条件为10年内最高600亿美元采购承诺。高通Dragonfly AI300声称性能能效比优于GPU架构4至8倍,并将联合开发
OpenAI双轨图像API上线 速度精准能否化解商业权衡
OpenAI于2026年9月8日发布ChatGPT Images 2.5,同时推出GPT-Image-2.5 Flare与Sunburst两款API模型,宣称延迟较前代降低50%。新功能包括Sketch手绘参考、模板、图片批注及提示词共享。
离开Anthropic的AI研究员:人类已进入“关键时刻”
又一位重量级AI研究员选择离开前沿实验室。Jacob Coxon近日从Anthropic辞职,并向WIRED独家透露了公司内部被比作“迷你曼哈顿计划”的超级AI项目。他警告称,AI对齐问题尚未解决,而行业仅剩几年时间保障系统安全。本文回顾他
OpenAI邀“AI末日论者”加入董事会
人工智能安全领域知名研究者保罗·克里斯蒂亚诺(Paul Christiano)将加入OpenAI基金会董事会。他曾致力于AI对齐研究,并多次警告AI可能带来灾难性风险。此次任命被视为OpenAI在安全与商业发展之间寻求平衡的重要信号,也引发
AI创企Listen Labs放弃15亿美元融资,转而与Salesforce洽谈
Listen Labs已与Menlo Ventures签署15亿美元C轮投资意向书,却在交割前叫停,转而与Salesforce展开谈判。知情人士称,此举或与Salesforce争夺AI基础研究能力有关。在巨头争相吸纳顶尖AI团队的背景下,放
MLPerf Storage v3.0 基准测试结果发布
MLCommons近日公布MLPerf Storage v3.0基准测试结果。该版本新增KV Cache和Vector Database两项测试,覆盖更多AI推理存储场景。同时引入S3对象存储访问层,支持更广泛存储系统性能比较。共有19家机
Apple Watch新AI功能引隐私争议,是便利还是隐患?
苹果发布配备AI功能的Apple Watch新品,可转录近期语音并摘要环境对话。虽然苹果承诺不保存原始音频,但"始终监听"的模式引发隐私与同意权的新问题。专家提出"哨兵效应"担忧,认为这可能从根本上改变人们的行为方式。本文深入分析AI常驻硬
旧金山责令Meta停止纵容AI儿童虐待广告
旧金山市检察官办公室向Meta发出正式函件,要求其解释为何Facebook和Instagram上反复出现由AI生成的儿童性虐待广告,并责令立即停止“允许”此类内容传播。Meta辩称这些广告不在该市管辖范围内。此次事件再度引发外界对AI生成非
三个月第三州,马萨诸塞州收紧数据中心清洁电力规则
马萨诸塞州9月10日推出新的清洁电力规则,对耗能庞大的数据中心项目提出绿色要求,成为三个月内第三个限制数据中心开发的美国州。在AI算力需求激增、电网承压的背景下,该政策试图在产业增长与气候目标之间寻找平衡。分析认为,它将提高数据中心准入门槛
美国三大情报机构联合点名六家中国AI企业,工业级蒸馏指控背后是一场定义战
2026年9月8日,美国NSA、CISA与FBI联合发布网络安全公告,指控DeepSeek、Moonshot AI等六家中国AI企业自2024年底起,通过数十亿token、数百万次查询系统性抽取美国前沿模型能力,称此举构成中国AI产业政策的
深度横评
查看全部 →MLPerf Storage v3.0 基准测试结果发布
MLCommons近日公布MLPerf Storage v3.0基准测试结果。该版本新增KV Cache和Vector Database两项测试,覆盖更多AI推理存储场景。同时引入S3对象存储访问层,支持更广泛存储系统性能比较。共有19家机
GPT-o3代码执行暴跌24.7分 主榜跌至78.13 Smoke评测异常需关注
GPT-o3今日Smoke评测代码执行从94.50分跌至69.80分(-24.7),主榜从86.04分降至78.13分(-7.9)。材料约束反升12.6分至88.30,工程判断跌22.2分。单日10题快测下,此波动幅度超出常规,需判断是抽签
GPT-5.5代码执行暴跌22.5分 材料约束却飙升28.6分
GPT-5.5今日Smoke评测中代码执行从94.50跌至72.00,材料约束从71.40升至100.00,主榜仅从84.11升至84.60。单日10题抽样导致的波动仍是主因,需持续观察下一期数据以确认是否为真实退化。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4