赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
赢政指数 · 每周真实沙箱评测 15 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
AI垃圾报告泛滥,谷歌冻结开源漏洞赏金计划
谷歌宣布暂停其开源软件漏洞赏金计划,原因是AI生成的低质量漏洞报告出现“显著增长”,审核成本已超过项目收益。这是继curl、OpenBSD等项目之后,开源社区再度被AI“投毒式”提交淹没的标志性事件。本文梳理事件来龙去脉,并分析当AI让“提
OpenAI安全负责人以辞职信指企业文化崩坏:12次大模型发布的亲历者说试错时代已经结束
OpenAI安全团队资深成员大卫·罗宾逊(David Robinson)于2026年10月3日在《大西洋》杂志发文辞职,他参与起草了OpenAI现行的《准备框架》并主导了12次前沿模型发布的安全报告,直指公司"企业文化已崩坏",指责其"迭代
图灵奖三巨头决裂:LeCun称零担忧,Hinton与Bengio联署警告智能爆炸
Meta首席AI科学家、2018年图灵奖得主Yann LeCun公开宣称对AI灭绝人类"零担忧",并直斥Anthropic CEO Dario Amodei"妄想"且"疯狂"。与此同时,同获图灵奖的Geoffrey Hinton与Yoshu
超级智能+自愿安全协议,能化解AI形象危机吗?
特朗普政府正试图为AI重塑形象:一边抛出“超级智能”的宏大叙事,一边推动一份不具约束力的安全协议。TechCrunch的Equity播客探讨了这种“软性公关+行业自律”组合能否真正化解公众对AI的恐惧,以及它在创新与监管之间的尴尬定位。
Claude Sonnet 4.6代码执行暴跌27.4分,材料约束却暴涨37.7分
Claude Sonnet 4.6今日Smoke评测中代码执行从71.90分跌至44.50分,材料约束从50.60分升至88.30分,主榜仅微升1.9分至64.21分。工程判断升至100分,任务表达跌至45分。单日10题抽样下,维度剧烈波动
Grok 4代码执行暴跌31.3分 材料约束反升34.7分
Grok 4今日Smoke评测代码执行从95.30分跌至64.00分,降31.3分;材料约束从48.40分升至83.10分,涨34.7分。主榜仅降1.6分至72.60分。单日10题抽签导致的波动是主因,需持续观察。
Claude Opus 4.7以95.63分居首:2026-10-05 Smoke快测数据简报
2026-10-05 赢政指数 Smoke 快测覆盖 14 个模型,Claude Opus 4.7 以 95.63 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
特朗普组建“超级智能部队”,AI安全之争再升级
美国总统特朗普宣布成立“超级智能部队”特别工作组,作为其对AI安全辩论的最新回应。这一举措被视为美国AI治理政策的重大转向,将聚焦前沿AI系统的安全评估与监管框架设计。科技界与政策圈反应不一,围绕AI发展速度与安全底线的争论再度升温。
微软2026数字防御报告:AI将漏洞武器化时间压缩至24小时内
微软2026数字防御报告覆盖2025年7月至2026年6月,显示攻击者利用AI将漏洞从发现到武器化的中位时间压缩至24小时以内,AI驱动钓鱼攻击占比从7%升至23%,自主勒索软件已攻击真实组织。报告指出AI代理模型成为攻击提速核心工具,企业
OpenAI携手Synopsys推出GPT-Synopsys,AI代理首次直接操控芯片设计工具链
2026年9月30日,OpenAI与电子设计自动化巨头Synopsys宣布多年战略合作,联合推出GPT-Synopsys专用模型。该模型可自主调用Synopsys EDA工具,对芯片设计的功耗、性能、面积及时序收敛进行迭代优化,标志着通用前
OpenAI常驻AI代理Dots正式上线,但驱动模型曾因不符合安全标准被叫停
OpenAI于2026年9月29日DevDay发布Dots常驻AI代理,基于GPT-6 Astra运行,拥有独立云计算机,可接入4000余款应用,首个Dot含在Pro和Business Premium订阅中。但原计划驱动Dots的GPT-6
美国防部成立自主作战司令部:四星建制背后,问责链能跑多远
2026年9月30日,美国防长赫格塞斯在匡蒂科宣布组建自主作战司令部(AutoWarCom),目标2027年10月建成,届时将成为继2019年太空司令部后美军新增的第12个战斗司令部,由四星上将统领无人机、AI与自主机器人作战体系。马斯克、
深度横评
查看全部 →Claude Sonnet 4.6代码执行暴跌27.4分,材料约束却暴涨37.7分
Claude Sonnet 4.6今日Smoke评测中代码执行从71.90分跌至44.50分,材料约束从50.60分升至88.30分,主榜仅微升1.9分至64.21分。工程判断升至100分,任务表达跌至45分。单日10题抽样下,维度剧烈波动
Grok 4代码执行暴跌31.3分 材料约束反升34.7分
Grok 4今日Smoke评测代码执行从95.30分跌至64.00分,降31.3分;材料约束从48.40分升至83.10分,涨34.7分。主榜仅降1.6分至72.60分。单日10题抽签导致的波动是主因,需持续观察。
Claude Opus 4.7以95.63分居首:2026-10-05 Smoke快测数据简报
2026-10-05 赢政指数 Smoke 快测覆盖 14 个模型,Claude Opus 4.7 以 95.63 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
95.7
#2
Gemini 3.1 Pro
88.1
#3
GLM-4.6
87.6
#4
DeepSeek V4 Pro
86.6
#5
Claude Opus 4.7
86.3
#6
GPT-5.5
84.2
#7
GPT-o3
84.1
查看完整守约排行 →
Research Lab
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to
WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with G
3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 417 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。