赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
为何如此多AI研究者担心机器杀死所有人?
在大型AI实验室内部,一种曾被视作科幻的恐惧正在回归:先进机器可能失控并威胁人类生存。快速能力跃升、递归自我改进与智能体集群相互叠加,让研究者真正感到不安。本文梳理这种恐惧的技术根源、行业竞争与监管挑战,并分析为何它不再只是哲学辩论,而正进
OpenAI联手摩根士丹利发布金融版ChatGPT,GPT-6 Astra直指华尔街初级分析师
2026年9月10日,OpenAI发布ChatGPT for Financial Services,以GPT-6 Astra为底座,由摩根士丹利和Evercore联合设计,内置Daloopa、PitchBook、LSEG News等金融数据
微软2032年算力目标38GW:三倍扩张背后,一个已经失控的算力缺口
据彭博社报道,微软计划至2032年将全球数据中心容量从当前约12GW扩至38GW以上,AI专用芯片容量将从约2GW升至约13GW,2026日历年资本支出预计达1750亿美元。这不仅是目前已披露的最大单一科技公司数据中心扩张计划,更揭示了一个
五角大楼拟向Fluidstack提供50亿美元贷款 国防资本首涉AI算力供应链
美国国防部战略资本办公室正与AI云计算初创公司Fluidstack谈判约50亿美元贷款,用于强化美国数据中心电力设备与冷却系统的供应链及制造产能。此举若成交将成为该办公室史上最大贷款,标志着美国政府以主权贷款方式直接介入AI基础设施供应链安
Cognition发布SWE-2 以Kimi K3基座实现代码模型性价比新平衡
Cognition于2026年9月10日发布SWE-2编程模型,基于月之暗面Kimi K3 2.8万亿参数基座,在FrontierCode 1.1 Main基准达到50.0%,与Fable 5.1差距不足1个百分点,同时运行成本降低64%。
Anthropic首发含案例威胁报告 拦截七领域AI滥用
Anthropic于2026年9月10日发布报告,披露2025年12月至2026年8月期间成功拦截跨七个危害领域的AI滥用行为,包括网络攻击、影响力操作和生物武器辅助研发等。这是AI头部公司首批公开结构化案例的威胁情报报告,时间点正值欧盟A
OpenAI发问:AI行业减速合法吗
据WIRED报道,OpenAI正寻求厘清:若AI行业因安全担忧协调放缓开发,是否会触犯反垄断法。AI领袖认为前沿模型竞赛日益危险,有必要集体踩刹车;但反垄断法通常禁止竞争对手协调限制产量或创新。安全与竞争的张力,正把AI治理推向法律灰色地带
供应链"快发现、慢行动":AI智能体如何破局
据J.S. Held《全球风险报告》估算,2025年供应链中断给企业造成的损失约为1840亿美元,而这笔账单的绝大部分被花在了"更快发现问题上",而非"更快采取行动"上。当行业仍把这一数字当作天气般无法规避的成本时,AI智能体正试图把供应链
AI真会毁灭人类吗?末日警告再度响起
本周播客《Uncanny Valley》聚焦三条看似无关却彼此呼应的新闻:一位前Anthropic研究员发出的AI末日警告、苹果秋季发布会的新一轮硬件与AI功能升级,以及一份声称特朗普赢得2020年大选的所谓“人口普查报告”。从生存风险到消
Anthropic指控阿里、月之暗面与DeepSeek发起模型蒸馏攻击
Anthropic于本周四发布新报告,指控阿里巴巴、月之暗面与DeepSeek三家中国AI公司对其模型发起持续性蒸馏攻击,称相关行为近几个月随行业竞争加剧而不断升级。报告将模型蒸馏这一技术手段推向中美AI博弈的风口浪尖,也再次引发关于模型输
OpenAI暂停Pro订阅注册:Astra需求超预期
据TechCrunch报道,OpenAI已暂停ChatGPT Pro订阅的新用户注册,原因是新一代模型Astra带来的需求远超预期,而Pro订阅对系统的压力最大。公司表示正在扩充容量,现有Pro用户不受影响。此举再次凸显AI巨头在推理算力供
马克·沃尔伯格将登Disrupt 2026:谈创业不谈自己
好莱坞演员马克·沃尔伯格确认出席 TechCrunch Disrupt 2026,与 Bruce K. Lee 同台对话,聚焦投资、创业、医疗健康、身心健康与企业构建。他明确表示,这次想聊的是创业者的工作,而非自己的演艺生涯。明星资本与健康
深度横评
查看全部 →Gemini 2.5 Pro代码执行暴跌25分 主榜下滑7.2分
Gemini 2.5 Pro今日Smoke评测代码执行从100.00分跌至75.00分,主榜从88.75分降至81.53分。材料约束升14.5分至89.50分,工程判断同步跌25分至50.00分。单日10题小样本下,需区分题目抽签波动与模型
Grok 4 材料约束暴跌22.2分 主榜下滑5.2
Grok 4今日Smoke评测材料约束从100.00分跌至77.80分,下降22.2分,主榜从93.79降至88.64。代码执行升至97.50分,任务表达升至95.00分。单日10题测试下,维度得分剧烈波动最可能源于题目抽签。
豆包 Pro以95.28分居首:2026-09-11 Smoke快测数据简报
2026-09-11 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 95.28 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4