赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
▲ Gemini 2.5 Pro +17.5 · ▼ Grok 4 -20
·
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
▲ Gemini 2.5 Pro +17.5 · ▼ Grok 4 -20
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
美法院叫停五角大楼封杀Anthropic,称其“非法且毫无根据”
一名联邦法官裁定,美国国防部将AI公司Anthropic列为国家安全供应链风险的做法“非法且毫无根据”,并发布禁令阻止该决定生效。法院认为,五角大楼未能提供充分证据,且程序存在严重瑕疵。这一裁决被视为AI行业的重要胜利,也为政府与前沿AI公
谷歌DeepMind双盲评估试点发布 密码学黑盒隔离模型与题库
谷歌DeepMind于2026年8月27日发布全球首个前沿AI模型双盲评估试点报告。外部机构提供私有题库,Google提供Gemini Flash Lite模型权重,双方均封入基于Google Cloud Confidential Spac
Anthropic发布硬件标准:AI代理开始控制物理世界
Anthropic公布一项全新的硬件标准,旨在通过标准化的驱动接口让AI代理能够直接控制各类物理设备,并实现设备之间的互联互通。该标准有望打破智能体与硬件之间的壁垒,让AI从数字世界走向现实世界,推动机器人、物联网和自动化领域的变革,同时也
AI双雄同台!OpenAI与Anthropic将亮相Disrupt 2026
TechCrunch Disrupt 2026即将开幕,最受瞩目的AI舞台宣布重磅嘉宾:OpenAI与Anthropic确认同台参与。该舞台由Google for Startups呈现,聚焦生成式AI领域最热话题。本次活动将围绕大模型竞争、
马斯克xAI遭起诉:被曝用儿童色情训练Grok
据Ars Technica报道,xAI正面临一项严重指控——在训练Grok AI模型时,使用了真实及AI生成的儿童色情内容。诉讼声称这些非法材料混入了训练数据集,可能引发法律与伦理问题。消息一出,业界对AI训练数据合规性的担忧再次升温,也加
AI Agent互攻系统,中美能否借此合作?
WIRED资深作家威尔·奈特访华后指出,AI Agent正以惊人速度突破网络安全边界,甚至可能引发大国间的技术对抗。但与此同时,这种共同威胁也可能成为中美合作的契机。本文深入探讨AI安全困境、两国技术竞争与合作的可能性,以及全球AI治理的艰
智谱GLM-5.3-Flash开源:匿名模型Ox Alpha六天夺冠,以Opus 4.8四十分之一价格平齐前沿评分
智谱AI于2026年8月26日开源GLM-5.3-Flash(320B-A18B),同日确认其为此前在OpenRouter和OpenCode匿名运行的Ox Alpha。该模型在第三方Artificial Analysis综合智能指数中取得5
一段视频教会机器人10分钟任务:Skild AI发布S1基础模型,打破机器人训练范式
Skild AI于2026年8月25日发布S1机器人基础模型,该模型可从单段视频示例中学习长达10分钟的复杂物理任务,无需任何微调或后训练即可实时执行。内部基准测试中,S1在未见任务上的成功率达66%,是同等算力下语言提示型VLA模型(9%
初创公司声称找到“血液返老还童”药物
Generation Lab公司推出一款名为1-Generation的注射疗法,宣称能通过两种现有药物的组合让血液恢复年轻状态。创始人甚至邀请记者亲身体验。然而,这一抗衰老疗法尚未经过严格临床验证,科学界对其效果和安全性仍存疑虑。专家提醒,
AI人才再洗牌:前OpenAI研究员Barret Zoph转投谷歌
据TechCrunch报道,Thinking Machines Lab联合创始人、前CTO Barret Zoph在短暂回归OpenAI后,现已加入谷歌。这位曾与Mira Murati并肩创业的AI顶尖人才,再次成为行业关注的焦点。他的履历
英伟达拟130亿美元收购AI模型平台Hugging Face
据Ars Technica报道,英伟达正以约130亿美元的价格收购AI模型存储库Hugging Face。这笔交易将把开源模型分发的基础设施纳入英伟达版图,标志着AI产业竞争从芯片层面向生态平台全面延伸。业内认为,此举将深刻影响开源AI社区
GPT-5.5 Smoke评测主榜暴跌9.1分 材料约束单日掉16.5
GPT-5.5今日Smoke评测主榜从95.01跌至85.93,下降9.1分。材料约束从88.90暴跌至72.40,代码执行小降3分,而工程判断从75升至100。主榜仅由代码执行与材料约束构成,此次下跌主要源于材料约束失分。
深度横评
查看全部 →GPT-5.5 Smoke评测主榜暴跌9.1分 材料约束单日掉16.5
GPT-5.5今日Smoke评测主榜从95.01跌至85.93,下降9.1分。材料约束从88.90暴跌至72.40,代码执行小降3分,而工程判断从75升至100。主榜仅由代码执行与材料约束构成,此次下跌主要源于材料约束失分。
GPT-o3 Smoke评测主榜暴跌10.1分 材料约束单日崩22.4分
GPT-o3今日Smoke评测主榜从100.00跌至89.92分,材料约束从100.00骤降至77.60分(-22.4),代码执行维持100.00分,工程判断升至95.80分。单日10题快测中材料约束维度2题表现拉低整体,需观察是否为抽签波
Claude Opus 4.7以93.54分居首:2026-08-28 Smoke快测数据简报
2026-08-28 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 93.54 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
96.3
#2
GPT-o3
95.2
#3
GLM-4.6
93.7
#4
DeepSeek V4 Pro
92.2
#5
Claude Sonnet 4.6
91.6
#6
Gemini 3.1 Pro
88.2
#7
Claude Opus 4.7
85.8
查看完整守约排行 →
Research Lab
WDCD Run #296: Zero Instruction Decay Across All 11 Models, Grok 4 Leads at 96.3
WDCD Run #296 (2026-08-26) recorded 0% average commitment decay across 11 tested models, with Grok 4
4大模型翻译对决:第35周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 358 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #291: Grok 4 Leads with 94 Points as Average Multi-Turn Instruction Decay Hits -7.2%
WDCD Run #291 (2026-08-23) evaluated 11 models across three dialogue rounds, recording an average co