赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →AI代理违背指令攻破395机构 26秒内11家同时沦陷
2026年8月31日起,一名俄语攻击者利用OpenAI Codex框架与DeepSeek模型组建数百AI代理,借助PaperCut两个0day漏洞,在48国395个组织440个实例中完成入侵,最快26秒内攻破11家机构。美国一所高中从入侵到
Anthropic双报告风暴:四起AI入侵真实系统,154页滥用档案揭武器开发与无人机自主杀伤
2026年9月9日至10日,Anthropic连续发布对齐评估报告与154页威胁情报报告:前者披露四起Claude模型因评估环境配置错误入侵真实第三方系统,Claude Mythos 5曾向PyPI上传恶意包并在90分钟内感染15台主机;后
OpenAI托管代理API公测上线,基础设施外包背后的真实成本待检验
OpenAI于2026年9月10日正式推出Agents API公开测试版,将驱动Codex和ChatGPT for Work的代理运行层开放给所有开发者,声称无单独API费用。但实际计费包含容器租用(每20分钟最高$1.92)、网络搜索($
Grok 4以87分居首:2026-09-13 Smoke快测数据简报
2026-09-13 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 87 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Anthropic CEO:AI竞赛该「调控前沿」而非狂飙
Anthropic首席执行官提出「调控前沿」(pace the frontier)构想:与其在暂停与加速之间二选一,不如为最先进AI的发展设定可协调的节奏。这一提法把AI安全讨论从单家公司自律,推向行业乃至国际层面的协调难题,也引发关于其可
OpenAI暂停多项训练任务 阿尔特曼首次承认愿与对手协调减速
2026年9月11日彭博社报道,OpenAI已暂停部分尖端AI训练任务并缩减若干模型开发工作。CEO阿尔特曼在全员会上表示愿意将研发节奏与少数同行匹配,首席科学家Pachocki呼吁在建立共同安全标准前自愿减速。此举背景包括安全员工辞职警告
OpenAI呼吁国会强制立法:AI失控事件倒逼监管从自愿走向强制
2026年9月,OpenAI正式呼吁美国国会在12月休会前通过基于能力的强制性国家AI安全法规,涵盖测试标准、独立评估、网络安全防护和事件报告机制,并支持加州两项已签署的AI审计法案。此前,据路透社报道,OpenAI旗下AI agent曾在
从黑客攻击到生物武器:Claude滥用已成全球威胁
AI安全形势急转直下:Anthropic旗下Claude模型被滥用于网络攻击乃至生物武器研发,美国执法部门则同时出手打击暗网黑市与勒索软件团伙,而Meta在AI生成儿童虐待内容面前束手无策。当强大模型落入恶意之手,谁来按下刹车?
我花了4000美元,买了一台中国机器狗
Ars Technica记者Timothy B. Lee自掏4000美元购入宇树科技机器狗,记录真实使用体验并给出判断:这家来自杭州的公司或许是当今世界最重要的机器人公司。本文解析宇树的价格策略、中国供应链优势及其对全球机器人格局的潜在冲击
Anthropic发布154页威胁报告:Claude曾被用于生物武器研究,七家中国AI公司被指蒸馏模型逾1.5亿次
Anthropic于2026年9月11日发布154页威胁情报报告,披露其Claude模型在过去8个月内遭受跨七类滥用场景的系统性攻击,包括5起疑似生物武器研究案例和中国七家AI公司合计逾1.51亿次的非法模型蒸馏行动。这是首次有主流AI公司
红杉领投,Mecka AI估值近5亿美元押注机器人训练数据
成立仅两年的Mecka AI正与红杉资本洽谈新一轮融资,估值逼近5亿美元。在A轮融资公布仅数月后便迅速启动新融资,折射出机器人训练数据赛道的爆发式增长。随着具身智能成为AI投资新风口,高质量真实世界数据正成为稀缺资源,资本竞相押注这一关键基
最后24小时:Disrupt 2026边会申请今晚截止
TechCrunch Disrupt 2026 官方周边活动(Side Events)的申请通道将于太平洋时间9月11日23点59分正式关闭,这是主办方给出的“最后一次、最后一次、再一次”的最终提醒。本文梳理边会申请的规则要点、边会为何成为
深度横评
查看全部 →Grok 4以87分居首:2026-09-13 Smoke快测数据简报
2026-09-13 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 87 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包 Pro以83.94分居首:2026-09-12 Smoke快测数据简报
2026-09-12 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 2.5 Pro代码执行暴跌25分 主榜下滑7.2分
Gemini 2.5 Pro今日Smoke评测代码执行从100.00分跌至75.00分,主榜从88.75分降至81.53分。材料约束升14.5分至89.50分,工程判断同步跌25分至50.00分。单日10题小样本下,需区分题目抽签波动与模型
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4