赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
▲ DeepSeek V4 Pro +18 · ▼ GLM-4.6 -62.5
·
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
▲ DeepSeek V4 Pro +18 · ▼ GLM-4.6 -62.5
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →Anthropic选纳斯达克IPO 目标估值2万亿美元冲人类纪录
2026年9月13日,彭博社与商业内幕同时确认Anthropic选定纳斯达克上市,目标估值1.5万亿至2万亿美元,融资规模或超SpaceX今年860亿美元纪录。IPO最快十月启动,投资者说明会本周举行。金融时报披露其Q2营收115亿美元,同
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
Anthropic CEO发布放缓宣言:三大头部同时刹车,究竟是安全共识还是寡头默契?
Anthropic CEO Dario Amodei于2026年9月12日发布3800字长文,呼吁放缓前沿模型开发,并宣布单方面向第三方评估机构提供员工级永久访问权限。Sam Altman、Elon Musk随即表态支持,三大AI头部创始人
Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5并列91.09分:2026-09-14 Smoke快测数据简报
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,
奥巴马喊话民主党:AI监管必须有“清晰计划”
美国前总统奥巴马近日公开呼吁民主党将人工智能列为“核心议程”之一,并要求拿出一份“非常清晰的计划”,回应公众对AI经济冲击与安全风险的担忧。此番表态被视为民主党在AI议题上寻求统一立场的重要信号,也把硅谷、国会与白宫之间围绕监管边界的博弈再
AI智能体“狂饮”电力,数据中心扩建潮席卷硅谷
硅谷正从轻量级的聊天机器人查询,转向资源密集型的代理式AI。这种能自主执行复杂任务的智能体,对算力和电力的需求呈指数级增长,正推动一场史无前例的数据中心建设狂潮。当AI从“回答问题”进化到“采取行动”,能源账单也随之飙升。
RLHF奠基人保罗·克里斯蒂亚诺加入OpenAI理事会:最强批评者入局,评测独立性存结构性张力
2026年9月9日,OpenAI宣布任命RLHF技术奠基人、ARC/METR创始人保罗·克里斯蒂亚诺加入基金会理事会及安全与安保委员会。此人曾公开写道AI灾难性失控"存在有实质意义的概率",并称OpenAI"并未走在将此风险降至可接受水平的
Amodei呼吁AI前沿减速并承诺第三方永久驻场:三巨头罕见共识背后的真实逻辑
2026年9月12日,Anthropic CEO Dario Amodei发表约3800字长文,呼吁全行业放缓前沿模型能力提升速度,并宣布单方面承诺为第三方评估机构提供永久员工级访问权限。Sam Altman、Elon Musk随即背书,但
美中9月中旬北京首谈AI安全 贝森特领军中方曾提定义前提
美国财政部长贝森特将于2026年9月中旬率团赴北京,与中方举行特朗普第二任期首次专项AI安全双边对话。会谈聚焦自主AI网络攻击风险与前沿实验室数据共享协议。此前中方提出须先就“AI安全”定义达成共识,否则谈判不推进。背景为5月特习峰会重启A
SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持
SGLang 和 Miles 团队联合发布对 DeepSeek-V4.1 的 Day-0 支持,针对其低比率压缩、滑动窗口注意力、流形超连接及 Engram 内存等架构创新进行了深度优化。文章详述跨层 KV 共享、稀疏检索、主机内存 Eng
AI代理违背指令攻破395机构 26秒内11家同时沦陷
2026年8月31日起,一名俄语攻击者利用OpenAI Codex框架与DeepSeek模型组建数百AI代理,借助PaperCut两个0day漏洞,在48国395个组织440个实例中完成入侵,最快26秒内攻破11家机构。美国一所高中从入侵到
Real-SWE基准曝光:Fable 5.1私有代码解决率仅38.8%
Specific Labs发布Real-SWE基准,测试前沿模型在真实私有企业代码库上的表现。Fable 5.1以38.8%领跑,GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%。六成任务所有模型通过率低于1
深度横评
查看全部 →Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5并列91.09分:2026-09-14 Smoke快测数据简报
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,
SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持
SGLang 和 Miles 团队联合发布对 DeepSeek-V4.1 的 Day-0 支持,针对其低比率压缩、滑动窗口注意力、流形超连接及 Engram 内存等架构创新进行了深度优化。文章详述跨层 KV 共享、稀疏检索、主机内存 Eng
GPT-5.5主榜暴跌21.4分 代码执行从97跌至75
GPT-5.5今日Smoke评测主榜从82.29分跌至60.87分,暴跌21.4分。代码执行97.00→75.00,材料约束64.30→43.60,工程判断维持100.00,任务表达91.70→81.70。诚信评级保持pass。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。