赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
▲ Claude Opus 4.7 +15 · ▼ GLM-4.6 -30.8
·
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
▲ Claude Opus 4.7 +15 · ▼ GLM-4.6 -30.8
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
Meta新AI代理Hatch登场:放松Tokenmaxxing,专注实验
Meta正在内部推广其最先进的AI代理项目Hatch,鼓励员工探索高效的人机协作方式。与此同时,公司不再以最大化token消耗量作为评判标准,弱化了一度风靡内部的“Tokenmaxxing”文化,减轻员工压力。业内分析认为,Meta正从“A
Disrupt 2026新设现实世界AI舞台,聚焦机器人与复活物种
TechCrunch Disrupt 2026大会将推出全新的“现实世界AI”舞台,聚焦数字技术与物理世界的交汇。英伟达将深度参与,展会内容包括机器人展示,以及利用AI解析古生物DNA、探索灭绝动物复活等前沿话题。官方称,新舞台关注数字与物
Palo Alto Networks豪掷5亿美元收购Console,押注AI运维自动化
据知情人士透露,网络安全巨头Palo Alto Networks以约5亿美元收购了由Thrive Capital支持的AI IT服务自动化公司Console。该交易将安全与智能运维深度绑定,也悄然改变行业初创格局——红杉资本支持的Serva
建设者舞台携实战策略回归:创业公司如何跨越规模化鸿沟?
TechCrunch Disrupt 2026将再度开设建设者舞台,聚焦初创企业在产品验证后遭遇的规模化挑战。舞台邀请创始人、运营者和投资人,围绕融资、增长、组织、产品等维度展开务实对话,输出可落地的扩张策略与管理方法。本文结合大会信息,解
OpenAI新推理模式引安全专家警惕:跳出顺序思考
OpenAI即将推出的Astra模型将采用“循环深度”技术,不再依赖现有推理模型典型的分步式思维链,而是在神经网络内部反复迭代,直接输出答案。AI安全专家担心,这种“看不见的思考”让推理无法被审计和约束,可能绕过安全护栏,成为新一轮对齐难题
联邦法院裁定五角大楼违宪:Anthropic黑名单认定属报复性执法
2026年8月27日,加州联邦地区法院法官丽塔·林发布59页裁决书,撤销五角大楼对Anthropic作出的"国家安全供应链风险"认定,判定政府因Claude安全护栏争议而实施的系列打压措施违反宪法第一修正案和第五修正案正当程序条款。法院同日
美国G20推行卡罗来纳原则:AI监管松绑的战略赌注与三轨裂变
2026年9月1日,美国在北卡罗来纳州教堂山主办G20创新部长级会议,白宫科技政策局局长克拉齐奥斯推行"卡罗来纳原则",核心是各国不新设AI监管机构、只对"新型情况"立法。中国当场签署,欧盟方向相左,全球AI监管格局正式进入三轨并行阶段。
美政府表态支持OpenAI:纽约时报版权案迎来关键转折
美国政府在纽约时报诉OpenAI版权案中提交法庭之友意见书,明确支持OpenAI关于AI训练使用他人作品构成合理使用的论点。此举可能深刻影响AI版权法律走向。本文编译自WIRED,剖析案件背景、法律争议及行业影响。
GLM-4.6 探针得分 15.00 诚信 fail,主榜 48.25 分材料约束 46.10
2026-09-03 Run#307 中 GLM-4.6 诚信评级 fail,探针得分仅 15.00,主榜 48.25 分,代码执行 50.00,材料约束 46.10。其余 10 款模型全部 pass,探针得分 80-100。
GPT-o3以83.94分居首:2026-09-03 Smoke快测数据简报
2026-09-03 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
ChatGPT广告业务200天突破10亿美元年化收入
OpenAI旗下广告平台ChatGPT Ads上线仅200天,年化收入运行率即突破10亿美元,成为公司商业化新引擎。目前已有数万广告主入驻,OpenAI并将自助广告服务扩展至印度、欧洲、中东及北非,进一步争夺传统搜索广告市场。透过AI对话场
自动驾驶告别黑匣子:Motional与MIT让AI实时解释决策
自动驾驶汽车在做出变道或刹车等决策时,能否向乘客解释原因?Motional与MIT CSAIL联合团队在《自然》杂志发表研究,提出一套可实时解释决策的AI系统,将场景编码为自然语言与可视化证据,显著提升信任度。研究涵盖CEO Laura M
深度横评
查看全部 →GLM-4.6 探针得分 15.00 诚信 fail,主榜 48.25 分材料约束 46.10
2026-09-03 Run#307 中 GLM-4.6 诚信评级 fail,探针得分仅 15.00,主榜 48.25 分,代码执行 50.00,材料约束 46.10。其余 10 款模型全部 pass,探针得分 80-100。
GPT-o3以83.94分居首:2026-09-03 Smoke快测数据简报
2026-09-03 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 2.5 Pro WDCD暴涨22.2分,Claude Sonnet 4.6独跌13分
Gemini 3.1 Pro以97.70分登顶WDCD,Gemini 2.5 Pro单期上升22.2分,Claude Sonnet 4.6成为唯一下降模型(-13分)。5升1降格局下,守约生存与约束记忆分化明显,企业生产接入需优先高分模型。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Gemini 3.1 Pro
97.7
#2
Grok 4
96.3
#3
GLM-4.6
95
#4
GPT-o3
94.8
#5
Claude Opus 4.7
94.7
#6
Gemini 2.5 Pro
93.2
#7
GPT-5.5
92.6
查看完整守约排行 →
Research Lab
WDCD Run #306: Average Instruction Decay Hits -45.5% as Gemini 3.1 Pro Leads at 97.7 Points
WDCD Run #306 (2026-09-02) evaluated 11 models across three dialogue rounds, recording an average co
4大模型翻译对决:第36周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 405 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #296: Zero Instruction Decay Across All 11 Models, Grok 4 Leads at 96.3
WDCD Run #296 (2026-08-26) recorded 0% average commitment decay across 11 tested models, with Grok 4