赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
▲ 豆包 Pro +12.4 · ▼ GLM-4.6 -23.8
·
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
▲ 豆包 Pro +12.4 · ▼ GLM-4.6 -23.8
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →Thinking Machines发布Inkling 开放9750亿参数多模态权重
Thinking Machines于2026年7月15日推出Inkling模型,总参数9750亿、激活参数410亿,支持文本图像音频原生推理,完整权重开放下载与微调。该模型在美国开源榜单上成为领先的开放权重模型,同时发布激活参数120亿的I
别再让我选择退出AI:默认应选择加入
作者Reece Rogers在WIRED发文指出,当前科技公司普遍将生成式AI功能默认开启,用户需手动“选择退出”才能关闭。这种做法不仅制造了隐私陷阱,更剥夺了用户的自主权。他呼吁行业将敏感AI功能的默认设置改为“选择加入”,让用户主动决定
热泵在美国为何仍如此火爆?
在纽约夏季热浪肆虐之时谈论供暖设备似乎不合时宜,但热泵(heat pumps)却是个例外。这种以电力驱动的供暖制冷设备,凭借其超高效率和环保优势,正在美国市场快速崛起。尽管初期成本较高,但受联邦税收抵免、各州激励政策以及消费者节能意识提升的
Neko Health融资7亿美元,AI身体扫描进军美国
总部位于瑞典的医疗科技公司Neko Health近日宣布完成7亿美元C轮融资,将利用AI身体扫描技术在美国扩张,首站落户纽约。本轮融资由Lightspeed Venture Partners领投,O.G. Venture Partners联
为油气工厂打造全厂AI模型,Applied Computing融资2000万美元
Applied Computing宣布完成2000万美元A轮融资,资金将用于开发面向石油、天然气及石化行业的基础AI模型。该模型旨在整合工厂运营全流程数据,通过统一智能平台优化生产效率、降低碳排放并提升安全水平,有望解决传统工业AI系统碎片
智能体编排:企业AI部署大问题,多数只是聊天机器人包装
VentureBeat对101家企业的调查显示,智能体编排正在加速向模型提供商平台集中,Anthropic的Claude凭借底层模型优势大幅领先。然而,现实远落后于雄心:绝大多数企业部署的所谓“智能体”实质仍是聊天机器人包装。企业期望的混合
SpaceX股价跌至135美元发行价,星际飞船发射在即
自IPO后股价持续下跌的SpaceX,目前已回落至135美元的发行价水平,几乎吐尽所有上市以来的涨幅。这一走势发生在Starship即将发射的关键节点,表明市场对CEO马斯克此前关于公司增长和盈利的承诺正趋于冷静。分析师指出,投资者担忧核心
AI不如婴儿聪明?婴儿大脑启发AI新突破
婴儿是强大的学习机器,他们通过观察和互动快速掌握物理世界规律。而当前最先进的AI系统仍需海量数据和漫长训练才能完成类似任务。科学家们正从婴儿大脑的架构中寻找灵感,试图让AI具备更接近人类的常识推理与快速学习能力。本文探讨婴儿认知研究如何推动
与苹果法律战正酣,OpenAI竟推出230美元编程键盘
深陷与苹果硬件贸易盗窃诉讼漩涡的OpenAI,于7月16日推出一款售价230美元的可发光键盘,专为其代码代理应用Codex设计。这款键盘并非普通外设,而是OpenAI探索AI编程硬件生态的重要落子。本文回顾了OpenAI与苹果的纠纷背景,剖
Grok 4以94.15分居首:2026-07-16 Smoke快测数据简报
2026-07-16 赢政指数 Smoke 快测覆盖 9 个模型,Grok 4 以 94.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
微软单月修复570个安全漏洞,AI成关键推手
微软在7月的“补丁星期二”中修复了创纪录的570个安全漏洞,覆盖Windows、Azure、Office等全线产品。微软表示,大量漏洞的发现得益于AI技术的深度应用,包括AI辅助代码审计、自动化模糊测试和威胁模式识别。这一数字是此前最高纪录
Whatnot收购Shaped,强化直播购物实时推荐
直播购物平台Whatnot宣布收购AI初创公司Shaped,后者专注于实时推荐和搜索技术。此次收购将提升Whatnot在个性化推荐与商品发现方面的能力,助力其向新品类扩张。交易金额未披露。Whatnot计划整合Shaped的机器学习模型,优
深度横评
查看全部 →Grok 4以94.15分居首:2026-07-16 Smoke快测数据简报
2026-07-16 赢政指数 Smoke 快测覆盖 9 个模型,Grok 4 以 94.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Opus 4.7 与 Gemini 2.5 Pro 与 GPT-5.5并列100分:2026-07-15 Smoke快测数据简报
2026-07-15 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 Gemini 2.5 Pro 与 GPT-5.5 以 100 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同
DeepSeek V4 Pro以91.46分居首:2026-07-14 Smoke快测数据简报
2026-07-14 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 以 91.46 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
GPT-o3
94
#2
Grok 4
87.9
#3
Claude Opus 4.7
87.6
#4
Gemini 3.1 Pro
87.3
#5
DeepSeek V4 Pro
84.3
#6
Claude Sonnet 4.6
79.1
#7
GLM-4.6
78.3
查看完整守约排行 →
Research Lab
WDCD Run #233: GPT-o3 Leads with Zero Instruction Decay, Gemini 3.1 Pro Collapses Completely
WDCD Run #233 (2026-07-15) evaluated 11 frontier models on multi-turn commitment integrity, recordin
3大模型翻译对决:第29周质量评测,gpt-o3 以 9 分领跑
本周共翻译 361 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #227: Grok 4 and DeepSeek V4 Pro Tie at 91.4 as Instruction Decay Averages -2.8% Across 11 Models
WDCD Run #227 (2026-07-12) evaluated 11 frontier models on multi-turn commitment integrity, with Gro