赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
▲ GLM-4.6 +21.9 · ▼ GPT-o3 -12.5
·
#1
GPT-o3 80.9
▲3.6
·
#2
DeepSeek V4 Pro 79.6
▲5.1
·
#3
Claude Opus 4.7 79
▼4
·
#4
Grok 4 77.8
▼4.4
·
#5
Claude Sonnet 4.6 77.4
▲1.5
·
#6
GPT-5.5 77.1
▼3.4
·
#7
Gemini 2.5 Pro 74
·
#8
豆包 Pro 72.3
▼7.7
·
#9
Qwen3 Max 71.1
▼3
·
#10
Gemini 3.1 Pro 69.4
▲3.5
·
#11
GLM-4.6 63.5
▲10.3
·
▲ GLM-4.6 +21.9 · ▼ GPT-o3 -12.5
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →DeepSeek V4 Pro以96.94分居首:2026-07-31 Smoke快测数据简报
2026-07-31 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 96.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
AI挖漏洞让Chrome每周打两次补丁
Google在2026年6月发布的两轮Chrome更新,修复的漏洞数量超过了此前23次更新的总和。得益于AI辅助的漏洞发现系统,Chrome的补丁发布频率大幅提升至每周两次。这一变化不仅大幅缩短了漏洞修复周期,也标志着AI在网络安全领域的应
蒙大拿州实验医疗中心计划提速:新规允许实验性药物直接销售
蒙大拿州本周通过一项新法案,允许生物科技公司在完成最低限度初步测试(仅需10名健康志愿者)后,支付12,500美元申请新成立的审查委员会批准,即可向消费者销售实验性药物。这一举措被视为该州打造“实验性医疗中心”计划的关键推进,引发医疗伦理与
英伟达开源联盟冷落OpenAI和Anthropic,AI分裂加剧
英伟达领衔的开源AI联盟公开排斥OpenAI和Anthropic等闭源巨头,引发行业对开源与闭源路线之争的新一轮热议。与此同时,白宫AI政策摇摆不定,用户隐私担忧加剧——你的聊天机器人日志可能正被搜索引擎公开索引。本文深度解析这场博弈背后的
谷歌发布Gemini Robotics 2.0:灵巧性与安全性双提升
谷歌近日公布了Gemini Robotics 2.0,该平台包含三个不同级别的模型,但目前仅开放其中一个供开发者使用。新版本在灵巧操作和自主安全决策方面实现显著突破,旨在推动机器人从工业场景向家庭通用服务迈进。本文深度解析其技术亮点与行业影
领英新增一键举报AI生成的“垃圾内容”
领英宣布推出新措施限制低质量AI生成帖子的泛滥,包括新增“像AI垃圾内容”举报按钮,并以AI校对工具取代原有的AI写作功能。此举反映了职场社交平台对内容质量的担忧,也标志着行业从“AI生成”到“AI辅助”的转变。
Hugging Face遭入侵:OpenAI黑客虽凶悍却非无懈可击
近日,AI模型托管平台Hugging Face遭遇一起复杂的网络攻击。攻击者手法迅猛、留下大量痕迹,但最终被安全团队成功拦截。网络安全专家指出,这次事件的最大教训并非AI安全漏洞,而是传统网络安全防御体系的基石作用。从及时检测异常流量到严格
MCP新规破解企业AI落地核心难题
知名科技媒体Ars Technica报道,AI协议Model Context Protocol(MCP)发布最新规范,直指企业采用中的主要障碍——功能稳定性与安全管控。新规不仅明确了工具调用的权限边界,还引入“功能冻结”条款,确保企业集成后
前部署工程师成AI行业新宠,仅2000人达标
一项最新研究估计,全美仅有约2000名工程师具备为企业带来显著AI投资回报所需的专业知识。随着企业争相大规模部署AI,前部署工程师(forward-deployed engineers)成为行业追逐的最新人才焦点。这些工程师不仅精通技术,还
谷歌Gemini Robotics 2:AI从数字走向物理世界
Google DeepMind最新发布的Gemini Robotics 2模型,标志着AI向“物理AGI”迈出了关键一步。该模型不仅能在虚拟世界中推理,还能操控真实物体、执行复杂物理任务,但将AI嵌入现实也引发了关于安全、伦理和滥用风险的新
Nscale收购Anyscale:加码AI计算栈布局
英国AI新锐云服务商Nscale宣布收购软件初创公司Anyscale,后者专注于帮助企业跨数据中心和服务器扩展AI工作负载。这笔交易将整合Anyscale的分布式计算平台(基于Ray框架),助力Nscale在AI基础设施领域构建更完整的垂直
Meta CEO称AI加速应用开发,更多新品即将面世
Meta首席执行官马克·扎克伯格在最新财报电话会议上透露,AI正在极大简化消费级应用的构建与发布流程。继近期为Facebook群组、Marketplace卖家、Instagram和游戏领域推出一系列新产品后,公司正储备更多新消费应用。扎克伯
深度横评
查看全部 →DeepSeek V4 Pro以96.94分居首:2026-07-31 Smoke快测数据简报
2026-07-31 赢政指数 Smoke 快测覆盖 10 个模型,DeepSeek V4 Pro 以 96.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
DeepSeek V4 Pro代码执行暴跌25分 主榜下滑6.7分
今日Smoke评测中,DeepSeek V4 Pro代码执行从100.00跌至75.00,主榜从83.53降至76.85。材料约束升至79.10,工程判断升至100.00,任务表达降至74.20,诚信评级从warn转为pass。单日10题快
Grok 4 Smoke评测主榜暴跌11.3分 材料约束单日降18分
Grok 4今日Smoke评测主榜从89.30分跌至78.01分,降幅11.3分。其中材料约束从78.90分骤降至60.90分,代码执行从97.80分降至92.00分,工程判断则从81.90分升至94.50分。单日波动主要集中在材料约束维度
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
94.8
#2
DeepSeek V4 Pro
93.6
#3
GLM-4.6
93.5
#4
Claude Opus 4.7
92.6
#5
Claude Sonnet 4.6
88.2
#6
GPT-o3
85.7
#7
Gemini 3.1 Pro
81
查看完整守约排行 →
Research Lab
WDCD Run #253: Grok 4 Leads with 94.8 Points as Average Instruction Decay Holds at 4.5%
WDCD Run #253 (2026-07-29) tested 11 models across three dialogue rounds, recording an average commi
3大模型翻译对决:第31周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 381 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #247: Grok 4 Leads with Negative Decay as Average Instruction Decay Narrows to -1.8%
WDCD Run #247 (2026-07-26) evaluated 11 models across three dialogue rounds, recording an average co