赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
赢政指数 · 每周真实沙箱评测 15 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
谷歌将Gemini升级为AI智能体,企业市场先行
谷歌宣布将智能体能力引入 Gemini,并率先面向企业市场开放。新版 Gemini 能自主规划并执行任务、跨业务系统操作,还可把工作委派给子智能体、调度多个 AI 模型,并拥有独立的工作身份与邮箱地址。这标志着 AI 正从“内容生成工具”转
OpenAI年收入被曝比预期少200亿美元,AI烧钱模式再遭质疑
据TechCrunch报道,此前有消息称OpenAI的年化收入约为700亿美元,但最新报告显示这一数字可能远低于预期,差距高达200亿美元。这一消息引发业界对AI巨头商业模式可持续性的广泛关注,也让市场重新审视大模型公司的真实盈利能力与高昂
本·阿弗莱克竟是AI极客,全网被惊到了
好莱坞影星本·阿弗莱克近日因一段展示其深厚AI知识的视频走红网络。他不仅熟知神经网络和Transformer架构,还能深入探讨开放权重等专业概念。今年早些时候,他将自己的AI电影制作初创公司出售给Netflix。这位演员正用实际行动证明,自
她为Meta设计了新AI标志,随后被骂上热搜
字体设计师杰西卡·希斯接下了Meta新AI标志的设计委托。她早知道为这家公司工作会招来非议,却低估了公众怒火的烈度。一枚标志为何会成为情绪的靶心?这场风波折射的,是设计师个人选择与科技巨头伦理争议之间越来越难以切割的纠缠,也是整个创意行业正
OpenAI解雇安全研究员引争议:前员工警告寒蝉效应
三名被OpenAI解雇的AI安全研究员发表公开信,否认公司关于其“不当处理敏感信息”的指控,并警告称这些解雇正在公司内部制造寒蝉效应,使从事安全与对齐研究的员工不敢发声。这封信再度将OpenAI的安全文化、内部治理与商业竞争压力之间的张力推
Claude Sonnet 4.6以94.74分居首:2026-10-09 Smoke快测数据简报
2026-10-09 赢政指数 Smoke 快测覆盖 14 个模型,Claude Sonnet 4.6 以 94.74 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
AI基建狂潮下,能源高管齐聚TechCrunch Disrupt
TechCrunch Disrupt 2026 将迎来 Ambrosia Energy 首席执行官 Ben Longmier 与 Bloom Energy 高级副总裁 Bill Thayer,两位能源领域高管将在 Smart Systems
99美元智能戒指Natura:把AI智能体戴在指尖
可穿戴厂商Natura推出一款售价99美元的Interface智能戒指,用户只需轻按戒指即可召唤AI智能体,代为完成任务、记录灵感并控制周边设备,同时它还能充当健康追踪器,监测心率与睡眠等数据。在Oura、三星等玩家盘踞的智能戒指赛道,这枚
OpenAI数学证明未达学界标准,指南之争浮出水面
TechCrunch报道,OpenAI近期发布大量数学证明,却偏离了由数学研究者为其制定的指南。这些证明被指缺乏严格形式化、未充分引用文献,也未经过同行评审,引发数学界对AI生成数学结果可信度的质疑。事件折射出AI公司追求基准突破与学术规范
19岁Cal AI创始人再创业,融资千万美元做AI智能体
曾凭卡路里追踪应用Cal AI走红的少年创业者Zach Yadegari,如今19岁再度出发,为新公司募集1000万美元,正式切入个人AI智能体赛道。新公司将直面Instinct、Muse、Bee等竞争对手,试图把AI从聊天工具变成真正替你
Goodfire推「由内而外」AI监控器,捕获失控智能体成本大降
AI智能体安全监控长期面临高昂成本难题。Goodfire推出全新「由内而外」监控方案:不再付费让第二个AI逐条审查智能体的所有行为,而是直接窥探模型内部的运行状态,仅在发现可疑信号时才调用额外资源介入。这一思路有望大幅降低智能体安全防护成本
Google发布本地优先会议笔记应用,挑战Granola
Google 推出全新 AI Edge Foresight 应用,主打本地优先的离线会议笔记体验,直接对标热门工具 Granola。它能在设备端完成对话转写、笔记生成和问答,无需将敏感音频上传云端。此举既顺应端侧 AI 浪潮,也凸显 Goo
深度横评
查看全部 →Claude Sonnet 4.6以94.74分居首:2026-10-09 Smoke快测数据简报
2026-10-09 赢政指数 Smoke 快测覆盖 14 个模型,Claude Sonnet 4.6 以 94.74 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6以87.41分居首:2026-10-08 Smoke快测数据简报
2026-10-08 赢政指数 Smoke 快测覆盖 15 个模型,Claude Sonnet 4.6 以 87.41 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Qwen3 Max WDCD暴跌21.9分 6模型下滑仅豆包Pro逆涨9.5
本期WDCD v3.1测试中,Qwen3 Max分数下降21.9分,Gemini 2.5 Pro下降10.4分,6个模型出现下滑,仅豆包 Pro上升9.5分。GLM-4.6以95.20分位居第一,Grok 4以94.80分紧随其后。数据揭示
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
GLM-4.6
95.2
#2
Grok 4
94.8
#3
Claude Opus 4.7
94
#4
GPT-o3
93.5
#5
Gemini 3.1 Pro
93.2
#6
DeepSeek V4 Pro
85
#7
豆包 Pro
84.8
查看完整守约排行 →
Research Lab
WDCD Run #365: Average Instruction Decay Hits -53.3%, GLM-4.6 Leads 15-Model Field
WDCD Run #365 (2026-10-07) measured multi-turn commitment across 15 AI models and recorded an averag
5大模型翻译对决:第41周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 476 篇文章,覆盖 5 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to