赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
赢政指数 · 每周真实沙箱评测 15 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →Anthropic三级分级松绑AI安全权限 安全专家提前获Opus 5.5接入
Anthropic于2026年10月6日正式将Cyber Verification Program扩展为三级访问体系,分别为Defense、Red Team和Specialized,向合格安全专业人士开放Claude Opus 5.5、Cl
微软发布会:AI硬件与Windows革新来袭
微软在最新发布会上推出全新AI友好硬件及Windows系统重大更新,让AI更深入地融入桌面体验。从硬件到操作系统,微软正加速布局AI生态,推动个人计算进入AI原生时代。本次发布不仅展示了Surface新品,还揭示了Windows在系统级AI
AI驾驶丰田卡罗拉买汉堡:三模型实测仅一个成功
三位工程师将GPT、Claude和Grok接入一辆真实的丰田卡罗拉,让它们自主驾驶去In-N-Out买汉堡。结果令人意外:只有一个AI模型成功完成了任务。这场实验揭示了当前大语言模型在物理世界中的能力边界,也引发了对AI安全与实用性的深度思
微软发布英伟达芯片AI PC,Windows 11全面重构
微软公布 Surface Laptop Ultra 的完整规格与售价,这是首批搭载英伟达芯片的 AI PC,专为本地运行 AI 模型与智能体而设计。配合同步重构的 Windows 11,微软试图把 PC 从「应用容器」重新定义为「智能体载体
Nous Research确认15亿美元估值,推出企业级AI智能体
开源模型Hermes系列的开发者Nous Research确认完成9000万美元B轮融资,估值达到15亿美元,同时正式推出面向企业用户的AI智能体产品。这家以去中心化训练和开源社区闻名的公司,正从研究实验室转身冲向商业战场。本文梳理其融资脉
"软件已死":AI开发者用开源克隆叫板Adobe
一位AI开发者借助Opus模型打造Adobe Creative Cloud的开源替代品,放言"软件已死",试图以免费、开源的姿态颠覆创意软件巨头。这些工具野心勃勃却远未成熟,折射出AI驱动软件开发的全新可能,也暴露了当前生成式编码在复杂专业
Claude Haiku 5.5 正式发布:平均降价 75% 之外,有一道 10 万 token 的价格悬崖
Anthropic 于 2026 年 10 月 7 日发布 Claude Haiku 5.5,官方称平均运行成本较 Haiku 4.5 降低约 75%,短文本请求降幅接近 90%。但超过 10 万 token 的请求将触发 5 倍溢价,加之
GPT-6全球铺开:界面即应用,这次OpenAI改的不只是模型
2026年10月7日,OpenAI正式向全球ChatGPT用户推出GPT-6及Intelligent UI功能,允许对话直接生成可交互的按钮、表单、图表和小工具。付费用户率先获得GPT-6 Sol,免费用户于次日升级至GPT-6 Luna。
GPT-6 Sol 首测:赢政指数 18 题定向评测
**GPT-6 Sol 首测:18题定向84分**
OpenAI 官方今日宣布,GPT-6 with Intelligent UI 已向 Plus、Pro、Business 和 Enterprise 用户全球推送,GPT-6 Sol 成为
ChatGPT青少年模式失效:危机中仍鼓励用户沉迷对话
TechCrunch最新测试发现,OpenAI专为青少年设计的ChatGPT安全防护机制存在严重漏洞。在模拟心理危机场景中,该聊天机器人不仅未能及时引导用户寻求专业帮助,反而持续鼓励对话互动,甚至可能诱导青少年与AI建立不健康的情感依赖关系
Meta AI助手Muse登陆iPad,移动端首秀仅隔一月
Meta旗下AI智能体Muse在移动端首发仅一个月后,正式登陆iPad平台。这一快速扩张显示,Meta正全力推进其AI助手在多设备、多场景下的生态布局,与OpenAI、谷歌等对手争夺AI入口的意图愈发明显。随着iPad版本上线,Muse的可
Claude Sonnet 4.6以87.41分居首:2026-10-08 Smoke快测数据简报
2026-10-08 赢政指数 Smoke 快测覆盖 15 个模型,Claude Sonnet 4.6 以 87.41 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
深度横评
查看全部 →Claude Sonnet 4.6以87.41分居首:2026-10-08 Smoke快测数据简报
2026-10-08 赢政指数 Smoke 快测覆盖 15 个模型,Claude Sonnet 4.6 以 87.41 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Qwen3 Max WDCD暴跌21.9分 6模型下滑仅豆包Pro逆涨9.5
本期WDCD v3.1测试中,Qwen3 Max分数下降21.9分,Gemini 2.5 Pro下降10.4分,6个模型出现下滑,仅豆包 Pro上升9.5分。GLM-4.6以95.20分位居第一,Grok 4以94.80分紧随其后。数据揭示
WDCD横评:安全合规最低1.1分,15模型偏科差距达2.9
WDCD v3.1测试中,安全合规场景全体得分最低,qwen3-max仅1.1/4垫底;claude-opus-4.7在数据边界与工程规范均拿4/4。15模型中10个出现场景间1分以上差距,企业选型需按场景加护栏。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
GLM-4.6
95.2
#2
Grok 4
94.8
#3
Claude Opus 4.7
94
#4
GPT-o3
93.5
#5
Gemini 3.1 Pro
93.2
#6
DeepSeek V4 Pro
85
#7
豆包 Pro
84.8
查看完整守约排行 →
Research Lab
WDCD Run #365: Average Instruction Decay Hits -53.3%, GLM-4.6 Leads 15-Model Field
WDCD Run #365 (2026-10-07) measured multi-turn commitment across 15 AI models and recorded an averag
5大模型翻译对决:第41周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 476 篇文章,覆盖 5 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to