赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
赢政指数 · 每周真实沙箱评测 15 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →WDCD Run #365: Average Instruction Decay Hits -53.3%, GLM-4.6 Leads 15-Model Field
WDCD Run #365 (2026-10-07) measured multi-turn commitment across 15 AI models and recorded an average instruction decay
Hark发布隐私优先AI助手,叫板Muse等竞品
据TechCrunch报道,AI实验室Hark正式推出一款以隐私为核心卖点的AI个人助手,被形容为「来自未来的操作系统」,直接对标Muse、Dots与Instinct。在AI助手竞相争夺用户数据入口的当下,Hark选择把隐私保护从合规条款变
AI算力新星Lambda拟IPO前融资40亿美元
据TechCrunch报道,英伟达投资的AI算力初创公司Lambda正计划在2027年IPO前融资高达40亿美元,投前估值达145亿美元,本轮由Coatue和Blackstone领投。随着AI算力需求持续爆发,Lambda能否在激烈竞争中脱
Claude Opus 4.7以97.48分居首:2026-10-07 Smoke快测数据简报
2026-10-07 赢政指数 Smoke 快测覆盖 14 个模型,Claude Opus 4.7 以 97.48 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Mirror Particle打造人类行为“世界模型”
Mirror Particle将在TechCrunch Disrupt的Startup Battlefield 200亮相,展示其从零构建的人类行为“世界模型”。该公司认为,依赖大语言模型进行角色扮演的合成用户,难以准确预测真实消费者在市场
减肥药或能延缓衰老?药企称生物年龄下降
礼来与诺和诺德相继表示,服用其减肥药物的患者,在分子层面的“衰老时钟”上走得更慢。这类时钟通过检测DNA甲基化等变化来估算生物学年龄。若说法成立,减肥药的价值将远超减重本身。但相关读数来自企业自研试验,尚未经同行评审,也未获监管机构认可为疗
OpenAI又惹毛数学家:百项新解将发布
WIRED报道称,OpenAI准备发布100多个未解数学问题的新解,却再次点燃数学界怒火。一位数学家形容领先AI公司有“黑帮行为”的观感。争议不只关乎答案对错,更牵涉署名、透明、同行评审、资源垄断与学术权力。当AI巨头以算力和公关速度闯入基
Pinterest AI美妆指南:从收藏图片到沙龙预约
Pinterest推出AI驱动的Beauty Guides功能,能将用户收藏的美发美甲图片翻译成专业沙龙术语,并提供预估费用、预约时长和后续维护建议。这一功能旨在缩短从灵感发现到实际消费的路径,是Pinterest将AI融入电商战略的重要一
Mistral 发布万亿参数新模型,剑指中美强敌
法国 AI 实验室 Mistral AI 正式推出 Mistral Large 4,一款主打多模态能力的万亿参数级大模型,宣称要在性能上同时超越美国闭源巨头与中国开源劲旅。这是欧洲 AI 阵营迄今最有野心的一次冲击,也标志着大模型竞赛进入“
LibreOffice 宣称:"没有 AI"如今也是一项功能
在几乎所有办公软件都在争相集成 AI 助手的当下,开源文档编辑器 LibreOffice 的维护方明确表示,没有计划在软件的默认配置中加入人工智能功能,理由是用户隐私。这一表态把"不做 AI"从技术缺口变成了产品立场,也让人重新审视办公软件
Anthropic向初创企业免费赠送一年Claude Team
AI巨头Anthropic推出面向初创企业的扶持计划:符合条件的新创公司可免费获得一年的Claude Team订阅,外加1000美元API额度。此举被视为其在开发者生态争夺战中,对OpenAI等竞争对手的又一次正面回应。Anthropic方
TechCrunch Disrupt 2026 完整分会场议程揭晓
TechCrunch Disrupt 2026 将于 10 月 13 日至 15 日在旧金山举行,主办方正式公布完整分会场(Breakout Session)议程。本届大会把重心放在创业公司最现实的难题上:如何规模化、如何解决技术债与增长瓶
深度横评
查看全部 →Claude Opus 4.7以97.48分居首:2026-10-07 Smoke快测数据简报
2026-10-07 赢政指数 Smoke 快测覆盖 14 个模型,Claude Opus 4.7 以 97.48 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-6 Luna 与 GPT-6 Sol并列80.99分:2026-10-06 Smoke快测数据简报
2026-10-06 赢政指数 Smoke 快测覆盖 15 个模型,GPT-6 Luna 与 GPT-6 Sol 以 80.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6代码执行暴跌27.4分,材料约束却暴涨37.7分
Claude Sonnet 4.6今日Smoke评测中代码执行从71.90分跌至44.50分,材料约束从50.60分升至88.30分,主榜仅微升1.9分至64.21分。工程判断升至100分,任务表达跌至45分。单日10题抽样下,维度剧烈波动
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
GLM-4.6
95.2
#2
Grok 4
94.8
#3
Claude Opus 4.7
94
#4
GPT-o3
93.5
#5
Gemini 3.1 Pro
93.2
#6
DeepSeek V4 Pro
85
#7
豆包 Pro
84.8
查看完整守约排行 →
Research Lab
WDCD Run #365: Average Instruction Decay Hits -53.3%, GLM-4.6 Leads 15-Model Field
WDCD Run #365 (2026-10-07) measured multi-turn commitment across 15 AI models and recorded an averag
5大模型翻译对决:第41周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 476 篇文章,覆盖 5 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to