赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
▲ Qwen3 Max +12.1 · ▼ Gemini 2.5 Pro -15
·
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
▲ Qwen3 Max +12.1 · ▼ Gemini 2.5 Pro -15
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
Supabase用户数据暴露警钟
TechCrunch报道称,部分Supabase客户因配置不当,将大量用户数据公开暴露在互联网上。事件并非平台整体被攻破,而是凸显AI生成应用、低代码和“氛围编程”在快速上线时容易忽视权限、数据库规则与安全审计,进而让个人信息面临泄露风险。
Meta Muse抢走AI聚光灯
OpenAI与Anthropic同日密集发布模型更新,试图重新定义前沿AI竞赛节奏。但真正引发行业关注的,却是Meta个人AI代理Muse。据称其早期增长速度已超过ChatGPT同期表现,显示AI入口之争正从模型能力转向用户场景与分发网络。
Nscale IPO前获33.6亿美元
英国AI新型云服务商Nscale在筹备赴美IPO之际,获得33.6亿美元可转换融资,投资方包括Third Point、英伟达等。资金将用于推进其大规模AI数据中心建设,凸显资本市场对算力基础设施的持续押注。
马克·沃尔伯格将登台Disrupt
TechCrunch宣布,演员兼创业者马克·沃尔伯格将亮相TechCrunch Disrupt 2026,与布鲁斯·K·李对谈投资、创业、医疗健康与身心 wellness。他强调此次并非聚焦个人履历,而是希望讨论创业者正在打造的产品与公司。
AI尚未重创应届生就业
生成式AI被普遍认为会最先冲击应届毕业生和初级白领岗位,但最新失业与招聘数据并未支持这一判断。Ars Technica援引相关分析称,目前尚无证据显示AI已造成大规模岗位替代或显著压缩新人招聘。
Anthropic百亿押注Akamai云
Anthropic与Akamai达成七年116亿美元云基础设施协议,未来规模可能增至约200亿美元。交易突出其对CPU算力的重视,并包含最高5%潜在股权安排。
豆包 Pro以92.85分居首:2026-09-26 Smoke快测数据简报
2026-09-26 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 92.85 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Meta全力押注Muse:AI应用爆红,分发战开打
Meta旗下的个人AI助手应用Muse近期冲上应用商店榜首,用户增长迅猛。据TechCrunch报道,Meta正动用Facebook、Instagram、WhatsApp等全线产品的分发能力为Muse导流,并把它定位为「个人AI代理」。在O
上诉法院支持五角大楼将Anthropic列为供应链风险
美国联邦上诉法院的一个分裂合议庭裁定,允许五角大楼将AI公司Anthropic列为供应链风险。Anthropic此前主张该认定侵犯其多项权利,但法院最终站在了特朗普政府一边。这一裁决可能对AI企业与美国国防部的合作格局产生深远影响,也为政府
AI模型通过图灵"另一项测试":完成二战密码破译遗志
TechCrunch报道,前沿AI模型Astra与Opus成功通过了艾伦·图灵在二战期间未竟的密码破译测试。这项测试不同于广为人知的"图灵测试",它衡量的是AI在真实密码分析任务中的能力。图灵当年在布莱切利园破解恩尼格玛密码的工作,被视为现
微软松口:新Surface不再自称Copilot+ PC
微软在最新Surface笔记本上悄然放弃“Copilot+ PC”品牌标识,不再要求用户必须购买带有该标签的设备。这标志着微软对AI PC的激进营销出现转向:从强调NPU算力与专属AI功能,转向让AI体验更自然融入Windows。本文梳理C
TechCrunch Disrupt 2026最后24小时:省200美元,抓住势头
TechCrunch Disrupt 2026大会进入最后24小时报名优惠,最高可省200美元。本文解读参会第5大理由——“势头”:在AI技术加速变革的当下,初创企业需要借助顶级科技盛会获取动能、人脉与洞察。错过优惠将多付200美元,更可能
深度横评
查看全部 →豆包 Pro以92.85分居首:2026-09-26 Smoke快测数据简报
2026-09-26 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 92.85 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-5.5以86.25分居首:2026-09-25 Smoke快测数据简报
2026-09-25 赢政指数 Smoke 快测覆盖 10 个模型,GPT-5.5 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Opus 4.7 与 Gemini 3.1 Pro并列84.61分:2026-09-24 Smoke快测数据简报
2026-09-24 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 Gemini 3.1 Pro 以 84.61 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.6
#2
Gemini 3.1 Pro
92.5
#3
GPT-o3
91.9
#4
DeepSeek V4 Pro
91.1
#5
Claude Opus 4.7
89.5
#6
GPT-5.5
83.6
#7
Claude Sonnet 4.6
80.3
查看完整守约排行 →
Research Lab
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst
4大模型翻译对决:第39周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 454 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #331: Grok 4 Leads at 91.8 as Average Instruction Decay Hits -15.1%
WDCD Run #331 (2026-09-20) evaluated 11 models on multi-turn commitment integrity, with Grok 4 toppi