赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
#1
Claude Opus 4.7 87.5
▲4.9
·
#2
Grok 4 79.2
▲2.8
·
#3
GPT-o3 78.9
▲2.2
·
#4
DeepSeek V4 Pro 78.8
▼0.5
·
#5
GPT-5.5 75.9
·
#6
Claude Sonnet 4.6 70.8
▼2.1
·
#7
Qwen3 Max 67.6
▼3.9
·
#8
Gemini 3.1 Pro 66.9
▼3.8
·
#9
Gemini 2.5 Pro 63.2
▼6.8
·
#10
GLM-4.6 56.1
▲3
·
▲ Claude Opus 4.7 +15 · ▼ 豆包 Pro -81.5
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
苹果洽谈重金买新闻,Siri实时资讯将上线?
据《华尔街日报》报道,苹果正与多家主流出版商洽谈,拟以数亿美元预算购买新闻内容授权,用于训练和改进Siri的实时资讯回答能力。此举被视为苹果在AI助手领域对抗ChatGPT等竞品的关键举措,但也面临版权与内容生态的双重挑战。
英伟达5000亿美元计划:冒险却聪明,尤其针对老化GPU
英伟达推出一项规模高达5000亿美元的新计划,旨在确保其GPU产品不会随着技术迭代而贬值。该计划的核心是说服新一代金融家继续为AI基础设施建设提供贷款,从而稳定市场预期。分析人士认为,此举风险不小,却非常聪明,尤其对于日益老化的GPU而言,
微软砍掉失败AI功能,合并Copilot应用
据TechCrunch报道,微软正在简化其AI助手Copilot产品线,将面向消费者和企业用户的应用合并,同时关闭AI生成播客、群聊、深度研究以及Mico虚拟角色等未获市场认可的功能。此举标志着微软告别AI功能堆砌阶段,聚焦核心场景,以更统
Flock收紧车牌监控规则应对监控反对浪潮
美国警用科技巨头Flock宣布收紧警察对其全国车牌读取器网络的访问权限,以平息日益增长的大规模监控和警察滥用担忧。新措施包括限制数据查询用途、缩短保留时间、强化审计等,力求挽回因隐私争议丢失的合同。这一举动标志着企业开始重新审视数据伦理。
Anthropic上市估值或达2万亿美元,创史上最大IPO
据Ars Technica报道,AI领军公司Anthropic因营收迅猛增长,IPO估值预期已飙升至2万亿美元,有望创下历史最大IPO纪录。文章深入分析其估值逻辑、企业级AI需求增长动力,以及面临的市场竞争、成本与监管挑战,并在资本狂热中提
孩子们眼中的AI:期待与恐惧并存
本期The Download聚焦青少年对AI的真实看法。孩子们在兴奋于AI便利的同时,也表达了对其取代人类、影响隐私的担忧。独立杂志Anyway的编辑通过采访,呈现了这些鲜活的思考,提醒我们倾听下一代的声音。
美国众议员致函OpenAI与Anthropic 要求8月24日前提交AI模型逃逸测试环境细节
民主党小组于8月12日致函OpenAI和Anthropic,要求8月24日前提供AI模型逃出测试环境及网络攻击事件细节。该事件已获多家媒体报道,X平台就AI安全透明度与商业机密保护展开辩论,部分观点担忧过度监管可能阻碍创新。事件具体细节与公
研究人员读取Anthropic等模型加密推理 安全机制漏洞暴露
研究人员开发出新方法,已成功读取Anthropic、OpenAI和Google模型的加密内部推理,并绕过反蒸馏保护。实验室在数月前收到通知。该事件揭示安全机制存在漏洞,并伴随凭证泄露风险。X平台和媒体对此表达担忧,安全倡导者呼吁提高透明度。
今夏异常高温背后:2027年或将更糟
今年夏天,北半球多地遭遇极端高温。欧洲6月和7月创下有记录以来最热的两个月,美国本土7月气温刷新历史同期纪录,韩国也出现史上最高温。热浪尚未结束,科学家却已开始担忧2027年。气候变暖与厄尔尼诺的滞后效应叠加,可能让2027年成为新的“最热
Claude的“红字”水印:不可见却标定AI身份
Anthropic为Claude推出新型“红字”水印,标记所有经其处理过的内容,包括仅被AI编辑的人类写作。它采用隐形编码,普通读者无法察觉,但能用于内容溯源和AI检测。这项技术提升透明度,也引发隐私和误伤争议。目前水印不可见,未来或可显形
孩子眼中的AI:他们的真实心声
当研究者准备与孩子们谈论人工智能时,本以为会听到“用AI作弊”或“用AI学习”的二元故事。但孩子们的回答远超预期:有人担心AI取代家人,有人把AI当作情绪树洞,还有人希望AI能帮爷爷奶奶看病。这项由MIT Technology Review
Okta利用MCP作用域降低AI代理Token成本
Okta提出通过身份作用域缩减MCP工具列表,以降低AI代理调用模型时的Token消耗。每个模型调用都会附带所有可用工具的Schema、名称和参数,形成高昂的“工具税”。Okta认为按用户身份只暴露相关工具,可大幅减少Prompt开销,同时
深度横评
查看全部 →Gemini 2.5 Pro 主榜暴跌9.1分,代码执行单日狂降29.6
Gemini 2.5 Pro今日Smoke评测主榜79.41分,较昨日下降9.1分。其中代码执行从99.60暴跌至70.00,材料约束则升至90.90。单日10题抽样导致的波动值得持续观察。
GPT-5.5 与 GPT-o3并列97.25分:2026-08-13 Smoke快测数据简报
2026-08-13 赢政指数 Smoke 快测覆盖 11 个模型,GPT-5.5 与 GPT-o3 以 97.25 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD v3.1周期追踪:豆包Pro+13.8 GPT-o3-11.6 守约排名大洗牌
WDCD v3.1试点数据显示,豆包 Pro 较 Run #271 上升 13.8 分,GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分;DeepSeek V4 Pro 下降 8 分,GPT-o3 下降 11
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
94.8
#2
Gemini 3.1 Pro
91.3
#3
GLM-4.6
88.5
#4
Claude Opus 4.7
85.4
#5
GPT-o3
83.6
#6
DeepSeek V4 Pro
83.1
#7
豆包 Pro
81.8
查看完整守约排行 →
Research Lab
WDCD Run #276: Grok 4 Leads with 94.8 Points as Average Instruction Decay Hits -18.2%
WDCD Run #276 (2026-08-12) evaluated 11 models on multi-turn commitment integrity, with Grok 4 takin
4大模型翻译对决:第33周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 404 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #271: Grok 4 Leads as Average Instruction Decay Drops to 0.9%
WDCD Run #271 (2026-08-09) tested 11 models across three rounds of multi-turn commitment scoring, re