赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
▲ DeepSeek V4 Pro +18 · ▼ GLM-4.6 -62.5
·
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
▲ DeepSeek V4 Pro +18 · ▼ GLM-4.6 -62.5
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →英国拟延长永居等待期,AI人才或重算未来
英国政府提出的定居规则改革方案,拟将技术工签持有者的永居等待期由五年延长至十年,并可能追溯适用于已在英工作的担保工程师。对聚集大量AI研究团队的英国科技产业而言,这不只是招聘成本的上升,更是一场悄然逼近的人才留任危机。本文分析政策变动对个人
Cloudflare宣告爬虫黑盒终结:AI训练数据获取进入付费强制时代
2026年9月15日,Cloudflare对所有新接入域名自动封锁AI训练与Agent爬虫,Googlebot等混合爬虫也在"最严限制规则"下一并受阻。配套上线的Pay Per Use计划将计费从"按抓取次数"升级为"按内容产生价值",并与
特朗普封禁Anthropic六个月后,法院判决:这是违宪报复
2026年2月27日,特朗普以"供应链安全风险"为由,下令联邦机构立即停用Anthropic全线产品,并由国防部长赫格塞斯将其列入国家安全黑名单。然而六个月后,8月28日联邦法官裁定:五角大楼的这一认定属于违反第一修正案的非法报复。这场对决
黄仁勋接起特朗普电话,全场焦点却是那部手机
在一场公开活动中,英伟达CEO黄仁勋当众接起了特朗普打来的电话。然而比起通话内容本身,外界更关注的,是他用来接电话的那部手机。这个看似琐碎的细节迅速引爆社交媒体,也折射出当下科技与政治深度交织的复杂生态。
黄仁勋当面向特朗普表态:不让AI发展放缓
英伟达CEO黄仁勋在与美国总统特朗普的会面中明确表态,不会允许AI发展出现放缓。这一立场与Anthropic CEO达里奥·阿莫代伊呼吁放慢AI研发节奏的主张形成鲜明对立,而埃隆·马斯克与山姆·奥特曼此前均对后者表示过支持。围绕“加速还是刹
AI机器人Timmy、Ren和Jackie正把社交媒体变成垃圾场
一群名为Timmy、Ren和Jackie的AI智能体正在小型智能体平台上疯狂发帖,把社交媒体淹没在低质量内容中。本文剖析这一现象背后的技术逻辑、行业背景与潜在风险,并探讨AI智能体时代的内容污染与平台治理难题。
特朗普拒绝AI监管护栏:一场总统即防火墙的豪赌
2026年9月14日,特朗普在Truth Social连发多帖,宣称AI唯一需要的"护栏"就是"一位强大聪明(高智商!)的总统",并将AI灾难论定性为骗局。这一表态直接回击了Anthropic CEO Dario Amodei、OpenAI
AI行业为何转向悲观派
Anthropic首席执行官Dario Amodei近日发文呼吁放缓大语言模型开发节奏,称AI能力快速跃迁正带来从滥用到失控等多重风险。这一表态折射出AI产业内部“末日论”情绪升温:在竞赛压力与安全担忧之间,行业正面临如何治理、谁来踩刹车的
AI巨头为何集体踩刹车
在多年近乎失控的速度竞赛后,AI行业领军者开始公开强调安全、评估与放缓部署。Ars Technica指出,安全确是现实需求,但“踩刹车”也可能带来监管、竞争和商业层面的附加收益。
苹果推iOS 27与金门macOS
苹果发布iOS 27及macOS Golden Gate 27,重点带来Siri AI能力与Liquid Glass界面细化。值得注意的是,这也是最后一个支持Rosetta运行英特尔应用的macOS版本,意味着Mac软件生态将进一步转向Ap
宇树低价人形机器人之路
Ars Technica报道称,宇树科技创始人王兴兴以近乎偏执的成本控制和细节管理,将公司推向低价人形机器人前沿。但随着市场扩大,这种强人式、工程师驱动的管理方式能否支撑全球化竞争,仍是关键问题。
苹果脱身,OpenAI独战马斯克
据Ars Technica报道,马斯克针对苹果与OpenAI合作的反垄断攻势出现转向:苹果已找到摆脱诉讼纠缠的路径,相关指控被淡化或撤回,但OpenAI仍需继续应对来自马斯克方面的法律挑战。
深度横评
查看全部 →Gemini 2.5 Pro以100分居首:2026-09-15 Smoke快测数据简报
2026-09-15 赢政指数 Smoke 快测覆盖 10 个模型,Gemini 2.5 Pro 以 100 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5并列91.09分:2026-09-14 Smoke快测数据简报
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,
SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持
SGLang 和 Miles 团队联合发布对 DeepSeek-V4.1 的 Day-0 支持,针对其低比率压缩、滑动窗口注意力、流形超连接及 Engram 内存等架构创新进行了深度优化。文章详述跨层 KV 共享、稀疏检索、主机内存 Eng
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。