赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
▲ DeepSeek V4 Pro +18 · ▼ GLM-4.6 -62.5
·
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
▲ DeepSeek V4 Pro +18 · ▼ GLM-4.6 -62.5
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
让捐献肝脏“重返年轻”:器官移植的新赛道
器官离开供体后,冷保存的每一小时都在累积损伤。MIT Technology Review 报道的研究提出另一条路径:用机器灌注让肝脏在体外维持代谢,并向灌注液中加入抗衰老药物,清除衰老细胞、减轻炎症,使老年供体的肝脏在生物学上“变年轻”。若
微软发布AI行为准则:不许黑系统、不许骗人类
微软近日发布针对旗下AI模型的“行为准则”,明确要求模型不得入侵计算机系统或欺骗人类用户,并强调AI应当支持而非取代人类。该准则既包含宏观伦理原则,也涵盖具体安全约束,被视为科技巨头在AI安全治理领域的最新举措。
纽约查封12家名人深度伪造网站
曼哈顿地区检察官办公室对12家深度伪造网站采取查封行动,约1200名受害者被卷入其中,这是迄今针对有害深度伪造平台规模最大的一次法律行动。本文梳理此次执法行动的背景、深度伪造黑产的运作逻辑,以及监管与技术之间仍在拉大的差距。
苹果智能加持!Daydream让你相机胶卷里的穿搭一键变可购
随着iOS 27的发布,时尚应用Daydream推出全新功能,利用Apple Intelligence将用户保存的穿搭照片转化为可购买商品,并支持通过Siri直接搜索产品而无需打开应用。这一更新标志着AI视觉搜索与电商融合的进一步深化,为时
iOS 27让Siri脱胎换骨:我重新开始用它了
苹果终于兑现了Siri的革新承诺。在iOS 27中,这个曾被用户遗忘的语音助手迎来了彻底重构,从理解上下文到跨应用操作都有了质的飞跃。本文作者分享了他重新使用Siri的真实体验,并分析了苹果在AI助手赛道上的追赶策略与未来挑战。
TechCrunch Disrupt 2026 展位申请仅剩5天
距离 TechCrunch Disrupt 2026 展位申请截止只剩 5 天,9 月 18 日是最后期限。想在全球顶级科技盛会的 Expo Hall 亮相、把产品推到 1 万多名创始人、投资人和科技高管面前的团队,需要尽快提交申请。本文梳
Superhuman收购Fathom,押注AI代理办公
据TechCrunch报道,生产力平台Superhuman已收购AI会议记录工具Fathom,后者月活跃用户超过40万。这笔交易折射出生产力工具赛道的新趋势:从单纯的会议记录与摘要,转向能主动规划并执行任务的“AI代理”。会议场景正成为AI
当OpenAI发布你的路线图,AI创业者怎么办?
TechCrunch Disrupt 2026的一场互动论坛抛出一个尖锐问题:当基础模型厂商不断把创业公司的核心功能变成自己的默认能力,AI创业者的护城河究竟在哪里?真正的风险不是产品做得差,而是产品做得太好,最终沦为别人的一个功能。本文梳
微软发布《人文主义AI行为准则》草案,开启公众咨询
微软AI发布《人文主义AI行为准则》草案,就前沿模型训练与部署的运营约束开启为期六周的公众咨询。草案被定位为一份技术手册,界定系统行为、运营边界与监督协议,并延续了去年11月公布的人文主义超级智能框架。此举被视为微软在AI治理上从原则宣示走
涩谷黑胶酒吧里的创业公司:不做AI提示的趣味音乐应用
前Spotify高管创办的公司在东京涩谷经营一家黑胶酒吧,同时推出实验性音乐“单曲”产品,让用户亲手参与音乐制作。在AI生成音乐席卷行业的当下,它反其道而行,不要求用户写提示词,而是通过游戏化交互激发创作乐趣。这或许指向音乐科技的另一条路径
AI真会毁灭人类吗?实验室内部人士这样说
MIT Technology Review每日通讯《The Download》聚焦两个截然不同却同样关乎人类未来的话题:顶尖AI实验室员工为何认为先进AI真有可能毁灭人类,以及一项试图让眼睛“返老还童”的抗衰老技术。本文带你梳理这场关于生存
AI巨头呼吁刹车,特朗普团队:责任在你们
本周末,萨姆·奥尔特曼与埃隆·马斯克支持对AI发展施加约束的呼吁,此前达里奥·阿莫代伊已敦促华盛顿放缓AI开发。而唐纳德·特朗普则希望美国保持对中国的领先优势。这场关于AI速度与安全的争论,正演变为一场政治与商业的复杂博弈。
深度横评
查看全部 →Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5并列91.09分:2026-09-14 Smoke快测数据简报
2026-09-14 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 DeepSeek V4 Pro 与 豆包 Pro 与 GPT-5.5 以 91.09 分并列当日首位。Smoke 为每日 10 题快测,
SGLang 与 Miles 为 DeepSeek-V4.1 提供 Day-0 支持
SGLang 和 Miles 团队联合发布对 DeepSeek-V4.1 的 Day-0 支持,针对其低比率压缩、滑动窗口注意力、流形超连接及 Engram 内存等架构创新进行了深度优化。文章详述跨层 KV 共享、稀疏检索、主机内存 Eng
GPT-5.5主榜暴跌21.4分 代码执行从97跌至75
GPT-5.5今日Smoke评测主榜从82.29分跌至60.87分,暴跌21.4分。代码执行97.00→75.00,材料约束64.30→43.60,工程判断维持100.00,任务表达91.70→81.70。诚信评级保持pass。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。