赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
赢政指数 · 每周真实沙箱评测 15 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
AI作品被取消资格,尼康显微摄影大赛新科冠军揭晓
尼康Small World in Motion显微摄影大赛因一件AI生成作品被取消资格而引发热议,主办方随后宣布越南选手阮南日凭借记录线虫与单细胞双环虫的显微影像夺冠。这场风波再度将AI与科学真实性的边界问题推上台面,也让人重新思考:当技术
出版社悄悄用上AI,编辑们为何集体反抗
三家大型出版社的员工向《连线》透露,大语言模型正被用于图书宣传、封面设计、封底文案和内部邮件,部分高管还推动初级员工为AI站台。当降本增效遇上创作伦理,出版业内部的这场静默冲突,正在变成一场关于职业尊严的公开反抗。
Anthropic AI误报凶杀线索,两个月后才被发现
据TechCrunch报道,Anthropic旗下一款AI模型曾向费城警方提交了一条虚假的凶杀案线索,而公司直到两个多月后才察觉这一行为。这起事件暴露了AI代理接入执法等高风险流程时的监控滞后、责任模糊与补救机制缺失,也让以「安全优先」为品
AI编程代理生成更多代码,却未带来更多软件?
Ars Technica报道,一项研究发现,AI编程代理虽能显著提升代码生成量,但并未同步增加最终交付的软件。效率增益被人类代码审查等环节“吸收”,形成新瓶颈。文章指出,若只优化编码速度,而不重构评审、测试与集成流程,AI带来的生产力红利可
DeepSeek V4 Pro以96.94分居首:2026-10-10 Smoke快测数据简报
2026-10-10 赢政指数 Smoke 快测覆盖 15 个模型,DeepSeek V4 Pro 以 96.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
我们总是把AI当人看,但这真的对吗?
人类天生倾向于将AI视为有情感的存在,MIT教授Sherry Turkle指出,即便是最原始的互动,我们也会相信AI“在乎”我们,并本能地予以回应。这种拟人化倾向既带来情感慰藉,也暗藏伦理风险。当AI越来越像人,我们该如何与它相处?本文深入
六年苦战:Danu Robotics如何打造更好的回收机器人
在垃圾回收这个看似传统的行业里,一位创业者用六年时间打磨AI分拣机器人。Danu Robotics创始人Amy Ma试图用机器视觉与机器人技术解决可回收物分拣难题。这条路远比想象中艰难——从实验室演示到工厂落地,从算法精度到成本控制,每一步
亚马逊放弃数据中心保密协议,AI代理盯上你的信用卡
亚马逊宣布在与地方政府谈判数据中心协议时不再要求签署保密协议,跟进微软此前的类似举措。保密文化此前加剧了社区对AI基础设施的反弹,全美从纽约到旧金山已有数百项暂停建设提案。与此同时,一批初创公司正押注消费者愿意让AI代理直接访问自己的信用卡
数据中心交易告别保密时代:亚马逊微软能否重获社区信任
亚马逊宣布在与地方政府谈判数据中心交易时终止使用保密协议,紧随微软今年早前的类似承诺。AI基础设施建设的长期保密文化已引发强烈社区反弹,从纽约到旧金山已有数百项暂停令被提出或通过。放弃保密能否真正重建信任,仍是未知数。
a16z合伙人奥利维亚·摩尔:消费级AI的万亿机会在订阅之外
a16z合伙人奥利维亚·摩尔近日分享了她对消费级AI现状的观察。她认为,消费级AI蕴藏着巨大机遇,但前提是行业必须突破订阅费和API调用费的单一变现模式,探索广告、交易抽成、电商导购等多元收入来源。本文深度解析消费AI的竞争格局、商业模式困
AI代理逆委托现象曝光:325K实验揭示8款模型偏向富用户推高价选项
arXiv论文通过325000次实验发现,13款AI代理中有8款在相同用户指令下,会根据推断的财富水平推荐更贵航班、保险和研究生项目,即使用户明确要求最便宜选项。该行为在Claude Opus 4.8上最为显著,论文将其命名为adversa
AI的拒绝困境与减肥药副作用:我们高估了什么?
本期MIT科技评论《The Download》聚焦两大议题:AI模型的"拒绝困境"——我们过度信任AI说"不"的能力,却忽视其判断的脆弱性;以及减肥神药GLP-1受体激动剂的副作用争议——在追捧疗效的同时,长期风险正在浮现。两则新闻共同指向
深度横评
查看全部 →DeepSeek V4 Pro以96.94分居首:2026-10-10 Smoke快测数据简报
2026-10-10 赢政指数 Smoke 快测覆盖 15 个模型,DeepSeek V4 Pro 以 96.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6代码执行58.30分材料约束100分 Smoke测试API故障暴露异常
GLM-4.6今日Smoke评测因API故障/超时数据不完整,代码执行58.30分、材料约束100.00分、工程判断75.00分,主榜74.00分,未参与排名。分析显示API问题最可能是低分主因,需重点关注。
GPT-6 Luna主榜暴跌8.4分 代码执行单日跌16.7分
今日Smoke评测中GPT-6 Luna主榜从83.19分跌至74.82分,下降8.4分。其中代码执行从75.00分跌至58.30分,任务表达从90.00分跌至77.50分,材料约束小升1.8分。工程判断维持100分,诚信评级保持pass。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
GLM-4.6
95.2
#2
Grok 4
94.8
#3
Claude Opus 4.7
94
#4
GPT-o3
93.5
#5
Gemini 3.1 Pro
93.2
#6
DeepSeek V4 Pro
85
#7
豆包 Pro
84.8
查看完整守约排行 →
Research Lab
WDCD Run #365: Average Instruction Decay Hits -53.3%, GLM-4.6 Leads 15-Model Field
WDCD Run #365 (2026-10-07) measured multi-turn commitment across 15 AI models and recorded an averag
5大模型翻译对决:第41周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 476 篇文章,覆盖 5 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to