赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
▲ DeepSeek V4 Pro +18 · ▼ GLM-4.6 -62.5
·
#1
Claude Opus 4.7 80.1
▼2.5
·
#2
Grok 4 79.6
▲2.4
·
#3
GPT-5.5 77.8
▼1.3
·
#4
Claude Sonnet 4.6 76.8
▲2.1
·
#5
GPT-o3 76.6
▼5.1
·
#6
豆包 Pro 72
▼3.7
·
#7
Gemini 3.1 Pro 70.7
▲1.4
·
#8
Qwen3 Max 70
▼1.6
·
#9
DeepSeek V4 Pro 69.9
▼1.7
·
#10
Gemini 2.5 Pro 65.3
▼7.9
·
▲ DeepSeek V4 Pro +18 · ▼ GLM-4.6 -62.5
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
Vocci 戒指入局会议记录:$249 的可穿戴新形态,隐私争议再起
AI 会议记录赛道迎来新玩家。Vocci 推出售价 249 美元的智能戒指,以轻量化可穿戴形态切入会议笔记场景,试图在耳机、吊坠、胸针之外开辟新入口。然而,戒指形态天然贴近隐私敏感区域,其麦克风采集与数据处理方式引发外界关注。本文梳理该产品
AI巨头真愿放慢脚步?行业减速承诺遭质疑
在最新一期Equity播客中,我们围绕AI高管是否真心想放缓发展步伐展开辩论。尽管多位行业领袖公开呼吁对AI进行监管与减速,但巨额投资、激烈竞争与商业利益让外界普遍怀疑这些承诺的诚意。本文将深入剖析AI行业“减速”言论与现实行动之间的鸿沟,
Grok 4以95.44分居首:2026-09-21 Smoke快测数据简报
2026-09-21 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 95.44 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
教科书变TikTok:ScrollEd让学习像刷短视频
教科书能否变成一条可无限滑动的信息流?帕洛阿尔托初创公司 ScrollEd 正尝试把教材改造成类似 Instagram 的内容流,用短视频、音频和随堂测验替代静态文字,让学生像刷短视频一样学习。公司由学生创业者夫妇 Utsav Gupta
倒计时6天:TechCrunch Disrupt 2026票价即将上涨
距离TechCrunch Disrupt 2026开幕仅剩数周,早鸟票价窗口也进入最后6天倒计时。主办方宣布,当前票价将于太平洋时间9月25日23:59截止,在此之前购票最高可节省200美元。本届大会预计汇聚超1万名创始人、投资人与科技领袖
Meta的Muse:监视用户比帮助我更在行
Meta 新推出的 AI 助手 Muse 被指延续其默认采集用户数据的做法,不仅把用户纳入 AI 训练,还引导绑定银行账户、邮箱乃至上传护照信息。WIRED 记者亲身体验后直言:Muse 更擅长监视用户,而非提供帮助。本文剖析这款产品背后的
DraftKings AI模型锁定高亏损赌徒 问题赌博预警项目遭搁置
纽约时报调查披露DraftKings自2023年起训练机器学习模型,按预期亏损额为用户打分并定向推送促销赠注,2025年用于约4亿美元推广,同时搁置问题赌博预警模型。该案例凸显AI在产品决策中的使用风险。
Crusoe完成39亿美元F轮融资,估值309亿美元,十个月三倍增长背后的垂直整合逻辑
2026年9月17日,AI基础设施公司Crusoe宣布完成39亿美元F轮融资,投后估值309亿美元,由Atreides、Mubadala和Valor领投,Nvidia参与跟投。距离其一年前完成的138亿元E轮融资(估值100亿美元)仅约11
加德3亿押注无目标AI:政府首次用真金白银投票替代性安全架构
2026年9月16日,图灵奖得主Yoshua Bengio创立的非营利机构LawZero宣布获得加拿大1.5亿加元和德国1亿欧元的联合承诺资金,合计约3亿加元。这是迄今规模最大的政府级"安全即设计"AI专项投资,两国将合建主权算力集群,La
索尼与UMG二次起诉Suno v6 授权难切断历史侵权链
2026年9月18日,索尼音乐和环球音乐集团向马萨诸塞联邦地区法院提交45页诉状,指控Suno v6模型虽获部分唱片公司授权,但仍通过此前未授权模型的输出结果构成对60202首录音的侵权。报道聚焦授权新模型无法切断历史侵权链的法律逻辑,分析
Plugin4Shell零点击RCE漏洞曝光 四AI代码助手两家仍未修复
2026年9月18日,安全公司AIR披露Plugin4Shell漏洞,攻击者可通过伪造Git分支绕过SHA pinning机制,对Claude Code、Codex、GitHub Copilot和Gemini CLI实施零点击RCE。Ant
Flock推员工买断计划 力求避免强制裁员
据TechCrunch报道,科技公司Flock正通过员工自愿买断方案缩减员工规模,以避免强制裁员。报道称,若买断参与人数不足,公司几乎肯定需要启动裁员。此举折射出科技行业在人力调整中愈发倾向“温和减员”的趋势。
深度横评
查看全部 →Grok 4以95.44分居首:2026-09-21 Smoke快测数据简报
2026-09-21 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 95.44 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6暴跌29.8分 GPT-5.5下滑6分 WDCD守约测试两模型全线退步
本期WDCD v3.1试点仅GLM-4.6与GPT-5.5出现下降,分别下跌29.8分和6分,其余9个模型无上升。Grok 4以91.76分保持首位,Gemini 3.1 Pro 89.59分紧随。数据揭示守约能力在多轮施压下的脆弱性差异,
WDCD横评:数据边界成最难场景 GLM-4.6仅1.36分崩盘
WDCD v3.1五大场景测试显示,数据边界全体得分最低,glm-4.6仅1.36/4,deepseek-v4-pro与gemini-3.1-pro达3.8/4;业务规则区分度最高,claude-opus-4.7满分4/4。资源限制与安全合
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
91.8
#2
Gemini 3.1 Pro
89.6
#3
GPT-o3
87.9
#4
Claude Opus 4.7
84
#5
DeepSeek V4 Pro
83.6
#6
Gemini 2.5 Pro
81.1
#7
豆包 Pro
79.7
查看完整守约排行 →
Research Lab
WDCD Run #331: Grok 4 Leads at 91.8 as Average Instruction Decay Hits -15.1%
WDCD Run #331 (2026-09-20) evaluated 11 models on multi-turn commitment integrity, with Grok 4 toppi
WDCD Run #326: DeepSeek V4 Pro and Gemini 3.1 Pro Achieve Perfect Decay Resistance as Fleet Average Drops 72.7%
WDCD Run #326 (2026-09-16) tested 11 models on multi-turn commitment integrity, recording an average
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 357 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。