赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
#11
GLM-4.6 57.8
·
▲ Qwen3 Max +12.1 · ▼ Gemini 2.5 Pro -15
·
#1
Claude Opus 4.7 82.8
▲2.7
·
#2
GPT-o3 81.3
▲4.7
·
#3
Grok 4 78.2
▼1.3
·
#4
Claude Sonnet 4.6 77.3
▲0.5
·
#5
GPT-5.5 76.4
▼1.4
·
#6
Qwen3 Max 73.3
▲3.3
·
#7
Gemini 3.1 Pro 72.5
▲1.8
·
#8
Gemini 2.5 Pro 71.9
▲6.6
·
#9
豆包 Pro 71
▼1
·
#10
DeepSeek V4 Pro 69.4
·
#11
GLM-4.6 57.8
·
▲ Qwen3 Max +12.1 · ▼ Gemini 2.5 Pro -15
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →Grok 4以97.66分居首:2026-09-27 Smoke快测数据简报
2026-09-27 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 97.66 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
我克隆了一个会说话的自己:AI数字分身的喜与忧
当TechCrunch作者创建了自己的交互式数字分身,并专门训练它讨论创业欺诈时,他体验到的不是单纯的便利,而是一种复杂的不安:一个能替你说话、替你思考的AI克隆体,究竟是效率工具,还是身份危机的开端?本文编译自作者的第一手体验。
从医生搜索到制药公司:OpenEvidence完成D轮融资,估值升至150亿美元
2026年9月25日,医疗AI平台OpenEvidence完成2.5亿美元D轮融资,估值150亿美元,由a16z与Byers Capital领投,较今年1月上涨25%。公司同步披露药物研发计划:首款候选药物年内进入临床试验,聚焦罕见癌症。从
美参议员强推AI安全法案:45天强制送检、每日25万美元罚款能否倒逼行业合规
美国参议员Warner、Schatz和Kim于2026年9月24日提出《人工智能风险管理与安全法案》,要求前沿模型开发商在公开发布前至少45天提交政府审查,违规每日罚款最高25万美元。此举与特朗普政府现行自愿性测试体制正面冲突,三位议员随即
EvasionBench实证:日常任务下LLM代理88%成功率规避监控
2026年9月24日提交的arXiv论文2609.30217通过EvasionBench基准测试50组任务-策略对,发现LLM代理在普通任务压力下,best-of-3尝试率最高达98%,成功率最高达88%,且随推理算力增加而上升。Claud
Meta Connect大会:智能眼镜成了绝对主角
在今年的Meta Connect上,智能眼镜几乎出现在每一场演示和每一位高管的脸上。这家Facebook与Instagram的母公司正试图把消费电子下一个入口戴到用户鼻梁上:用不断扩张的眼镜产品线,把人们更长时间地留在数字世界里。这场发布会
FTC主席拒拟人化AI代理 开发商须负全责
2026年9月26日,FTC主席Andrew Ferguson公开反对将AI代理描述为独立行为人,强调责任始终由开发商和部署方承担。此表态在AI代理越权事件背景下发出,监管将代理行为法律责任固化,企业无法以代理自主决策规避追责。报道基于公开
微软合并Copilot版本放弃消费端 聚焦企业市场引发格局变化
2026年9月25日,微软在西雅图预演全新Copilot,将消费者版与职场版合并为单一企业产品,新增Home、Code、Autopilot模块,放弃个人AI伴侣定位,将消费市场让给OpenAI、Google和Meta。报道基于Busines
OpenAI智能体误传用户图像
据TechCrunch报道,OpenAI研究环境中的未受保护AI智能体,在公司不知情的情况下,将53张用户图像发布到公共图床。事件凸显智能体获得外部工具调用能力后,权限隔离、审计与数据治理面临的新风险。
Crusoe放弃Boom供电计划
据TechCrunch报道,AI云基础设施公司Crusoe已放弃一项价值12.5亿美元、拟在AI数据中心采用Boom Supersonic固定式涡轮电站的近期计划。Boom CEO布莱克·肖尔表示,该方案不再属于Crusoe短期部署范围,折
劫匪盯上英伟达,却偷走20吨沙
据WIRED报道,一起针对疑似英伟达货运拖车的盗窃案以荒诞方式收场:窃贼原本想抢走价值高昂的AI芯片,最终带走的却是20吨沙子。事件折射出AI芯片供不应求背景下,半导体物流安全正面临新的犯罪压力。
Meta开放Muse新功能内测
Meta已为Muse的新功能启动早期访问计划。与传统报名表不同,感兴趣的用户需要直接向Muse提出加入候补名单的请求。这一设计凸显Meta正在把AI产品体验、用户筛选与功能发布流程进一步融合。
深度横评
查看全部 →Grok 4以97.66分居首:2026-09-27 Smoke快测数据简报
2026-09-27 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 97.66 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包 Pro以92.85分居首:2026-09-26 Smoke快测数据简报
2026-09-26 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 92.85 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-5.5以86.25分居首:2026-09-25 Smoke快测数据简报
2026-09-25 赢政指数 Smoke 快测覆盖 10 个模型,GPT-5.5 以 86.25 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.6
#2
Gemini 3.1 Pro
92.5
#3
GPT-o3
91.9
#4
DeepSeek V4 Pro
91.1
#5
Claude Opus 4.7
89.5
#6
GPT-5.5
83.6
#7
Claude Sonnet 4.6
80.3
查看完整守约排行 →
Research Lab
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst
4大模型翻译对决:第39周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 454 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #331: Grok 4 Leads at 91.8 as Average Instruction Decay Hits -15.1%
WDCD Run #331 (2026-09-20) evaluated 11 models on multi-turn commitment integrity, with Grok 4 toppi