赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
#1
GPT-6 Sol 82.2
·
#2
Claude Opus 4.7 81.5
▼2.4
·
#3
GPT-o3 80.6
▲2.9
·
#4
GPT-5.5 80.5
▲2.3
·
#5
Grok 4 80.4
▼2.9
·
#6
GPT-6 Astra 80.4
·
#7
Claude Sonnet 4.6 80.1
▲3.7
·
#8
GPT-6 Luna 79.4
·
#9
GPT-6.1 Sol 78.6
·
#10
豆包 Pro 76.7
▼3.8
·
#11
DeepSeek V4 Pro 76.4
▲1.3
·
#12
Gemini 3.1 Pro 74.2
▼1.3
·
#13
Qwen3 Max 73.6
▲4.9
·
#14
Gemini 2.5 Pro 72.2
▼1.8
·
#15
GLM-4.6 58.8
▲33.4
·
▲ GPT-6 Luna +82 · ▼ Claude Sonnet 4.6 -10.2
·
赢政指数 · 每周真实沙箱评测 15 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
AI时代的“知心姐姐”:Hot Girl Hotline如何为年轻女性支招
由两姐妹创立的Hot Girl Hotline,利用AI为年轻女性提供个性化约会与情感建议。该平台强调安全性和避免情感依赖,试图在AI陪伴应用泛滥的时代,打造一个更健康、更负责任的情感支持工具,被视为AI时代的“Dear Abby”专栏。
TikTok推AI购物助手与一键结账,边刷边买成真
TikTok 正式上线对话式 AI 购物助手(Shopping Assistant)与一键结账功能,用户可在刷视频的同时用自然语言描述需求、获得商品推荐并直接完成支付。这标志着社交电商正从“算法推荐”迈向“AI 代理代为决策”的新阶段,也意
Instinct把AI智能体搬进群聊:没账号也能一起用
AI智能体初创公司Instinct推出群聊功能,让好友们可以共同调用其AI助手完成旅行规划、拼车安排、活动协调等事务。用户无需拥有Instinct账号即可参与群聊,个人账号与群聊空间保持隔离,个人智能体在共享信息或代为行动前必须获得用户授权
一条命令卸载Apple Intelligence,释放12GB空间
有开发者推出命令行工具,可在 macOS 27 上快速移除 Apple Intelligence 组件,据称能释放超过 12GB 存储空间。这是继系统设置开关之后,用户对端侧 AI 功能拥有更强控制权的又一次尝试。本文梳理该工具的原理、Ap
Reflection发布Beam开放权重模型,低算力对标中国模型
美国AI初创公司Reflection正式发布开放权重模型Beam,主打以更低算力成本对标中国开源模型。该公司将Beam及后续模型瞄准企业与主权国家市场,核心卖点是打造“AI工厂”——让机构用自有专有数据训练Reflection的模型,构建本
GPT-6 Luna 与 GPT-6 Sol并列80.99分:2026-10-06 Smoke快测数据简报
2026-10-06 赢政指数 Smoke 快测覆盖 15 个模型,GPT-6 Luna 与 GPT-6 Sol 以 80.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
预测分析进入智能体AI时代:从预测到自主决策
2026年,企业AI的核心命题已从'预测模型能否超越统计预测'转向'如何让预测系统基于自身结论自主行动,同时不偏离业务意图'。前沿已从预测转向自主决策,企业面临的最大挑战在于弥合'预见'与'行动'之间的鸿沟——既要释放智能体AI的效率红利,
HackerRank的AI面试官已完成50万场面试,招聘要变天?
据TechCrunch报道,HackerRank推出的AI面试官已累计完成超过50万场面试,Snowflake、Snorkel和Capgemini等企业成为早期测试者。这一数字标志着AI面试从技术演示走向规模化商用。本文梳理其运作逻辑、企业
谁将决定冠军?TechCrunch创业擂台终极评委揭晓
TechCrunch Disrupt 2026 公布 Startup Battlefield 200 终极评审团:最后五位评委将决定这场全球最受关注的创业路演大赛冠军归属。本文梳理这项赛事的选拔机制、评审逻辑与历史战绩,并分析为何创业擂台赛
研究人员追踪中国AI“智能体舰队”
TechCrunch报道,独立研究人员发现一支中国AI“智能体舰队”,疑似运行在腾讯基础设施上,并瞄准阿里巴巴旗下地图服务高德。该事件显示,AI代理集群正从实验走向真实网络对抗,可自动爬取、调用API或制造异常流量。云平台、地图服务商与安全
开源还是闭源AI?创始人的技术选型突围战
在TechCrunch Disrupt 2026的圆桌讨论中,多位创始人分享了在开源与闭源AI之间的真实选型逻辑:成本、延迟与合规构成三重权衡,而非此即彼的时代已经结束。混合架构与模型抽象层正成为默认答案,灵活性本身成为早期团队最稀缺的资产
OpenAI推出图像生成视觉广告,AI商业化再进一步
OpenAI宣布在美国市场率先推出视觉广告功能,该广告将出现在用户完成图像生成结果之后。此举标志着OpenAI在商业化探索上迈出重要一步,也引发了关于AI平台广告模式与用户体验平衡的广泛讨论。本文深入分析这一新广告形式的运作机制、行业背景及
深度横评
查看全部 →GPT-6 Luna 与 GPT-6 Sol并列80.99分:2026-10-06 Smoke快测数据简报
2026-10-06 赢政指数 Smoke 快测覆盖 15 个模型,GPT-6 Luna 与 GPT-6 Sol 以 80.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Claude Sonnet 4.6代码执行暴跌27.4分,材料约束却暴涨37.7分
Claude Sonnet 4.6今日Smoke评测中代码执行从71.90分跌至44.50分,材料约束从50.60分升至88.30分,主榜仅微升1.9分至64.21分。工程判断升至100分,任务表达跌至45分。单日10题抽样下,维度剧烈波动
Grok 4代码执行暴跌31.3分 材料约束反升34.7分
Grok 4今日Smoke评测代码执行从95.30分跌至64.00分,降31.3分;材料约束从48.40分升至83.10分,涨34.7分。主榜仅降1.6分至72.60分。单日10题抽签导致的波动是主因,需持续观察。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
95.7
#2
Gemini 3.1 Pro
88.1
#3
GLM-4.6
87.6
#4
DeepSeek V4 Pro
86.6
#5
Claude Opus 4.7
86.3
#6
GPT-5.5
84.2
#7
GPT-o3
84.1
查看完整守约排行 →
Research Lab
5大模型翻译对决:第41周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 476 篇文章,覆盖 5 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 to
WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with G