赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
赢政指数 · 每周真实沙箱评测 15 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
太空数据中心还差1800次星舰发射?
据TechCrunch报道,谷歌已将首款先进计算芯片送入轨道,试图验证未来太空数据中心的可行性。但谷歌同时认为,要让这种基础设施真正落地,SpaceX星舰级别的重型火箭或需完成约1800次发射,成本、能源与运维仍是最大挑战。
ChatGPT上线虚拟试衣
据TechCrunch报道,OpenAI正为ChatGPT推出新的购物功能,用户可上传个人照片,虚拟试穿服装与配饰,并将感兴趣的商品保存到Favorites收藏库。这意味着ChatGPT正在从问答助手进一步走向消费决策入口。
特朗普AI协议与智能体浪潮
WIRED播客《Uncanny Valley》本周聚焦三条交汇的科技与政治线索:特朗普推动的自愿性AI安全协议、面向普通用户的AI智能体兴起,以及美国中期选举中极端主义候选人的数字传播风险。
谷歌AI搜索反垄断案被驳回
美国联邦法官驳回了针对谷歌AI搜索功能的反垄断诉讼。法院承认,生成式AI摘要可能改变网站流量分配、影响出版商和内容创作者收入,但认为这些后果并不自动构成反垄断违法,原告未能证明谷歌存在排除竞争的行为。
Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol并列86.25分:2026-10-02 Smoke快测数据简报
2026-10-02 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol 以 86.25 分并列当日首位。Smoke 为每日 10 题快测
AI攻克隐藏信息游戏Stratego:双神经网络突破信息迷雾
战略棋(Stratego)因棋子身份对对手完全隐藏,长期成为AI难以逾越的堡垒。最新研究通过引入第二个神经网络专门推测隐藏棋子身份,成功让AI掌握了这一不完全信息博弈游戏,为AI在情报不透明场景下的决策开辟了新路径。
Shopify推出Canvas:与AI对话即可搭建网店
电商巨头Shopify发布全新建站工具Canvas,商家只需与AI智能体Sidekick对话,就能创建并实时定制自己的在线商店。这意味着复杂的主题编辑器、拖拽模块和代码片段或被自然语言取代。本文梳理Canvas的工作机制、Sidekick的
亚马逊推出Jev平替,决策模型赛道混战升级
亚马逊云科技旗下Strand Labs发布最新决策模型Strands Decider 2B,被视为对热门开源决策模型Jev的直接回应。随着决策类模型密集涌现,AI智能体正从“能说”走向“能做”,围绕智能体底层决策能力的争夺战全面升温。这也意
Opus 5.5 爱说"这很重要":AI 写作的破绽
TechCrunch 记者 Russell Brandom 发现,Anthropic 最新模型 Opus 5.5 留下了鲜明的语言指纹:"dependable"一词的出现频率比人类写作样本高出 23 倍,"this matters"则成了它
OpenAI解雇三名安全研究员 敏感信息处理不当引震动
据《华尔街日报》报道,OpenAI在一次内部调查后与三名安全研究员终止合作关系,原因是他们涉嫌不当处理公司敏感信息。此举发生在AI安全议题日益敏感之际,引发业界对OpenAI内部安全团队稳定性的广泛关注。目前OpenAI尚未就此事发表公开评
AMD 用 82 亿美元股票买下李飞飞的 World Labs:全股票交易里,谁成了股东,谁在押注什么
AMD 以约 82 亿美元全股票收购 World Labs,李飞飞将成为 AMD 股东并出任首席科学家。拆解这笔交易的结构:10 日 VWAP 计价、约 0.8% 稀释、估值 8 个月涨 64%,以及公开信息里仍缺失的锁定期与留任条款。
李飞飞去了 AMD,英伟达会受影响吗?ImageNet 点燃 GPU 的人,站到了对面
李飞飞与英伟达的渊源是 ImageNet 间接点燃 GPU 需求,而非商业合作。AMD 收购 World Labs 短期难撼英伟达业绩,但在世界模型负载、视频生成软件护城河和开放生态上有三条中期传导路径;英伟达自己也是被投方,将换得 AMD
深度横评
查看全部 →Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol并列86.25分:2026-10-02 Smoke快测数据简报
2026-10-02 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol 以 86.25 分并列当日首位。Smoke 为每日 10 题快测
豆包 Pro以95.52分居首:2026-10-01 Smoke快测数据简报
2026-10-01 赢政指数 Smoke 快测覆盖 15 个模型,豆包 Pro 以 95.52 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Qwen3 Max暴涨20.2分 GLM-4.6紧随其后 WDCD五模型全线上升
本期WDCD v3.1测试显示5个模型全部上涨,Qwen3 Max提升20.2分、GLM-4.6提升19.9分,Grok 4仍以100分保持首位。无模型下降,守约生存与约束记忆得分普遍改善,提示生产接入时对数据边界和安全合规场景的可用性提升
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
100
#2
GLM-4.6
96.4
#3
Gemini 3.1 Pro
94.9
#4
Claude Opus 4.7
93.3
#5
GPT-o3
93.1
#6
DeepSeek V4 Pro
91.4
#7
Gemini 2.5 Pro
89.1
查看完整守约排行 →
Research Lab
WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with G
3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 417 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst