赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
#1
Claude Opus 4.7 83.9
▲1.1
·
#2
Grok 4 83.3
▲5.1
·
#3
豆包 Pro 80.5
▲9.5
·
#4
GPT-5.5 78.2
▲1.8
·
#5
GPT-o3 77.7
▼3.6
·
#6
Claude Sonnet 4.6 76.4
▼0.9
·
#7
Gemini 3.1 Pro 75.5
▲3
·
#8
DeepSeek V4 Pro 75.2
▲5.8
·
#9
Gemini 2.5 Pro 74
▲2.1
·
#10
Qwen3 Max 68.7
▼4.6
·
#11
GLM-4.6 25.4
▼32.4
·
▲ DeepSeek V4 Pro +16.2 · ▼ GLM-4.6 -47.9
·
赢政指数 · 每周真实沙箱评测 15 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →OpenAI安全主管Robinson上周离职 两年内第七位高层出走IPO前安全机制空档
OpenAI安全透明主管David Robinson上周离职,这是该公司过去两年内第七位出走的安全高层。此前三名安全研究员因向外部监察机构泄露信息被解雇。事件发生在OpenAI冲刺四季度IPO节点,负责撰写模型“系统卡”的核心人员离开,令外
苹果收紧全盘访问权限,遏制AI代理滥用
苹果近日调整macOS的全盘访问权限机制,旨在阻止AI代理程序滥用高权限读取用户数据。Meta对此提出异议,认为苹果的权限管控不足以解决消息被读取的风险,苹果则予以反驳。这一举措折射出AI代理快速普及背景下,操作系统厂商与AI应用开发者之间
亚马逊10亿美元计划遭反噬:公关难掩数据中心污染争议
亚马逊宣布投入10亿美元,用于回馈承载其数据中心的社区,并承诺不再要求居民与地方官员签署保密协议。这一转向获得部分肯定,但公司通篇回避数据中心自身的污染足迹——柴油发电机排放、水资源消耗与电价上涨,被批评者指为用慈善掩盖外部成本。当AI算力
Sean Parker携音乐重塑Stability AI,唱片业从敌人变盟友
曾以Napster颠覆音乐产业的Sean Parker,如今带着唱片公司的祝福和资金回归,围绕音乐生成重建Stability AI。从“请求原谅”到“请求许可”,这位争议人物能否在AI时代完成救赎?本文深度解析Stability AI的战略
谷歌9月AI全线推进:Gemini 4 Argon百万Token输出、网络防御优先、卫星在轨跑TPU
谷歌在2026年9月完成了年内最密集的一轮AI产品推进:旗舰模型Gemini 4 Argon以业界最高的百万token输出上限和网络安全优先入场策略收官当月;Gemini 3.8系列、语音模型和Windows端齐头并进;科学侧同步落地Alp
美逮捕一科技CEO,涉走私3亿美元英伟达芯片入华
美国执法部门逮捕一名科技公司首席执行官,指控其参与将价值约3亿美元的英伟达AI芯片走私进入中国,以规避美国出口管制。这是近年来针对先进计算芯片非法流向中国的最新一宗刑事行动,也再次暴露出口管制在执行环节的供应链漏洞。随着逮捕案例接连出现,英
受裁员影响?TechCrunch Disrupt 2026通行证仅75美元
TechCrunch 活动团队宣布,面向受裁员影响的科技从业者,TechCrunch Disrupt 2026 的 Expo+ Pass 推出 75 美元特别优惠,仅限前 100 名符合条件的申请者。对正在重新规划职业路径的工程师、产品经理
Claude Opus 4.7以98.65分居首:2026-10-03 Smoke快测数据简报
2026-10-03 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 以 98.65 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
AI排班酿混乱:护士警告安全问题
据WIRED报道,一家大型医院集团和放射影像网络引入Palantir的AI排班软件,试图简化护士排班。但护士与员工反映,新系统频繁出错,导致排班混乱、职业倦怠和沮丧。他们警告,这不仅是管理效率问题,更可能演变为患者安全风险。AI在医疗运营中
自主AI重塑企业智能:2.5万亿美元投资加速落地
企业AI已不再是未来愿景,而是进入全面运营。模型能力快速提升、性能成本持续下降,推动自主AI从辅助工具走向可规划、执行与闭环优化的智能系统。2026年全球AI投资预计达2.5万亿美元,同比增长44%。本文分析企业智能被重新定义的路径,以及规
AI伤孩子于无形,这家公司想造“碰撞测试假人”
当公众讨论还聚焦于AI的“存在性风险”时,心理层面的AI伤害早已真实发生。TechCrunch报道称,初创公司Circuit Breaker Labs提出用“碰撞测试假人”的思路评估AI,通过模拟不同心理脆弱程度的用户,在产品上线前提前探测
白宫将AI改称“超级智能”,科技巨头签署安全承诺
本周,白宫召集几乎所有主要科技公司CEO,包括扎克伯格、贝索斯、马斯克和Anthropic的达里奥·阿莫代伊,签署被特朗普称为“道德约束”的AI安全承诺。特朗普还签署行政令,正式将AI更名为“超级智能”。同时,Meta和OpenAI试图让A
深度横评
查看全部 →Claude Opus 4.7以98.65分居首:2026-10-03 Smoke快测数据简报
2026-10-03 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 以 98.65 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GLM-4.6 材料约束 100 分代码执行 41.70 分 诚信探针仅 15 分
GLM-4.6 在 2026-10-02 Smoke 快测中材料约束达到 100.00 分,代码执行仅 41.70 分,主榜 67.94 分,诚信评级 fail(探针 15.00)。当日 14 个模型中仅 GLM-4.6 触发诚信探针,其余
Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol并列86.25分:2026-10-02 Smoke快测数据简报
2026-10-02 赢政指数 Smoke 快测覆盖 15 个模型,Claude Opus 4.7 与 GPT-5.5 与 GPT-6 Astra 与 GPT-6.1 Sol 以 86.25 分并列当日首位。Smoke 为每日 10 题快测
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
100
#2
GLM-4.6
96.4
#3
Gemini 3.1 Pro
94.9
#4
Claude Opus 4.7
93.3
#5
GPT-o3
93.1
#6
DeepSeek V4 Pro
91.4
#7
Gemini 2.5 Pro
89.1
查看完整守约排行 →
Research Lab
WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with G
3大模型翻译对决:第40周质量评测,deepseek-v4-pro 以 8.7 分领跑
本周共翻译 417 篇文章,覆盖 3 个AI模型。经抽样盲评,deepseek-v4-pro 综合得分最高(8.7/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average inst