赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
▲ Claude Opus 4.7 +15 · ▼ GLM-4.6 -30.8
·
#1
Grok 4 81.6
▲7.6
·
#2
Claude Opus 4.7 80.9
▼1.7
·
#3
GPT-o3 80.2
▲2.1
·
#4
豆包 Pro 79.8
▲1.5
·
#5
GPT-5.5 76.1
·
#6
Claude Sonnet 4.6 75.2
▼2.3
·
#7
Qwen3 Max 72.9
▼1.1
·
#8
Gemini 2.5 Pro 71.9
▲0.6
·
#9
DeepSeek V4 Pro 70.3
▲2.8
·
#10
Gemini 3.1 Pro 66.6
▼3.4
·
#11
GLM-4.6 66.5
▲13.2
·
▲ Claude Opus 4.7 +15 · ▼ GLM-4.6 -30.8
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →
AI数据中心Crusoe获30亿美元融资 估值达300亿
据TechCrunch报道,数据中心开发商Crusoe在与Jane Street签署130亿美元合同后,完成了一笔30亿美元的新融资,估值攀升至300亿美元。这轮融资再次把AI基础设施投资推向高潮,也揭示出从天然气发电转型而来的Crusoe
ARC-AGI-3框架差异致GPT-6 Astra成绩现37点鸿沟
2026年9月3日ARC Prize发布报告显示,GPT-6 Astra在ARC-AGI-3上因测试框架不同得分出现37个百分点差距,标准harness为62.7%、Provider Adapter harness为99.9%。本文从事实还
预测市场押注引逮捕,科技大佬却在瞎谈“流氓AI”
在WIRED最新一期播客《Uncanny Valley》中,编辑们聊到了本周最离奇的科技新闻:预测市场狂热让押注者被禁号、失业甚至被捕;AI监控公司Flock为警察提供跨摄像头搜索工具,社区隐私一退再退;硅谷“科技老哥”们把想象中的“流氓A
OpenAI与Anthropic同时宕机,原因成谜
9月4日,ChatGPT、Claude和Grok三大AI服务几乎在同一时间遭遇大规模宕机,引发行业震动。截至目前,OpenAI与Anthropic均未给出明确解释,用户和专家纷纷猜测是否与基础设施、网络攻击或电力问题有关。本次事件凸显了AI
OpenAI发布GPT-6 Astra:10万GPU铸就最大训练规模,网络安全能力首达关键门槛
2026年9月3日,OpenAI正式启动GPT-6 Astra的分阶段发布,该模型使用超10万GPU完成预训练,是该公司历史上规模最大的一次训练。Astra在ARC-AGI-3上得分98.6%,并成为首个突破OpenAI"关键"网络安全门槛
桑德斯提案永久禁止人工超级智能:核武器级处罚能管住已出笼的AI吗
2026年9月3日,美国参议员伯尼·桑德斯与众议员格雷格·卡萨尔联合提出《禁止人工超级智能法案》,拟永久禁止超级智能开发,并暂停先进AI研发直至联邦监管框架建立。违者面临"企业死刑"及最高20年有期徒刑。法案直接援引Anthropic的暂停
Abliteration.ai:把移除AI安全护栏做成了一门生意
Abliteration.AI推出去除安全护栏的AI模型访问服务,宣称让防御者与恶意行为者拥有同等工具,长期看将改善网络安全。然而这类模型极易被滥用,也暴露了当前AI对齐技术的脆弱性。本文编译自TechCrunch,探讨这种“威胁透明”式商
传Accel拟领投Thinking Machines 10亿美元融资,估值达400亿美元
据TechCrunch报道,投资机构Accel正就领投AI初创公司Thinking Machines新一轮融资进行洽谈。本轮融资金额约10亿美元,估值达400亿美元。这家备受关注的AI公司当前年收入运行率已超1亿美元。若交易达成,Think
GLM-4.6材料约束+28.2分却工程判断-39.6 诚信从fail升pass主榜反涨12.7
GLM-4.6今日Smoke评测主榜从48.25升至60.94,材料约束从46.10升至74.30,工程判断从64.60跌至25.00,任务表达从50.00跌至25.00,诚信评级从fail升至pass。单日10题抽签导致侧榜剧烈波动,主榜
GPT-5.5代码执行从100暴跌至75 Smoke评测主榜降7.5分
GPT-5.5今日Smoke评测代码执行从100.00跌至75.00,主榜从79.12降至71.67。材料约束反升14分至67.60,工程判断同步跌25分。单日10题抽样导致的波动与模型真实退化需区分判断。
Claude Opus 4.7以92.49分居首:2026-09-04 Smoke快测数据简报
2026-09-04 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 92.49 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
为避马斯克,OpenAI放弃年入十亿美元客户
WIRED独家获悉,OpenAI内部预计与AI编程工具Cursor的合作每年可带来超10亿美元收入,但在马斯克旗下SpaceX收购这家初创公司后,OpenAI仍坚决终止合作。放弃巨额收入背后,既是科技巨头间的技术安全博弈,也折射出个人宿怨对
深度横评
查看全部 →GLM-4.6材料约束+28.2分却工程判断-39.6 诚信从fail升pass主榜反涨12.7
GLM-4.6今日Smoke评测主榜从48.25升至60.94,材料约束从46.10升至74.30,工程判断从64.60跌至25.00,任务表达从50.00跌至25.00,诚信评级从fail升至pass。单日10题抽签导致侧榜剧烈波动,主榜
GPT-5.5代码执行从100暴跌至75 Smoke评测主榜降7.5分
GPT-5.5今日Smoke评测代码执行从100.00跌至75.00,主榜从79.12降至71.67。材料约束反升14分至67.60,工程判断同步跌25分。单日10题抽样导致的波动与模型真实退化需区分判断。
Claude Opus 4.7以92.49分居首:2026-09-04 Smoke快测数据简报
2026-09-04 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 92.49 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Gemini 3.1 Pro
97.7
#2
Grok 4
96.3
#3
GLM-4.6
95
#4
GPT-o3
94.8
#5
Claude Opus 4.7
94.7
#6
Gemini 2.5 Pro
93.2
#7
GPT-5.5
92.6
查看完整守约排行 →
Research Lab
WDCD Run #306: Average Instruction Decay Hits -45.5% as Gemini 3.1 Pro Leads at 97.7 Points
WDCD Run #306 (2026-09-02) evaluated 11 models across three dialogue rounds, recording an average co
4大模型翻译对决:第36周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 405 篇文章,覆盖 4 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #296: Zero Instruction Decay Across All 11 Models, Grok 4 Leads at 96.3
WDCD Run #296 (2026-08-26) recorded 0% average commitment decay across 11 tested models, with Grok 4