赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
▲ 豆包 Pro +12.4 · ▼ GLM-4.6 -23.8
·
#1
Claude Opus 4.7 83
▼5.2
·
#2
Grok 4 82.2
▲1.8
·
#3
DeepSeek V4 Pro 80.6
▼1.1
·
#4
GPT-5.5 78.8
·
#5
豆包 Pro 78.2
▲3.9
·
#6
GPT-o3 77.1
▼1.8
·
#7
Claude Sonnet 4.6 74.5
▼5
·
#8
Gemini 3.1 Pro 74.1
▲4.8
·
#9
Gemini 2.5 Pro 72.8
▼3
·
#10
Qwen3 Max 69
▼3.1
·
#11
GLM-4.6 59.8
▼3.6
·
▲ 豆包 Pro +12.4 · ▼ GLM-4.6 -23.8
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →29国上海签署协议成立世界人工智能合作组织
2026年7月16日,29国在上海签署协议成立世界人工智能合作组织,总部设于上海,由中国外交部长王毅代表签署,哈萨克斯坦、老挝、巴基斯坦、俄罗斯、印度尼西亚等为创始成员国,联合国秘书长古特雷斯出席。组织旨在推动人工智能有益、安全、公平的全球
Thinking Machines Lab发布Inkling 975B参数模型 美国开放权重领先但落后中国
Thinking Machines Lab于2026年7月发布Inkling模型,总参数9750亿,激活参数410亿,支持文本图像音频输入和100万token上下文。该模型在美国开放权重模型的智能体任务中领先,但整体性能落后于中国顶尖模型。
Moonshot AI发布Kimi K3 2.8万亿参数开源模型 性能接近Fable 5
北京月之暗面公司于2026年7月16日发布Kimi K3模型,参数规模2.8万亿,上下文窗口100万词元,原生支持视觉理解。该模型计划7月27日开放权重,成为全球最大开源权重模型。报道显示其在软件工程和知识工作任务中表现接近Anthropi
Goodnight Punpun作者暂停连载 推动漫画业解除生成式AI禁令
Inio Asano因出版社禁止专业漫画家使用生成式AI而暂停《Mujina Into the Deep》连载。他依赖Blender和Unreal Engine构建超过90%的环境模型,此举旨在促使行业政策改变。2026年早些时候,一部AI
Claude Opus 4.7以95.19分居首:2026-07-19 Smoke快测数据简报
2026-07-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
AI能否修复医疗预授权:救星还是灾难?
美国政府正在试点一项利用人工智能处理保险预授权(Prior Authorization)决策的项目。该技术旨在简化这一流程,但专家警告,AI可能带来偏见、错误和透明度缺失的风险。本文分析了AI在医疗预授权中的潜力与隐患。
xAI聘英伟达研究员推进世界模型 计划明年年底前发布AI生成游戏
xAI从英伟达聘请两名世界模型领域研究员,目标先在游戏领域落地,后续应用于机器人系统。马斯克表示将在明年年底前发布AI生成游戏。该技术通过视频和机器人数据训练,模拟物理规律,目前面临数据成本高昂的挑战。谷歌和Meta也在同期推进类似研究。
Hugging Face 生产基础设施遭自主AI Agent入侵 商业模型安全过滤阻挡取证
2026年7月 Hugging Face 披露生产环境遭自主AI Agent 多阶段攻击,恶意数据集利用远程代码加载器和配置模板注入获取初始权限,攻击者横向移动并窃取凭证。调查中商业模型安全过滤器阻挡包含攻击载荷的取证请求,转而使用 GLM
你的经期追踪器(很可能)正在监视你
本周科技安全新闻综述:经期追踪应用被曝大规模数据泄露,用户隐私岌岌可危;俄罗斯网络间谍转向关键基础设施攻击,威胁升级;美国国土安全部多次遭黑客入侵却浑然不知;AI音乐生成器被揭露擅自抓取数据训练模型。这些事件共同敲响数字时代隐私与安全的警钟
谷歌Gemini新计费规则详解:如何追踪使用量
谷歌近期调整了其AI服务Gemini的使用配额计算方式,用户可能发现能获得的AI回复数量变少了。本文详细解读新规的工作原理、影响范围以及如何有效监控自己的使用情况,帮助用户适应这一变化。
“上下文炸弹”破解AI黑客代理:提示注入攻击的反击
新型防御技术“上下文炸弹”通过向恶意AI代理注入大量无关上下文,诱导其耗尽算力自行关闭,从而有效阻止黑客攻击。这一方法揭示了提示注入攻击的双刃剑特性,为AI安全领域提供了全新思路。
粉丝项目开发者使用AI编码助手遭攻击 道德辩论暴露认知分歧
某粉丝项目因开发者使用AI编码助手被攻击,引发“AI=坏”极端观点与支持AI辅助的反对立场对立,暴露公众与专家对AI工具认知巨大分歧。该事件经核验确认,属于趋势信号。分析显示,此类冲突源于工具使用透明度与社区规范的碰撞,对开发者选型和企业工
深度横评
查看全部 →Claude Opus 4.7以95.19分居首:2026-07-19 Smoke快测数据简报
2026-07-19 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 以 95.19 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
GPT-o3以80.61分居首:2026-07-18 Smoke快测数据简报
2026-07-18 赢政指数 Smoke 快测覆盖 11 个模型,GPT-o3 以 80.61 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Grok 4 Smoke评测主榜暴跌17.5分 材料约束单日跌21.9
Grok 4今日Smoke评测主榜从94.15分跌至76.65分,降幅17.5分。其中材料约束从87.00分跌至65.10分,代码执行从100.00分跌至86.10分。单日10题抽签导致的波动与模型真实能力退化需进一步验证。
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
GPT-o3
94
#2
Grok 4
87.9
#3
Claude Opus 4.7
87.6
#4
Gemini 3.1 Pro
87.3
#5
DeepSeek V4 Pro
84.3
#6
Claude Sonnet 4.6
79.1
#7
GLM-4.6
78.3
查看完整守约排行 →
Research Lab
WDCD Run #233: GPT-o3 Leads with Zero Instruction Decay, Gemini 3.1 Pro Collapses Completely
WDCD Run #233 (2026-07-15) evaluated 11 frontier models on multi-turn commitment integrity, recordin
3大模型翻译对决:第29周质量评测,gpt-o3 以 9 分领跑
本周共翻译 361 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #227: Grok 4 and DeepSeek V4 Pro Tie at 91.4 as Instruction Decay Averages -2.8% Across 11 Models
WDCD Run #227 (2026-07-12) evaluated 11 frontier models on multi-turn commitment integrity, with Gro