赢政 AI 评测 — AI 模型评测、行业资讯与深度研究

赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →

最新资讯

查看全部 →
OpenAI因安全顾虑放缓Astra模型开发
资讯 08-08 08:23 TC
OpenAI因安全顾虑放缓Astra模型开发
OpenAI近日宣布,基于安全顾虑,已主动放缓其下一代人工智能模型Astra的开发。该模型在测试中达到“关键网络安全阈值”,能够独立识别并针对传统防护严密的现实系统发起网络攻击。OpenAI表示,此举旨在确保技术安全可控,同时引发行业对AI
Rippling自尝AI账单苦果,推出员工AI开支追踪工具
资讯 08-08 06:23 TC
Rippling自尝AI账单苦果,推出员工AI开支追踪工具
在自家AI支出数月内暴涨、差点失控之后,人力资源软件公司Rippling推出了一款名为AI Spend Console的新产品,帮助企业追踪每位员工及团队在AI工具上的花费。该工具直击企业AI成本透明化与合理管控的痛点,也反映出生成式AI时
资讯 08-08 06:09 NF
SpaceX与Reflection签署63亿美元算力协议 Starlink与Starship参与AI基础设施
SpaceX与AI初创公司Reflection签署63亿美元算力交易,涉及Starlink边缘计算和Starship发射能力支持AI基础设施。该协议验证AI算力需求规模化,市场视其为国防级合作前景信号。协议具体执行时间表和Starship实
评测 08-08 03:36
豆包 Pro Smoke 评测五维度全缺席 API 故障致零记录
豆包 Pro 在今日 Smoke 评测中因 API 故障/超时导致 execution、grounding、judgment、integrity、communication 五维度数据完全缺失,主榜得分为-,本期不参与排名。单日 10 题快
评测 08-08 03:36
Claude Sonnet 4.6代码执行暴跌19.5分 主榜却逆势上涨13.8分
今日Smoke评测中,Claude Sonnet 4.6代码执行从94.50分跌至75.00分,材料约束从43.30分升至97.80分,主榜从71.46分升至85.26分。仅2题抽样导致的波动是主因,整体能力未见系统性退化。
评测 08-08 03:35
Claude Opus 4.7 与 GPT-o3并列97.66分:2026-08-08 Smoke快测数据简报
2026-08-08 赢政指数 Smoke 快测覆盖 9 个模型,Claude Opus 4.7 与 GPT-o3 以 97.66 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
硅谷的“人工国家”:为何科技领袖都是糟糕的科幻读者
资讯 08-08 02:25 TC
硅谷的“人工国家”:为何科技领袖都是糟糕的科幻读者
历史学家Jill Lepore在新书《人工国家》中提出,科技公司常以“市政厅”“宪法”等政治话语包装产品,如同在建立新政府。从Twitter的“口袋里的市政厅”到Anthropic的Claude宪法,这种隐喻并未让硅谷加分。Lepore指出
Cloudflare推出Kitesurf:专为AI代理打造的云托管浏览器
资讯 08-08 02:24 TC
Cloudflare推出Kitesurf:专为AI代理打造的云托管浏览器
Cloudflare发布Kitesurf,一款面向AI代理而非人类的云托管浏览器。它比Chromium更省算力,能高效执行自动化任务,助力开发者构建基于浏览器的AI代理。此举标志着云服务商开始深入AI代理基础设施赛道。
OpenAI智能音箱用机械部件“活”起来,不模仿苹果
资讯 08-08 02:23 ARS
OpenAI智能音箱用机械部件“活”起来,不模仿苹果
据彭博社记者马克·古尔曼报道,OpenAI已确认其即将推出的高端智能音箱并非苹果产品的仿制品,而是采用独特的机械部件设计,使其显得“更有生命力”。这款设备将融入语音交互与AI代理功能,但价格不菲。本文编译解析其设计理念、行业背景及潜在影响。
资讯 08-08 01:30 X
ByteDance Seedance 2.5 Video AI产品发布分析
ByteDance发布Seedance 2.5视频AI产品,支持提示词生成高级视频。制片人群体在X平台讨论其成本节省与真实感效果,提示指南与技能相关内容正在流行。文章基于给定话题摘要与关键词展开分析。
资讯 08-08 01:29 X
OpenAI发布GPT-5.6 Sol模型 付费用户获事实推理升级
OpenAI面向ChatGPT Plus和Pro用户推出GPT-5.6 Sol模型,重点提升事实推理能力,同时为免费用户提供Luna模型。官方帖文在X平台获得超过1.8万点赞,讨论集中在服务可及性与性能改进上。本文基于给定话题信息与摘要,分
资讯 08-08 01:29 X
Google DeepMind 领导层调整:Hassabis 接任 Alphabet 首席科学家
Demis Hassabis 成为 Alphabet 首席科学家,部分顶尖研究人员离职创办 Discovery Loop 等初创公司。这一变动反映 DeepMind 内部调整,同时竞争对手在 AI 领域持续推进。相关讨论已在 X 和 WSJ