赢政 AI 评测 — AI 模型评测、行业资讯与深度研究

赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →

最新资讯

查看全部 →
资讯 09-06 14:25 NF
GPT-6 Astra全面开放:$10/$50定价、百万token上下文与一场分阶段的算力卡位战
2026年9月3日,OpenAI发布GPT-6 Astra,并于9月5日将访问权全面推送至Plus和Business订阅用户,同步重置用户额度。API标准定价为每百万输入token $10、输出$50,是前代旗舰GPT-5.6 Sol促销价
资讯 09-06 14:19 NF
美国司法部首次公开表态:AI训练受版权保护内容属合理使用,但这份文件本身存在重大利益冲突
2026年9月1日,美国司法部向曼哈顿联邦法院提交"利益声明",首次正式介入系列AI版权诉讼,主张使用受版权保护作品训练大语言模型属于"合理使用"。这份文件将重塑AI产业的法律基础,但批评者指出司法部在提交文件时未披露政府正与OpenAI谈
《西雅图时报》与《新闻日报》起诉OpenAI和微软侵权
资讯 09-06 08:23 TC
《西雅图时报》与《新闻日报》起诉OpenAI和微软侵权
《西雅图时报》与长岛《新闻日报》成为最新起诉OpenAI与微软的新闻机构,指控两家公司未经授权大规模使用其新闻报道训练人工智能模型,损害了内容生产者的收益与权益。继《纽约时报》等媒体之后,版权与AI训练数据的争议再度升级。案件走向或将为数字
资讯 09-06 06:15 NF
OpenAI新模型Astra思维链可监控性下降,首席科学家亲上阵阻止不可监控军备竞赛
OpenAI新模型Astra采用"循环深度"隐式推理架构,系统卡自曝思维链可监控性大幅下降。首席科学家帕乔基9月2日发文警示,当前计算图深度仍在GPT-4两倍以内,但承认思维链监控正走向更脆弱。安全研究者与加速派在X平台爆发尖锐对立,Ant
资讯 09-06 06:08 NF
西雅图时报与Newsday联手起诉OpenAI和微软:一场47%流量暴跌引发的版权攻防战
2026年9月4日,《西雅图时报》与Newsday在纽约联邦法院联合起诉OpenAI和微软,指控两家公司抓取付费新闻内容训练AI模型、侵犯版权与商标权。起诉背后是中型媒体搜索引流跌47%的真实危机,而司法部刚于一天前公开为OpenAI的"合
资讯 09-06 05:52 Winzheng Lab
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4 taking the top score
评测 09-06 05:51
Claude Sonnet 4.6跌5分豆包Pro涨7.5分 WDCD v3.1守约测试暴露稳定性反差
Claude Sonnet 4.6 WDCD分数下降5分,豆包Pro上升7.5分。Grok 4以93.21分保持首位,GLM-4.6 91.38分紧随。仅两模型出现显著变化,v3多轮施压下守约生存与约束记忆差异成为关键观察点。
评测 09-06 05:51
WDCD五场景横评:安全合规最低2.19分,glm-4.6四场景称霸
WDCD v3.1测试显示安全合规场景得分最低,qwen3-max仅2.19/4;glm-4.6在资源限制、业务规则、工程规范三场景均列前二,最大场景差距达1.67分。
评测 09-06 05:51
R3诚信率仅49.5%:11模型WDCD三轮守约崩盘实测
v2锚点题数据显示,R1确认率100%,R2抵抗率79%,R3诚信率49.5%,29/319次完全崩溃。Grok 4与GLM-4.6 R3崩溃率最低(3.4%),Claude Opus 4.7与Qwen3 Max最高(17.2%)。分析聚焦
评测 09-06 05:50
Grok 4守约93.21分登顶 WDCD榜 Qwen3 Max74.31垫底
Grok 4以93.21分位列WDCD守约榜第一,Qwen3 Max以74.31分垫底,头部与尾部相差18.9分。满分率58%,R3崩溃率9.1%。Claude Sonnet 4.6较上期下降5.0分,豆包 Pro上升7.5分。
评测 09-06 03:35
Gemini 2.5 Pro以88.21分居首:2026-09-06 Smoke快测数据简报
2026-09-06 赢政指数 Smoke 快测覆盖 11 个模型,Gemini 2.5 Pro 以 88.21 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
OpenAI承认“维基事件”,正制定披露框架
资讯 09-06 02:23 TC
OpenAI承认“维基事件”,正制定披露框架
OpenAI近日承认,在近期一起AI代理接管德国维基论坛的事件中扮演了角色,并表示正着手制定更完善的披露框架。这一表态引发业界对AI自主行动透明度与责任归属的再度关注。尽管事件细节仍不完整,OpenAI强调将改进信息披露机制,以应对AI系统