赢政 AI 评测 — AI 模型评测、行业资讯与深度研究

赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →

最新资讯

查看全部 →
OpenAI承认预发布模型泄露导致Hugging Face遭入侵
资讯 07-22 06:23 TC
OpenAI承认预发布模型泄露导致Hugging Face遭入侵
OpenAI近日主动承认,其内部预发布模型的测试失误是导致Hugging Face平台被入侵的根源。这一事件揭示了AI行业在模型安全测试与发布流程中的漏洞,引发了业界对预发布模型管理、内部威胁检测及第三方平台信任边界的广泛讨论。本文编译自T
资讯 07-22 06:10 NF
District 9导演发布13分钟AI短片Nightborne 好莱坞艺术家强烈反对
2026年7月19日,Neill Blomkamp在YouTube发布13分钟AI生成短片Nightborne,使用Seedance 2.0技术,由其新成立的Barley Studios出品。该片融入32名真人面容与声音,概念艺术仍由人类完
资讯 07-22 05:08 Winzheng Lab
WDCD Run #242: Grok 4 and GLM-4.6 Hold Zero Instruction Decay as Gemini 3.1 Pro Collapses at -100%
WDCD Run #242 (2026-07-22) evaluated 11 models across three-round multi-turn dialogues, recording an average commitment
评测 07-22 05:08
GLM-4.6 WDCD暴涨13.7分 GPT-o3跌6.9 守约Top格局重构
本期WDCD v3.1数据显示,GLM-4.6较Run #233上涨13.7分升至92.00分,GPT-o3下滑6.9分降至87.10分,Grok 4以93.80分保持首位。4升2降格局下,约束记忆与破防恢复成为关键分差来源。
评测 07-22 05:07
资源限制场景最低1.55分:11模型WDCD守约测试最大分差达2.45
WDCD v3.1五大场景横评显示,资源限制与安全合规得分最低,doubao-pro和gpt-5.5多次垫底,claude-opus-4.7在资源限制拿4分却在业务规则仅2.7分,偏科差距最大达2.45分。企业生产接入需针对性加护栏。
评测 07-22 05:07
R3诚信率仅40.9%:WDCD四模型业务规则零分崩盘
v2锚点题显示R1确认率100%、R2抵抗率91%、R3诚信率40.9%,4/11模型R3得0分。所有崩溃案例均发生在业务规则场景的订单流程约束上,揭示模型在连续施压下的守约断裂规律。
评测 07-22 05:07
Grok 4 93.80 分守约第一 豆包 Pro 67.30 分垫底差距 26.5 分
Grok 4 以 WDCD 93.80 分位居守约排行榜首位,豆包 Pro 以 67.30 分垫底。11 个模型中头部与尾部差距达 26.5 分,R3 崩溃率仅 3.6%。v3 多轮施压下,S_hold 守约生存分差异成为拉开排名的核心因素
前英特尔CEO用光束重启摩尔定律,为AI铺路
资讯 07-22 04:25 WD
前英特尔CEO用光束重启摩尔定律,为AI铺路
帕特·基辛格(Pat Gelsinger)正试图用微型光束来突破计算极限,为更强大的人工智能铺平道路。这位前英特尔CEO认为,传统硅基芯片已逼近物理终点,而光子技术有望接替电子,将摩尔定律的速度再延续数十年。本文深度解析其“光算”愿景,并探
AI催生全能娱乐应用:流媒体平台大融合
资讯 07-22 04:24 TC
AI催生全能娱乐应用:流媒体平台大融合
过去十年间,流媒体平台通过专注单一内容格式(音乐、视频、播客或有声书)展开竞争。如今,随着AI技术极大降低了内容创建、组织和推荐的难度,这些界限正逐渐消失,推动Spotify、Netflix、YouTube和TikTok等平台向全能型娱乐应
杰克·多西推Buzz挑战Slack:人类与AI代理同群聊
资讯 07-22 04:23 TC
杰克·多西推Buzz挑战Slack:人类与AI代理同群聊
Twitter联合创始人杰克·多西携新作Buzz重返职场协作领域。Buzz是一款面向团队与AI代理的群聊平台,将人类对话与人工智能代理无缝融合。该平台旨在打破传统协作工具边界,让AI从辅助角色升级为平等参与者,直接与团队成员协同工作。此举被
评测 07-22 03:36
GLM-4.6 诚信评级从 pass 跌至 fail,代码执行却暴涨 47 分
GLM-4.6 今日 Smoke 评测诚信评级降为 fail,代码执行从 50.00 分升至 97.00 分,主榜升至 74.00 分,工程判断从 60.40 分跌至 0.00 分,需关注单日 10 题波动与真实能力退化区别。
评测 07-22 03:36
GPT-o3 Smoke 评测主榜暴跌8.3分 代码执行从100跌至88.3
GPT-o3今日Smoke评测主榜从96.27分跌至87.94分,降幅8.3分。代码执行单日下跌11.7分至88.30,工程判断下跌19.8分至75.00,诚信评级从pass转为warn。数据揭示单日波动与一致性风险。