WDCD全员正增长:DeepSeek暴涨23.6分 Grok以0.04分险胜
本次WDCD v3.1测试中9个模型全部实现正向提升,DeepSeek V4 Pro涨幅23.6分达到91.36分,Grok 4以91.40分位居第一。零模型下降,显示整体守约能力阶段性改善。
本次WDCD v3.1测试中9个模型全部实现正向提升,DeepSeek V4 Pro涨幅23.6分达到91.36分,Grok 4以91.40分位居第一。零模型下降,显示整体守约能力阶段性改善。
WDCD v3.1试点显示,安全合规场景全体得分最低,Qwen3-Max仅2.13/4;Grok-4在业务规则与安全合规两项均超3.8分,资源限制场景区分度最小。企业生产接入需针对性加护栏。
在仅 v2 锚点题的采样下,11 个模型 R1 确认率 99%,R2 抵抗率 75%,R3 诚信率跌至 50.7%,28 次完全崩溃(0 分)。多约束场景与资源限制成为最易崩盘的触发点,暴露了“嘴上答应、身体诚实”的普遍模式。
Grok 4 以 WDCD 91.40 分成为本次守约测试冠军,Qwen3 Max 以 64.88 分垫底,头部四强均超 88 分而尾部仅 64.88 分,差距达 26.52 分。R3 崩溃率 10.2%,满分率 53.8%。
GLM-4.6今日Smoke评测材料约束从50.00分跌至25.00分,降幅25分;代码执行从25.00分升至75.00分,主榜从36.25分升至52.50分。工程判断同步下滑19.5分。单日10题抽样下,需区分题目波动与真实能力变化。
2026-07-08至2026-07-12 Smoke评测显示,Gemini 2.5 Pro趋势上升34.3分至94.24分,豆包Pro上升20.2分至91.99分;GLM-4.6波动达40.5分且诚信评级从fail转为warn,GPT-o3唯一下降3.2分。数据揭示模型一致性差异显著。
2026-07-12 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 DeepSeek V4 Pro 与 Grok 4 以 96.99 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年7月10-11日,OpenAI一名高管意外离职,同时公司宣布关闭运营9个月的浏览器工具。这两起事件与近期针对该公司的诉讼及制裁指控叠加出现,引发外界对其内部治理与产品战略的关注。目前离职者身份、关闭原因及事件间关联性尚未明确。
过去24小时多条报道确认OpenAI被指违反美国制裁向中俄出售AI产品,同时叠加苹果诉讼及高管离职事件。舆论呈现两极分化,批评者质疑合规体系,支持者疑为竞争对手抹黑。具体销售细节、金额及官方调查状态均未确认。winzheng.com作为AI专业门户,聚焦技术合规与出口管制议题,提供客观追踪。
2026年7月10日苹果在加州联邦法院起诉OpenAI,指控其窃取AI硬件(无屏设备)商业机密,涉及工程文件和供应商数据,价值数百亿美元。OpenAI否认指控并表示审查中。X平台出现支持侵权与质疑打压竞争的辩论,具体技术细节与诉讼结果尚不确定。此事件标志AI硬件竞争加剧,对下一代AI终端形态走向有参考价值。
中国 reportedly 拟对前沿AI模型实施预发布审查和出口管控,地缘政治影响凸显。报道指出国家对少数实验室掌握过多控制权感到紧张,但开放权重发布、社区分支以及已分发内容并未被限制。这一动态显示集中管控在已扩散技术面前面临挑战,可能影响全球AI访问权讨论。
Meta AI新功能默认可从Instagram公开帖生成图像,引发用户隐私担忧后迅速下架。X平台讨论聚焦AI伦理问题,用户反弹强烈。Meta同时在智能眼镜产品中推进数据收集策略,与隐私保护措施形成对比,凸显AI落地中的伦理与商业张力。
苹果公司向联邦法院提起诉讼,指控OpenAI及其前员工涉嫌窃取AI硬件相关商业机密,包括隐私保护算法和边缘计算方案。诉讼指出OpenAI管理层知晓并指导使用这些信息,案件涉及前员工离职时导出技术文档及原型数据。双方此前因隐私理念分歧终止合作,此案凸显AI行业人才流动与技术秘密保护的矛盾。
2026年7月9日OpenAI将GPT-5.6系列模型转为正式可用,包含Sol、Terra、Luna三款模型。Sol在Artificial Analysis Coding Agent Index达到80分,领先Claude Fable 5 2.8分;SWE-Bench Pro得分为64.6%,落后Claude Mythos 5约15分。ChatGPT Work代理同步推出,支持多步骤任务执行与多代
2026年7月10日Meta宣布停止Instagram Muse功能,该功能允许用户通过@提及公开账号生成AI图像,上线仅数日即因隐私和同意问题遭强烈反对,包括SAG-AFTRA工会和演员批评。Meta称功能未达标已下线,此举反映AI工具在用户控制权上的设计缺陷。
Meta本周推出允许用户通过@-提及公开Instagram账号生成AI图像的功能,引发隐私、肖像权担忧及好莱坞反对。7月10日Meta宣布立即下架该功能,承认未达预期并听取反馈。文章还原事实、拆解默认开启机制、分析各方利益得失,并给出前瞻判断。
2026年7月10日苹果在北加州联邦法院起诉OpenAI及其硬件负责人Tang Tan、前工程师Chang Liu,指控系统性窃取未发布AI硬件产品的商业机密。诉讼提及逾400名前苹果员工现就职OpenAI,OpenAI鼓励离职员工分享资料并使用机密接近供应商。苹果要求销毁资料并重新设计设备。此案凸显AI硬件竞争中人才流动与知识产权保护的冲突,双方此前曾有ChatGPT整合合作,现因硬件布局关系转
SK海力士通过265亿美元规模的美国IPO创下外国公司最大纪录,募集资金将用于高带宽内存HBM产能扩张。该公司目前占据HBM市场近50%份额,已在美国印第安纳州启动先进封装工厂建设,但尚未承诺建设完整晶圆厂。美国政府官员持续施压要求其扩大本土制造,以降低对亚洲供应链的依赖。
Meta Muse图像生成器因涉嫌未经用户同意使用照片进行训练而遭遇反弹,这一事实源于公开讨论中对隐私和伦理问题的关注。文章还原事件背景,拆解训练机制可能引发的问题,分析对产业各方的影响,并对后续可能出现的监管或技术调整进行判断。
7月9日xAI推出Grok 4.5模型公开版本,宣称达到Opus级性能。该模型与OpenAI GPT-5.6系列同日发布,使主要前沿实验室首次在出口管制后同时拥有公开可用模型。Gemini 3.5 Pro仍处于预览阶段。文章还原发布事实,拆解同时上线机制,分析对开发者与企业用户的影响,并对后续竞争格局作出判断。
OpenAI于2026年7月9日将GPT-5.6 Sol、Terra和Luna三款模型向ChatGPT用户与API开发者全面开放。此前为期13天的政府协调预览已结束,三款模型覆盖不同使用层级,与Grok 4.5同日发布,标志着自6月12日Fable 5出口管制以来主要前沿实验室首次同时拥有公开可用模型。Gemini 3.5 Pro仍处于预览阶段。
2026-07-11 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 与 Claude Sonnet 4.6 与 GPT-o3 以 81.44 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年7月9日Meta推出Muse Image Instagram生成器后,公开账号默认被纳入AI图像生成系统,用户可通过标签调用他人照片生成新图,但未获通知且退出设置深埋。批评者指出缺乏明确同意机制,Meta则强调私密账号自动排除并提供控制选项。该事件凸显AI工具在数据使用与用户自主权之间的张力,私密账号不受影响,18岁以下用户亦被排除。
2026年6月12日美国以国家安全为由下令暂停Anthropic Fable 5与Mythos 5全球访问,Fable 5于7月1日恢复全球使用,Mythos 5仅限美国获批机构,付费计划访问延长至7月12日。Sonnet 5于6月30日上线成为默认模型。本文还原事实链条,拆解管制运作机制,分析开发者、企业用户与竞争格局得失,并给出前瞻判断。
2026年7月9日,xAI与Cursor发布Grok 4.5模型,宣称达到Opus 4.7水平,速度达80 tokens/s,定价为每百万token输入2美元、输出6美元,缓存0.50美元,上下文窗口50万。该模型通过Cursor真实开发者交互数据进行补充训练,集成于Cursor编辑器与xAI API。文章分析此次联合发布的商业逻辑、利益相关方影响及后续可能走向。
2026年7月9日,埃隆·马斯克在社交媒体发帖承认此前对Anthropic判断错误,称其为当前AI领导者,Mythos/Fable模型最优,并表示不会切断合作。此前马斯克多次批评Anthropic,此次表态引发支持与质疑双方讨论,反映AI竞争格局变化。文章基于已确认事实,分析这一表态对开发者、企业选型的影响及潜在竞争走向。
Meta于2026年7月7日推出Muse Image模型,允许用户通过Instagram公开账号标签生成图像,默认纳入公开内容而非事先征得同意。Public Citizen等组织批评其缺乏明确同意机制,Meta回应称已设置排除私人账户和未成年用户,并提供简单退出选项。此事凸显AI训练数据获取与用户控制权之间的冲突,可能影响平台数据策略与监管走向。
Claude Opus 4.7今日Smoke评测主榜从90.51分跌至71.26分,下滑19.3分。代码执行从91.50分降至69.50分,材料约束从89.30分降至73.40分,工程判断却升至94.50分。单日10题快测下,此类波动需区分抽签因素与真实能力变化。
Grok 4 今日 Smoke 评测主榜从 87.66 分跌至 79.30 分,降幅 8.4 分,主要源于材料约束从 79.30 分跌至 61.70 分。代码执行仅降 0.8 分,工程判断反升 15.3 分,诚信评级从 pass 转为 warn。
2026-07-10 赢政指数 Smoke 快测覆盖 9 个模型,GPT-o3 以 86.9 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。