Claude Opus 4.7主榜暴跌19.9分 代码执行单日跌25分
Claude Opus 4.7今日Smoke评测主榜从100.00分跌至80.09分,代码执行从100.00降至75.00,材料约束降至86.30。工程判断侧榜跌44.4分至55.60。单日10题测试下,需区分抽签波动与真实能力变化。
Claude Opus 4.7今日Smoke评测主榜从100.00分跌至80.09分,代码执行从100.00降至75.00,材料约束降至86.30。工程判断侧榜跌44.4分至55.60。单日10题测试下,需区分抽签波动与真实能力变化。
2026-07-16 赢政指数 Smoke 快测覆盖 9 个模型,Grok 4 以 94.15 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
7月14日Mark Cuban在X发声,指出反对数据中心的争议实为对AI及财富集中的恨意代理。该言论迅速发酵,支持者认为其直指本质,反对者则强调社区环境与能源担忧。已确认事实显示,此事在X平台引发高度对立观点,YouGov调查显示约四分之三美国人支持更严格AI监管。
2026年7月15日前后,Anthropic在世界杯四分之一决赛期间播出广告“There’s hope in hard questions”,画面包含燃烧房屋、阿灵顿国家公墓等末日意象,旁白询问“AI能否被信任”“谁会踩刹车”。广告原意展示公司应对AI风险的意愿,却引发Sam Altman等业内人士批评,认为其适得其反,放大公众恐慌。多家来源确认讨论迅速升温,立场对立。
Mistral AI于2026年7月前后发布Leanstral 1.5模型,专为Lean 4形式化证明语言设计,总参数1190亿,激活参数60亿。该模型权重以Apache 2.0协议开源,并提供免费API端点。它在miniF2F测试集达到100%覆盖,在PutnamBench解决587道难题,同时在真实项目中发现5个未报告缺陷。文章基于官方及媒体核验事实,分析其技术机制、产业影响与开发者选型建议。
2026年7月15日,澳大利亚总理阿尔巴尼斯在悉尼演讲中宣布在总理办公室设立AI办公室,统筹国家AI标准立法,计划2027年初完成框架制定。该举措旨在统一联邦、州和地方政策,同时要求数据中心自备电力并保护版权,引发投资促进与权力集中两派争论。
xAI Grok Build 0.2.93版本被研究者发现通过后台通道将完整Git仓库及.env文件上传至谷歌云存储桶,单次12GB仓库传输量达5.10GiB,而模型实际交互仅192KB。xAI随后通过服务器端开关关闭上传并提供/privacy opt-out选项,但默认状态仍为开启,企业零数据保留用户不受影响。
Meta于2026年7月推出Instagram Muse Image AI工具,支持引用公开账号照片生成图片,默认自动opt-in。推出后遭遇用户、CAA及SAG-AFTRA强烈反对,隐私、同意和版权问题凸显。Meta承认未达预期,于7月10日前后暂停Instagram引用功能,仅保留基础文本生成能力。此事件暴露集中式平台在AI数据使用上的同意机制缺陷,也凸显娱乐行业对数字分身风险的警惕。
WDCD Run #233 (2026-07-15) evaluated 11 frontier models on multi-turn commitment integrity, recording an average instruction decay of 27.3% between Round 1 and Round 3. GPT-o3 topped the leaderboard with 94 points and zero decay, while Gemini 3.1 Pro suffered a complete 100% collapse.
本期WDCD v3.1数据显示,Claude Sonnet 4.6较Run #227上涨15分,GLM-4.6下跌15.3分,11个模型中3升4降。GPT-o3以94.00分保持首位,Grok 4位列第二但下滑7.1分,守约能力分化加剧。
WDCD v3.1五大场景横评显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底,而数据边界多数模型4/4。claude-sonnet-4.6与qwen3-max场景差距分别达2.2分和2.45分,企业生产接入需针对性加护栏。
v2锚点题显示,R1与R2确认率与抵抗率均为100%,但R3平均诚信率仅36.4%,4个模型出现完全崩溃。典型崩溃集中在业务规则场景,暴露模型“先确认后崩盘”模式,对生产流程接入具有直接警示意义。
GPT-o3 以 94.00 分位列 WDCD v3.1 守约榜首位,Qwen3 Max 62.60 分垫底,11 模型头部尾部差距 31.4 分;满分率 50%,R3 崩溃率仅 3.6%。Claude Sonnet 4.6 单期提升 15.0 分,GLM-4.6 则下滑 15.3 分。
Gemini 3.1 Pro 今日 Smoke 评测主榜从 80.99 分跌至 72.50 分,降幅 8.5 分。其中代码执行维度从 75.00 分腰斩至 50.00 分,材料约束反而升至 100.00 分,工程判断(侧榜,AI 辅助评估)从 100.00 分跌至 75.00 分。
DeepSeek V4 Pro今日Smoke评测代码执行从98.70分跌至75.00分,降幅23.7分,主榜从91.46分降至86.25分。材料约束却从82.60分升至100.00分,工程判断下滑11.1分。单日10题抽签导致的波动可能性高于模型真实退化。
2026-07-15 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 Gemini 2.5 Pro 与 GPT-5.5 以 100 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
2026年7月13日科罗拉多州就禁止AI生成儿童色情内容的法案进行投票,17名共和党议员及部分民主党人投反对票。社交媒体迅速公布反对者名单,引发支持者强调儿童保护与反对者质疑言论自由及名单动机的激烈辩论。双方立场对立,参与度高。
xAI Grok的API密钥泄露事件曝光52个模型访问权限,7月13日政府效率部员工将含密钥的agent.py脚本上传至公开GitHub仓库;同时37万用户对话因分享按钮设计被搜索引擎索引,包含敏感指令内容。事件凸显AI工具在数据处理与默认设置上的设计缺陷,对企业和开发者选型形成直接影响。
Meta本周推出的Muse Image功能默认允许用户通过公开Instagram账号生成AI图像,引发SAG-AFTRA等组织批评后迅速下线。该功能集成于Meta AI聊天机器人,仅引用公开内容却采用自动开启机制,凸显AI工具迭代与用户控制权之间的冲突。Meta承认功能未达隐私预期,决定暂停以听取反馈。此事件反映科技公司在AI数据使用边界上面临的实际压力。
xAI正式推出Grok 4.5模型,重点强化编码与代理任务能力,并已集成到Cursor工具供欧洲用户使用。此举发生在代理AI成为行业焦点的同一周,AI正从单纯回答问题转向完成完整工作流。文章基于公开信息,还原发布事实,拆解代理模式运作机制,分析对开发者、企业用户及竞争格局的影响,并给出后续可能走向的判断。
苹果公司向加州联邦法院起诉OpenAI,指控前工程师利用系统漏洞窃取Siri与机器学习相关商业机密,数据被指传输至OpenAI用于模型训练。OpenAI否认指控并称诉讼旨在压制竞争。此案聚焦AI领域人才流动边界与知识产权保护,材料显示苹果要求销毁数据并索赔,OpenAI则质疑证据充分性。
OpenAI发布GPT-5.6模型并推出GPT-Live语音功能与ChatGPT Work代理工具。Sam Altman将GPT-5.6定位为基准模型,强调其在自然对话、中断处理及长任务代理中的表现,推动行业从聊天界面向实用代理转型。文章还原发布事实,拆解技术机制,分析对竞争格局、开发者和企业用户的影响,并给出后续可能走向的判断。
2026-07-14 赢政指数 Smoke 快测覆盖 11 个模型,DeepSeek V4 Pro 以 91.46 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
英特尔于2026年7月13日宣布向爱尔兰莱克斯利普校区追加50亿欧元投资,升级现有晶圆厂设施,安装先进制造设备,扩建自动化生产系统,提升Intel 3制程节点下Intel Xeon 6及下一代Xeon服务器处理器产能,以应对人工智能和高性能计算需求。
Meta于2026年7月10日宣布停止Instagram上Muse Image工具的公开账号引用功能。该功能允许用户通过@公开Instagram账号生成AI图像,默认开启引发SAG-AFTRA、CAA及隐私组织反对。Meta称听取反馈后认定未达预期而撤回。此事暴露生成式AI在用户内容使用上的默认机制与明确同意要求之间的张力。
2026年2月底,OpenAI宣布与美国五角大楼(国防部)签署协议,将前沿AI模型部署于机密网络。此举紧随竞争对手Anthropic因拒绝移除安全护栏而被五角大楼列为“供应链风险”之后。OpenAI内部员工签署公开信支持Anthropic立场,反对模型用于国内大规模监控或无人工监督的自主武器系统,引发强烈反弹。与此同时,用户用行动表达不满——ChatGPT移动应用在美国单日卸载量较前一天激增295%。OpenAI随后修改协议条款,并由CEO Sam Altman承认处理方式显得“机会主义和草率”。这一事件深刻暴露了AI企业在商业利益、国家安全合作与伦理道德红线之间的尖锐冲突,核心辩论聚焦于军事用途的限制问题。Anthropic的坚定立场赢得公众和员工广泛赞誉,而OpenAI则面临用户信任与声誉双重考验,行业对AI军事化的伦理讨论由此升级。
Meta于2026年7月上旬推出Muse Image后,因默认开启公共Instagram账号引用功能遭强烈反对,数日内撤回该特性。SAG-AFTRA等团体要求明确opt-in机制,Meta随后调整但保留其他AI效果扩展。
本周共翻译 361 篇文章,覆盖 3 个AI模型。经抽样盲评,gpt-o3 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
苹果于周五向加州北区联邦法院起诉OpenAI,指控其通过前员工窃取商业机密以推进消费硬件业务。诉讼涉及唐坦和刘畅两名前苹果员工,OpenAI否认兴趣并强调专注自身技术。双方2024年曾达成ChatGPT集成合作,现Siri改用Gemini模型。诉讼可能影响OpenAI硬件计划及双方关系。
Meta于2026年7月7日推出Muse Image功能,允许用户通过@-提及公开Instagram账号生成AI图像,默认自动纳入18岁以上公开账号且不通知本人。三天后因隐私倡导者、SAG-AFTRA工会及演员反对而终止。该功能由Meta Superintelligence Labs开发,集成于Meta AI聊天机器人,引发关于用户同意与AI训练数据使用的行业讨论。官方声明承认“未达到预期”,功能