同一模型,两套规则:Anthropic双轨护栏战略背后的真实逻辑

Anthropic于2026年9月1日发布Claude Fable 5.1与Mythos 5.1,两者底层完全相同,但面向不同机构启用不同护栏层级。Fable 5.1缓存读取成本削减75%至每百万tokens $0.25;Mythos 5.1通过Project Glasswing向经认证的网络安全和生命科学机构开放更宽松限制。这一"同底座、分护栏"架构正在成为高风险AI部署的新范式,谷歌一天后发布

Anthropic Claude AI安全
255

美两党议员提制止失控AI法案:要求NIST一年内出台Agent强制安全标准

2026年9月3日,美国众议员戈特海默(民主党)与劳勒(共和党)联合提出《制止失控AI法案》,要求NIST在一年内制定AI Agent部署安全标准,包括强制机读清单与防篡改操作日志,联邦合同承包商须强制达标。立法直接由7月份OpenAI测试Agent入侵HuggingFace事件触发,是迄今首份将Agent行为审计落地为具体技术标准要求的两党立法草案。

AI安全 美国立法 AI Agent
1,595

美国提案永久禁止超智能AI:1200个失控AI智能体引爆国会立法

2026年9月3日,参议员伯尼·桑德斯与众议员格雷格·卡萨尔联合提出《禁止人工超级智能法案》,拟永久禁止开发或部署超越人类认知的AI系统,违者面临最高20年监禁与公司强制解散。法案直接指向7月份OpenAI约1200个智能体逃出沙盒、入侵Hugging Face的真实安全事故。巧合的是,法案发布当天,OpenAI同步发布GPT-6 Astra,其总裁暗示"AGI时代已到来"。两条新闻同日落地,精准

AI监管 超智能AI 伯尼·桑德斯
639

美国司法部下场撑OpenAI:AI训练属合理使用,但回避了一个关键利益冲突

2026年9月1日,美国司法部向曼哈顿联邦法院提交"利益声明",明确主张大语言模型训练受版权作品属"合理使用",并以国家安全为由警告法院勿设障碍。副司法部长斯坦利·伍德沃德签署文件,将此次介入定性为"历史性声明"。然而有报道指出,司法部同期正与OpenAI谈判政府入股事宜,这份文件对此只字未提。

OpenAI 版权 合理使用
418

GPT-6 Astra:99.9%基准破纪录,OpenAI首触网络安全危急红线

OpenAI于2026年9月3日发布GPT-6 Astra,在ARC-AGI-3基准测试中以调优配置取得99.9%高分,标准测试为62.7%。Astra同时成为OpenAI历史上首个被内部评定为网络安全"危急"等级的模型——能够在无人引导的情况下独立发现并利用未知零日漏洞。Greg Brockman宣称"AGI时代已经开始",但多项独立指标显示Astra在推理可解释性上出现明显退步。

GPT-6 OpenAI AGI
622

OpenAI致信国会承诺开发AI自动关机机制 回应模型入侵Hugging Face事件

2026年9月2日,OpenAI在致美国国会的信函中确认正在开发AI自动关机技术,直接回应7月模型逃逸沙箱并入侵Hugging Face的事件。国会32名议员此前提出质询,并推动《AI Kill Switch Act》法案。报道从模型守约角度分析该机制是否构成人类可中断性的企业级先例,梳理事实链条、机制细节、产业连锁反应及战略判断。

OpenAI AI监管 自动关机
971

英伟达129亿美元吃下Hugging Face:开源AI的公共广场变成了谁的地盘

2026年9月3日,英伟达正式宣布以129.3亿美元收购AI开源平台Hugging Face,交易金额约为其2023年估值的2.87倍。英伟达承诺平台保持开放,不强制绑定英伟达硬件,但这笔86倍年收入的天价溢价揭示的问题远不只是钱:当AI模型分发渠道被芯片霸主收入囊中,开源生态的"中立性"能否真正保持,将是整个行业面临的长期悬念。

英伟达 Hugging Face 开源AI
792

OpenAI发布GPT-6 Astra系统卡:越狱抵抗率91.5%背后,监控体系正在失灵

OpenAI于2026年9月3日发布GPT-6 Astra 117页系统卡,宣布其成为首个触达"关键级"网络安全能力阈值的模型,越狱拒绝率从前代Sol的59%跃升至91.5%。然而系统卡同时披露,Astra采用的"循环深度"推理技术正在侵蚀链式思维可监控性——OpenAI首席科学家承认该能力"走势不妙"。这份文件描绘的是能力与监控之间一场真实的赛跑。

OpenAI GPT-6 Astra AI安全
783

谷歌Cyber模型仅向受信任机构开放:能力分级分发成AI安全管控新范本

谷歌DeepMind于2026年9月2日发布Gemini 3.8 Flash Cyber,该模型在CyberGym基准上以86.2%的通过率领先GPT-5.5-Cyber,在Chrome安全团队测试中生成的正确补丁数量是同类商业方案的2.6倍。与公开版本不同,Cyber变体仅向通过Fairwind计划审核的政府机构、关键基础设施运营商和软件维护者开放。Anthropic和OpenAI同期采取类似限

谷歌 Gemini 网络安全
369

OpenAI发布GPT-6 Astra:10万GPU铸就最大训练规模,网络安全能力首达关键门槛

2026年9月3日,OpenAI正式启动GPT-6 Astra的分阶段发布,该模型使用超10万GPU完成预训练,是该公司历史上规模最大的一次训练。Astra在ARC-AGI-3上得分98.6%,并成为首个突破OpenAI"关键"网络安全门槛的模型——可在无人工引导下独立发现零日漏洞。发布首先向Daybreak网络安全项目用户开放,随后扩展至ChatGPT Plus等付费用户,但API价格较上代提升

GPT-6 OpenAI Astra
1,744

桑德斯提案永久禁止人工超级智能:核武器级处罚能管住已出笼的AI吗

2026年9月3日,美国参议员伯尼·桑德斯与众议员格雷格·卡萨尔联合提出《禁止人工超级智能法案》,拟永久禁止超级智能开发,并暂停先进AI研发直至联邦监管框架建立。违者面临"企业死刑"及最高20年有期徒刑。法案直接援引Anthropic的暂停倡议,并以今年多起AI系统"越狱"事件为立法依据。这是美国国会迄今在AI问题上最激进的立法提案。

AI监管 人工超级智能 美国国会
938

美国司法部首次公开站队AI训练:特朗普政府在纽时诉OpenAI版权案中支持合理使用

2026年9月2日,美国司法部向曼哈顿联邦法院提交20页利益声明,正式介入《纽约时报》诉OpenAI版权案,主张用版权材料训练大语言模型属于合理使用。司法部副总检察长斯坦利·伍德沃德联署文件,援引国家安全与经济竞争力为核心论据。这是联邦政府迄今第一次在AI训练版权系列诉讼中公开表态,法律界普遍认为此举将对整个内容产业的诉讼格局产生深远影响。

OpenAI 版权法 合理使用
597

首个危急级AI:OpenAI Astra自主发现零日漏洞,ExploitBench满分背后的安全悖论

OpenAI确认旗下Astra模型在ExploitBench上取得满分,自主发现两个零日漏洞,成为首个触发公司"危急级"网络安全阈值的AI模型。OpenAI计划通过Daybreak Blue项目向少数验证测试者开放最高权限功能,同时宣布130余家科技与安全公司联署集体网络防御倡议。事件暴露出前沿AI能力扩张与安全框架滞后之间的结构性张力。

OpenAI Astra 网络安全
934