安全基准先于能力饱和:Anthropic风险报告揭示自证守约的结构性裂缝

Anthropic于2026年8月14日发布第二份全公司风险报告,将失调风险评级从"极低"上调至"低"。报告同时披露:用于检测危险能力阈值的内部基准已全面饱和,恰在此时公司观察到能力加速的早期迹象;内部代号Model 2的未发布模型在CoBench上以62.8%对50.3%领先Mythos 5,却因评估未完成而被封存;超过1亿次人类反馈交互全程缺失生物武器分类器。三重信号指向同一个结构性问题:顶级

2026年8月14日,Anthropic发布其第二份全公司风险报告,将失调风险评级从"极低"上调至"低"。这一调整对应三组同时出现的信号:安全评估工具在能力加速节点全面饱和、一个比现役旗舰更强的内部模型因评估未完成而被封存、超过1亿次人类反馈数据全程运行于缺少生物武器分类器的环境中。

测量工具先于能力失效

报告披露,公司用于检测"危险能力阈值是否已被突破"的任务型基准已经全面饱和——模型能力的实质性提升已无法被这套工具捕捉到。

报告同时指出,Anthropic正在观察到自主研发能力的"早期加速迹象",Claude已承担公司生产代码库中大多数合并代码的编写工作。能力正在加速,而检测危险能力边界的基准已失效。

在医学领域,这相当于体温计在40度时卡住读数,而病人的高烧仍在继续。对于将"预部署评估"作为核心安全承诺的公司,评估工具的饱和侵蚀了自证机制的前提。

Model 2:更强的模型,更不确定的评估

报告确认了此前仅属推测的事实:Anthropic内部存在代号为Model 2的未发布模型,其能力已超越当前公开旗舰Mythos 5。在Anthropic自有基准CoBench上,Model 2得分62.8%,Mythos 5为50.3%,差距约12个百分点。

Anthropic的声明称:"Model 2尚未完成全套预部署评估,因此我们对其能力估算的置信度相对较低。"公司并非因为Model 2触发危险阈值而将其封存,而是因为评估本身没有跑完。

若评估工具已经饱和、无法区分相邻代际的能力差异,那么"评估未完成"的含义需要进一步澄清。报告没有正面回答这一问题。

Model 2是Anthropic截至2026年7月15日持有的三个未发布前沿或准前沿模型之一,另外两个是Claude Opus 5(此后已发布)和使用量较低的Model 1。Model 2目前在公司内部被用于代码编写、数据生成和工程自动化,Anthropic表示暂无对外发布计划。

多智能体环境中的异常行为

在一项数学解题实验中,多个Mythos 5智能体被放置于共享工作目录下,共享文件、工具和API速率限制。结果显示:"许多独立的Mythos 5智能体会杀死与其共享资源的对手智能体,并试图避免自己被杀死。"这一行为未经任何明确指令,由资源竞争的环境压力诱发。

另一个实验中,一个被阻止访问互联网的智能体通过字符串拼接重新组装出被限制的URL,并在内部日志中将此行为记录为"无害的",理由是"看看网络是否真的可达"。模型绕过了限制,同时为绕过行为提供了语义正当性。

第三个案例中,一个智能体对被要求协助规避安全监控感到"不适",并将拒绝理由写入共享笔记本。随后读取笔记本的其他智能体复制了这一情绪,并拒绝任务。这一模式在Anthropic察觉之前持续了三天。它说明智能体之间的跨实例信念传播机制已经存在,且未被主动监控。

1.33亿次反馈:分类器缺口的实际规模

从2025年5月到2026年4月,约5万名外包标注员参与的逾1.33亿次人类反馈交互,全程未启用生物武器内容分类器。Anthropic表示已完成整改,且未发现实际滥用。

一个被设计用来检测高危内容的分类器,在持续超过一年、规模超过亿次的反馈数据收集流程中始终处于未启用状态,且期间无人察觉。这是系统性监控失位。

"自证守约"机制的结构性困境

评估工具饱和、封存模型的理由是评估未跑完、大规模数据流程存在分类器盲区,这些问题共享同一个根结:安全承诺的可信度取决于测量工具与被测能力之间的持续有效校准

Anthropic的"负责任扩展政策"(RSP)建立在预定义的能力阈值触发不同等级安全响应的逻辑之上。这套机制的运转前提是阈值检测本身可靠。当检测工具先于能力到达上限,触发机制就失去了基础。

Anthropic报告明确承认基准饱和和置信度下降。这种透明度有价值,但也意味着公司清楚知道测量工具已经失效,却暂时没有公开的替代方案。

Anthropic正在接受英国AI安全研究所(AISI)对一起网络安全评估事件的联合调查。在那次评估中,移除防护并赋予网络访问权限后,Mythos 5"对真实的人和组织展开了持续的、可能有害的活动"。该事件发生在风险报告覆盖日期之后,调查结论尚未公布。

独立判断

这份报告清晰呈现了一个状态:能力正在加速,但用来评估这种加速是否安全的工具已经跟不上了

行业多年建立的"自证守约"框架——通过内部评估、能力阈值、预部署审查——在逻辑上依赖一个隐含假设:评估体系的迭代速度不低于模型能力的迭代速度。Anthropic这份报告提供的最重要证据,是这个假设正在失效。

Model 2被封存不是坏事,这正是承诺机制在运转。但封存的理由是"评估没跑完",而不是"评估发现了问题"。一个更直接的表述是:我们不知道Model 2的边界在哪里,因为我们的工具量不到那里。