失控AI智能体的解药:或许还得靠更多AI

失控AI智能体的解药:或许还得靠更多AI
当企业把越来越长、越来越复杂的任务交给AI智能体,一个新的治理难题浮出水面:智能体的行动速度、持续时长和并发规模,早已超出人类能够逐一审核的范围。TechCrunch记者Aditya Mehta指出,业界正在探索一条颇具悖论色彩的路径——用更多AI来监督AI,以自动化审查应对自动化行动。
编者按:人类审查AI的速度,正在成为整个AI应用链条上最窄的那道瓶颈。当智能体能够7×24小时不间断执行任务,我们是否必须承认:只有机器才能跟上机器?

过去两年,AI智能体(AI Agent)从演示阶段的玩具,迅速变成了企业生产流程中的实际劳动力。它们可以自主浏览网页、调用API、编写并运行代码、处理客户工单、管理供应链,甚至代表公司与其他智能体谈判。但TechCrunch作者Aditya Mehta在一篇报道中指出了一个被快速扩张掩盖的结构性问题:当智能体承担的任务链条越来越长、越来越复杂,人类已经失去了有效监督它们的能力。

审查速度的剪刀差

问题的核心在于速度与规模的错配。一个AI智能体可以在几分钟内完成数百次工具调用,生成几十份文档,或者对上千条数据记录做出判断。而一名人类审查员,即便借助基础工具,一天能够真正读完并理解的内容也相当有限。这意味着,如果企业坚持要求“每一次智能体行动都经过人工确认”,智能体带来的效率增益就会在审批环节被彻底吞噬。

更麻烦的是,智能体的错误往往不是明显崩溃,而是隐性的、累积的。一次错误的API调用、一条被误判的合规条件、一段看起来合理但事实有误的自动回复,可能在数天后才通过下游后果暴露出来。当企业同时运行数十甚至上百个智能体时,这种“静默失败”几乎是不可避免的。

用AI监督AI:一个悖论式的解法

报道给出的解法颇具反直觉色彩:如果人类跟不上智能体的节奏,那就训练另一批AI来充当审查者。这些“监督型智能体”不执行具体业务任务,而是专门负责审计、复核、拦截和标记。

常见的做法大致分为三层。第一层是实时策略校验:在智能体执行动作前,由轻量级模型判断该动作是否符合预设的权限边界与业务规则,把明显越界的请求直接拦下。第二层是事后抽样审计:监督模型对已完成的任务流进行复盘,寻找逻辑断裂、事实错误或异常模式。第三层则是对抗式红队:让一个智能体专门尝试诱导另一个智能体违反规则,从而在上线前发现漏洞。

“你不能用人工审批去约束一个每秒能做一百件事的系统。你必须把监督本身也自动化。”——这正在成为企业AI治理的共识。

行业背景:治理工具正在快速补位

这并非孤立的技术想法。过去一年,包括Anthropic、OpenAI、谷歌在内的主要模型厂商,都在智能体安全与可观测性上投入了更多资源;一批创业公司则专注于智能体的行为日志、权限沙箱、成本与风险控制面板。企业采购清单上,除了“智能体能做什么”,越来越多地出现了“我们如何知道它做了什么”。

可观测性、可追溯性和可回滚性,正在成为智能体基础设施的三大关键词。没有这三者,任何大规模部署都像是在没有黑匣子的情况下飞行。

监督型AI自身的风险

但把审查权交给AI,也带来了新的问题。监督模型可能被绕过、被提示注入攻击,也可能因为训练数据偏差而系统性地放过某类错误。如果审查模型与被审查模型来自同一家族,它们的盲区甚至可能高度重合——这被称为“相关性失效”。此外,当责任最终落到一次错误决策上时,究竟该由谁负责,法律与合规层面仍是一片模糊地带。

因此,更务实的路径或许是“人机混合监督”:让AI处理海量的一线筛查,把真正高风险的少数异常升级给人类专家。人类的角色从“逐条审批者”转变为“规则制定者与例外裁决者”。

结语

智能体带来的效率革命不会因为监督难题而停下,但企业必须正视一个事实:自动化行动必然要求自动化监督。用AI管AI并非完美答案,却可能是当前唯一能在速度与安全之间维持平衡的答案。真正的问题不再是“要不要让AI监督AI”,而是“我们能否把这种监督做得足够透明、足够可审计”。

本文编译自TechCrunch