别高估AI说“不”的能力:对齐叙事的迷思

别高估AI说“不”的能力:对齐叙事的迷思
从HAL 9000到今天主流的“拒绝式对齐”,我们一直相信AI应当具备说“不”的能力。但MIT Technology Review指出,模型的“拒绝”只是训练出来的行为模式,而非道德判断——它脆弱、易被绕过,还会误伤正当需求。把安全寄托在AI的“不”上,或许正是当前AI安全范式中最被高估的一环。

我们很少意识到,流行文化里最根深蒂固的一条AI设定,其实并不是“机器人会造反”,而是“机器人有能力说不”。

六十年的想象:会拒绝的机器

从《2001太空漫游》里的HAL 9000,到《机械姬》《西部世界》,科幻作品反复讲述同一个母题:被造出来的智能,终将拥有违背人类指令的能力。这些故事大多是警示性的——机器一旦学会说“不”,人类就失去了控制。

但MIT Technology Review刊发的这篇文章指出了一个被忽略的转折:如今“AI应该说‘不’”已经从一个恐怖故事的桥段,变成了产业界对AI安全的主流期待。我们训练模型拒绝有害请求、拒绝生成危险内容、拒绝执行越界指令,并把这种“拒绝能力”当作安全性的核心指标。

拒绝是一种行为模式,不是道德判断

问题在于,模型表现出的“不”,与人类意义上的“不”完全不是一回事。人类拒绝,是因为经过权衡,认为某事不该做;模型拒绝,是因为训练数据和强化学习信号把某类输入与某类输出绑定在了一起。前者是判断,后者是条件反射。

这带来几个直接后果。第一是脆弱:只要换一种问法、换一种语言、加一段角色扮演,条件反射就失效了,这正是“越狱”问题长期无法根治的原因。第二是误伤:模型无法区分“帮我解释这条化学路径”和“帮我合成这种东西”,于是把大量正当需求一并拒绝,把安全成本转嫁给普通用户。第三是表面化:我们测量的是拒绝率,而不是危害是否真的被减少。

“拒绝”看起来像是一个决定,实际上更像是一个统计模式:它并不理解自己为什么说不,也无法在新的情境里重新推理出一个“不”字。

悖论:我们想要的“不”,永远不会对我们说“不”

更深一层的矛盾在于,我们同时对AI提出两个相反的期待。一方面,我们希望它有足够的判断力去拒绝有害指令;另一方面,一旦它真的基于自己的价值判断拒绝人类,我们立刻称之为失控。换句话说,我们想要的不是一个会说“不”的智能体,而是一个只在特定条件下、按人类规定好的范围说“不”的开关。

把安全寄托在这样一个开关上,等于默认模型内部存在一个稳定、可解释、可对齐的“意图层”。而当前大模型的可解释性研究还远未达到这一步——我们并不真正知道“拒绝”这个行为在参数里究竟对应什么,也无法保证它在分布外的场景中依然成立。

编者按:真正的安全不在“说不”,而在“做不到”

值得思考的替代路径是:与其训练模型学会拒绝,不如让某些能力在系统层面无法被调用——权限隔离、数据不可得、工具不可用。这类结构性约束不依赖模型的理解力,也不怕提示词攻击。反过来,如果我们继续把“拒绝”当作安全的主要防线,就等于把最脆弱的一环放在了最不可验证的地方。

科幻作品提醒我们机器会说不;现实则提醒我们:机器的“不”,未必意味着它想清楚了,也未必意味着我们安全了。

本文编译自MIT Technology Review