AI的拒绝困境与减肥药副作用:我们高估了什么?

AI的拒绝困境与减肥药副作用:我们高估了什么?
本期MIT科技评论《The Download》聚焦两大议题:AI模型的"拒绝困境"——我们过度信任AI说"不"的能力,却忽视其判断的脆弱性;以及减肥神药GLP-1受体激动剂的副作用争议——在追捧疗效的同时,长期风险正在浮现。两则新闻共同指向一个核心命题:技术的能力边界与信任的合理尺度。

编者按

技术的每一次跃进,都伴随着信任的重新分配。本期《The Download》带来两则看似无关的新闻——AI模型的拒绝机制,以及减肥神药的副作用争议——却共同追问同一个问题:我们究竟该对技术寄予多少信任?当AI学会说"不",当减肥药改变千万人的身体,信任的边界正在被重新定义。

当AI学会说"不":拒绝机制的信任危机

今天的AI模型经过训练,会对大量提示词说"不"。如果你问聊天机器人如何毒杀某人,它会拒绝回答;如果你要求它生成仇恨言论,它也会礼貌地推脱。这种"拒绝能力"被视为AI安全的核心护栏,也是各大实验室在模型对齐(alignment)上的标志性成果。

然而,MIT科技评论的报道指出,我们或许正在把太多信任寄托在AI的"拒绝"之上。问题不在于AI是否会拒绝,而在于拒绝背后的判断逻辑,远比表面看起来脆弱。

"我们正在把安全责任外包给一个并不真正理解语境的系统。"

首先是过度拒绝(over-refusal)问题。安全训练往往以"宁可错杀,不可放过"为原则,导致模型对大量无害请求也予以拒绝。医疗研究者询问药物过量症状、安全分析师探讨漏洞原理、小说作者描写犯罪情节——这些正当需求常常触发模型的防御机制。过度拒绝不仅损害用户体验,更可能让专业领域的关键信息被屏蔽,反而制造新的风险。

其次是不足拒绝(under-refusal)问题。攻击者通过越狱提示(jailbreak)、角色扮演、多语言切换等手段,可以绕过安全护栏。模型在一种表述下拒绝,换个说法就会配合。这说明拒绝更像是模式匹配,而非真正理解"什么是有害的"。

更深层的问题在于,拒绝机制被当作对齐的代理指标。当模型拒绝率达标,实验室就认为安全目标达成。但真实世界的伤害高度依赖语境:同一句话在医疗、教育和恶意场景下意义完全不同。一个只会识别表面模式的系统,无法承担这种判断责任。

行业已经开始反思。Anthropic提出的"宪法AI"、OpenAI的模型规范(Model Spec)都在尝试让拒绝更精细、更有层次,而非简单地"一刀切"。但根本矛盾依然存在:安全与可用性之间的平衡,需要人类价值观的持续介入,而非一次性的训练数据。拒绝,或许只是安全问题的开始,而非终点。

减肥神药的另一面:副作用与长期风险

另一则值得关注的新闻,是GLP-1受体激动剂类减肥药物的副作用争议。以司美格鲁肽(semaglutide,商品名Ozempic、Wegovy)和替尔泊肽(tirzepatide,商品名Mounjaro、Zepbound)为代表的药物,正在全球掀起一场减肥革命。

这些药物最初用于治疗2型糖尿病,通过模拟肠道激素GLP-1来抑制食欲、延缓胃排空。临床试验显示,患者平均可减重15%至20%,效果远超传统生活方式干预。市场规模迅速膨胀,诺和诺德与礼来两家公司市值一度飙升,GLP-1成为医药行业最炙手可热的赛道。

但光环之下,副作用正在被重新审视。常见反应包括恶心、呕吐、腹泻和便秘;更严重的担忧则集中在胃轻瘫(gastroparesis)、胰腺炎、胆囊疾病,以及被称为"Ozempic脸"的现象——因快速减重导致的面部凹陷和皮肤松弛。

更值得警惕的是肌肉流失。研究显示,减掉的体重中可能有相当比例来自肌肉组织,这对老年人和本就体弱者尤为不利,可能加剧肌少症与跌倒风险。此外,停药后的体重反弹几乎是普遍现象,长期用药的必要性、成本与心理健康影响仍是未解难题。

"我们正在用治疗糖尿病的药物,去应对一个本质上是社会性的健康问题。"

监管机构已开始行动。FDA和EMA陆续更新标签,要求标注相关风险。但药物经济学的问题依然尖锐:当健康生活方式难以推广时,用药物快速解决问题是否可持续?当减肥变成一针了之的消费行为,我们是否忽视了饮食结构、运动习惯与社会环境这些根本变量?

信任的边界:两个议题的共同启示

无论是AI的拒绝机制,还是减肥神药,两则看似无关的新闻指向同一个命题:技术的能力边界在哪里,我们该给予多少信任?

对AI,我们高估了"拒绝"作为安全机制的有效性;对减肥药,我们在疗效的兴奋中可能低估了长期风险。二者都提醒我们:面对快速迭代的技术,保持批判性的审慎,比盲目信任更为重要。真正的进步,不是让技术替代判断,而是让人类在理解技术局限的前提下,做出更明智的决策。

本文编译自MIT Technology Review