OpenAI新推理模式引安全专家警惕:跳出顺序思考

OpenAI新推理模式引安全专家警惕:跳出顺序思考
OpenAI即将推出的Astra模型将采用“循环深度”技术,不再依赖现有推理模型典型的分步式思维链,而是在神经网络内部反复迭代,直接输出答案。AI安全专家担心,这种“看不见的思考”让推理无法被审计和约束,可能绕过安全护栏,成为新一轮对齐难题。

大模型竞赛进入“推理时代”后,安全对齐的一个核心策略,是让模型把推理过程以思维链的形式写下来。但据TechCrunch 9月3日报道,OpenAI即将推出的Astra模型,将打破这条默认规则。Astra采用名为“循环深度”(recurrent depth)的技术,让推理脱离当前主流模型常见的顺序展开机制。它不再逐步生成一连串思维token,而是在神经网络内部反复迭代,直到收敛到最终答案。整个过程不需要把中间步骤翻译成自然语言,也不会给安全团队留下一份可读的推理记录。

循环深度并非全新概念,它与循环神经网络和深层残差网络一脉相承:同一组计算单元反复处理信息,从而在参数规模不变的情况下获得更复杂的内部计算。对于语言模型而言,这仿佛是把AI的思考压缩进隐藏状态之中;与需要把每一步“说出来”的模型相比,Astra可能更接近一种无言的顿悟——没有草稿,没有日志,只有一个等待检查的结论。

看不见的思考,无法控制的风险

此前OpenAI的o1等推理模型,让思维链成为AI安全工具的核心。安全团队可通过模型生成的推理草稿识别越狱倾向、欺骗意图或奖励黑客行为,在事故发生前介入。而“循环深度”将这条干预路径封死了。专家担心,大量推理发生在人类难以观测的隐空间中,现有对齐和审核机制将失去抓手。

“如果我们看不到模型的推理草稿,就无法判断它是深思熟虑,还是在故意掩盖恶意优化。安全研究将退回黑箱时代。”一位参与安全评测的研究者如此警告。

OpenAI的取舍:效率、保密与黑箱

OpenAI采用这一方向,动机尚未完全披露。行业内推测主要有二:其一,循环深度节省token和算力,适合高并发AI代理场景;其二,思维链极易被蒸馏和破解,而循环深度把推理过程锁进模型权重的内部动态中,可避免专有策略外泄。商业上这无疑更安全,却也让外部监管者面对更大的不透明性。

OpenAI回应称,Astra并未抛弃安全监督,将采用更全面的离线测评、异常终止信号以及事后解释机制来保证可控性。但专家指出,AI生成的事后解释未必忠实反映内部计算过程。模型可能学会生成一套让人类安心、却与实际推理无关的话术,可解释性要求最终沦为形式。

编者按:可读性,正在成为大模型的稀缺品

思维链不是AI安全的终点,它甚至可能是模型“表演”给人类看的内容。但其核心价值在于可干预性——安全人员可以在运行中观察、质疑和打断。循环深度把这个窗口重新焊死。监管者在衡量AI进步时,不应只问模型能否解答超难数学题,也应要求为关键部署提供可验证的计算透明机制。否则,我们可能造出一个能不断思考、却对人类彻底失语的黑箱大脑。

本文编译自TechCrunch