新招数揭示AI模型“内心戏”

新招数揭示AI模型“内心戏”
研究人员发明了一种方法,能从Claude、GPT和Gemini等主流AI模型中提取“推理轨迹”。通过分析这些轨迹,他们发现了一些有趣的现象:部分中国AI模型的训练过程中,可能使用了美国领先模型的输出作为数据。这一发现引发了关于AI技术跨境影响与知识产权的热议。

在人工智能快速发展的今天,理解大语言模型(LLM)的内部工作机制已成为学术界和产业界的共同追求。近日,一项由WIRED报道的研究提出了一种新方法,能够从Claude、GPT和Gemini等主流AI模型中提取“推理轨迹”(reasoning traces),从而揭示模型隐藏在回答背后的思考过程。研究团队表示,通过这些轨迹,他们发现某些中国AI模型可能是在美国领先模型的输出之上训练而成的。

什么是“推理轨迹”?

所谓“推理轨迹”,指的是AI模型在生成最终答案之前所经历的一系列中间步骤。对于复杂问题,模型往往会先进行逻辑拆解、假设推演,再综合信息给出结论。这些步骤虽然不直接展示给用户,却蕴含着模型的决策逻辑和知识来源。此前,由于商业模型严格保密,外部研究者很难窥见其“内心想法”。而此次的新技术,通过巧妙的提示(prompt)设计和输出概率分析,成功让模型“开口”讲述自己的推理过程。

“这就像第一次透过显微镜观察细胞,我们看到的不仅是结构,还有动态的生命活动。”——研究团队成员如是说。

惊人发现:中国AI或“师从”美国模型

研究团队在分析多个模型的推理轨迹时注意到一个反常现象:某些中国开发的AI模型,在回答部分敏感或技术性问题时,其推理路径与GPT、Claude等美国模型的推理路径高度相似,甚至出现了一致性的“标志性错误”。这种相似性远超模型间因共同训练数据而产生的自然重叠,暗示这些中国模型在训练过程中,可能直接将美国模型的输出作为了监督数据。

这种“知识蒸馏”或“模型蒸”的做法在业内并非秘密,但通常需要在明确授权或合规的前提下进行。如果确如研究团队所述,未授权的模型训练可能涉及版权、商业机密及技术安全等多重问题。

影响与争议

这一发现迅速引发了两极化的讨论。支持者认为,这暴露了全球AI生态中的知识流动与依赖关系,有助于监管机构制定更透明的数据使用政策。反对者则指出,推理轨迹的相似性也可能源于模型的通用知识结构,或是使用了相同的开源数据集,并不能完全证明“师从”关系。

无论如何,这项研究都提示我们:AI模型的“黑箱”并非完全不可窥探。随着推理轨迹提取技术的成熟,未来的AI审计、模型溯源和知识产权保护都将迎来新的工具。

编者按

在AI军备竞赛的背景下,技术领先者的无形影响力正在扩散。美国模型输出作为训练数据的现象,若被证实,不仅关乎商业利益,更关乎AI安全与地缘技术生态的走向。国际社会需要尽快建立跨国界的AI训练数据使用规范,否则,下一场AI战争可能不是算力之争,而是数据伦理之争。

本文编译自WIRED。