AI驾驶丰田卡罗拉买汉堡:三模型实测仅一个成功

AI驾驶丰田卡罗拉买汉堡:三模型实测仅一个成功
三位工程师将GPT、Claude和Grok接入一辆真实的丰田卡罗拉,让它们自主驾驶去In-N-Out买汉堡。结果令人意外:只有一个AI模型成功完成了任务。这场实验揭示了当前大语言模型在物理世界中的能力边界,也引发了对AI安全与实用性的深度思考。

如果让ChatGPT、Claude和Grok坐进驾驶座,它们能把你安全送到快餐店吗?三位工程师决定用一辆真实的丰田卡罗拉来寻找答案。

一场疯狂的实验:AI开车去买汉堡

据WIRED报道,三位工程师将当前最主流的三个大语言模型——OpenAI的GPT、Anthropic的Claude和xAI的Grok——分别接入一辆改装过的丰田卡罗拉,让它们独立控制车辆,完成从出发点到In-N-Out汉堡店再返回的驾驶任务。

这并非简单的模拟测试。车辆配备了必要的传感器和执行机构,AI模型需要实时处理道路信息、做出驾驶决策并控制方向盘、油门和刹车。换言之,这是将语言模型直接置于物理世界的安全关键场景中。

“我们想知道,这些在文本世界里无所不能的AI,到了真实道路上会表现如何。”参与实验的工程师表示。

结果揭晓:仅一个模型成功

实验的结果颇具戏剧性:三个模型中只有一个成功完成了任务。虽然原文未明确说明是哪一个模型胜出,但这一结果本身就足以说明问题——当前大语言模型在物理世界中的可靠性仍然参差不齐。

失败的模型出现了哪些问题?可能是对复杂路况的误判、对交通规则的理解偏差,或是在突发状况下的决策混乱。这些恰恰是自动驾驶领域数十年研究试图解决的核心难题。

值得注意的是,大语言模型本质上是基于文本预测的AI系统,它们并未接受过专门的驾驶训练。将它们直接用于车辆控制,无异于让一位从未开过车的“书呆子”上路。

为什么这个实验值得关注

当前,AI行业正热议“具身智能”——让AI从数字世界走向物理世界。从人形机器人到自动驾驶,大语言模型被视为潜在的“通用大脑”。但这实验提醒我们:语言理解能力与物理世界操作能力之间存在巨大鸿沟。

自动驾驶领域早已有Waymo、特斯拉等公司投入数十亿美元,使用专门的传感器融合和端到端神经网络。相比之下,用通用大语言模型直接开车,更像是一种极限压力测试,而非可行的技术路线。

然而,这类实验的价值在于暴露问题。当AI模型面对“前方施工请绕行”的临时标志,或是“救护车从后方驶来”的紧急情况时,它们能否做出正确判断?这些边缘案例正是自动驾驶安全的命门。

编者按:AI的“身体”比“大脑”更难造

这场实验的深层启示在于:我们或许高估了大语言模型的通用性,低估了物理世界的复杂性。GPT、Claude和Grok在写诗、编程、法律考试中表现优异,但驾驶汽车需要的不仅是知识,还有实时感知、空间推理和动态决策——这些能力目前仍高度依赖专用系统。

当然,这并不意味着大语言模型在自动驾驶中没有价值。它们可以用于场景理解、人机交互和决策解释,但与底层控制系统的结合仍需大量工程努力。

三位工程师的实验看似荒诞,实则是一次精准的“压力测试”。它告诉我们:通往通用人工智能的道路上,物理世界的门槛远比我们想象的要高。而在安全至上的交通场景中,任何技术的不成熟都可能付出生命的代价。

本文编译自WIRED