现场直击:我看到AI机器人即兴用香蕉当工具

现场直击:我看到AI机器人即兴用香蕉当工具
在通用人工智能初创公司Generalist AI的一次参访中,我看到了一只机械臂在没有预先编程的情况下,随手拿起一根香蕉当作工具使用。这一看似滑稽的场景,背后却是AI在物理世界中从“被动执行”走向“主动即兴”的关键一跃。本文作者Will Knight认为,这预示着机器人学习范式的深刻转变:不再依赖海量数据预训练,而是依靠实时推理与环境交互。

当我站在Generalist AI的实验室里时,眼前的一幕几乎让我怀疑自己是否看错了:一只工业机械臂正小心翼翼地用一根香蕉去按压一个按钮。它不是被精密编程去完成这个动作的——至少,没有人为这个特定场景写过一行代码。它只是“看了看”周围,然后决定香蕉是此刻最合适的工具。

这是我在2026年8月的一次实地探访。Generalist AI是一家致力于让机器人学会“随机应变”的初创公司。他们把这种能力称为“现场学习”(on-the-spot learning)。与传统的机器人不同,它们不需要在固定环境中重复执行预设轨迹,而是能在全新的任务中,通过实时推理和物理试探找到解决方案。

从“预训练”到“即兴发挥”

过去十年,机器人学习的主流范式是“大规模预训练+微调”。像RT-2、PaLM-E这样的视觉-语言-动作模型,通过海量互联网数据和机器人数据进行训练,期望模型能泛化到新场景。但现实世界的复杂性在于——你永远无法预见到所有情况。当遇到“一个黄色弯曲的物体”时,模型可能会识别出它是香蕉,却不一定会想到“可以用它来按压按钮”。

Generalist AI的突破在于,他们将“工具”的概念从固定列表扩展到了无限可能。在他们的系统中,机器人不再依赖“这个工具是用来做什么的”这类静态知识,而是通过实时的接触反馈和视觉观察,推断出“这个物体此刻能否帮助我实现目标”。这更像人类的即兴表演:随手拿起一本书垫桌脚,或用勺子当螺丝刀。

“我们在教机器人不要迷信预训练。真正的智能,是在未知中作出合理选择的能力。”——Generalist AI研发负责人对笔者表示。

香蕉背后的技术革命

据现场工程师介绍,这套系统由三个核心模块构成:一个实时场景理解模型,负责解析物体的几何属性和物理属性;一个基于世界模型的推演器,能在毫秒级时间内模拟“如果我用香蕉按压,会发生什么”;一个自适应的运动控制层,负责将抽象计划转化为精准的力控动作。三者协同,让机械臂在十秒内完成了从“观察香蕉”到“实施按压”的全过程。

更令人惊叹的是,这并非预先安排的演示。工程师临时更换了香蕉的位置、角度,甚至把目标按钮换成了红色圆钮。机械臂每次都会重新推理,并找到新的抓取点和发力方式。它甚至在某次尝试中,用香蕉的侧面而不是尖端去按压,因为那样更稳定。

通用机器人的曙光?

长期以来,机器人技术被分为两大流派:工业机器人追求速度与精度,协作机器人追求安全与易用,但它们都缺乏“常识”。而像Figure、1X、特斯拉Optimus等人形机器人,虽然展示了惊人的运动能力,但在开放任务中的决策能力仍显不足。

Generalist AI的路线为行业提供了另一种想象:也许通用机器人不需要拥有庞大的知识库,只需要具备“即时的物理直觉”。这种直觉,正是通过大量在模拟环境中“犯错”训练出来的。当机器人把香蕉当锤子、当支架、当扳手时,它不是在执行程序,而是在“理解”物理世界。

当然,目前的系统仍有明显局限。它只擅长操作桌面上的小型物体,对柔软、易变形的食材(如香蕉本身)的抓取仍偶有失误。但正如每一位见证者感受到的,那根香蕉所代表的,不是一次演示,而是一种方向的宣告——AI的下一个前沿,不是更流畅的对话,而是更机智的“动手能力”。

编者按:当大模型在语言世界里不断刷新认知,物理世界中的AI仍处于“牙牙学语”的阶段。但Generalist AI的这次展示让人看到,机器人的“即兴发挥”可能比我们预想的来得更早。香蕉作为工具,或许就是机器人迈向通用智能的一小步。

本文编译自WIRED