谷歌今日通过官方博客正式揭晓了Gemini Robotics 2.0——这是一次面向机器人操作系统的重大升级。据Ars Technica报道,该平台共包含三个不同层级的模型,但截至目前仅有一个面向公众开放,其余两个将逐步在合作伙伴与内部测试中落地。新版本的核心承诺是:让机器人拥有更接近人类的灵巧手指和更强的自主安全判断能力。
三大模型:分层设计满足不同需求
Gemini Robotics 2.0的三个模型被命名为Gemini Robotics Base、Gemini Robotics Pro和Gemini Robotics Lite。Base模型是当前唯一公开发布版本,它专注于基础抓取和移动任务,可运行在低成本的工业机械臂上,适合教育和小型制造企业快速部署。Pro模型则针对高精度装配和医疗服务场景优化,支持多指协同操作和实时力反馈,预计今年第四季度开放内测。Lite模型是轻量级边缘端方案,专为消费级扫地机器人和陪护机器人设计,能在本地完成全部推理,无需云端依赖。
“过去的机器人更像‘盲人摸象’,而Gemini Robotics 2.0让它们拥有了‘触觉’和‘直觉’。”——谷歌机器人部门VP在博客中表示。
安全性是本次升级的另一重点。系统引入了“自修正夹持”算法:当机械手在抓取易碎物品时检测到滑脱趋势,控制器会在50毫秒内微调指尖角度和压力,避免物体坠落或损坏。此外,新版本还内置了“动态防碰撞”模块,能在高速运动中实时避开人类和随机障碍物,不同于传统静态地图的路径规划。
行业背景:机器人灵巧性为何是硬骨头?
在机器人技术领域,灵巧操作(Dexterous Manipulation)被视为“圣杯”之一。过去十年,大型语言模型和视觉理解取得了惊人进步,但机器人的手部精细控制仍停留在实验室阶段。例如,抓起鸡蛋不碎、拧开瓶盖、穿针引线——这些对人类来说再简单不过的动作,对机器人却涉及触觉传感器精度、力矩控制频率、多任务规划等数十个变量。
谷歌DeepMind团队自2023年起将Gemini多模态模型与物理机器人结合,2025年首次推出Gemini Robotics 1.0,实现了对自然语言指令的初步理解。而2.0版本的关键变化在于:不再仅仅依赖预训练模型,而是引入了“在线适应性学习”——机器人在执行任务时持续更新自身的物理模型,从而应对未知物体的形状和材质。
编者按:谷歌的“通用机器人”野心与现实挑战
从公开信息来看,Gemini Robotics 2.0的技术路线已经明显区别于特斯拉Optimus和Figure公司的硬碰硬式堆料。谷歌更强调软件定义的灵活性和安全冗余,这或许符合其“AI优先”的传统。然而,开放程度仍是隐忧:仅一个基础模型开源,Pro和Lite模型何时落地、价格如何均未披露。此外,机器人在真实家庭环境中的光照变化、地面材质多样性与人类不可预测行为,仍会让任何预训练模型措手不及。
值得注意的是,本次发布的时间点(2026年7月)恰好处于全球机器人投资热潮的第三波。随着生成式AI向物理世界渗透,行业普遍认为2026-2027年是“可通用家用机器人”的关键窗口期。谷歌选择此时亮出2.0版本,明显意在抢占标准制定者的角色,而非仅仅卖硬件。
展望未来,如果谷歌能将Gemini Robotics 2.0的Lite模型集成到Nest或类似消费品中,普通人或许在2027年就能买到一台不仅能说话、还能帮你做饭和整理房间的机器人。但在这之前,安全法规、用户信任和成本控制仍是三座大山。
本文编译自Ars Technica
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接