多年来,我们对实用人形机器人的憧憬,总感觉像是一段原地踏步的演示:头30秒令人惊叹,但最终还是被禁锢在实验室里,重复着一个预先排练好的动作。它们能捡起积木,这没问题,但要在杂乱的房间里穿行,却摇摇晃晃,像个糖吃多了的小孩。现在,Google DeepMind 祭出大招,推出了Gemini Robotics 2——一个AI平台,与其说是软件更新,不如说是给各种形态和尺寸的机器人做了一次彻底的“换脑手术”,意图提供一个破局之策。
其理念看似简单,却蕴含深意:打造一个统一的“智能层”,让任何机器人都能在混乱、不可预测的人类世界中进行感知、推理和行动。这不仅仅是为了实现单臂的精细操控,更是Google所称的“全身智能”。史上首次,一个单一的AI模型被设计来控制人形机器人的从脚尖到指尖的每一个关节,将平衡、移动和操作协调成一个流畅的整体。这其中的区别,就好比从编程机器人的关节运动,进化到赋予它独立的“思想”。
三位一体的AI大脑
Gemini Robotics 2 的核心并非单一模型,而是由三个各司其职的专业模型协同工作。你可以把它想象成在物理世界中完成任务的“指挥部”。
首先是 Gemini Robotics 2 本身,这个是主力的视觉-语言-动作(VLA)模型。它就像一个勤恳的“执行官”,能将“把洒水壶放到最下面的架子上”这样的高阶指令,转化为行走、弯腰、保持平衡、放置物体等一系列复杂的马达控制序列。
其次是 Gemini Robotics ER 2,即“具身推理”(Embodied Reasoning)模型。这可是个“战略军师”。它能持续观察真实世界的视频流,理解语境,规划多步骤任务,甚至在出现问题时及时纠偏。如果说主模型是身体,那么ER 2就是那个高阶大脑,负责在VLA模型思考“如何做”之前,先搞清楚“做什么”。它甚至能调用谷歌搜索等外部工具来辅助其决策。
最后是 On-Device 2,这位“变装大师”。这是一个轻量级的VLA模型,经过优化可在机器人硬件上本地运行。但它的杀手锏在于强大的适应性。Google宣称,它只需短短几小时,通过少于200次的演示,就能适应一个全新的机器人躯体——即便传感、关节和机械结构都截然不同。这无疑是迈出了里程碑式的一步,彻底摆脱了困扰业界数十年的传统硬件专属AI开发模式。
告别“实验台”,拥抱真实世界
任何机器人AI的真正考验,都在于其处理复杂任务的能力,而不仅仅是工厂流水线上的重复作业。Gemini Robotics 2 明确旨在走出实验室,进入复杂的真实世界场景。演示中展现了前所未有的灵巧度:它能控制一个拥有五指、22个自由度的机械手拧下灯泡(成功率高达92%),也能给垃圾袋打结(成功率44%,看来这个还有提升空间)。
这种能力上的飞跃,得益于将整个身体整合到决策过程中。在与 Apptronik的Apollo 2 人形机器人进行的测试中,该机器人从货架上取回物品的成功率达到了76.3%——这项任务需要协调行走、平衡、伸展和抓取等多个动作。
但或许最具前瞻性的功能是多机器人协作。Gemini Robotics ER 2 可以充当中央协调器,在完全不同类型的机器人之间分配任务。想象一下,一个像Apollo一样的人形机器人将物品递给一个轮式移动机器人进行运输,每个机器人都能理解自己在整个工作流程中的角色。这清晰地展现了该平台的雄心:为机器间的协同工作创造一种通用“语言”。
机器人界的“安卓”?
通过 Gemini Robotics 2,Google正在进行一项战略性布局,试图成为下一代机器人硬件的底层操作系统。通过创建一个强大、适应性强的AI,理论上可以运行在任何机器上,他们正将自己定位为蓬勃发展的机器人“躯体”生态系统的“大脑”供应商。
对于开发者和研究人员来说,好消息是这个强大新工具的部分功能已经开放。Gemini Robotics ER 2 现在已通过 Gemini API 和 Google AI Studio 向开发者提供,允许他们开始构建利用其高级推理能力的应用程序。这为更广泛的社区打开了大门,让他们可以在自己的机器人项目中尝试多步骤规划和真实世界视频理解。
当然,从一个惊艳的演示到真正实用、可靠的机器人之间,仍是一道鸿沟。真实世界远比受控的实验室复杂多变得多。但通过专注于能够学习、适应和协作的通用智能,Google DeepMind 正在搭建一座桥梁。他们不只是在制造一个更智能的机器人,更是在为所有机器人变得更智能描绘蓝图。而这一次,演示片中的未来,或许真的要照进现实了。
