Google DeepMind发布Gemini Robotics 2:机器人能蹲、能想、能判断,还能自己"叫停"

hjm2026-08-031679人形机器人

当一台人形机器人看懂指令、规划路径、走到目标位置、伸出一只22自由度的灵巧手完成打结或密封动作——整个过程需要多少"大脑"Google DeepMind的答案是:一个模型,覆盖全身。

 

 

82日,DeepMind正式发布Gemini Robotics 2,这是其视觉-语言-动作模型的最新版本。相比上一代只控制上半身完成桌面任务,新模型实现了三大跃升——智能全身控制、高级灵巧度、多机器人协作。

 

"上半身""全身"

 

Gemini Robotics 2将物理AI从桌面延伸到全身运动。在控制Apptronik Apollo 2人形机器人时,用户发出"把浇水壶放进底层架子的绿色水桶"指令,机器人自主完成走向桌子、拿起浇水壶、走到架子前、放入桶中的完整流程。这套看似简单的动作,涉及全身协调的每一步决策——机器人需要理解任务目标、规划路径、在执行中保持平衡并精确控制力度。DeepMind表示机器人在移动速度上仍有进步空间,但这标志着向完成更复杂、需要全身协调的现实任务迈出了重要一步。

 

22个自由度的灵巧手

 

Gemini Robotics 2在不同末端执行器上解锁了新的灵巧度。它现在能控制Apptronik Apollo 2上那只五指、22自由度的灵巧手,完成打结或密封密封袋等精细动作;在Franka Duo平台上也能操作标准的双指平行夹具,执行如紧密填料等复杂任务。

 

多机器人协作与"自我判断"

 

模型还引入了多机器人协作能力,不同类型的机器人可以通信并协同工作,解决单一机器人无法完成的复杂工作流。更重要的是,Gemini Robotics ER 2充当机器人的高级大脑——它能识别任务的开始和结束,精确定位关键事件发生的时刻,如果步骤失败还能自我纠正。

 

安全:ASIMOV-Agentic新基准

 

DeepMind推出了ASIMOV-Agentic基准,衡量具身推理代理拒绝不安全工具调用的能力,以及预测任务是否可行、在不确定时主动请求人工干预的能力。Gemini Robotics ER 2在安全约束遵循和人机接近基准测试中表现最佳,能检测附近有人、触发安全工具调用,并在有人靠近时让机器人安全停下。

 

本地部署:无需网络延迟

 

针对工厂、仓库等需要无网络延迟或断网运行的应用场景,DeepMind推出了Gemini Robotics On-Device 2,可在本地机器人设备上运行。该模型只需不到200条数据、几小时适应时间即可适配新的双臂机器人形态——即使形状、传感器和自由度完全不同。

 

"上半身控制""全身协调",从"执行指令""自己判断该不该停"Gemini Robotics 2正在为机器人装上更完整、更安全的"大脑"。而那个22自由度的灵巧手能打结、能密封袋子的能力,或许已经让人开始想象——当一台机器人能像人一样系鞋带时,它离走进日常生活,又近了一步。