谷歌发布Gemini Robotics 2,全身协调仍面临灵巧性瓶颈
Taylor Wilson
这次升级到底升了什么?
Gemini Robotics 2的核心突破:控制范围从上半身扩展到全身——机器人现在能边走边蹲边拿东西。
这意味着→ 机器人不再是"固定在桌前的手臂",而是可以移动+操作同时进行的整体。
用大白话说= 以前只能坐着干活,现在能走着干活——听起来简单,但对AI来说是全新的控制难题。
三款模型各管什么?
Gemini Robotics 2:把摄像头画面和语音指令变成电机动作——相当于机器人的"小脑"。
Gemini Robotics ER 2:负责高层任务规划,支持多步骤协调和多台机器人协作——相当于"调度中心"。
On-Device 2:可以在设备本地运行,不依赖云端。三款模型既能协同也能独立工作。
灵巧性为什么仍然是瓶颈?
谷歌DeepMind机器人总监饶坦承:真正的灵巧性仍是遥远目标,机器人动作依然缓慢而刻意。
这反映出一个根本问题——人类凭直觉完成的动作,机器人需要停下来逐步计算。
学习效率差距同样巨大:人类一两次试错就能调整,当前机器人系统做不到。
用大白话说= 拧灯泡成功率92%,但捆垃圾袋、封密封袋这种需要手指灵活配合的任务,成功率明显更低。
安全性做了哪些改进?
谷歌称ER 2是其迄今最安全的机器人模型,在遵循指令和绕开人类方面有改进。
新增评估基准:测试机器人能否识别不确定性、主动拒绝不安全指令。
这意味着→ 安全不只是"别撞到人",还包括机器人能判断"这个指令我不该执行"。
谁能用、怎么用?
ER 2通过谷歌AI Studio开放,企业平台进入私有预览;Robotics 2和On-Device 2面向早期合作伙伴和100多名受信任测试者开放。
核心硬件合作方包括Apptronik、Agile Robots和波士顿动力。
这反映出谷歌的路线:自己做AI大脑,把身体交给硬件伙伴——与OpenAI和英伟达的具身智能路线形成三方竞争。
具身智能商业化,谁能先跑出来?
三方路线分化:谷歌做通用控制模型,OpenAI探索视觉+语言+动作融合的基础模型,英伟达提供训练工具链。
但三家面对同一个瓶颈:灵巧性。谁先让机器人的手指像人一样灵活,谁就先打开商业化大门。
用大白话说= 现在大家都能让机器人走路、搬箱子,但"捆垃圾袋"这种事做不好,就进不了真实家庭和工厂。
Content is for reference only, not financial advice.