谷歌發布Gemini Robotics 2,全身協調仍面臨靈巧性瓶頸

Taylor Wilson
Published todayAbout 3 min read

谷歌DeepMind發布Gemini Robotics 2系列模型,首次將AI控制從機器人上半身擴展至全身協調;但團隊坦承,真正的靈巧性仍是遙遠目標——機器人每一步都要「停下來想」,這限制了具身智能的商業化節奏。

01

這次升級到底升了甚麼?

Gemini Robotics 2的核心突破:控制範圍從上半身擴展到全身——機器人現在能邊走邊蹲邊拿東西。
這意味著→ 機器人不再是「固定在桌前的手臂」,而是可以移動+操作同時進行的整體。
簡單來說= 以前只能坐着幹活,現在能走着幹活——聽起來簡單,但對AI來說是全新的控制難題。
02

三款模型各管甚麼?

Gemini Robotics 2:把鏡頭畫面和語音指令變成摩打動作——相當於機器人的「小腦」。
Gemini Robotics ER 2:負責高層任務規劃,支持多步驟協調和多台機器人協作——相當於「調度中心」。
On-Device 2:可以在設備本地運行,不依賴雲端。三款模型既能協同也能獨立工作。
03

靈巧性為甚麼仍然是瓶頸?

谷歌DeepMind機器人總監饒坦承:真正的靈巧性仍是遙遠目標,機器人動作依然緩慢而刻意
這反映出一個根本問題——人類憑直覺完成的動作,機器人需要停下來逐步計算。
學習效率差距同樣巨大:人類一兩次試錯就能調整,當前機器人系統做不到。
簡單來說= 扭燈泡成功率92%,但捆垃圾袋、封密封袋這種需要手指靈活配合的任務,成功率明顯更低。
04

安全性做了哪些改進?

谷歌稱ER 2是其迄今最安全的機器人模型,在遵循指令和繞開人類方面有改進。
新增評估基準:測試機器人能否識別不確定性、主動拒絕不安全指令
這意味著→ 安全不只是「別撞到人」,還包括機器人能判斷「這個指令我不該執行」。
05

誰能用、怎麼用?

ER 2通過谷歌AI Studio開放,企業平台進入私有預覽;Robotics 2和On-Device 2面向早期合作夥伴和100多名受信任測試者開放。
核心硬件合作方包括Apptronik、Agile Robots和波士頓動力
這反映出谷歌的路線:自己做AI大腦,把身體交給硬件夥伴——與OpenAI和英偉達的具身智能路線形成三方競爭。
06

具身智能商業化,誰能先跑出來?

三方路線分化:谷歌做通用控制模型,OpenAI探索視覺+語言+動作融合的基礎模型,英偉達提供訓練工具鏈。
但三家面對同一個瓶頸:靈巧性。誰先讓機器人的手指像人一樣靈活,誰就先打開商業化大門。
簡單來說= 現在大家都能讓機器人走路、搬箱子,但「捆垃圾袋」這種事做不好,就進不了真實家庭和工廠。

Content is for reference only, not financial advice.

谷歌發布Gemini Robotics 2,全身協調仍面臨靈巧性瓶頸 · nashnova