2026 年 7 月 30 日,Google DeepMind 正式發表了堪稱機器人領域里程碑的 Gemini Robotics 2。這不是一次普通的升級——它讓機器人首次具備了從腳到指尖的「全身智能」,還能與其他機器人團隊協作,並在數小時內適應全新的機體。
業界普遍認為,這是通往「物理世界通用人工智慧(Physical AGI)」的最重要一步。
什麼是「全身智能」?
過去的人形機器人大多只能控制上半身,做一些桌面操作。Gemini Robotics 2 把這個限制徹底打破了。
所謂「全身智能」,就是讓 AI 系統有能力從腳到指尖完整控制整個人形機器人——走路、蹲下、彎腰、伸手、平衡,所有動作協調一致。
想像一下,你對機器人說:「把澆水壺放到底層架子的綠色箱子裡。」機器人需要:
- 理解你的指示
- 走向桌子,拿起水壺
- 走到架子旁
- 彎下腰
- 精準將水壺放入指定位置
Gemini Robotics 2 做到了這一切——而且這個過程中的所有動作都是由同一個 AI 模型協調完成,不是預先編寫的程式。
三款模型,三種角色
DeepMind 這次不是推出單一模型,而是一整套分工明確的 AI 系統:
| 模型 | 角色 | 功能 | 開放對象 |
|---|---|---|---|
| Gemini Robotics 2 (VLA) | 小腦(動作執行) | 視覺+語言→馬達控制,全身人形機器人+五指靈巧手 | 早期合作夥伴 |
| Gemini Robotics ER 2 | 大腦(推理規劃) | 觀察環境、規劃多步驟任務、協調多機器人協作 | AI Studio 開放使用 |
| Gemini Robotics On-Device 2 | 本機適應引擎 | 離線運行,<200 個樣本、數小時適應全新機體 | 早期合作夥伴 |
VLA:負責動作的「小腦」
Gemini Robotics 2 (VLA) 是最先進的視覺-語言-動作模型。它將攝影機看到的畫面與人類的語言指令,轉換為精確的馬達控制信號。
在 Apptronik 的 Apollo 2 人形機器人上,VLA 控制了搭載 22 個自由度的 SharpaWave 五指靈巧手——你能想像機器人用五根手指打一個結、或是密封夾鏈袋嗎?Gemini Robotics 2 做到了。
當然,DeepMind 自己也坦承,速度還遠不如人類。某些精細動作的成功率仍在 40-44% 左右,但考慮到這是機器人首次在一個模型中同時協調全身動作和五指操作,這已經是一個巨大的飛躍。
| 任務 | 成功率 |
|---|---|
| 旋開燈泡 | 92% |
| 從架上取物 | 76.3% |
| 從桌上取物 | 68.4% |
| 從地板取物 | 45.7% |
| 打包垃圾袋 | 44% |
| 密封夾鏈袋 | 40% |
ER 2:負責推理的「大腦」
如果說 VLA 是機器人的小腦,ER 2 就是它的高階大腦。
Gemini Robotics ER 2(具身推理模型)可以做到:
- 透過攝影機串流觀察房間環境
- 規劃長達數分鐘、涉及數百個決策的多步驟任務
- 自主修正錯誤——如果某一步失敗,它會重新嘗試而不是從頭開始
- 指揮多台不同型號的機器人協同工作
- 呼叫工具(如 Google Search)來尋找資訊
在 DeepMind 的展示中,ER 2 成功指揮了 Boston Dynamics 的 Spot 機器狗,讓它自主導航並拿取零食——而這完全是透過自然語言指令完成的。
ER 2 在關鍵時間點識別上的準確率達 91.3%,平均誤差僅 0.96 秒。這讓機器人能夠精準判斷「何時該停止倒咖啡」、「何時該換下一個動作」。
On-Device 2:能「轉學」的本地引擎
這可能是三款模型中最具商業潛力的一個。
Gemini Robotics On-Device 2 是專為離線環境設計的高效 VLA 模型。它的厲害之處在於——僅僅需要不到 200 個樣本,就能在數小時內適應一台全新的機器人,即使那台機器人的形狀、感測器和自由度都完全不同。
這在機器人領域是一個革命性的突破。長期以來,機器人的技能一直卡在「一個技能對一台機器」的困境中——你無法把在人形機器人上學到的動作,直接搬運到另一種機器人上。On-Device 2 打破了这个限制。
ASIMOV-Agentic 安全框架
讓 AI 控制實體機器人,安全絕對是第一優先級。
DeepMind 推出了全新的 ASIMOV-Agentic 安全框架,它讓 ER 2 具備以下能力:
- 拒絕不安全指令:如果機器人判斷某個動作不安全(例如會撞到人),它會直接拒絕
- 可預測任務可行性:如果任務不可行,機器人會主動請求人類介入
- 安全停機:檢測到人類接近時自動停止,等人離開後再恢復運作
ER 2 是 DeepMind 至今「最安全」的機器人模型。
多機器人團隊協作:不僅僅是一台機器
Gemini Robotics 2 最令人驚豔的,可能是讓不同類型的機器人團隊合作的能力。
想像一個場景:輪式機器人擅長在室內平坦地面移動,人形機器人擅長爬樓梯和搬重物。當需要完成一個複雜的任務時,ER 2 可以協調兩種機器人分工合作——輪式機器人負責搬運到樓下,人形機器人接手爬上樓梯送達目的地。
DeepMind 在展示中使用了 Apptronik 的 Apollo 2、Franka Duo 雙臂平台、以及 Agile Robots 的多種機型,驗證了這個「一個大腦控制多種機體」的商業可行性。
產業影響:一腦多用,機器人格局改寫
Gemini Robotics 2 的發布,對整個機器人產業傳遞了一個明確的信號:AI 模型才是核心,硬體只是載體。
過去機器人公司的競爭優勢在於硬體——誰的馬達更精準、誰的關節更靈活。而現在,DeepMind 證明了同一個 AI 模型可以控制完全不同的機器人。
這讓機器人硬體的價值相對下降,AI 軟體的價值大幅上升。對於 Apptronik、Boston Dynamics 這些硬體合作夥伴來說,這既是機會也是挑戰——他們的機器人性能決定了展示效果,但真正的智慧來自於 DeepMind 的模型。
值得注意的是,美國政府近期已開始限制中國製造機器人的進口,而許多可供 Gemini Robotics 2 運行的機器人機體正是產自中國。這為這個領域增添了地緣政治的變數。
下一步:走向物理世界的 AGI
DeepMind 團隊負責人 Carolina Parada 在對外聲明中強調:「Gemini Robotics 2 是邁向物理世界 AGI 的重要里程碑。」
當大型語言模型已經學會寫文章、寫程式、畫圖的同時,這些模型正在學習走路、彎腰、抓住物體——真正走進物理世界。這大概就是 2026 年最令人震撼的 AI 進展之一。
Gemini Robotics ER 2 已經開放開發者透過 Google AI Studio 體驗,而 VLA 和 On-Device 2 則僅限早期合作夥伴使用。
原始來源:Google DeepMind 官方部落格 | Google 開發者部落格 | 區塊客中文報導
