機器人技術邁向全新里程碑!據 Google DeepMind 於今(30)日發布的最新公告,官方正式推出「Gemini Robotics 2」智能層,為下一代機器人帶來史無前例的全身控制、進階靈巧操作與多機器人協作能力。這項技術預示著機器人將從預先編程的單一自動化機器,進化為能自主學習並解決物理世界複雜挑戰的通用 AI。
(前情提要:Google DeepMind 發布 Lyria 3.5 音樂模型!全面升級人聲與歌詞,支援生成 3 分鐘神曲)
(背景補充:Claude 驚爆私密對話外洩 Google、Bing 搜尋頁,如何手動關閉分享功能?)
在通往通用人工智慧(AGI)的道路上,如何讓 AI 真正走入物理世界一直是科技巨頭角力的關鍵。台北時間 7 月 30 日,Google DeepMind 發表了震撼業界的最新成果《Gemini Robotics 2 帶來機器人全身智能》,正式宣告機器人發展邁入全新階段。該系統能讓機器人自主適應不可預測的環境,並將學到的技能快速轉移至不同的機器人機體上。
三大核心模型,建構機器人超級大腦
根據 DeepMind 團隊負責人 Carolina Parada 帶領發布的公告指出,Gemini Robotics 2 包含三個具備高度能力的模型,各自肩負不同任務:
- Gemini Robotics 2:作為最先進的視覺-語言-動作(VLA)模型,能將視覺與語言輸入轉換為馬達控制,實現從腳到指尖的完整人形機器人控制,並大幅提升雙手與夾爪的靈巧操作能力。
- Gemini Robotics ER 2:這款「具身推理(Embodied Reasoning)」視覺語言模型扮演著機器人的大腦代理角色,能與人類溝通、理解物理世界,並規劃長達數分鐘的多步驟任務,甚至新增了機器人團隊協作功能。
- Gemini Robotics On-Device 2:這是一款專為設備本地端運行的 VLA 模型,主打極高的適應效率,通常只需不到 200 個範例,便能在幾小時內快速適應全新的機器人機體。
人形機器人全身控制與極致靈巧操作
在實際能力展示方面,Gemini Robotics 2 首次實現了將意圖轉化為人形機器人的智能全身動作。例如,當 Apptronik 的 Apollo 2 人形機器人接收到「把澆水壺放到底層架子的綠色箱子裡」的指令時,它能自主走到桌子拿起水壺,再走到架子旁精準放置。此外,透過裝載於 Apollo 2 上的 22 自由度五指 SharpaWave 手,系統還能執行打結、密封夾鏈袋等極度精細的動作。而操作標準兩指平行夾爪(如 Franka Duo 平台)也能完成緊密包裝等複雜任務。
在代理式推理能力上,ER 2 模型能處理涉及數百個決策的複雜任務,並具備自我修正機制;它還支援多機器人協作,讓不同類型的機器人共同完成單機無法負荷的工作流。同時,安全被視為發展的基礎,團隊推出了全新基準 ASIMOV-Agentic 來評估安全協調與不確定性處理,使 ER 2 成為目前在遵循安全約束與人類接近度上最安全的機器人模型。
目前,Gemini Robotics ER 2 已在 Google AI Studio 提供,並在 Gemini Enterprise Agent Platform 展開私人預覽;而 VLA 與本地端模型則僅對早期合作夥伴開放。DeepMind 強調,這項突破是邁向「解決物理世界 AGI」的重要里程碑,未來的機器人將能與人類並肩工作,解決複雜挑戰。

📍相關報導📍
搜尋廣告創新高,網站流量卻腰斬:Reddit、路透、經濟學人正集體考慮封鎖 Google 爬蟲
Google 新推出「自拍影片登入」帳號:忘記密碼、遺失設備也能救援
