资讯模型与产品··来源: Thenextweb·原文 →

Google DeepMind 釋出 Gemini Robotics 2:單一 AI 大腦控制人形機器人全身運動

Google DeepMind 釋出 Gemini Robotics 2 模型家族,首次實現從視覺到動作的全身人形機器人控制,可協調多臺機器協同作業並在數小時內適配新機器人本體。系統包含三個模型層級,但在精細操作成功率和執行速度上仍存在明顯短板,燈泡擰卸成功率 92%,而封口袋僅 40%。

Google DeepMind 釋出 Gemini Robotics 2:單一 AI 大腦控制人形機器人全身運動
[广告位 · 上线后接 AdSense]

機械臂out!全身協調才是真未來:DeepMind這次玩大了

谷歌DeepMind剛剛扔出王炸——Gemini Robotics 2模型家族!這波直接把機器人控制技術從"區域性操作"升級到"全身運動"時代。最狠的是,這套系統首次打通了從"看得到"到"動得了"的全鏈路,現在人形機器人不僅能走能蹲,還能在狹小空間裡精準操作物體。

實測環節直接看呆:Apptronik家的Apollo 2人形機器人,聽到一句"把澆水壺放進底層架子的綠色箱子裡",自己就哐哐完成了整套動作——走過去、抓起來、彎腰、精準投放。DeepMind機器人負責人Carolina Parada放話:"我們要讓AI殺進物理世界,打造所有機器人都能用的智慧底層。"

三層架構拆解:從動手到動腦

Gemini Robotics 2其實是模型全家桶,包含三個段位:

  1. 執行層(Gemini Robotics 2):把機器人的視覺聽覺訊號直接轉化成動作指令,專門負責動手。這代模型牛在能操控Apollo的5指22關節機械手玩打結、封口袋這些精細活,換個雙指夾爪也能適配。

  2. 大腦層(Gemini Robotics ER 2):負責高階局——拆解複雜任務+即時監控進度。實測中它能邊幹活邊呼叫谷歌搜尋,甚至能指揮Boston Dynamics的Spot機器狗幫忙拿零食。更騷的是支援不同機器人組隊開黑(比如輪式+人形搭配),現在已開放給開發者呼叫。

  3. 離線版(On-Device 2):沒網也能跑!適配新機器人只需200個樣本+幾小時訓練,直接破解機器人屆的技能遷移難題。

翻車資料曝光:精細操作還是菜

DeepMind這次罕見自曝短板。據Bloomberg實測,擰燈泡成功率92%,但到了精細活就拉胯:Chosun Daily資料顯示,扎垃圾袋成功率僅44%,封口袋更是隻有40%

動作速度也是硬傷——機器人每個動作前都要"思考人生",而人類根本不用過腦子。DeepMind機器人主管Kanishka Rao坦白:"真正的靈活操作還很遠,機器人學習效率被人類吊打。"這其實是行業通病,各家搞機器人基礎模型的初創公司都在撞這堵牆。

安全牌怎麼打?ASIMOV基準+人類檢測

隨著機器人開始滿屋亂竄,DeepMind把安全牌拉滿。Gemini Robotics ER 2號稱"史上最安全",能敏銳檢測人類靠近立即暫停,確認安全區沒人才繼續幹活。

他們還搞了個ASIMOV-Agentic基準測試(名字取自科幻大佬Isaac Asimov),專門檢測機器人會不會拒絕危險指令,或者主動喊人來幫忙。雖然名字中二,但針對的核心風險——機器人亂執行錯誤指令——確實是實打實的工程難題。

硬體供應鏈的魔幻現實

最尷尬的來了:谷歌只做軟體不造硬體,但機器人硬體正在變敏感。Axios爆料,美國剛出臺政策禁售中國產機器人,可很多能跑這套系統的機器人本體偏偏Made in China。

谷歌現在抱緊西方夥伴大腿,包括Apptronik、Boston Dynamics、Agile Robots等,還有100+測試合作方。但對手也沒閒著:OpenAINvidia都在憋大招,目標都是"一個模型,通吃所有機器人"。

階段性勝利而已

DeepMind很清醒,這次只是"里程碑"不是終點。Gemini Robotics 2確實讓機器人更實用了,但也清楚告訴我們:離人類隨手整理房間的水平還差十萬八千里。對中國玩家來說,這既是技術對標物,也提示了本土企業在硬體製造+軟硬結合上的機會視窗。

常見問題

Gemini Robotics 2 與之前的機器人模型主要區別是什麼?

之前的 DeepMind 機器人模型主要控制上半身完成桌面任務,Gemini Robotics 2 首次實現全身控制,可驅動人形機器人行走、下蹲、平衡並在狹窄空間操作物體,同時支援異構機器人協同作業。

為什麼封口袋成功率只有 40% 但燈泡擰卸能達到 92%?

精細雙手協調任務(如封口袋需要兩手配合施力控制)比單手旋轉動作(擰燈泡)複雜得多。業內普遍認為,類人靈巧操作仍是當前機器人技術的最大瓶頸,涉及觸覺反饋、力控制和即時調整等多維難題。

On-Device 2 模型'數小時適配新機器人'對開發者意味著什麼?

傳統方法中,將 AI 能力遷移到新機器人本體可能需要數週甚至數月的資料採集和訓練。On-Device 2 僅需不到 200 個示例和數小時即可完成,這大幅降低了多機型適配的時間和成本門檻,對小團隊尤其有價值。

美國禁售中國製造機器人對 Gemini Robotics 2 有何影響?

Google 不製造機器人硬體,依賴合作伙伴提供本體。美國政策可能限制其在中國製造硬體上的部署,目前 Google 主要與 Apptronik、Boston Dynamics 等西方廠商合作。這對中國開發者而言,反而可能是發展本土軟硬一體化方案的機會。

普通開發者現在能用 Gemini Robotics ER 2 嗎?

可以。Gemini Robotics ER 2(推理層)已通過 Gemini API 和 Google AI Studio 向開發者開放,可用於多步驟任務規劃、工具呼叫和多機器人協同場景的原型開發。


本文基於 GNews:TNW 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://thenextweb.com/news/gemini-robotics-2-whole-body-humanoid-control

[广告位 · 上线后接 AdSense]
标签:#谷歌

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

谷歌稱 AI 助力 Chrome 單月修復漏洞超過去兩年總和

谷歌稱 AI 助力 Chrome 單月修復漏洞超過去兩年總和

谷歌宣佈藉助內部 AI 工具,在 6 月釋出的兩個 Chrome 版本中修復了 1,072 個安全漏洞,超過此前兩年 23 個版本累計修復的 1,036 個。這一資料印證了行業預測:大語言模型正在將漏洞發現轉變為工業化規模的自動化流程,迫使防禦方也必須用 AI 對抗惡意攻擊者。微軟同樣報告了類似趨勢,但蘋果尚未顯示同等增長。

行业动态谷歌
Meta 用 AI 加速應用開發:LLM 助力新產品快速迭代

Meta 用 AI 加速應用開發:LLM 助力新產品快速迭代

Meta CEO 扎克伯格在財報電話會議上透露,大語言模型正在幫助公司加快產品開發速度,繼近期推出多款獨立應用後,更多新應用即將釋出。公司已實現 Instagram 每條 Reels 和 Feed 內容自動通過 LLM 處理,用於改進推薦系統。這標誌著 Meta 在經歷多次獨立應用失敗後,找到了用 AI 技術提升產品成功率的新路徑。

行业动态Meta
微軟財報披露 AI 投資收益:Anthropic 單季貢獻 32 億美元,OpenAI 價值波動顯著

微軟財報披露 AI 投資收益:Anthropic 單季貢獻 32 億美元,OpenAI 價值波動顯著

微軟 2026 財年 Q4 財報顯示,其對 Anthropic 的投資單季錄得 32 億美元賬面收益,而 OpenAI 投資同期減記約 6 億美元。儘管 OpenAI 全年仍貢獻 50 億美元收益,但 Anthropic 單季表現追平全年水平,凸顯兩大 AI 實驗室投資回報的分化趨勢。微軟持有 OpenAI 約 27% 股權,並與 Anthropic 達成 300 億美元 Azure 服務協議。

行业动态OpenAI
OpenAI 向學術研究者免費開放 GPT 模型:2027 年前覆蓋 10 萬人

OpenAI 向學術研究者免費開放 GPT 模型:2027 年前覆蓋 10 萬人

OpenAI 宣佈啟動"ChatGPT for Academic Researchers"計劃,將向全球 10 萬名科學家、數學家和工程師免費提供 AI 模型訪問許可權。該計劃今年夏季先從 1 萬名參與者開始,並承諾到 2027 年投入超過 2.5 億美元支援外部科學研究。入選機構的研究者可獲得 OpenAI 技術支援,使用最新 GPT-5.6 Sol Pro 模型,並邀請 4 名同事加入。

行业动态OpenAI