Google DeepMind 发布 Gemini Robotics 2:单一 AI 大脑控制人形机器人全身运动
Google DeepMind 发布 Gemini Robotics 2 模型家族,首次实现从视觉到动作的全身人形机器人控制,可协调多台机器协同作业并在数小时内适配新机器人本体。系统包含三个模型层级,但在精细操作成功率和执行速度上仍存在明显短板,灯泡拧卸成功率 92%,而封口袋仅 40%。
机械臂out!全身协调才是真未来:DeepMind这次玩大了
谷歌DeepMind刚刚扔出王炸——Gemini Robotics 2模型家族!这波直接把机器人控制技术从"局部操作"升级到"全身运动"时代。最狠的是,这套系统首次打通了从"看得到"到"动得了"的全链路,现在人形机器人不仅能走能蹲,还能在狭小空间里精准操作物体。
实测环节直接看呆:Apptronik家的Apollo 2人形机器人,听到一句"把浇水壶放进底层架子的绿色箱子里",自己就哐哐完成了整套动作——走过去、抓起来、弯腰、精准投放。DeepMind机器人负责人Carolina Parada放话:"我们要让AI杀进物理世界,打造所有机器人都能用的智能底层。"
三层架构拆解:从动手到动脑
Gemini Robotics 2其实是模型全家桶,包含三个段位:
-
执行层(Gemini Robotics 2):把机器人的视觉听觉信号直接转化成动作指令,专门负责动手。这代模型牛在能操控Apollo的5指22关节机械手玩打结、封口袋这些精细活,换个双指夹爪也能适配。
-
大脑层(Gemini Robotics ER 2):负责高端局——拆解复杂任务+实时监控进度。实测中它能边干活边调用谷歌搜索,甚至能指挥Boston Dynamics的Spot机器狗帮忙拿零食。更骚的是支持不同机器人组队开黑(比如轮式+人形搭配),现在已开放给开发者调用。
-
离线版(On-Device 2):没网也能跑!适配新机器人只需200个样本+几小时训练,直接破解机器人届的技能迁移难题。
翻车数据曝光:精细操作还是菜
DeepMind这次罕见自曝短板。据Bloomberg实测,拧灯泡成功率92%,但到了精细活就拉胯:Chosun Daily数据显示,扎垃圾袋成功率仅44%,封口袋更是只有40%。
动作速度也是硬伤——机器人每个动作前都要"思考人生",而人类根本不用过脑子。DeepMind机器人主管Kanishka Rao坦白:"真正的灵活操作还很远,机器人学习效率被人类吊打。"这其实是行业通病,各家搞机器人基础模型的初创公司都在撞这堵墙。
安全牌怎么打?ASIMOV基准+人类检测
随着机器人开始满屋乱窜,DeepMind把安全牌拉满。Gemini Robotics ER 2号称"史上最安全",能敏锐检测人类靠近立即暂停,确认安全区没人才继续干活。
他们还搞了个ASIMOV-Agentic基准测试(名字取自科幻大佬Isaac Asimov),专门检测机器人会不会拒绝危险指令,或者主动喊人来帮忙。虽然名字中二,但针对的核心风险——机器人乱执行错误指令——确实是实打实的工程难题。
硬件供应链的魔幻现实
最尴尬的来了:谷歌只做软件不造硬件,但机器人硬件正在变敏感。Axios爆料,美国刚出台政策禁售中国产机器人,可很多能跑这套系统的机器人本体偏偏Made in China。
谷歌现在抱紧西方伙伴大腿,包括Apptronik、Boston Dynamics、Agile Robots等,还有100+测试合作方。但对手也没闲着:OpenAI和Nvidia都在憋大招,目标都是"一个模型,通吃所有机器人"。
阶段性胜利而已
DeepMind很清醒,这次只是"里程碑"不是终点。Gemini Robotics 2确实让机器人更实用了,但也清楚告诉我们:离人类随手整理房间的水平还差十万八千里。对中国玩家来说,这既是技术对标物,也提示了本土企业在硬件制造+软硬结合上的机会窗口。
本文基于 GNews:TNW 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://thenextweb.com/news/gemini-robotics-2-whole-body-humanoid-control
常见问题
- Gemini Robotics 2 与之前的机器人模型主要区别是什么?
- 之前的 DeepMind 机器人模型主要控制上半身完成桌面任务,Gemini Robotics 2 首次实现全身控制,可驱动人形机器人行走、下蹲、平衡并在狭窄空间操作物体,同时支持异构机器人协同作业。
- 为什么封口袋成功率只有 40% 但灯泡拧卸能达到 92%?
- 精细双手协调任务(如封口袋需要两手配合施力控制)比单手旋转动作(拧灯泡)复杂得多。业内普遍认为,类人灵巧操作仍是当前机器人技术的最大瓶颈,涉及触觉反馈、力控制和实时调整等多维难题。
- On-Device 2 模型'数小时适配新机器人'对开发者意味着什么?
- 传统方法中,将 AI 能力迁移到新机器人本体可能需要数周甚至数月的数据采集和训练。On-Device 2 仅需不到 200 个示例和数小时即可完成,这大幅降低了多机型适配的时间和成本门槛,对小团队尤其有价值。
- 美国禁售中国制造机器人对 Gemini Robotics 2 有何影响?
- Google 不制造机器人硬件,依赖合作伙伴提供本体。美国政策可能限制其在中国制造硬件上的部署,目前 Google 主要与 Apptronik、Boston Dynamics 等西方厂商合作。这对中国开发者而言,反而可能是发展本土软硬一体化方案的机会。
- 普通开发者现在能用 Gemini Robotics ER 2 吗?
- 可以。Gemini Robotics ER 2(推理层)已通过 Gemini API 和 Google AI Studio 向开发者开放,可用于多步骤任务规划、工具调用和多机器人协同场景的原型开发。
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
顶级 AI 图像生成工具,以画面质感、艺术风格、构图理解著称。V7 模型在写实和创意两个方向均领先。需 Discord 或网页版使用。
Cursor
精选AI 开发工具
AI-first 代码编辑器,基于 VS Code 构建,深度集成 Claude / GPT-4o 等模型。Composer 多文件编辑、Tab 自动补全、Agent 模式三大杀手锏。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以长上下文(200K tokens)、对复杂任务的细腻理解、Artifacts 可视化输出闻名。Claude Sonnet 4.5 / Opus 4.7 在编程、写作、推理多项基准上领先。
相关推荐
同类资讯 — 由发布时间排序

谷歌称 AI 助力 Chrome 单月修复漏洞超过去两年总和
谷歌宣布借助内部 AI 工具,在 6 月发布的两个 Chrome 版本中修复了 1,072 个安全漏洞,超过此前两年 23 个版本累计修复的 1,036 个。这一数据印证了行业预测:大语言模型正在将漏洞发现转变为工业化规模的自动化流程,迫使防御方也必须用 AI 对抗恶意攻击者。微软同样报告了类似趋势,但苹果尚未显示同等增长。

Meta 用 AI 加速应用开发:LLM 助力新产品快速迭代
Meta CEO 扎克伯格在财报电话会议上透露,大语言模型正在帮助公司加快产品开发速度,继近期推出多款独立应用后,更多新应用即将发布。公司已实现 Instagram 每条 Reels 和 Feed 内容自动通过 LLM 处理,用于改进推荐系统。这标志着 Meta 在经历多次独立应用失败后,找到了用 AI 技术提升产品成功率的新路径。

微软财报披露 AI 投资收益:Anthropic 单季贡献 32 亿美元,OpenAI 价值波动显著
微软 2026 财年 Q4 财报显示,其对 Anthropic 的投资单季录得 32 亿美元账面收益,而 OpenAI 投资同期减记约 6 亿美元。尽管 OpenAI 全年仍贡献 50 亿美元收益,但 Anthropic 单季表现追平全年水平,凸显两大 AI 实验室投资回报的分化趋势。微软持有 OpenAI 约 27% 股权,并与 Anthropic 达成 300 亿美元 Azure 服务协议。

OpenAI 向学术研究者免费开放 GPT 模型:2027 年前覆盖 10 万人
OpenAI 宣布启动"ChatGPT for Academic Researchers"计划,将向全球 10 万名科学家、数学家和工程师免费提供 AI 模型访问权限。该计划今年夏季先从 1 万名参与者开始,并承诺到 2027 年投入超过 2.5 亿美元支持外部科学研究。入选机构的研究者可获得 OpenAI 技术支持,使用最新 GPT-5.6 Sol Pro 模型,并邀请 4 名同事加入。