谷歌 Gemini Robotics 2 发布:人形机器人迎来全身控制新时代
当机器人不再只会"点头眨眼",而是能像人一样弯腰、转身、拾起洒水壶并稳稳放到架子上,人形机器人的商业化拐点正在到来。近日,谷歌 DeepMind 正式发布 Gemini Robotics 2 系列模型,首次实现对人形机器人的全身动作控制,将摄像头画面与自然语言指令直接转化为电机控制信号。这被业界视为具身智能从"实验室演示"走向"真实世界部署"的关键一步。本文综合科创板日报及微博等公开信息,梳理这一发布背后的技术突破、现实短板与谷歌的产业战略。
一、从"上身运动"到"全身控制":技术跃迁的核心
此前的机器人操控模型,大多局限于机械臂或机器人上半身的精细操作:抓取、放置、拧动,动作范围有限,机器人本体则像一根固定在地上的柱子。Gemini Robotics 2 的最大突破,在于把控制维度从"手臂"扩展到"全身"——行走、转向、蹲起、俯身、抬臂,全部动作由同一个模型统一协调输出。 据科创板日报报道,谷歌 DeepMind 在演示中展示了人形机器人 Apollo 的完整任务链条:它穿过房间,绕过障碍物,拿起地上的洒水壶,转身走到货架前,将洒水壶稳稳放置到指定位置。整个流程中,机器人没有依赖预先编写的动作脚本,而是实时读取摄像头画面、理解自然语言指令,并据此生成连续的电机控制指令。这意味着机器人具备了对"环境变化"的即时反应能力——障碍物出现在路径上,它会调整步伐;水壶位置偏移,它会修正抓取姿态。 从技术路径看,Gemini Robotics 2 采用的是"视觉-语言-动作"(VLA)一体化架构:多模态大模型负责理解场景与指令,动作解码器负责将理解结果映射为关节电机的高频控制信号。这种端到端的生成方式,绕开了传统"感知-规划-控制"分模块拼接带来的延迟与误差累积,使机器人在动态环境中的响应更加自然流畅。
二、ER 2:"推理大脑"负责想,机器人负责做
如果说 Gemini Robotics 2 是机器人的"小脑",负责精细动作的执行,那么同期发布的 Gemini Robotics ER 2(Embodied Reasoning 2)则是它的"大脑",负责更高层的任务规划。 ER 2 的核心能力在于多步骤任务的分解与编排。面对"把厨房收拾干净"这类复合指令,ER 2 会将其拆解为"识别脏污区域-规划移动路线-依次执行清理动作-检查完成状态"等子任务序列,并在执行过程中根据环境反馈动态调整计划。更值得注意的是,ER 2 支持多机器人协作场景:多个机器人可以在共享的推理框架下分工配合,一个负责搬运、一个负责摆放,通过统一的任务图协调行动节奏,避免相互干扰。 这种"大脑与身体分离"的设计,恰恰反映了谷歌对机器人产业分工的深层判断:模型能力与本体硬件解耦,推理模型可以持续迭代升级,而无需等待某一款机器人硬件的改版。
三、亮眼成绩与残酷现实:92% 与"扎垃圾袋"的差距
发布会上,谷歌给出了部分基准测试数据:在"拧下灯泡"这一精细操作任务中,Gemini Robotics 2 的成功率达到 92%,展现出对力度控制、旋转轨迹和工具使用的高水平掌握。这一成绩在同类 VLA 模型中处于领先位置。 然而,光鲜数字的另一面是现实任务的巨大落差。据微博相关讨论及发布会披露,机器人面对"扎紧垃圾袋"这类看似简单、实则涉及柔性物体形变与多步协调的动作时,成功率仍然很低。垃圾袋是柔性、易变形、不可精确建模的物体,捏住袋口、绕圈、打结每一步都依赖触觉反馈与视觉校正的紧密配合,这恰恰是当前视觉主导的 VLA 模型的短板。 这一对比清晰地划出了当前技术的能力边界:结构化的、刚体的、可重复的任务(如拧灯泡、抓杯子)正在被快速攻克;而非结构化的、柔性的、依赖触觉的任务仍是难以逾越的关卡。这也提醒我们,人形机器人的规模化落地,不会是一条匀速上升的曲线,而是一个个细分场景逐个击破的漫长过程。
四、谷歌的野心:不造本体,只卖"大脑"
Gemini Robotics ER 2 将通过 API 向开发者开放,这是本次发布中最具战略意味的信息。它宣告了谷歌在机器人领域的明确姿态:不亲自下场制造机器人本体,而是做机器人产业的"智能底座"——向全球的机器人公司、开发者输出大脑能力。 这一战略与谷歌在手机、芯片、云服务等领域的一贯打法一脉相承:把模型能力做成标准化的平台服务,让下游厂商基于 API 开发各自的应用,谷歌则坐拥数据飞轮与生态入口。对硬件厂商而言,这意味着可以省去自研大模型的高昂成本,快速获得顶级的推理与操控能力;对谷歌而言,则意味着无需承担硬件制造的重资产风险,就能触及几乎所有主流机器人产品。 从产业格局看,"卖大脑"模式一旦跑通,谷歌将像安卓之于手机行业一样,成为机器人时代的"操作系统级"玩家。而真正决定这一模式成败的,是 ER 2 能否在真实复杂场景中持续证明其泛化能力——毕竟,机器人赛道的终局竞争,从来不只是参数比拼,而是对物理世界的深刻理解。 结语: Gemini Robotics 2 与 ER 2 的发布,让"机器人像人一样思考与行动"从愿景迈出了实质性的一步。92% 的拧灯泡成功率令人振奋,扎垃圾袋的低成功率则提醒我们保持清醒:具身智能的黄金时代刚刚拉开序幕,但通往"全能家务机器人"的路,仍然需要模型、硬件与数据的长期协同进化。谷歌选择站在产业链顶端输出"大脑",既是对自身优势的精准卡位,也是对整个人形机器人生态的一剂强心针。 (本文综合引用来源:科创板日报、微博公开报道与讨论)
本文仅代表作者个人观点(仅供参考)
来源:创客OPC原创整理
📰 本文信息综合整理自公开报道,仅供参考。