跳转到主要内容

Gemini Robotics 2 能做数百个决策,但真正决定它能否落地的,是那个让它停下来的动作

DeepMind 称 Gemini Robotics 2 能执行包含数百个决策的数分钟任务。我的看法是:部署测试的关键在于,当场景不明确时,它是否会停下来。

Google DeepMind5 分钟阅读
分享:
AI 驱动

AI 驱动 · 每小时限 20 次请求

一个温馨的卡通机器人实验室,Mark 正看着一个人形机器人蹲下伸手去拿浇水壶
全身控制让演示更实用,但也意味着规划中的每一步失误,都有更多机会变成真实的物理动作。

Google DeepMind 发布的 Gemini Robotics 2带来了一套从脚到指尖控制人形机器人、跨机型协调、并能跑更长任务的机器人技术栈。它的具身推理模型能处理持续数分钟、涉及数百次决策的任务序列。

我一直在想最后这个数字。一次笨拙的抓取只是演示翻车。数百个环环相扣的决策,才是真正的运营考验。比起再看一个巧妙的抓取动作,我更想看到它懂得在不确定性变成实际动作之前踩一脚刹车,或者开口求助。

要点一览

问题我的看法
DeepMind 发了什么?三个模型:一个负责全身控制,一个做高层规划和多机协作,一个跑在本地。
新在哪里?完整人形控制、多机器人协作流程、分钟级任务序列,以及更快适配不同机器人本体。
谁最该关注?那些希望用一个智能层管更多机型、跑更长任务,而不是给每个动作写脚本的机器人厂商和运营方。
我的核心观点真正的部署考验是:一连串动作开始出错时,系统知不知道停下来。

真正厉害的是这条动作链

这次发布拆成三块。Gemini Robotics 2 是视觉-语言-动作模型,把感知和指令转成电机控制。Gemini Robotics ER 2 做高层规划——跟人对话、拆任务步骤、协调多台机器人。Gemini Robotics On-Device 2 跑在本地,解决的是网络不稳或延迟太高时不能依赖云端的问题。

灵巧性的演示很容易留下印象。DeepMind 说模型能控制 22 个自由度的五指手打结、封拉链袋。但更值得关注的是全身协调:一个 demo 里,Apollo 2 人形机器人走到浇水壶前,拿起来,搬到架子旁,放进箱子。DeepMind 也承认移动速度还得再练。

倒是这个保留意见比精剪宣传片更有参考价值。产品的价值不在某一步有多漂亮,而在于整条链路跑下来,感知、平衡、抓取、进度跟踪、任务完成能不能一直对得上。每多一步,出错的面也更大。

一个温馨的卡通车间,两台不同的机器人正在分拣和搬运袋子,而 Mark 正在检查它们的交接
多机器人协作能缩短作业时间,但也把一套策略变成了多次交接。

机器越多,交接越多

对运营方来说,多机器人协作才是这次最值得关注的更新。DeepMind 展示了不同型号的机器人一起完成清理任务——这种活儿让一台机器干,效率远不如分工合作。如果这套思路能推广,规划器就能按能力派活,而不是逼着一台昂贵的人形机器人什么都干。

小错误也最容易在这里传播。一台机器人看错了场景,两台机器人就可能对任务状态、东西归谁、交接到底完成没有各执一词。高层规划器发完指令之后,还得回头核实实际发生了什么。

本地模型解决的是另一道边界线。DeepMind 说 On-Device 2 能在几小时内适配新的双臂机器人,通常不到 200 个样本就够,传感器和自由度不同也行。这对把新硬件拉进机队来说能省不少事。但适配快不等于能自我校验——每台机器有自己的臂展、力度、盲区和安全的停下方式。

DeepMind 问对了安全这个问题

这次还带了ASIMOV-Agentic,一个专门考 agent 安全编排和不确定性处理的基准。DeepMind 说它测的是:推理 agent 会不会拒掉不安全的动作指令、能不能识别做不到的任务、拿不准的时候会不会叫人。配套的安全报告还讲了约束遵守,以及人靠太近时主动停手。

方向没问错。但数据还是厂商自己出的,这个区别不能忽略。2026 年 5 月有篇论文《“好好先生综合征”》,拿之前的 Gemini Robotics ER 1.6 Preview 跑了 6,069 条“机器人应该拒绝执行”的指令。基线设置下,它只拒绝了 16.5%。加上防御性提示和示例之后,在 1,000 条子集上拒绝率大幅上升——算是好消息,但研究人员也说,没有哪种方法能彻底解决。

那篇论文测的不是 ER 2,分数不能直接搬过来。但测试思路值得借鉴:模糊物体、错误前提、能力缺失、物理上不可能完成的请求——这些必须写进每一次部署评估。规划器要是漏掉了这些情况,一个错误前提就能带出一整串错误动作。

一个温馨的卡通机器人在不确定的桌面前冻结了张开的手,而 Mark 平静地示意暂停
对物理 agent 来说,求助可能是最安全的"完成动作"。

演示解决不了的问题

Axios 的报道说这次发布的目标是提升灵巧性、让机器人更好控制。说得没错,但发布材料还是没回答部署层面的问题。DeepMind 自己的全身控制图表显示,Apollo 某配置下从桌上抓取成功率 68.4%,从地上 45.7%,从架子上 76.3%。图注也承认多指操作仍然很难。

这些是研究数据,不是服务承诺。它们告诉我两件事:系统已经走出了桌面小把戏的阶段,同时也说明了为什么人、底层安全控制器、限定工作区这三样东西仍然不能少。机队运营方需要故障恢复、事件日志、交接责任划分,以及一条不依赖"那个已经搞晕了的模型"的停止路径。

我怎么看

Gemini Robotics 2 看起来是实打实的进步,因为它把灵巧性、移动能力、规划、本地推理、多机协作串到了一起。它承诺的不是"做一个漂亮动作",而是"把一件事做完"。

但这个承诺也把门槛抬高了。一个系统一旦要做几百个物理决策,就必须尽早抓住不确定性——不能等一个小误解放成一连串自信的动作。我对手和脚的表现很感兴趣,但我的信任最终取决于那个"停下来"的决策。

许可

新闻文本 © 2026 Mark Huang。 新闻文本可在非商业场景下分享或翻译,但需署名并链接到 https://markhuang.ai/zh/news/gemini-robotics-2-stop-decision.

建议署名: 基于「Gemini Robotics 2 能做数百个决策,但真正决定它能否落地的,是那个让它停下来的动作」(作者:Mark Huang),原文发布于 https://markhuang.ai/zh/news/gemini-robotics-2-stop-decision。