# Gemini Robotics 2 能做数百个决策，但真正决定它能否落地的，是那个让它停下来的动作

**Summary:** DeepMind 称 Gemini Robotics 2 能执行包含数百个决策的数分钟任务。我的看法是：部署测试的关键在于，当场景不明确时，它是否会停下来。

- Canonical: https://markhuang.ai/zh/news/gemini-robotics-2-stop-decision
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-07-30
- Section: News
- Tags: AI, 机器人, Gemini, 具身智能, AI 安全
- Source: [Google DeepMind](https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一个温馨的卡通机器人实验室，Mark 正看着一个人形机器人蹲下伸手去拿浇水壶](https://cdn.markhuang.ai/news/gemini-robotics-2-stop-decision/hero.webp)

*全身控制让演示更实用，但也意味着规划中的每一步失误，都有更多机会变成真实的物理动作。*

[Google DeepMind 发布的 Gemini Robotics 2](https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/)带来了一套从脚到指尖控制人形机器人、跨机型协调、并能跑更长任务的机器人技术栈。它的具身推理模型能处理持续数分钟、涉及数百次决策的任务序列。

我一直在想最后这个数字。一次笨拙的抓取只是演示翻车。数百个环环相扣的决策，才是真正的运营考验。比起再看一个巧妙的抓取动作，我更想看到它懂得在不确定性变成实际动作之前踩一脚刹车，或者开口求助。

## 要点一览

| 问题             | 我的看法                                         |
| -------------- | -------------------------------------------- |
| DeepMind 发了什么？ | 三个模型：一个负责全身控制，一个做高层规划和多机协作，一个跑在本地。           |
| 新在哪里？          | 完整人形控制、多机器人协作流程、分钟级任务序列，以及更快适配不同机器人本体。       |
| 谁最该关注？         | 那些希望用一个智能层管更多机型、跑更长任务，而不是给每个动作写脚本的机器人厂商和运营方。 |
| 我的核心观点         | 真正的部署考验是：一连串动作开始出错时，系统知不知道停下来。               |

## 真正厉害的是这条动作链

这次发布拆成三块。Gemini Robotics 2 是视觉-语言-动作模型，把感知和指令转成电机控制。Gemini Robotics ER 2 做高层规划——跟人对话、拆任务步骤、协调多台机器人。Gemini Robotics On-Device 2 跑在本地，解决的是网络不稳或延迟太高时不能依赖云端的问题。

灵巧性的演示很容易留下印象。DeepMind 说模型能控制 22 个自由度的五指手打结、封拉链袋。但更值得关注的是全身协调：一个 demo 里，Apollo 2 人形机器人走到浇水壶前，拿起来，搬到架子旁，放进箱子。DeepMind 也承认移动速度还得再练。

倒是这个保留意见比精剪宣传片更有参考价值。产品的价值不在某一步有多漂亮，而在于整条链路跑下来，感知、平衡、抓取、进度跟踪、任务完成能不能一直对得上。每多一步，出错的面也更大。

![一个温馨的卡通车间，两台不同的机器人正在分拣和搬运袋子，而 Mark 正在检查它们的交接](https://cdn.markhuang.ai/news/gemini-robotics-2-stop-decision/multi-robot-handoff.webp)

*多机器人协作能缩短作业时间，但也把一套策略变成了多次交接。*

## 机器越多，交接越多

对运营方来说，多机器人协作才是这次最值得关注的更新。DeepMind 展示了不同型号的机器人一起完成清理任务——这种活儿让一台机器干，效率远不如分工合作。如果这套思路能推广，规划器就能按能力派活，而不是逼着一台昂贵的人形机器人什么都干。

小错误也最容易在这里传播。一台机器人看错了场景，两台机器人就可能对任务状态、东西归谁、交接到底完成没有各执一词。高层规划器发完指令之后，还得回头核实实际发生了什么。

本地模型解决的是另一道边界线。DeepMind 说 On-Device 2 能在几小时内适配新的双臂机器人，通常不到 200 个样本就够，传感器和自由度不同也行。这对把新硬件拉进机队来说能省不少事。但适配快不等于能自我校验——每台机器有自己的臂展、力度、盲区和安全的停下方式。

## DeepMind 问对了安全这个问题

这次还带了[ASIMOV-Agentic](https://huggingface.co/datasets/google/asimov_agentic/blob/main/README.md)，一个专门考 agent 安全编排和不确定性处理的基准。DeepMind 说它测的是：推理 agent 会不会拒掉不安全的动作指令、能不能识别做不到的任务、拿不准的时候会不会叫人。配套的[安全报告](https://storage.googleapis.com/deepmind-media/gemini-robotics/Gemini-Robotics-2-Safety.pdf)还讲了约束遵守，以及人靠太近时主动停手。

方向没问错。但数据还是厂商自己出的，这个区别不能忽略。2026 年 5 月有篇论文[《“好好先生综合征”》](https://arxiv.org/abs/2605.20544)，拿之前的 Gemini Robotics ER 1.6 Preview 跑了 6,069 条“机器人应该拒绝执行”的指令。基线设置下，它只拒绝了 16.5%。加上防御性提示和示例之后，在 1,000 条子集上拒绝率大幅上升——算是好消息，但研究人员也说，没有哪种方法能彻底解决。

那篇论文测的不是 ER 2，分数不能直接搬过来。但测试思路值得借鉴：模糊物体、错误前提、能力缺失、物理上不可能完成的请求——这些必须写进每一次部署评估。规划器要是漏掉了这些情况，一个错误前提就能带出一整串错误动作。

![一个温馨的卡通机器人在不确定的桌面前冻结了张开的手，而 Mark 平静地示意暂停](https://cdn.markhuang.ai/news/gemini-robotics-2-stop-decision/stop-decision.webp)

*对物理 agent 来说，求助可能是最安全的"完成动作"。*

## 演示解决不了的问题

[Axios 的报道](https://www.axios.com/2026/07/30/google-robotics-software-update)说这次发布的目标是提升灵巧性、让机器人更好控制。说得没错，但发布材料还是没回答部署层面的问题。DeepMind 自己的全身控制图表显示，Apollo 某配置下从桌上抓取成功率 68.4%，从地上 45.7%，从架子上 76.3%。图注也承认多指操作仍然很难。

这些是研究数据，不是服务承诺。它们告诉我两件事：系统已经走出了桌面小把戏的阶段，同时也说明了为什么人、底层安全控制器、限定工作区这三样东西仍然不能少。机队运营方需要故障恢复、事件日志、交接责任划分，以及一条不依赖"那个已经搞晕了的模型"的停止路径。

> **Info:**
>
> 我第一个会跑的评估会很无聊：给机器人一个在变化房间里的模糊任务，然后打分——它多快发现信息不够、停得安不安全、人能不能看懂它为什么停。

## 我怎么看

Gemini Robotics 2 看起来是实打实的进步，因为它把灵巧性、移动能力、规划、本地推理、多机协作串到了一起。它承诺的不是"做一个漂亮动作"，而是"把一件事做完"。

但这个承诺也把门槛抬高了。一个系统一旦要做几百个物理决策，就必须尽早抓住不确定性——不能等一个小误解放成一连串自信的动作。我对手和脚的表现很感兴趣，但我的信任最终取决于那个"停下来"的决策。
