# Gemini Robotics ER 2：用视频理解、任务编排与多机器人协作赋能机器人

- 来源：Google DeepMind：Blog（RSS）
- 发布时间：2026-07-30 23:00
- AIHOT 分数：60
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cms7o2xsk0nraro2epo1gt8ln
- 原文链接：https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration

## 精选理由

DeepMind 把 Gemini 带到机器人领域，视频理解、任务编排和多机协作的叙事很宏大，但全是愿景，没有实测数据，是不是真正的 step change 得等细节。做机器人的可以先建个追踪。

## AI 摘要

Google DeepMind 推出 Gemini Robotics ER 2，一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升，使机器人能够推理、协作并解决真实世界任务。

## 正文

Gemini Robotics ER 2 代表着在为机器人赋予视频理解、任务编排和多机器人协作能力方面的一次跨越式进步——让机器人能够在物理世界中发挥更大的作用。

我们正式推出 Gemini Robotics ER 2，这是一款旨在充当机器人高级大脑的全新模型。它能够实现实时空间推理、多步骤任务规划，以及不同机器人之间的协作。你现在可以通过 Gemini API、Google AI Studio 或 Gemini Enterprise Agent Platform 访问该模型，开始构建属于你自己的物理 AI 智能体。

Google 刚刚发布了 Gemini Robotics ER 2，它就像机器人的智能大脑。它能帮助机器人快速思考、规划多步骤任务，甚至与其他机器人协同工作。该模型让机器人能够观看视频流，实时追踪自身进度并纠正错误。它的设计目标是让机器人在现实世界中更安全、更有用。

要让机器人在日常环境中协助人类，仅有准确的空间推理是不够的。机器人还必须快速思考，使其决策和推理的时机与物理世界的实时速度相匹配。

正因如此，我们今天推出 Gemini Robotics ER 2，这是我们面向机器人领域能力最强的“具身推理”模型。可以把 Gemini Robotics ER 2 看作机器人的高层大脑。它让机器人能够与人类对话、理解物理世界，并规划多步骤任务。随后，它把运动执行交给任意给定的底层视觉-语言-动作（VLA）模型。Gemini Robotics ER 2 还能原生调用 Google Search 等工具来查找信息，或调用任何其他用户自定义函数。Gemini Robotics ER 2 的设计让机器人能够在执行动作的同时“思考”下一步该做什么。

Gemini Robotics ER 2 相比 Gemini Robotics ER 1.6 是一次重大升级。通过观看连续视频流，机器人现在能够跟踪自身进度、在出现问题时进行调整，并准确知道何时进入下一步。我们还引入了多机器人协作，使机器人能够在共享空间中协同工作，完成单个机器人无法独立完成的复杂工作流。

Gemini Robotics ER 2 现已通过 Gemini API、Google AI Studio 向开发者公开提供，并在 Gemini Enterprise Agent Platform 上开放私密预览。为帮助你快速上手，我们分享了示例，展示如何配置该模型并编写提示词，以驱动更实用的物理 AI 任务。

推进物理智能体能力

物理世界中的大多数任务都很复杂，需要多个步骤才能完成。Gemini Robotics ER 2 是一个物理智能体，它为机器人编排各个步骤，使其能够自我纠正，并泛化到更新颖的情境中。要构建智能体式设置，开发者可以将底层控制接口——例如视觉-语言-动作（VLA）模型或导航 API——声明为工具，并将多模态视频、音频或文本直接流式传入模型。

Gemini Robotics ER 2 改进了这一工具编排工作流。我们可以通过仿真中的机器人、使用真实世界的机器人控制，甚至将其与远程操控机器人的人类配对，来评估其性能。

在三种控制模式下——真实 VLA、仿真 VLA 和人类远程操控——Gemini Robotics ER 2 在工具编排方面始终优于 ER 1.6。

在机器人领域，高层推理取决于执行速度。Gemini Robotics ER 2 集成到 Gemini Live API 中，使用针对延迟敏感任务优化的双向流式端点。其结果是流畅的编排：Gemini Robotics ER 2 指挥动作模型和机器人 API 完成多步骤任务，而不会出现令人不适的“停下来思考”式停顿。

为了说明这一点，我们构建了一个演示，Spot来自我们的合作伙伴Boston Dynamics。我们使用 Gemini Robotics ER 2 来编排Spot API，例如导航和机械臂运动，打造出一个能为你取物的交互式机器人。

搭载 Gemini Robotics ER 2 的 Boston Dynamic Spot 在收到自然语言指令后取来了一份爆米花零食。

代码已在 Github 上提供，并附有其他示例。

解锁时间智能，实现稳健的任务完成

机器人技术最艰巨的挑战之一，是判断任务何时完成。Gemini Robotics ER 2 在视频理解和进度追踪方面带来了跨越式提升，能够在切换到下一项任务之前，验证复杂任务——例如拧紧灯泡或扎紧垃圾袋——是否已按规格完成。

在本次更新中，我们在任务进度理解的两项基础能力上取得了进展：进度分类和关键时刻定位。

连续进度分类

进度分类是指机器人追踪任务完成进度的能力。在我们的评估中，我们将视频流中的每一帧划分为五个进度等级（0-20%、20-40%、40-60%、60-80%、80-100%）。通过量化任务进度，Gemini Robotics ER 2 为机器人提供了实时的态势感知，使其能够即时调整动作，或重试失败的步骤，而无需重新启动整个工作流程。

Gemini Robotics ER 2 在进度分类任务上达到了 57.4% 的准确率，超越了前代模型和竞争的前沿模型。

精准的时刻定位

时刻定位衡量的是模型识别关键事件发生的确切视频帧的能力（即何时停止往杯子里倒咖啡）。Gemini Robotics ER 2 在时刻定位方面取得了显著的性能提升，使机器人能够精确地在任务之间切换、验证成功并给出纠正建议。

在时刻定位任务中，Gemini Robotics ER 2 达到了 91.3% 的准确率和 0.96s 的平均绝对距离。它与规模大得多的模型类别不相上下，但以极低的计算成本和 4 倍的执行速度实现了这一精度——这种亚秒级延迟正是现实世界中安全操作物理机器人所真正需要的。

多机器人协作

没有哪一台机器人能胜任所有任务——轮式漫游车在室内表现出色，而人形机器人则可能擅长应对崎岖地形。Gemini Robotics 2 支持多机器人协作，让不同类型的机器通过共享的语义理解进行通信，从而交接并完成复杂任务。看看 Gemini Robotics ER 2 如何让 Apptronik 的 Apollo 2 和 Franka F3 Duo 在此处协作。

提升通用空间智能

Gemini Robotics ER 2 推进了我们的核心空间推理能力，这通过三项基准测试来衡量：

成功/失败检测： 现在基于原始视频流而非静态快照运行，以捕捉执行过程中的失败，如溢出、滑落或错位。

通用仪表读数： 从圆形表盘和视镜扩展到数字显示屏、线性刻度、直尺和液体温度计。我们在 10 种不同类型的仪表上进行了测试。

增强空间 VQA： 通过 Gemini 在多模态理解方面的进展改进视觉问答。

Gemini Robotics ER 2 在所有核心能力上始终取得最高准确率，亮点包括成功检测（图像/视频）、问答（ERQA）和通用仪表读数。

推进具身智能的安全性

Gemini Robotics ER 2 是我们最安全的模型，在安全指令遵循和人类接近度基准测试上取得了显著提升，这两项基准分别评估模型在推理任务中遵守物理约束的能力，以及检测人类的空间感知能力。我们发现，Gemini Robotics ER 2 能在有人靠近时成功让人形机器人停下，并且只有在周围区域清空后才会自主恢复工作。为了推进物理智能体的安全性，我们推出了一项基准测试，通过检验基础模型执行安全约束、监控环境、评估物理可行性以及寻求人类澄清的能力，来评估其作为安全 VLA 编排器的能力。详情请参阅我们的安全技术报告。

Gemini Robotics ER 2 在安全指令遵循和人类接近度基准测试上优于 ER 1.6 及其他前沿模型。

展望未来，我们的计划是推动这些模型迈向更复杂的任务，以加速实用机器人的开发，并支持机器人社区。
