跳到主内容
multimodalGoogle DeepMind

Google Gemini Robotics

Google DeepMind 基于 Gemini 2.0 的机器人多模态模型家族,能把自然语言指令和摄像头画面直接转成机器人动作;2026 年进一步推出 On-Device 本机推理版本,让模型跑在机器人自己身上。

发布 2026-07-23更新 2026-09-24核实 2026-09-24

规格

厂商
Google DeepMind
发布日期
2025/3/25
类型
multimodal
上下文窗口
1000K tokens
最大输出
8K tokens
定价
通过 Vertex AI / Google AI Studio 按 Gemini 2.0 计价;机器人定制版为企业授权,具体以官方为准
API 兼容
google

基准测试

优于传统分层控制(定性)
语言指令零样本泛化
显著低于云端往返(On-Device 版)
本机推理延迟

优势

  • •基于 Gemini 2.0 多模态底座,原生理解图像/视频/语言
  • •能现场生成机器人控制代码(code generation on the fly),不需为每个场景预编程
  • •On-Device 本机本地推理版本,断网也能跑,延迟低、鲁棒性强
  • •与 Google 生态(AndroidXR / Project Astra)协同,面向消费级机器人场景

不足

  • •国内无官方直连,需 Vertex AI 或中转
  • •真实开放世界长尾任务仍弱于专用运控
  • •本机推理对机器人端算力(如 Jetson 级)有门槛

适用场景

未知场景的零样本操作(没训练过的指令也能尝试)仓储 / 工厂的非结构化抓取与分拣家庭 / 服务场景的语义级交互(说人话就能指挥)作为'大脑'驱动波士顿动力 Atlas 等本体

概述

Gemini Robotics 是 Google DeepMind 把 Gemini 多模态能力"装进机器人身体"的成果。它解决的核心问题是:让机器人听懂一句人话 + 看懂眼前画面,然后自己决定怎么动——而不是工程师为每一个动作预先写死控制代码。

基于 Gemini 2.0 的视觉-语言底座,它能做到两件传统机器人做不到的事:

  1. 现场生成控制代码:面对没专门编程过的场景,模型即时产出可执行的机器人指令;
  2. 本机本地推理(On-Device):2026 年推出的 Gemini Robotics On-Device 把模型直接跑在机器人自身的算力上,断网也能工作,延迟更低、在真实部署里更稳。

核心能力

多模态"大脑"

和纯运控机器人不同,Gemini Robotics 继承了 Gemini 对图像、视频、语言的原生理解。你用自然语言下指令,它结合摄像头画面做语义决策——这正是 VLA 模型 想达成的"端到端统一"。

生成式控制(code on the fly)

最被看重的特性是:模型能为新任务实时生成控制代码。这意味着"教机器人做一件新事"从"养团队半年"变成"说一句话",是 机器人基础模型 泛化能力的直接体现。

On-Device 本地推理

云端推理在工厂 / 家庭里有两个致命问题:延迟、断网即瘫。Gemini Robotics On-Device 把模型下沉到机器人端,是 2026 年具身智能从 demo 走向部署的关键一步(同类思路也见于 NVIDIA Jetson Thor)。

在产业里的落点

  • 波士顿动力 Atlas:2026 年进入量产的新一代 Atlas 集成了 Google Gemini,作为"大脑"驱动决策;
  • 研究生态:作为开放能力被多家机器人本体与高校采用,与 NVIDIA GR00T、Figure Helix 同列 2026 年主流技术路线之一。

与其他机器人模型的定位差异

维度Gemini RoboticsNVIDIA Isaac GR00TFigure Helix
主体定位模型 + 生态开放基础模型 + 全栈工具链双系统本体智能
强项多模态理解 + 生成控制代码跨本体训练 + 仿真 + Scaling Law双机协作、动态环境
推理位置云端 / 本机 On-Device本机(Jetson Thor)本机
开放度企业授权为主开放权重 + 工具链闭源

避坑清单

  1. 别把「能生成控制代码」当成「能直接上真机」:模型现场产出的是候选指令,真实部署仍需仿真验证 + 安全限速 + 人工急停。生成代码 ≠ 可安全执行,这道闸门不能省。
  2. On-Device 版本有算力门槛:本地推理把延迟和断网问题解决,但把压力转移到了机器人端的算力与功耗上。选型前先确认本体算力是否够,否则会得到一个「很慢的本地模型」。
  3. 国内合规路径要提前规划:与所有 Google 模型一样大陆无官方直连,机器人本体侧还要解决端算力与部署合规(数据出境、摄像头采集合规)。研究团队多用海外云 + 真机 / 仿真组合。
  4. 企业授权为主,别预设「开放权重」:本卡开放度以企业授权为主,与 Isaac GR00T 的「开放权重 + 工具链」不是一回事,采购前请确认授权范围。
  5. 评测口径差异极大:具身智能的基准对场景、本体、初始条件高度敏感,跨论文的分数基本不可比。看 Demo 与看产线是两回事。

FAQ

Q: Gemini Robotics 与 Isaac GR00T 怎么选? A: 一句话:要「多模态大脑 + 生态」选 Gemini Robotics,要「开放权重 + 全栈工具链(仿真/跨本体)」选 GR00T。前者强在语义理解与生成式控制,后者强在跨本体训练与仿真 Scaling。很多团队其实两者都用:GR00T 做训练与仿真,Gemini 做上层语义决策。

Q: On-Device 值得吗? A: 取决于部署环境。工厂 / 家庭这类对延迟与断网敏感的场景值得,云端推理「断网即瘫」是硬伤;实验室 / 有稳定网络的场景,云端版本迭代更快、算力更足,先不上本地更省心。

Q: 现在能直接买到吗? A: 以企业授权 / 合作为主,不是自助开通的 API。请联系 Google DeepMind 或查看官方渠道;研究用途可关注开放能力与高校合作计划。

国内使用

与所有 Google 模型一样,Gemini Robotics 在大陆无官方直连,需 Vertex AI 或中转,且机器人本体侧还要解决端算力与部署合规。研究团队多用海外云 + 真机 / 仿真(Isaac Sim)组合。

延伸阅读