Google Gemini Robotics
Google DeepMind 基于 Gemini 2.0 的机器人多模态模型家族,能把自然语言指令和摄像头画面直接转成机器人动作;2026 年进一步推出 On-Device 本机推理版本,让模型跑在机器人自己身上。
发布 2026-07-23更新 2026-09-24核实 2026-09-24规格
- 厂商
- Google DeepMind
- 发布日期
- 2025/3/25
- 类型
- multimodal
- 上下文窗口
- 1000K tokens
- 最大输出
- 8K tokens
- 定价
- 通过 Vertex AI / Google AI Studio 按 Gemini 2.0 计价;机器人定制版为企业授权,具体以官方为准
- API 兼容
基准测试
优势
- •基于 Gemini 2.0 多模态底座,原生理解图像/视频/语言
- •能现场生成机器人控制代码(code generation on the fly),不需为每个场景预编程
- •On-Device 本机本地推理版本,断网也能跑,延迟低、鲁棒性强
- •与 Google 生态(AndroidXR / Project Astra)协同,面向消费级机器人场景
不足
- •国内无官方直连,需 Vertex AI 或中转
- •真实开放世界长尾任务仍弱于专用运控
- •本机推理对机器人端算力(如 Jetson 级)有门槛
适用场景
概述
Gemini Robotics 是 Google DeepMind 把 Gemini 多模态能力"装进机器人身体"的成果。它解决的核心问题是:让机器人听懂一句人话 + 看懂眼前画面,然后自己决定怎么动——而不是工程师为每一个动作预先写死控制代码。
基于 Gemini 2.0 的视觉-语言底座,它能做到两件传统机器人做不到的事:
- 现场生成控制代码:面对没专门编程过的场景,模型即时产出可执行的机器人指令;
- 本机本地推理(On-Device):2026 年推出的 Gemini Robotics On-Device 把模型直接跑在机器人自身的算力上,断网也能工作,延迟更低、在真实部署里更稳。
核心能力
多模态"大脑"
和纯运控机器人不同,Gemini Robotics 继承了 Gemini 对图像、视频、语言的原生理解。你用自然语言下指令,它结合摄像头画面做语义决策——这正是 VLA 模型 想达成的"端到端统一"。
生成式控制(code on the fly)
最被看重的特性是:模型能为新任务实时生成控制代码。这意味着"教机器人做一件新事"从"养团队半年"变成"说一句话",是 机器人基础模型 泛化能力的直接体现。
On-Device 本地推理
云端推理在工厂 / 家庭里有两个致命问题:延迟、断网即瘫。Gemini Robotics On-Device 把模型下沉到机器人端,是 2026 年具身智能从 demo 走向部署的关键一步(同类思路也见于 NVIDIA Jetson Thor)。
在产业里的落点
- 波士顿动力 Atlas:2026 年进入量产的新一代 Atlas 集成了 Google Gemini,作为"大脑"驱动决策;
- 研究生态:作为开放能力被多家机器人本体与高校采用,与 NVIDIA GR00T、Figure Helix 同列 2026 年主流技术路线之一。
与其他机器人模型的定位差异
| 维度 | Gemini Robotics | NVIDIA Isaac GR00T | Figure Helix |
|---|---|---|---|
| 主体定位 | 模型 + 生态 | 开放基础模型 + 全栈工具链 | 双系统本体智能 |
| 强项 | 多模态理解 + 生成控制代码 | 跨本体训练 + 仿真 + Scaling Law | 双机协作、动态环境 |
| 推理位置 | 云端 / 本机 On-Device | 本机(Jetson Thor) | 本机 |
| 开放度 | 企业授权为主 | 开放权重 + 工具链 | 闭源 |
避坑清单
- 别把「能生成控制代码」当成「能直接上真机」:模型现场产出的是候选指令,真实部署仍需仿真验证 + 安全限速 + 人工急停。生成代码 ≠ 可安全执行,这道闸门不能省。
- On-Device 版本有算力门槛:本地推理把延迟和断网问题解决,但把压力转移到了机器人端的算力与功耗上。选型前先确认本体算力是否够,否则会得到一个「很慢的本地模型」。
- 国内合规路径要提前规划:与所有 Google 模型一样大陆无官方直连,机器人本体侧还要解决端算力与部署合规(数据出境、摄像头采集合规)。研究团队多用海外云 + 真机 / 仿真组合。
- 企业授权为主,别预设「开放权重」:本卡开放度以企业授权为主,与 Isaac GR00T 的「开放权重 + 工具链」不是一回事,采购前请确认授权范围。
- 评测口径差异极大:具身智能的基准对场景、本体、初始条件高度敏感,跨论文的分数基本不可比。看 Demo 与看产线是两回事。
FAQ
Q: Gemini Robotics 与 Isaac GR00T 怎么选? A: 一句话:要「多模态大脑 + 生态」选 Gemini Robotics,要「开放权重 + 全栈工具链(仿真/跨本体)」选 GR00T。前者强在语义理解与生成式控制,后者强在跨本体训练与仿真 Scaling。很多团队其实两者都用:GR00T 做训练与仿真,Gemini 做上层语义决策。
Q: On-Device 值得吗? A: 取决于部署环境。工厂 / 家庭这类对延迟与断网敏感的场景值得,云端推理「断网即瘫」是硬伤;实验室 / 有稳定网络的场景,云端版本迭代更快、算力更足,先不上本地更省心。
Q: 现在能直接买到吗? A: 以企业授权 / 合作为主,不是自助开通的 API。请联系 Google DeepMind 或查看官方渠道;研究用途可关注开放能力与高校合作计划。
国内使用
与所有 Google 模型一样,Gemini Robotics 在大陆无官方直连,需 Vertex AI 或中转,且机器人本体侧还要解决端算力与部署合规。研究团队多用海外云 + 真机 / 仿真(Isaac Sim)组合。
延伸阅读
- 技术路线:VLA 模型(视觉-语言-动作)
- 能力底座:机器人基础模型
- 同赛道:NVIDIA Isaac GR00T
- 行业背景:具身智能 / 2026 上半年具身智能十大进展