方法论VLAVision-Language-Action具身智能机器人扩散策略RT-2
VLA 模型(视觉-语言-动作)
Vision-Language-Action 模型:把'看(视觉)''懂(语言)''做(动作)'端到端统一到一个模型里,是具身智能的核心技术路线,被誉为'机器人的 ChatGPT 时刻'。
发布 2026-07-23更新 2026-09-30什么是 VLA 模型
VLA(Vision-Language-Action,视觉-语言-动作)模型 是一种把"视觉感知、语言理解、动作生成"三者端到端统一在同一个神经网络里的具身智能模型。你给它一张摄像头画面 + 一句自然语言指令("把红色方块放到蓝色碗里"),它直接输出机器人关节的动作序列——中间没有手写的状态机,也没有分模块拼接。
它为什么被称作"机器人的 ChatGPT 时刻"?因为 ChatGPT 证明了"一个统一大模型 + 海量数据"能泛化到无数没见过的文本任务;VLA 想对物理动作做同样的事——一个模型,靠数据喂出来,就能处理没专门编程过的操作。
典型结构:VLM 骨干 + 扩散动作头
主流 VLA 基本是"两段式"架构:
[摄像头图像 + 语言指令]
↓
VLM 骨干(视觉-语言模型,如 Gemini / InternVL)
↓ 输出:任务语义表示(token 流 / 嵌入)
动作专家(Action Expert)
├─ 扩散模型(Diffusion Policy):去噪生成连续动作轨迹
└─ 或离散化动作 token:自回归预测下一步动作
↓
[关节角度 / 末端执行器位姿 / 夹爪开合]
- VLM 骨干负责"看懂场景 + 听懂指令",复用的是多模态大模型的能力;
- 动作头负责"怎么动",业界主流用**扩散策略(Diffusion Policy)**生成平滑、连续的轨迹,比直接回归一个坐标稳得多。
代表模型(2025–2026)
| 模型 | 机构 | 特点 |
|---|---|---|
| RT-2 | Google DeepMind | 最早把"视觉-语言"预训练知识迁移到动作的探索者之一,泛化性强 |
| OpenVLA | 社区开源 | 开放权重的 VLA 基线,降低了研究门槛 |
| π0(Pi-Zero) | Physical Intelligence | 流式动作专家,主打灵巧手复杂操作 |
| Helix | Figure AI | 双系统(感知-语义 + 实时运控),实现双机协作未知环境操作 |
| GR00T | NVIDIA | 开放人形基础模型,配 Cosmos 仿真 + Newton 物理引擎,主打"可定制" |
| Gemini Robotics | Google DeepMind | 基于 Gemini 2.0,能现场生成机器人控制代码,并支持本机本地运行 |
| WVLA 2.0 | 宇树 | 量产数据反哺,已落地 G1 会议室自主整理等场景 |
VLA 与传统分层控制的区别
| 维度 | 传统分层(感知→规划→控制) | VLA 端到端 |
|---|---|---|
| 改动成本 | 换任务要重调规则 / 重训控制器 | 自然语言切换,模型泛化 |
| 未知场景 | 容易失败(没写过的就崩) | 靠语义理解兜底,鲁棒性更高 |
| 可解释性 | 高(每一步可读) | 低(黑盒动作) |
| 数据需求 | 低(规则主导) | 高(要大量演示 / 仿真数据) |
| 实时性 | 高 | 依赖算力,本机推理是趋势 |
所以当下工业落地多是混合路线:VLA 做高层语义决策,传统运控做底层稳定执行。
当前难点
- 数据稀缺:真实机器人演示数据远少于互联网文本/图像,仿真(如 NVIDIA GR00T-Dreams)能补约 40% 成功率,但长尾仍靠真实数据;
- 本机算力:云端推理有延迟、断网即瘫,所以 Gemini Robotics On-Device、Jetson Thor 这类边端推理成为 2026 重点;
- 安全与越界:端到端模型难加硬约束,工业场景需要"动作范围 / 力控上限"的可验证护栏;
- 长程任务漂移:多步操作里一步错容易连锁翻车,需要世界模型做"想象-验证"回环。
VLA 与世界模型、机器人基础模型的关系
- VLA 解决"看到指令 → 怎么动";
- 机器人基础模型 是更广义的"在海量多本体数据上预训练、可零样本泛化"的底座,VLA 常是它的一个实例化形态;
- 世界模型(如 NVIDIA Cosmos、Google Genie)补上"在脑内模拟下一步会发生什么",让 agent 能先想后动。
三者叠起来,才接近"通用具身智能"。
常见误区
- 「VLA = 大模型 + 机械臂」——差得远。真正的难点在动作表征与数据:动作是连续量、有物理约束、且不同本体的自由度都不一样。把语言模型的 token 预测直接套到动作上,是这条路线上最常见的误解。
- 「端到端就等于不需要中间表示」——实践里多数系统仍保留感知 → 规划 → 控制的分层,只是层与层之间由同一个模型贯通。「端到端」描述的是训练目标,不是架构图上必须只有一层。
- 「仿真里跑通就能上真机」——sim-to-real gap 是这条路线最大的现实落差。仿真解决了数据量的瓶颈,但接触力、摩擦、形变、光照这些细节差异,会让仿真里的高分策略在真机上失效。
- 「数据越多越好」——机器人数据的采集成本极高且异构(不同本体、不同传感器布局、不同标注方式)。简单堆量往往不如先把本体与标注规范统一。这也是「机器人基础模型」强调跨本体预训练的原因。
- 「VLA 会先于数字 Agent 成熟」——从落地节奏看,数字世界的 Agent 先跑通是合理的:它没有物理延迟、没有硬件损耗、失败成本极低。具身智能的兑现周期应显著长于软件 Agent,任何「明年就普及」的说法都需谨慎对待。
怎么判断一个 VLA 进展是真突破还是演示
| 观察点 | 演示级 | 工程级 |
|---|---|---|
| 任务集 | 单一、精心布置的场景 | 多样且有随机扰动 |
| 成功率口径 | 只报最优一次 | 报多次均值与方差 |
| 泛化 | 换个杯子就失败 | 未见过的物体也能处理 |
| 数据来源 | 只在本任务上采集 | 大规模跨本体预训练 + 少量微调 |
| 失败处理 | 卡住等人 | 能检测失败并重试 / 求助 |
这张表同样适用于看任何机器人 Demo——「能不能复现」比「看起来多惊艳」重要得多。
延伸阅读
- 上位概念:具身智能
- 能力底座:机器人基础模型
- 代表实现:Google Gemini Robotics / NVIDIA Isaac GR00T
- 同源数字智能:AI Agent / Function Calling