跳到主内容
方法论VLAVision-Language-Action具身智能机器人扩散策略RT-2

VLA 模型(视觉-语言-动作)

Vision-Language-Action 模型:把'看(视觉)''懂(语言)''做(动作)'端到端统一到一个模型里,是具身智能的核心技术路线,被誉为'机器人的 ChatGPT 时刻'。

发布 2026-07-23更新 2026-09-30

什么是 VLA 模型

VLA(Vision-Language-Action,视觉-语言-动作)模型 是一种把"视觉感知、语言理解、动作生成"三者端到端统一在同一个神经网络里的具身智能模型。你给它一张摄像头画面 + 一句自然语言指令("把红色方块放到蓝色碗里"),它直接输出机器人关节的动作序列——中间没有手写的状态机,也没有分模块拼接。

它为什么被称作"机器人的 ChatGPT 时刻"?因为 ChatGPT 证明了"一个统一大模型 + 海量数据"能泛化到无数没见过的文本任务;VLA 想对物理动作做同样的事——一个模型,靠数据喂出来,就能处理没专门编程过的操作。

典型结构:VLM 骨干 + 扩散动作头

主流 VLA 基本是"两段式"架构:

[摄像头图像 + 语言指令]
        ↓
   VLM 骨干(视觉-语言模型,如 Gemini / InternVL)
        ↓ 输出:任务语义表示(token 流 / 嵌入)
   动作专家(Action Expert)
   ├─ 扩散模型(Diffusion Policy):去噪生成连续动作轨迹
   └─ 或离散化动作 token:自回归预测下一步动作
        ↓
   [关节角度 / 末端执行器位姿 / 夹爪开合]
  • VLM 骨干负责"看懂场景 + 听懂指令",复用的是多模态大模型的能力;
  • 动作头负责"怎么动",业界主流用**扩散策略(Diffusion Policy)**生成平滑、连续的轨迹,比直接回归一个坐标稳得多。

代表模型(2025–2026)

模型机构特点
RT-2Google DeepMind最早把"视觉-语言"预训练知识迁移到动作的探索者之一,泛化性强
OpenVLA社区开源开放权重的 VLA 基线,降低了研究门槛
π0(Pi-Zero)Physical Intelligence流式动作专家,主打灵巧手复杂操作
HelixFigure AI双系统(感知-语义 + 实时运控),实现双机协作未知环境操作
GR00TNVIDIA开放人形基础模型,配 Cosmos 仿真 + Newton 物理引擎,主打"可定制"
Gemini RoboticsGoogle DeepMind基于 Gemini 2.0,能现场生成机器人控制代码,并支持本机本地运行
WVLA 2.0宇树量产数据反哺,已落地 G1 会议室自主整理等场景

VLA 与传统分层控制的区别

维度传统分层(感知→规划→控制)VLA 端到端
改动成本换任务要重调规则 / 重训控制器自然语言切换,模型泛化
未知场景容易失败(没写过的就崩)靠语义理解兜底,鲁棒性更高
可解释性高(每一步可读)低(黑盒动作)
数据需求低(规则主导)高(要大量演示 / 仿真数据)
实时性高依赖算力,本机推理是趋势

所以当下工业落地多是混合路线:VLA 做高层语义决策,传统运控做底层稳定执行。

当前难点

  1. 数据稀缺:真实机器人演示数据远少于互联网文本/图像,仿真(如 NVIDIA GR00T-Dreams)能补约 40% 成功率,但长尾仍靠真实数据;
  2. 本机算力:云端推理有延迟、断网即瘫,所以 Gemini Robotics On-Device、Jetson Thor 这类边端推理成为 2026 重点;
  3. 安全与越界:端到端模型难加硬约束,工业场景需要"动作范围 / 力控上限"的可验证护栏;
  4. 长程任务漂移:多步操作里一步错容易连锁翻车,需要世界模型做"想象-验证"回环。

VLA 与世界模型、机器人基础模型的关系

  • VLA 解决"看到指令 → 怎么动";
  • 机器人基础模型 是更广义的"在海量多本体数据上预训练、可零样本泛化"的底座,VLA 常是它的一个实例化形态;
  • 世界模型(如 NVIDIA Cosmos、Google Genie)补上"在脑内模拟下一步会发生什么",让 agent 能先想后动。

三者叠起来,才接近"通用具身智能"。

常见误区

  1. 「VLA = 大模型 + 机械臂」——差得远。真正的难点在动作表征与数据:动作是连续量、有物理约束、且不同本体的自由度都不一样。把语言模型的 token 预测直接套到动作上,是这条路线上最常见的误解。
  2. 「端到端就等于不需要中间表示」——实践里多数系统仍保留感知 → 规划 → 控制的分层,只是层与层之间由同一个模型贯通。「端到端」描述的是训练目标,不是架构图上必须只有一层。
  3. 「仿真里跑通就能上真机」——sim-to-real gap 是这条路线最大的现实落差。仿真解决了数据量的瓶颈,但接触力、摩擦、形变、光照这些细节差异,会让仿真里的高分策略在真机上失效。
  4. 「数据越多越好」——机器人数据的采集成本极高且异构(不同本体、不同传感器布局、不同标注方式)。简单堆量往往不如先把本体与标注规范统一。这也是「机器人基础模型」强调跨本体预训练的原因。
  5. 「VLA 会先于数字 Agent 成熟」——从落地节奏看,数字世界的 Agent 先跑通是合理的:它没有物理延迟、没有硬件损耗、失败成本极低。具身智能的兑现周期应显著长于软件 Agent,任何「明年就普及」的说法都需谨慎对待。

怎么判断一个 VLA 进展是真突破还是演示

观察点演示级工程级
任务集单一、精心布置的场景多样且有随机扰动
成功率口径只报最优一次报多次均值与方差
泛化换个杯子就失败未见过的物体也能处理
数据来源只在本任务上采集大规模跨本体预训练 + 少量微调
失败处理卡住等人能检测失败并重试 / 求助

这张表同样适用于看任何机器人 Demo——「能不能复现」比「看起来多惊艳」重要得多。

延伸阅读