机器人学中的VLA与 VLM:为何加入动作会改变整个系统

视觉-语言模型(VLM)能够解释图像和语言,并返回数字答案,如文本、标签、坐标或结构化描述。视觉-语言-行动模型(VLA)必须将类似输入与机器人可执行的动作连接起来。这个额外的字母将工程问题从描述世界转变为改变它。

VLM可以正确识别杯子,并解释它放在盘子旁边。 VLA必须选择目标杯子,选择可够到的握把,产生动作,监控接触,并在物体滑动时做出反应。结果取决于相机校准、机器人几何形状、控制器时机、安全行为以及语义理解。

边界是建筑性的,而非绝对的。机器人系统可以使用 VLM 来感知,用独立的规划器来执行动作,而另一个模型则从头到尾产生动作。通过实际输入、输出和反馈环路比较系统,而不是假设所有使用 VLA 标签的产品都具备相同能力。

VLM产生关于场景的信息

VLM将视觉表现与语言结合起来,能够回答问题、为图像添加说明、识别对象或推理空间关系。在机器人领域,这些输出可以支持感知和规划。一个点、边界区域或任务描述可以告诉另一个组件哪些对象或位置重要。

输出保持信息性,除非连接到机器人控制过程。正确命名物体并不意味着如何接近、哪个夹持姿势稳定、移动速度或意外接触后该做什么。

VLA 为具身系统生成可执行动作

VLA模型将视觉观察和语言指令映射到机器人动作上。根据系统不同,动作可以是目标姿势、航点、关节指令、夹持器命令或运动块。动作接口决定模型需要学习的内容,以及传统控制器必须学习的内容。

由于输出推动硬件,评估必须包含物理后果。延迟可能导致修正不稳定,小的坐标误差可能错过目标,歧义指令可能选择错误目标。系统需要反馈和独立方式来减速、停止或请求帮助。

输出会改变整个堆栈

相同的图像和指令可以进入任一模型类别,但预期输出会改变数据、架构和测试。 VLM 可以与答案进行评估。 VLA 必须通过机器人评估,因为相同的指令标记在不同物体或不同校准下可能产生不同的运动。

卡片总结了从场景解读到闭环动作的实际过渡过程。它还展示了为何仅仅在 VLM 上添加动作头还不够:机器人状态、时机、身体和恢复必须在系统中有所体现。

视觉语言模型与视觉—语言—动作模型的输入输出比较
加入动作引入了具身性、时机、校准、反馈和物理风险。来源:Physical AI Lab。

动作表示决定模型控制什么

一个动作可以用关节角度、关节速度、末端执行器姿态、夹持器状态或学习的标记来表示。绝对目标提供目的地,而δ动作描述的是从当前状态的变化。短动作块减少了重复推断,但可能使中途修正更慢。

除非说明动作空间和控制率,否则比较不完整。以低速率产生6D航点的模型依赖下游控制器,与产生高速率关节命令的模型不同。这两种系统都可能被称为 VLA,但其风险和硬件依赖性差异很大。

模型输出它的代表意义下游遗留的
文本或标签对象、关系或任务描述规划与控制
2D 或 3D点地面目标位置姿态估计与运动生成
末端执行器位姿期望的工具位置和方向逆运动学与关节控制
关节动作块机器人专用命令序列追踪、安全过滤与反馈

反馈将行动转化为策略

一个有用的机器人策略是在操作后观察结果。如果夹持器关闭时未固定物体,下一次观察应触发纠正、重试或停止。开环回放在固定场景中看似成功,但当物体姿态或接触发生变化时失败。

反馈还会暴露不确定性。系统可以比较预期的下一状态与测量状态,监控置信度,并在差异过大时升级。这种恢复行为比单一成功轨迹更强烈地传递出一个信号。

空间定位必须成为可执行的几何体

像“把标记放进托盘”这样的语言指令对机器人来说描述不足。模型必须识别标记、选择抓取点、考虑障碍物并生成手臂可及的路线。空间上正确的答案在机械上仍可能不可能。

谷歌Gemini机器人文档展示了基于机器人场景的空间点和轨迹式输出。这些例子展示了VLM式推理与动作之间的桥梁,而真实控制器和机器人仍决定执行质量。

连接机械臂与工作台物体的编号轨迹点
机器人动作必须作为观察场景中的轨迹进行基础。来源:Google AI for Developers。许可:CC BY 4.0

VLA 训练需要同步的机器人交互数据

VLM 预训练可以使用大量图像-文本对。 VLA 训练还需要观察与可执行动作和结果相匹配。 机器人动作数据指南 解释了为何仅凭视频是不够的:状态、命令、时序、校准和成功标签必须共享时间线。

Google DeepMind的 RT-2 工作描述了将视觉和语言转化为机器人动作,而 Open X-Embodiment和RT-X 则涉及跨多样机器人数据集的学习。跨机器人数据增加了规模,同时也使动作规范化和具身元数据变得至关重要。

评估必须将理解与执行分开

模型可以理解指令,但由于感知噪声、运动约束或接触而失败。报告语义目标准确性与掌握成功率、任务完成率和干预分开。这揭示了变更是否提升了语言理解,还是仅仅提升了下游控制器。

评估还应识别未见的条件。新的指令、对象、背景和机器人身体测试不同形式的泛化。单一平均值隐藏了哪一层失败,因此使用证据表保持区分。

评估层度量示例失败被隔离
语言基础正确的对象或区域误解了指令
动作预测轨迹或指令错误错误的动作表示
物理执行抓取与任务成功率控制、校准或接触失效
操作行为干预率与恢复率策略无法处理例外

VLA是机器人系统中的一个组成部分

广泛的 机器人基础模型 可能支持跨任务的 VLA 行为,但部署的系统仍需状态估计、控制器、安全功能、日志记录和操作。其中一些组件可以学习,另一些则保持传统。

这种系统视角防止了两种相反的错误:一是因为非端到端而否定有用的 VLM;二是假设 VLA 标签意味着整个机器人是自主的。架构应以任务性能和失效容纳度来评判,而非图中出现的盒子数量。

如何比较两款机器人模型

记录每个模型的视觉输入、语言输入、机器人状态输入、动作表示、控制率、训练数据及支持的身体。然后记录物理评估:试验次数、未见条件、干预措施、恢复和安全极限。即使厂商使用不同标签,这也能形成可比的规范。

最后,问问错误发生后会发生什么。一个能检测不确定性并将控制权交给安全恢复过程的模型,可能比一个基准准确率更高但没有升级的模型更有用。最好的比较是从观察到行动再到测量结果的整个循环。

评估“机器人学中的VLA与 VLM:为何加入动作会改变整个系统”时,还应保存模型版本、机器人配置、标定文件、测试日期和全部试验记录。把成功、失败、恢复与人工介入放在同一份数据中,才能区分模型能力、系统接口和现场流程造成的差异。

成本评估除了设备与算力,还要记录数据采集、工程调试、安全措施、维护、停机和人员培训。只有把这些持续投入与单位成功任务的价值比较,才能判断方案是否适合扩大。

上线后仍要持续检查分布变化、传感器漂移、机械磨损和人工接管原因。监测结果应能触发降级、停止与重新验证流程,并为下一轮数据采集和模型更新留下可追溯记录。

最终结论应明确写出已知限制、尚未验证的场景和下一项可证伪的实验,使后续团队能够沿着证据继续推进。

  • 确定具体输出:文本、点、姿势、联合动作或动作块。
  • 列出机器人状态和标定数据。
  • 区分语义准确性与实际任务的成功率。
  • 统计干预、恢复和安全事件。

常见问题

VLM安装在机器人上时会变成VLA吗?

不。 VLM 可以在机器人内部提供感知或推理,但 VLA 专门将观察和语言与机器人使用的动作表征联系起来。

VLA总是端到端吗?

不。有些模型预测低层次动作,而另一些则生成下游控制器执行的路径点或计划。动作接口必须说明。

VLA能让机器人完全自主吗?

不会。自主性还取决于感知、控制、恢复、安全、任务覆盖以及人员何时介入。仅凭型号名称无法回答这些问题。

为什么一个 VLA 需要的不仅仅是机器人视频?

视频显示外貌和动作,但可能省略关节状态、指令、时序、校准和干预。训练可执行策略需要对齐这些信号。

VLA和VLM的表现应该如何比较?

将语言和视觉基础与行动预测、体能任务成功、干预和恢复区分开来。它们并不共享一个普遍的指标。

模型名称不能证明自主性

VLA、 VLM 和机器人基础模型是宽泛的标签。在比较能力声明前,请核实已发布的架构、动作接口、评估协议和操作限制。