视觉-语言模型(VLM)能够解释图像和语言,并返回数字答案,如文本、标签、坐标或结构化描述。视觉-语言-行动模型(VLA)必须将类似输入与机器人可执行的动作连接起来。这个额外的字母将工程问题从描述世界转变为改变它。
VLM可以正确识别杯子,并解释它放在盘子旁边。 VLA必须选择目标杯子,选择可够到的握把,产生动作,监控接触,并在物体滑动时做出反应。结果取决于相机校准、机器人几何形状、控制器时机、安全行为以及语义理解。
边界是建筑性的,而非绝对的。机器人系统可以使用 VLM 来感知,用独立的规划器来执行动作,而另一个模型则从头到尾产生动作。通过实际输入、输出和反馈环路比较系统,而不是假设所有使用 VLA 标签的产品都具备相同能力。
VLM产生关于场景的信息
VLM将视觉表现与语言结合起来,能够回答问题、为图像添加说明、识别对象或推理空间关系。在机器人领域,这些输出可以支持感知和规划。一个点、边界区域或任务描述可以告诉另一个组件哪些对象或位置重要。
输出保持信息性,除非连接到机器人控制过程。正确命名物体并不意味着如何接近、哪个夹持姿势稳定、移动速度或意外接触后该做什么。
VLA 为具身系统生成可执行动作
VLA模型将视觉观察和语言指令映射到机器人动作上。根据系统不同,动作可以是目标姿势、航点、关节指令、夹持器命令或运动块。动作接口决定模型需要学习的内容,以及传统控制器必须学习的内容。
由于输出推动硬件,评估必须包含物理后果。延迟可能导致修正不稳定,小的坐标误差可能错过目标,歧义指令可能选择错误目标。系统需要反馈和独立方式来减速、停止或请求帮助。
输出会改变整个堆栈
相同的图像和指令可以进入任一模型类别,但预期输出会改变数据、架构和测试。 VLM 可以与答案进行评估。 VLA 必须通过机器人评估,因为相同的指令标记在不同物体或不同校准下可能产生不同的运动。
卡片总结了从场景解读到闭环动作的实际过渡过程。它还展示了为何仅仅在 VLM 上添加动作头还不够:机器人状态、时机、身体和恢复必须在系统中有所体现。

动作表示决定模型控制什么
一个动作可以用关节角度、关节速度、末端执行器姿态、夹持器状态或学习的标记来表示。绝对目标提供目的地,而δ动作描述的是从当前状态的变化。短动作块减少了重复推断,但可能使中途修正更慢。
除非说明动作空间和控制率,否则比较不完整。以低速率产生6D航点的模型依赖下游控制器,与产生高速率关节命令的模型不同。这两种系统都可能被称为 VLA,但其风险和硬件依赖性差异很大。
| 模型输出 | 它的代表意义 | 下游遗留的 |
|---|---|---|
| 文本或标签 | 对象、关系或任务描述 | 规划与控制 |
| 2D 或 3D点 | 地面目标位置 | 姿态估计与运动生成 |
| 末端执行器位姿 | 期望的工具位置和方向 | 逆运动学与关节控制 |
| 关节动作块 | 机器人专用命令序列 | 追踪、安全过滤与反馈 |
反馈将行动转化为策略
一个有用的机器人策略是在操作后观察结果。如果夹持器关闭时未固定物体,下一次观察应触发纠正、重试或停止。开环回放在固定场景中看似成功,但当物体姿态或接触发生变化时失败。
反馈还会暴露不确定性。系统可以比较预期的下一状态与测量状态,监控置信度,并在差异过大时升级。这种恢复行为比单一成功轨迹更强烈地传递出一个信号。
空间定位必须成为可执行的几何体
像“把标记放进托盘”这样的语言指令对机器人来说描述不足。模型必须识别标记、选择抓取点、考虑障碍物并生成手臂可及的路线。空间上正确的答案在机械上仍可能不可能。
谷歌Gemini机器人文档展示了基于机器人场景的空间点和轨迹式输出。这些例子展示了VLM式推理与动作之间的桥梁,而真实控制器和机器人仍决定执行质量。

VLA 训练需要同步的机器人交互数据
VLM 预训练可以使用大量图像-文本对。 VLA 训练还需要观察与可执行动作和结果相匹配。 机器人动作数据指南 解释了为何仅凭视频是不够的:状态、命令、时序、校准和成功标签必须共享时间线。
Google DeepMind的 RT-2 工作描述了将视觉和语言转化为机器人动作,而 Open X-Embodiment和RT-X 则涉及跨多样机器人数据集的学习。跨机器人数据增加了规模,同时也使动作规范化和具身元数据变得至关重要。
评估必须将理解与执行分开
模型可以理解指令,但由于感知噪声、运动约束或接触而失败。报告语义目标准确性与掌握成功率、任务完成率和干预分开。这揭示了变更是否提升了语言理解,还是仅仅提升了下游控制器。
评估还应识别未见的条件。新的指令、对象、背景和机器人身体测试不同形式的泛化。单一平均值隐藏了哪一层失败,因此使用证据表保持区分。
| 评估层 | 度量示例 | 失败被隔离 |
|---|---|---|
| 语言基础 | 正确的对象或区域 | 误解了指令 |
| 动作预测 | 轨迹或指令错误 | 错误的动作表示 |
| 物理执行 | 抓取与任务成功率 | 控制、校准或接触失效 |
| 操作行为 | 干预率与恢复率 | 策略无法处理例外 |
VLA是机器人系统中的一个组成部分
广泛的 机器人基础模型 可能支持跨任务的 VLA 行为,但部署的系统仍需状态估计、控制器、安全功能、日志记录和操作。其中一些组件可以学习,另一些则保持传统。
这种系统视角防止了两种相反的错误:一是因为非端到端而否定有用的 VLM;二是假设 VLA 标签意味着整个机器人是自主的。架构应以任务性能和失效容纳度来评判,而非图中出现的盒子数量。
如何比较两款机器人模型
记录每个模型的视觉输入、语言输入、机器人状态输入、动作表示、控制率、训练数据及支持的身体。然后记录物理评估:试验次数、未见条件、干预措施、恢复和安全极限。即使厂商使用不同标签,这也能形成可比的规范。
最后,问问错误发生后会发生什么。一个能检测不确定性并将控制权交给安全恢复过程的模型,可能比一个基准准确率更高但没有升级的模型更有用。最好的比较是从观察到行动再到测量结果的整个循环。
评估“机器人学中的VLA与 VLM:为何加入动作会改变整个系统”时,还应保存模型版本、机器人配置、标定文件、测试日期和全部试验记录。把成功、失败、恢复与人工介入放在同一份数据中,才能区分模型能力、系统接口和现场流程造成的差异。
成本评估除了设备与算力,还要记录数据采集、工程调试、安全措施、维护、停机和人员培训。只有把这些持续投入与单位成功任务的价值比较,才能判断方案是否适合扩大。
上线后仍要持续检查分布变化、传感器漂移、机械磨损和人工接管原因。监测结果应能触发降级、停止与重新验证流程,并为下一轮数据采集和模型更新留下可追溯记录。
最终结论应明确写出已知限制、尚未验证的场景和下一项可证伪的实验,使后续团队能够沿着证据继续推进。
- 确定具体输出:文本、点、姿势、联合动作或动作块。
- 列出机器人状态和标定数据。
- 区分语义准确性与实际任务的成功率。
- 统计干预、恢复和安全事件。
常见问题
VLM安装在机器人上时会变成VLA吗?
不。 VLM 可以在机器人内部提供感知或推理,但 VLA 专门将观察和语言与机器人使用的动作表征联系起来。
VLA总是端到端吗?
不。有些模型预测低层次动作,而另一些则生成下游控制器执行的路径点或计划。动作接口必须说明。
VLA能让机器人完全自主吗?
不会。自主性还取决于感知、控制、恢复、安全、任务覆盖以及人员何时介入。仅凭型号名称无法回答这些问题。
为什么一个 VLA 需要的不仅仅是机器人视频?
视频显示外貌和动作,但可能省略关节状态、指令、时序、校准和干预。训练可执行策略需要对齐这些信号。
VLA和VLM的表现应该如何比较?
将语言和视觉基础与行动预测、体能任务成功、干预和恢复区分开来。它们并不共享一个普遍的指标。
模型名称不能证明自主性
VLA、 VLM 和机器人基础模型是宽泛的标签。在比较能力声明前,请核实已发布的架构、动作接口、评估协议和操作限制。