机器人动作分块: ACT、时间集成与闭环执行

动作分块要求机器人策略同时预测多个未来动作,而不是每个查询只做一个动作。一个连贯的块减少了长时间操作任务中高层决策的数量,并能保留演示中学到的运动结构。这也带来了一个新问题:在再次观察之前,应该信任多少该区块?

Transformers动作分块(ACT)是一种与ALOHA一同引入的特定模仿学习方法。 ACT使用条件变分自编码器和变换器组件,从图像和机器人状态预测动作序列。动作分块是更广泛的设计模式;并非所有分块策略都使用ACT、 CVAE或相同的时间集合。

将本指南与 扩散策略指南机器人关节控制指南一起使用。将预测的块、应用于硬件的部分和下一次观测时间分别视为可测量的独立量。

动作区块缩短了有效决策时间

一个持续数千伺服周期的任务,当每个策略查询预测一个短轨迹段时,需要的高级选择会更少。段内的动作共享上下文,这可以减少独立一步预测带来的抖动,并帮助表示协调的双手或接触丰富的运动。

归约并非自由的。执行区块内的误差可能在下一次观测前累积。因此,分块将部分问题从每步预测转向视界选择和闭环调度。长预测可以作为上下文,而无需机器人以开环方式执行。

宇航员在国际空间站操作机器人2号硬件
遥操作示教可以保持协调行动,但学习到的片段仍需针对延迟、干扰和硬件限制进行测试。来源:NASA。版权: NASA媒体使用指南

ACT就是一种具体的分块架构

官方 ALOHA项目 引入了ACT技术,用于预测细粒度双手操作的动作块。其策略结合了视觉和本体感觉输入,配合基于变换器的条件变分自编码器,在训练过程中使用潜在变量表示演示变异。

部署时, ACT通常使用确定性先验均值,而非请求演示样式标签。架构、摄像头编码器、潜在处理和动作规范化是必须钉顶的实现细节。报告的ALOHA任务和数据效率是该设置的证据,而非所有机器人的普遍成功保证。

预测时域、执行时域和查询时域彼此不同

区块长度是模型预测的未来动作数量。执行视野是系统替换前发送的次数,查询区间是新预测开始的时间。有些实现查询每个控制步骤并结合重叠;另一些实现执行前缀以减少推理负载。

每个视野都用步数和秒数表示。同一100步区块表示100 Hz为1秒, 10 Hz为10秒。还报告推断延迟,以及新预测是否与观测时间或计算结束时间对齐。

数量定义太短了太长了
预测块未来产生的行动弱时间背景未来未卜
执行前缀替换前的操作计算与抖动负载缓慢扰动响应
查询区间策略请求之间的时间队列争用陈旧的计划
观测历史提供过往证据模糊运动记忆与旧背景
伺服周期硬件目标更新粗控时序需求

时间集成融合重叠的预测结果

ACT论文中,频繁查询会产生多个预测,针对同一未来时间步。时间集合将这些重叠估计与偏向近期预测的权重结合起来。这可以在整合新观测值的同时平滑区块之间的变化。

平均作用并非总是中立的。笛卡尔旋转、离散夹持器状态和多模态替代方案需要在插值有意义的表示中。两种单独有效的策略可以平均成一个无效的中间值。记录贡献预测和权重,以便区分平滑失败与模型错误。

五级机器人动作分块执行循环
预测块、执行前缀和查询速率是独立的设计选择。来源:Physical AI Lab。

块长度遵循任务动态和接触

自由空间覆盖可能容忍比插入、抓握闭合或工具接触更长的前缀。根据预期扰动时间、相机帧率、推理尾延迟和底层控制器带宽选择动作时域。在阶段切换附近缩短刷新间隔,或允许任务状态机更改策略调度。

在未完成的试验中独立扫描块和前缀。测量完成度、干预、指令不连续性和对移动物体的反应。在静态演示中得分较高的视界,当接触时间变化时可能失败,因为策略在物理事件转移后仍会持续记忆的片段。

演示需要时间上的对齐和多样性

遥操作日志将人类意图、摄像头帧、机器人状态和指令操作耦合。这些流之间的延迟可能会使策略反应迟到。保留原始时间戳,估算遥操作延迟,并定义动作标签是否代表期望或应用的机器人状态。根据文档规则,仅移除损坏样本。

收集物体姿态、接近、纠正和恢复的变化,而不仅仅是干净的名义成功。学习者无法推断如何从演示中缺失的状态恢复。平衡重复任务和操作符,避免最大会话占主导地位,并在分拆训练和评估数据时保持连续的事件。

低级别控制器负责塑造每个区块

预测的关节目标会通过插值、增益、转矩和运动限制。如果训练机器人使用不同的控制器速率或阻抗,同一数值块可能会产生不同的物理路径。保留控制器配置和测量应用时间戳与模型伪装。

机器人关节增益调节导引碰撞检测导轨进行坐标限制和跟踪检查。块是一个学习的参考序列,而非经过认证的运动原语。伺服层必须可预测地拒绝不可能或陈旧的指令。

失效模式可观察的症状隔离测试缓解措施
陈旧的观察纠正行动太晚了添加受控延迟缩短前缀或调度
区块边界跳跃命令不连续性重叠目标的剧情集合规则或过渡规则
控制器不匹配追踪与联系变更重复同样的目标匹配接口与增益
模平均无效中间动作检查贡献者结构化输出或选择
缺失的恢复数据复合漂移任务中扰动添加纠正示范

闭环扰动测试揭示了陈旧行为

在策略生成块后移动物体,调整抓取时机,添加一个小的顺应偏转,或暂时遮挡摄像头。测量机器人移动了多少毫秒,以及在应用动作发生变化之前的移动量。这比说系统频繁重新规划更有信息量。

测试推理超载和丢弃的观察值。决定是完成当前前缀、保留最后一个有界目标还是停止。排队旧块通常很危险,因为每个块都基于过时状态。使用序列标识符证明是哪个观察产生了每个应用命令。

评估需要进展和失败分类法

二元任务成功隐藏了策略在放置过程中是否达到、被抓取、解除或失败。定义可观察的里程碑,分类感知、错误物体、轨迹、接触、滑倒、暂停和保护性停止失败。即使操作员挽救了试验,也将人工干预计为结果。

报告匹配和偏移条件的试验计数和置信区间。在不同策略版本中重复相同的初始配置,并随机运行顺序以减少预热或操作员偏差。视频对复核非常有用,但需要同步的指令、状态和事件日志来测量延迟和边界行为。

复制是完整的执行合同的固定方式

ALOHA仓库提供与项目相关的硬件和学习代码。有效的复制品仍记录仓库的修订、数据集、摄像机转换、策略速率、区块大小、时间集合设置、动作单元和机器人控制器。

通过离线回放、受保护的硬件试验和逐步调整的测试来推动配置。保持固定的任务开始和干扰回归集。如果新块大小提升了平均完成度,但增加了碰撞或干预尾部,说明该变更并未带来整体更好的部署。

评估“机器人动作分块: ACT、时间集成与闭环执行”时,还应保存模型版本、机器人配置、标定文件、测试日期和全部试验记录。把成功、失败、恢复与人工介入放在同一份数据中,才能区分模型能力、系统接口和现场流程造成的差异。

成本评估除了设备与算力,还要记录数据采集、工程调试、安全措施、维护、停机和人员培训。只有把这些持续投入与单位成功任务的价值比较,才能判断方案是否适合扩大。

上线后仍要持续检查分布变化、传感器漂移、机械磨损和人工接管原因。监测结果应能触发降级、停止与重新验证流程,并为下一轮数据采集和模型更新留下可追溯记录。

  • 区分动作分块与ACT架构。
  • 记录预测、执行和查询时间。
  • 对应演示与物理时间戳对齐。
  • 测试重叠、陈旧的观察和推理超载。
  • 报告里程碑、干预措施和不确定性。

常见问题

ACT和所有行动分块策略一样吗?

不。 ACT是一种特殊的CVAE和变换器模仿学习方法。其他架构也可以预测和执行动作块。

机器人应该执行整个预测的片段吗?

不一定。许多系统在区块结束前会再次查询,或结合重叠的预测。安全的选择取决于延迟、任务动态和干扰。

时间集合是做什么的?

它结合了针对同一时间步长的多个预测,通常对较新的预测加权更强。它可以平滑更新,但也能平均不兼容模式。

动作分块和轨迹规划有何不同?

学习到的块可以从数据中预测动作。运动规划器通常在显式的运动学或碰撞模型中进行搜索。这两种模型都可能提供对控制器的引用,但它们的保证不同。

最重要的部署日志是什么?

观察捕获、推断开始和结束、预测序列、应用命令和机器人状态都集中在同一时间基。该日志暴露了陈旧和边界误差。

动作分块控制边界

动作区块是与机器人接口、控制器和数据分发绑定的学习指令序列。验证整个物理系统的时序、可行性、接触行为和保护反应。