动作分块要求机器人策略同时预测多个未来动作,而不是每个查询只做一个动作。一个连贯的块减少了长时间操作任务中高层决策的数量,并能保留演示中学到的运动结构。这也带来了一个新问题:在再次观察之前,应该信任多少该区块?
Transformers动作分块(ACT)是一种与ALOHA一同引入的特定模仿学习方法。 ACT使用条件变分自编码器和变换器组件,从图像和机器人状态预测动作序列。动作分块是更广泛的设计模式;并非所有分块策略都使用ACT、 CVAE或相同的时间集合。
将本指南与 扩散策略指南 及 机器人关节控制指南一起使用。将预测的块、应用于硬件的部分和下一次观测时间分别视为可测量的独立量。
动作区块缩短了有效决策时间
一个持续数千伺服周期的任务,当每个策略查询预测一个短轨迹段时,需要的高级选择会更少。段内的动作共享上下文,这可以减少独立一步预测带来的抖动,并帮助表示协调的双手或接触丰富的运动。
归约并非自由的。执行区块内的误差可能在下一次观测前累积。因此,分块将部分问题从每步预测转向视界选择和闭环调度。长预测可以作为上下文,而无需机器人以开环方式执行。

ACT就是一种具体的分块架构
官方 ALOHA项目 引入了ACT技术,用于预测细粒度双手操作的动作块。其策略结合了视觉和本体感觉输入,配合基于变换器的条件变分自编码器,在训练过程中使用潜在变量表示演示变异。
部署时, ACT通常使用确定性先验均值,而非请求演示样式标签。架构、摄像头编码器、潜在处理和动作规范化是必须钉顶的实现细节。报告的ALOHA任务和数据效率是该设置的证据,而非所有机器人的普遍成功保证。
预测时域、执行时域和查询时域彼此不同
区块长度是模型预测的未来动作数量。执行视野是系统替换前发送的次数,查询区间是新预测开始的时间。有些实现查询每个控制步骤并结合重叠;另一些实现执行前缀以减少推理负载。
每个视野都用步数和秒数表示。同一100步区块表示100 Hz为1秒, 10 Hz为10秒。还报告推断延迟,以及新预测是否与观测时间或计算结束时间对齐。
| 数量 | 定义 | 太短了 | 太长了 |
|---|---|---|---|
| 预测块 | 未来产生的行动 | 弱时间背景 | 未来未卜 |
| 执行前缀 | 替换前的操作 | 计算与抖动负载 | 缓慢扰动响应 |
| 查询区间 | 策略请求之间的时间 | 队列争用 | 陈旧的计划 |
| 观测历史 | 提供过往证据 | 模糊运动 | 记忆与旧背景 |
| 伺服周期 | 硬件目标更新 | 粗控 | 时序需求 |
时间集成融合重叠的预测结果
在 ACT论文中,频繁查询会产生多个预测,针对同一未来时间步。时间集合将这些重叠估计与偏向近期预测的权重结合起来。这可以在整合新观测值的同时平滑区块之间的变化。
平均作用并非总是中立的。笛卡尔旋转、离散夹持器状态和多模态替代方案需要在插值有意义的表示中。两种单独有效的策略可以平均成一个无效的中间值。记录贡献预测和权重,以便区分平滑失败与模型错误。

块长度遵循任务动态和接触
自由空间覆盖可能容忍比插入、抓握闭合或工具接触更长的前缀。根据预期扰动时间、相机帧率、推理尾延迟和底层控制器带宽选择动作时域。在阶段切换附近缩短刷新间隔,或允许任务状态机更改策略调度。
在未完成的试验中独立扫描块和前缀。测量完成度、干预、指令不连续性和对移动物体的反应。在静态演示中得分较高的视界,当接触时间变化时可能失败,因为策略在物理事件转移后仍会持续记忆的片段。
演示需要时间上的对齐和多样性
遥操作日志将人类意图、摄像头帧、机器人状态和指令操作耦合。这些流之间的延迟可能会使策略反应迟到。保留原始时间戳,估算遥操作延迟,并定义动作标签是否代表期望或应用的机器人状态。根据文档规则,仅移除损坏样本。
收集物体姿态、接近、纠正和恢复的变化,而不仅仅是干净的名义成功。学习者无法推断如何从演示中缺失的状态恢复。平衡重复任务和操作符,避免最大会话占主导地位,并在分拆训练和评估数据时保持连续的事件。
低级别控制器负责塑造每个区块
预测的关节目标会通过插值、增益、转矩和运动限制。如果训练机器人使用不同的控制器速率或阻抗,同一数值块可能会产生不同的物理路径。保留控制器配置和测量应用时间戳与模型伪装。
与 机器人关节增益调节导引 和 碰撞检测导轨进行坐标限制和跟踪检查。块是一个学习的参考序列,而非经过认证的运动原语。伺服层必须可预测地拒绝不可能或陈旧的指令。
| 失效模式 | 可观察的症状 | 隔离测试 | 缓解措施 |
|---|---|---|---|
| 陈旧的观察 | 纠正行动太晚了 | 添加受控延迟 | 缩短前缀或调度 |
| 区块边界跳跃 | 命令不连续性 | 重叠目标的剧情 | 集合规则或过渡规则 |
| 控制器不匹配 | 追踪与联系变更 | 重复同样的目标 | 匹配接口与增益 |
| 模平均 | 无效中间动作 | 检查贡献者 | 结构化输出或选择 |
| 缺失的恢复数据 | 复合漂移 | 任务中扰动 | 添加纠正示范 |
闭环扰动测试揭示了陈旧行为
在策略生成块后移动物体,调整抓取时机,添加一个小的顺应偏转,或暂时遮挡摄像头。测量机器人移动了多少毫秒,以及在应用动作发生变化之前的移动量。这比说系统频繁重新规划更有信息量。
测试推理超载和丢弃的观察值。决定是完成当前前缀、保留最后一个有界目标还是停止。排队旧块通常很危险,因为每个块都基于过时状态。使用序列标识符证明是哪个观察产生了每个应用命令。
评估需要进展和失败分类法
二元任务成功隐藏了策略在放置过程中是否达到、被抓取、解除或失败。定义可观察的里程碑,分类感知、错误物体、轨迹、接触、滑倒、暂停和保护性停止失败。即使操作员挽救了试验,也将人工干预计为结果。
报告匹配和偏移条件的试验计数和置信区间。在不同策略版本中重复相同的初始配置,并随机运行顺序以减少预热或操作员偏差。视频对复核非常有用,但需要同步的指令、状态和事件日志来测量延迟和边界行为。
复制是完整的执行合同的固定方式
ALOHA仓库提供与项目相关的硬件和学习代码。有效的复制品仍记录仓库的修订、数据集、摄像机转换、策略速率、区块大小、时间集合设置、动作单元和机器人控制器。
通过离线回放、受保护的硬件试验和逐步调整的测试来推动配置。保持固定的任务开始和干扰回归集。如果新块大小提升了平均完成度,但增加了碰撞或干预尾部,说明该变更并未带来整体更好的部署。
评估“机器人动作分块: ACT、时间集成与闭环执行”时,还应保存模型版本、机器人配置、标定文件、测试日期和全部试验记录。把成功、失败、恢复与人工介入放在同一份数据中,才能区分模型能力、系统接口和现场流程造成的差异。
成本评估除了设备与算力,还要记录数据采集、工程调试、安全措施、维护、停机和人员培训。只有把这些持续投入与单位成功任务的价值比较,才能判断方案是否适合扩大。
上线后仍要持续检查分布变化、传感器漂移、机械磨损和人工接管原因。监测结果应能触发降级、停止与重新验证流程,并为下一轮数据采集和模型更新留下可追溯记录。
- 区分动作分块与ACT架构。
- 记录预测、执行和查询时间。
- 对应演示与物理时间戳对齐。
- 测试重叠、陈旧的观察和推理超载。
- 报告里程碑、干预措施和不确定性。
常见问题
ACT和所有行动分块策略一样吗?
不。 ACT是一种特殊的CVAE和变换器模仿学习方法。其他架构也可以预测和执行动作块。
机器人应该执行整个预测的片段吗?
不一定。许多系统在区块结束前会再次查询,或结合重叠的预测。安全的选择取决于延迟、任务动态和干扰。
时间集合是做什么的?
它结合了针对同一时间步长的多个预测,通常对较新的预测加权更强。它可以平滑更新,但也能平均不兼容模式。
动作分块和轨迹规划有何不同?
学习到的块可以从数据中预测动作。运动规划器通常在显式的运动学或碰撞模型中进行搜索。这两种模型都可能提供对控制器的引用,但它们的保证不同。
最重要的部署日志是什么?
观察捕获、推断开始和结束、预测序列、应用命令和机器人状态都集中在同一时间基。该日志暴露了陈旧和边界误差。
动作分块控制边界
动作区块是与机器人接口、控制器和数据分发绑定的学习指令序列。验证整个物理系统的时序、可行性、接触行为和保护反应。