机器人动作令牌化将连续命令映射到序列模型可预测的符号中。编码可能使用均匀箱、分位数箱、学习码本或压缩序列,但每个选项都会引入一个契约,涵盖单位、区间、归一化、时间视界和解码。
令牌精度并非操作目标。单箱误差对一个节点来说接近零可能无害,但对另一个节点近接触时不安全,而截尾则可能因总损耗而消失。评估物理单元及目标控制器的重建。
本指南应与 VLA 指南 及 机器人动作分块指南一起使用。将分词器和训练统计数据作为模型依赖纳入版本管理。
先定义连续行动契约
列出每个维度,包括命令数量、坐标系、单位、符号、有效范围、控制速率和执行器掩膜。关节位置、关节速度、笛卡尔δ、夹持器状态和移动基座扭转不能安全地共享分词器,除非有明确语义。
记录动作是绝对的还是相对的,以及积分发生的位置。两个七个数字的数组可以解码为在不同控制器下完全不同的运动。

有意识地选择均匀或分位数的箱
均匀分箱保持相等的物理间距,使最大量化误差易于解释,但它们可能会浪费词汇量在很少使用的范围内。分位数分组为每个标记分配相似的训练频率,提高利用率,同时使物理分辨率不均匀。
仅拟合训练数据的箱边并发布。比较不同维度和操作区域的解码错误,而不仅仅是词汇困惑度。
| 编码 | 实力 | 主要风险 | 必须进行的审计 |
|---|---|---|---|
| 连续回归 | 直接物理输出 | 音阶失衡 | 单位误差 |
| 均匀分箱 | 固定物理分辨率 | 稀疏尾部标记 | 覆盖与剪辑 |
| 分位数箱 | 平衡令牌频率 | 物理误差不均 | 箱宽 |
| 学习码本 | 捕捉相关性 | 死代码或不稳定码 | 使用与解码漂移 |
| 序列压缩 | 行动标记减少 | 边界伪影 | 重建与延迟 |
将削波视为测量的失效模式
超出拟合范围的值通常会被裁剪到第一个或最后一个令牌上。这样可以保持张量形状的有效性,同时将不同的极端命令转换成同一符号,并隐藏因令牌丢失引起的分布偏移。
按维度计算对数裁剪率、大小及任务上下文。当尾部行为频繁且重要时,扩展范围、变换分布或拒绝部署。
以物理单位计量重构
在训练策略前,通过标记器解码真值动作。报告关节角度、速度、末端执行器姿态、夹持器和移动基座的实际控制率错误。包含最大值和高百分位数值,而不仅仅是平均值。
将重建序列通过运动学和控制器极限运行。小的分量误差可能累积成块块上的大型笛卡尔漂移或接触力变化。
将令牌化与动作分块区分开
分词表示值或序列;动作分块预测未来命令的范围,并选择它们的执行或组合方式。模型可以使用连续区块、离散每步令牌或压缩区块令牌。
将令牌计数、区块视野、重叠、时序系综和远视界行为作为独立的实验变量。否则延迟或成功的变化不能归因于编码器。

预算词汇和序列长度结合
更多的箱可以减少标量量化误差,同时增加词汇量或预测难度。分别编码每个维度和时间步长可以使动作标记计数乘以维度和视野,减少视觉或语言上下文的空间,增加解码延迟。
测量端到端提示长度、生成令牌数量、首次动作延迟和控制截止时间。只有当其重建足够满足任务需求时,紧凑表示才有用。
理解FAST为时间动作压缩
FAST论文提出了频率空间动作序列分词,并报告了其评估机器人数据集和模型中压缩和训练行为的改进。相关的RSS论文提供了同行评审的方法背景。
FAST 并不等同于动作分块。它以紧凑的方式编码序列,而策略仍需对目标机器人进行评估的地平线、解码器和执行规则。
将规范化绑定到分词器
许多管道在分组或回归前对动作维度进行规范化。每个数据集、每个机器人或全局统计数据会改变令牌边界和解码幅度,因此同一令牌标识符在没有统计数据的情况下没有稳定的物理意义。
使用 交叉身体规范化指南,将共享语义与机器人特有尺度区分开来。用检查点冻结遮罩、分位数、裁剪策略和逆变换。
明确处理夹持器与混合动作类型
二进制夹持器命令不应像平滑关节一样量化。混合动作可以结合类别模式、连续运动和终止信号,每种信号都带有相应语义的丢失和解码器。
审计稀有模式令牌和冲突演示。经常正确的手臂轨迹配合延迟或反向握把令牌,仍可能在整个操作过程中失败。
比较合同研究实施
RT-1在其报告的变换器策略中使用了令牌化的机器人动作, RT-2 则在所研究的视觉-语言-动作设置中以文本令牌表示机器人动作。 OpenVLA仓库 记录了一个独立的实现和动作-令牌接口。
不要按名称在系统间传输箱数、范围或解码假设。检查已发布的代码和检查点特定统计数据,然后在本地重现目标动作合同。
测试延迟、饱和度和硬件回放
在部署硬件上进行基准标记化和自回归解码,结合真实上下文长度。在启用动作前,测量中位数和尾端延迟、错过控制截止时间、解码失败和饱和。
在策略输出前,在仿真或受保护的硬件模式下重放重建的真值命令。比较连续基线、编码的真值值和学习到的预测,以确保标记器误差依然可见。
| 层 | 度规 | 警告 | 反响 |
|---|---|---|---|
| 覆盖范围 | 尾翼和削波率 | 命令饱和 | 改装范围 |
| 重建 | 物理单位误差 | 任务尺度漂移 | 调整分箱 |
| 序列 | 每个预测时域的词元数 | 上下文或延迟尖峰 | 压缩 |
| 控制器 | 限额与截止日期事件 | 无效执行 | 固定合同 |
| 任务 | 成功与安全边际 | 代币评分误导 | 拒绝释放 |
发布完整的代币化捆绑包
包含分词器版本、词汇表、箱边或码本、规范化统计、动作掩码、单位、帧、控制率、地平线、译码器代码和校验和。没有这些伪影的检查点不是可复现的机器人策略。
关闭发布审查,需进行以下检查。
评估“机器人动作词元化:从连续控制到离散编码”时,还应保存模型版本、机器人配置、标定文件、测试日期和全部试验记录。把成功、失败、恢复与人工介入放在同一份数据中,才能区分模型能力、系统接口和现场流程造成的差异。
成本评估除了设备与算力,还要记录数据采集、工程调试、安全措施、维护、停机和人员培训。只有把这些持续投入与单位成功任务的价值比较,才能判断方案是否适合扩大。
上线后仍要持续检查分布变化、传感器漂移、机械磨损和人工接管原因。监测结果应能触发降级、停止与重新验证流程,并为下一轮数据采集和模型更新留下可追溯记录。
最终结论应明确写出已知限制、尚未验证的场景和下一项可证伪的实验,使后续团队能够沿着证据继续推进。
实际项目还应指定数据、模型、控制器和安全流程的负责人,并预先定义回滚条件。责任边界、审批记录与变更日志越清楚,故障发生后越容易停止扩散、定位原因并安全恢复。
把任务拆成感知、决策、动作执行和结果确认,可以更准确地定位瓶颈。每一阶段都应有独立指标与失败示例,避免用端到端成功率掩盖偶发但严重的风险。
引用的产品规格、论文结果和监管要求需要记录发布日期与适用版本。资料更新后应重新核对关键结论;无法从一手来源确认的内容,应明确标注为待验证信息。
小规模试点的价值在于提前暴露接口、人员协作和异常处理问题。试点结束后应依据预设门槛决定扩大、修改或停止,而不是因为已经投入资源就默认继续。
所有结论都应能够追溯到原始记录,并可复核。
硬件与软件接口应分别记录单位、坐标系、时钟、延迟和允许范围,并通过自动测试检查不一致。接口定义变化时,旧数据和旧控制参数不能在未经验证的情况下直接复用。
- 记录每一个动作维度和框架。
- 只针对训练数据拟合令牌范围。
- 报告削波和解码的物理错误。
- 测量令牌数量和尾部延迟。
- 在硬件发布前重放原装解码器。
常见问题
离散动作令牌比连续回归更好吗?
两者都不是普遍的;比较物理重建、策略学习、延迟和任务结果在匹配条件下的情况。
每个动作维度应该使用多少个箱子?
从可接受的物理误差、观测覆盖率和模型容量中选择,然后按维度和任务区域进行验证。
FAST和动作分块是一样的吗?
不。 FAST压缩动作序列;分块定义预测和执行视野。
训练后可以重新计算分词器的统计数据吗?
没有重新验证,因为变化的区间或分位数改变了代币的物理含义,这就不安全了。
用代币化动作模型应该存储什么?
存储词汇、边或码本、规范化、掩码、帧和单位约定、地平线、解码器和校验和。
动作编码与重建边界
动作标记器是机器人控制界面的一部分。通过解码的物理运动、控制器时序和任务结果来评估,而不仅仅是代币丢失。