人机介入数据来自自主部署,人员监控行为,在困难或不安全状态下接管,纠正轨迹,并可能将控制权交还。它不同于从一开始就由人为控制的离线遥操作示教。
其价值在于策略诱导状态和恢复背景。记录必须包括接管前的观察、控制权、人为行为、干预理由、回归决策以及后续自主结果,这些都是在同一连续时间线上的。
将本指南与 遥操作数据指南 及 机器人评估指南结合使用。保持职业安全与机器安全控制独立于学习循环。
干预与全面演示分开
演示样本由人工操作员选择状态。干预样本示例显示策略在操作员决定需要帮助前访问的状态。这些分布支持不同的学习问题,并应带有不同的标签。
保留修正前后自主操作。移除它们会使事件变成一个孤立的人力片段,丢失关于接管原因及回传是否成功的证据。

将控制权定义为状态机
有用的状态包括自主、警告、请求接管、人控、请求回交、自主确认和紧急停止。仅靠按钮边缘无法显示机器人是否接受请求或哪个命令到达了执行器。
记录仲裁输出和执行器命令,而不仅仅是策略和操作员提案。当网络中断、死人开关或安全控制器与请求模式冲突时,定义优先级。
| 阶段 | 必修记录 | 主要问题 | 失效风险 |
|---|---|---|---|
| 自治 | 策略观察与行动 | 是什么导致了麻烦? | 缺失的前身 |
| 收购 | 请求时间与有效控制时间 | 权限转移多晚? | 延迟 |
| 更正 | 人类行为与意图 | 尝试了哪些回收? | 模糊标签 |
| 回溯 | 门与州信任 | 策略现在能应付吗? | 立即复发 |
| 结果 | 任务、安全与干预结果 | 恢复有效吗? | 摘材 |
保留干预前的上下文
在接管前缓冲几秒或与任务相关的时间窗口,使数据集包含前置提示、策略操作和进度损失。正确的窗口取决于任务动态和动作时域,而非固定的帧数。
存储同步视频、机器人状态、指令、强制、模式和事件时间。人工决策可能依赖于模型输入当前不包含的证据。
衡量决策与系统接管延迟
操作员在接口、网络、仲裁和控制器延迟中感知和决策的时间是分开的。物理机器人在任一间隔内都可以进行较长的移动,从而改变人类实际接收到的状态。
记录请求、确认、首次有效人工指令和可测量响应。根据真实的延迟后状态进行训练,而不是假设纠正从按下按钮时就开始。
记录干预原因和恢复意图
仅凭动作序列很少能解释操作者是否预防了碰撞、纠正了对齐、改善抓握或对不确定性作出了反应。使用受控原因分类法,加上可选的注释和信心。
理由支持过滤和评估,但应与经过验证的根本原因分开。操作员的判断可能不完整或不一致。

从干预中学习,但不要复制所有行为
Sirius项目利用干预信号在人工循环部署框架中重新加权样本。结果是一种特定的研究方法,包含报告的任务和硬件,而非每个干预帧应获得最大权重的通用规则。
比较行为克隆、干预加权及其他匹配数据更新情况。人类矫正可能被遥操作接口延迟、次优或受限。
保持在线强化学习的范围明确
HIL-SERL项目结合了演示、二元奖励分类器、在线强化学习和人类干预。其项目页面描述了随着策略改进,在报告的操作任务中减少干预。
不要将奖励示例、示范缓冲区、干预措施和自主经验合并到一个无标签数据集中。它们的作用和选择偏差各不相同。
来自可管理策略状态的门回交
回交应在机器人稳定、无碰撞且处于策略可处理的状态分布范围内进行。当操作员停止移动时释放控制,可以在未解决的接触或对齐不良时恢复自主性。
要求确认并监控第一个自主视野。允许立即重新接管而不丢失过渡历史。
样本干预措施而不抹除正常行为
干预窗口罕见且有价值,因此过采样很常见。过度加权可能导致策略模拟正常状态下的恢复动作,或过度拟合某操作员的习惯。
使用 数据集混合指南,保留正常的自主、成功恢复和硬负样本。按阶段报告有效暴露情况。
评估干预数量
干预减少意味着更高的自主性,但也意味着操作员更宽容,漏掉危险或任务提前结束。报告自主成功、不安全事件、工作量、决策延迟、纠正时间、复发率和任务质量。
运行固定策略独立评估,无需隐藏辅助。将收集者的安全支持与策略的自主能力分离。
带模式叠加的完整回合回顾
同时回放视频、状态、策略动作、人工操作、有效指挥和权威状态。检查边界对齐情况、丢包情况,以及操作员本打算接管但机器人因其他原因停止的情况。
示例为非干预事件、虚假接管事件以及值得庆祝的恢复事件。维护运营商数据的隐私和员工治理。
| 度规 | 措施 | 需要分母 | 误导性的捷径 |
|---|---|---|---|
| 干预率 | 操作员工作量 | 所有符合条件的推广 | 原始计数 |
| 接管延迟 | 控制转移 | 请求事件 | 仅按键时间戳 |
| 纠正成功 | 立即恢复 | 已完成的干预措施 | 漂亮的片段 |
| 复发率 | 回传质量 | 自治返回 | 第一个安全框架 |
| 自主成功 | 策略能力 | 固定方案试验 | 辅助完成 |
与干预数据合同一起释放
文档权威状态、触发策略、延迟、观察缓冲区、动作通道、原因分类法、回传门、安全控制、采样器和评估协议。将每个训练示例与其原始的持续推广链接。
通过以下清单进行验证。
评估“人在回路的机器人干预数据”时,还应保存模型版本、机器人配置、标定文件、测试日期和全部试验记录。把成功、失败、恢复与人工介入放在同一份数据中,才能区分模型能力、系统接口和现场流程造成的差异。
成本评估除了设备与算力,还要记录数据采集、工程调试、安全措施、维护、停机和人员培训。只有把这些持续投入与单位成功任务的价值比较,才能判断方案是否适合扩大。
上线后仍要持续检查分布变化、传感器漂移、机械磨损和人工接管原因。监测结果应能触发降级、停止与重新验证流程,并为下一轮数据采集和模型更新留下可追溯记录。
最终结论应明确写出已知限制、尚未验证的场景和下一项可证伪的实验,使后续团队能够沿着证据继续推进。
实际项目还应指定数据、模型、控制器和安全流程的负责人,并预先定义回滚条件。责任边界、审批记录与变更日志越清楚,故障发生后越容易停止扩散、定位原因并安全恢复。
把任务拆成感知、决策、动作执行和结果确认,可以更准确地定位瓶颈。每一阶段都应有独立指标与失败示例,避免用端到端成功率掩盖偶发但严重的风险。
引用的产品规格、论文结果和监管要求需要记录发布日期与适用版本。资料更新后应重新核对关键结论;无法从一手来源确认的内容,应明确标注为待验证信息。
小规模试点的价值在于提前暴露接口、人员协作和异常处理问题。试点结束后应依据预设门槛决定扩大、修改或停止,而不是因为已经投入资源就默认继续。
所有结论都应能够追溯到原始记录,并可复核。
硬件与软件接口应分别记录单位、坐标系、时钟、延迟和允许范围,并通过自动测试检查不一致。接口定义变化时,旧数据和旧控制参数不能在未经验证的情况下直接复用。
异常测试应覆盖断电、通信丢失、传感器失真、对象滑移和人员进入工作区等情形。系统不仅要发现异常,还应以可预测的方式减速、停止或请求人工确认。
维护计划需要把检查周期、易损件、备件、校准和软件更新纳入同一套记录。若维护成本或停机时间持续上升,应重新评估系统设计,而不是只提高操作人员负担。
报告平均值之外,还应公开最差结果、分布尾部和失败视频或日志索引。对安全关键任务而言,少数严重失败往往比平均性能更能决定是否可以部署。
- 在接管前记录自主上下文。
- 测量有效的控制转移和物理响应。
- 存储纠正的原因、目标和结果。
- 从可管理的策略状态进行门禁回传。
- 分别评估自主性、安全和学习收益。
常见问题
干预数据和遥操作示教数据是一样的吗?
不是。这些数据是在自主执行期间收集的,尤其是在有人决定策略需要修正的州。
只能节省几秒干预时间吗?
不。保留前兆、接管、修正、回归及后续结果在同一集同步时间线上。
干预次数减少是否代表改善?
不。它要配合固定协议的自主性、安全、工作量和未发生事件指标。
每一个人类行为都应该被视为真实的事实吗?
不。人工修正可能延迟、界面限制或次优,需要上下文标签和评估。
什么时候应该恢复控制权?
只有在显式门确认策略能够管理的稳定状态并确认回传后。
控制-权限与自主回传边界
干预数据既是控制权追踪,也是训练样本。保留导致接管的状态以及自主回归安全的证据。