Human-in-the-Loop 데이터는 처음부터 사람이 조종한 시범과 다릅니다. 로봇이 자율 실행하다 실패 직전 사람이 takeover한 순간에는 정책이 어떤 상태까지 스스로 갔고, 왜 개입했으며, 어떤 교정으로 다시 자율 상태에 돌아왔는지가 들어 있습니다. 이 경계를 보존해야 사람 개입이 단순 성공 시범이 아니라 실패 예측과 복구 학습 자료가 됩니다.
아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.
개입 데이터는 시범이 아니라 정책이 어려워한 상태에서 나온 교정이다
처음부터 사람이 조종한 teleoperation은 전문가 분포를 보여 주지만, 자율 정책이 실제로 들어가는 잘못된 상태를 충분히 포함하지 않을 수 있습니다. intervention은 정책 rollout 위에서 발생하므로 분포 이탈과 실패 전조를 직접 담습니다.
로봇 원격조작 데이터와 저장 형식을 공유할 수 있어도 provenance를 구분해야 합니다. episode 시작부터 사람인지, 정책에서 takeover했는지, 어느 시점에 다시 넘겼는지가 학습 의미를 바꿉니다.
takeover 버튼보다 먼저 개입 판단과 제어권 상태를 정의한다
사람이 위험을 보자마자 개입하는지, 실패가 확실할 때만 개입하는지 운영 규칙이 다르면 데이터 분포도 달라집니다. 안전 위험, 작업 실패, 품질 저하, 시간 초과처럼 trigger reason을 제한된 taxonomy로 기록합니다.
Sirius 공식 프로젝트는 사람이 복잡한 상황에서 개입하고 실행 데이터를 다시 정책 개선에 쓰는 human-in-the-loop autonomy를 보여 줍니다. 핵심은 사람 행동만이 아니라 개입 전후 정책 transition을 함께 남기는 것입니다.
episode에는 자율·개입 전·교정·복귀 구간이 끊기지 않아야 한다
개입 action만 별도 파일로 저장하면 어떤 오류를 고쳤는지 알 수 없습니다. 최소한 개입 전 관측 window, 정책 action, takeover event, 사람 action, release event와 이후 outcome을 하나의 monotonic timestamp로 연결합니다.
제어권 상태는 AUTO, PENDING, HUMAN, RETURN과 같이 명시합니다. 입력 장치 신호가 들어왔지만 로봇에 적용되기 전의 통신·안전 필터 지연도 분리해야 사람 action과 실제 실행 action을 혼동하지 않습니다.
| 구간 | 필수 기록 | 학습에 쓰는 의미 | 누락 시 문제 |
|---|---|---|---|
| 자율 | policy action·state | 정상 문맥 | 개입 원인 소실 |
| 개입 전 | risk signal·latency | 실패 전조 | 너무 늦은 label |
| 교정 | human·executed action | 복구 목표 | 안전 필터 효과 혼입 |
| 복귀 | handoff·outcome | 복구 성공 여부 | 재실패 구분 불가 |
사람이 로봇 가까이 있는 현장에서는 데이터 수집과 안전 절차를 분리한다
사진처럼 작업자가 물리 장비를 가까이서 감독하는 경우 개입 UI가 있어도 안전 기능을 대신하지 않습니다. 비상정지, 속도·힘 제한, 작업공간 분리와 안전 감시가 독립적으로 동작해야 합니다.
사람 action이 안전 필터에 잘렸다면 원래 입력과 실제 적용 명령을 둘 다 저장합니다. 그렇지 않으면 모델은 실행되지 않은 위험 명령을 정답으로 배우거나 필터가 만든 결과를 사람 판단으로 오해합니다.

개입 지연은 사람의 판단 시간과 시스템 전달 시간을 나눠 측정한다
위험 장면 발생부터 사람이 판단하기까지의 시간, 버튼 입력부터 제어권 전환까지의 시간, 사람 명령이 actuator에 적용되기까지의 시간을 나눕니다. 하나의 takeover timestamp만으로는 늦은 개입 원인을 찾기 어렵습니다.
학습 label을 개입 시점 한 frame에만 두면 이미 실패가 진행된 상태를 놓칩니다. task와 속도에 맞는 pre-intervention window를 포함하되 정상 장면까지 모두 위험으로 표시하지 않도록 사람 검토와 민감도 분석이 필요합니다.
HIL-SERL은 개입을 시범 버퍼와 RL 경험에 다르게 연결한다
HIL-SERL 공식 프로젝트는 자율 RL 중 사람이 필요한 순간 corrective action을 제공하고 개입 데이터를 demonstration과 RL buffer에 활용합니다. 학습이 나아질수록 개입 빈도를 줄이는 운영도 설명합니다.
이 설계를 그대로 복사하기보다 intervention transition, policy transition, reward label이 어느 buffer에 들어가는지 명세합니다. 같은 frame을 여러 버퍼에서 반복 사용할 때 sampling weight도 기록해야 합니다.
개입 이유와 교정 목표는 action만으로 복원되지 않는다
사람이 같은 왼쪽 이동을 입력해도 충돌 회피, 재파지, 시야 확보, 관절 한계 회피 중 무엇을 고친 것인지 다를 수 있습니다. 짧은 reason code와 target subgoal을 저장하면 실패 유형별 학습과 평가가 가능합니다.
자유 텍스트는 풍부하지만 일관성이 낮으므로 taxonomy와 선택형 label을 기본으로 하고 필요한 경우 메모를 추가합니다. 작업자가 여러 명이면 label guide와 교차 검토 표본을 둡니다.
복귀 시점은 사람이 손을 뗀 순간이 아니라 정책이 다시 감당할 수 있는 상태다
입력 장치가 0으로 돌아왔다고 즉시 AUTO로 넘기면 로봇이 아직 어려운 접촉 상태에서 다시 실패할 수 있습니다. 안정 pose, object state, gripper 상태, confidence와 최소 유지시간을 만족할 때 handoff합니다.
로봇 VLA 평가에서는 intervention count뿐 아니라 개입 후 autonomous completion, 같은 유형 재개입, cycle time과 품질을 측정합니다. 사람이 끝까지 수행한 성공은 자율 성공과 분리합니다.
학습 sampler는 개입 구간을 강조하되 전체 정상 분포를 잃지 않게 한다
개입 frame이 적다고 수백 배 반복하면 모델이 모든 장면에서 사람식 급한 교정을 내놓을 수 있습니다. 정상 자율 구간, pre-intervention, correction, recovery를 별도 도메인으로 두고 가중치와 반복 상한을 검증합니다.
로봇 데이터 혼합 비율의 worst-domain 평가를 적용하면 rare failure를 보존하면서 정상 작업 성능의 역전을 찾을 수 있습니다. operator별 편향도 domain으로 분리합니다.
개입 횟수 감소만으로 정책 개선을 판단하지 않는다
사람이 피로하거나 위험을 놓쳐 개입이 줄 수도 있고 정책이 더 느리게 움직여 위험을 피한 것처럼 보일 수도 있습니다. task success, quality, near-miss, cycle time, operator workload와 intervention latency를 함께 봅니다.
Sirius 원 논문은 사람 신뢰를 근사해 training sample을 재가중하는 접근을 설명합니다. 자체 현장에서는 사람마다 개입 기준이 다르다는 한계를 포함해 검증해야 합니다.
표본 검수는 개입 전후 영상을 한 번에 재생해야 한다
개입 action CSV만 보면 trigger가 타당했는지 알 수 없습니다. 개입 전 몇 초, 교정, release 이후를 영상·state·policy action·human action과 함께 재생해 잘못된 timestamp와 불필요한 takeover를 찾습니다.
실패 label은 사람 판단이므로 주기적으로 blind review를 합니다. 같은 장면에 대한 operator 간 일치도와 reason code 혼동을 보고 label guide를 수정합니다.

운영 합격 기준은 안전한 개입과 자율 복귀, 학습 이득을 따로 둔다
수집 시스템은 제어권 전환 실패가 없어야 하고, 데이터는 모든 transition을 재현해야 하며, 학습 결과는 unseen task condition에서 자율 성공을 높여야 합니다. 세 층을 하나의 성공률로 합치지 않습니다.
로봇 데이터 팩토리에는 intervention session, operator, policy version, safety filter와 dataset version을 연결합니다. 어느 정책에서 나온 개입인지 빠지면 개선 전후 분포를 비교할 수 없습니다.
| 층 | 지표 | 합격 기준 | 주의 |
|---|---|---|---|
| 제어권 | takeover·return latency | 누락·이중 명령 없음 | UI 성공과 안전 동일시 금지 |
| 데이터 | context·reason·outcome | episode 재생 가능 | 개입 clip만 저장 금지 |
| 운영 | intervention·near-miss | 위험과 workload 감소 | 횟수 단독 해석 금지 |
| 학습 | autonomous success | 미관측 조건 개선 | 사람 완수 성공 분리 |
Human-in-the-Loop 로봇 데이터에서 자주 묻는 질문
Human-in-the-Loop 데이터와 teleoperation 시범은 같은가요?
아닙니다. intervention은 정책이 자율 실행한 상태에서 사람이 takeover한 교정이며 개입 전 정책 문맥과 복귀 결과가 핵심입니다.
개입한 몇 초만 저장하면 되나요?
개입 전 위험 징후, 정책 action, 사람 action, 실제 적용 명령과 이후 outcome을 같은 episode로 저장해야 실패 원인과 복구 효과를 학습할 수 있습니다.
개입 횟수가 줄면 정책이 좋아진 것인가요?
항상 그렇지 않습니다. 작업 성공·품질·near-miss·cycle time과 작업자 workload를 함께 봐야 피로나 느린 동작으로 인한 착시를 피할 수 있습니다.
사람 action을 그대로 정답으로 쓰면 되나요?
안전 필터에 잘린 명령이나 지연된 교정을 구분해야 합니다. 원래 입력, 실제 적용 action과 개입 이유를 함께 저장하고 표본 검토가 필요합니다.
언제 자율 모드로 돌려보내야 하나요?
작업자가 손을 뗀 순간보다 정책이 감당 가능한 안정 pose·object·gripper 상태와 confidence 조건을 만족할 때 handoff합니다.
사람 개입 학습은 산업 안전 기능이나 위험성 평가를 대신하지 않습니다. 작업자 보호, 비상정지, 속도·힘 제한과 승인된 운전 절차는 학습 파이프라인과 독립적으로 유지해야 합니다.