로봇 실패를 모두 다시 수집하면 비용이 크고 같은 오류만 반복됩니다. 실패 마이닝은 rollout에서 실제 실패, 실패 직전 징후, 불확실하지만 성공한 장면과 새로운 상태를 후보로 모으고, 불확실성·새로움·영향·검토 비용을 함께 보고 다음 수집 순서를 정합니다. 액티브 러닝의 목표는 어려운 frame을 많이 모으는 것이 아니라 모델의 빈틈을 가장 잘 줄이는 episode를 고르는 것입니다.
아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.
실패 마이닝은 실패 frame 찾기가 아니라 원인과 문맥이 있는 episode 후보를 만드는 일이다
물체를 놓친 마지막 frame만 저장하면 잘못된 접근이 언제 시작됐는지 알 수 없습니다. 실패 전 관측·action·접촉 변화와 이후 정지·복구를 포함한 window를 후보 단위로 삼습니다.
로봇 VLA 평가의 성공률과 별도로 failure event schema를 둡니다. task outcome, near-miss, operator abort, safety stop과 quality reject를 구분해야 재수집 목표가 선명해집니다.
후보 풀에는 실제 실패뿐 아니라 불확실한 성공과 새로운 장면도 포함한다
정책이 우연히 성공했지만 action이 흔들리거나 confidence가 낮은 장면은 다음에는 실패할 수 있습니다. 반대로 이미 수천 번 본 동일 실패는 점수가 높아도 추가 정보가 적습니다.
RSS의 FAIL-Detect 논문 페이지는 성공 데이터만으로도 sequential OOD와 uncertainty를 이용해 runtime failure를 찾는 문제를 다룹니다. 실패 데이터가 없을 때 후보를 만드는 근거로 참고할 수 있습니다.
불확실성·새로움·영향도·비용을 한 점수로 섞기 전에 각각 보정한다
ensemble variance, action entropy, density score는 스케일이 다르고 task마다 calibration이 달라집니다. holdout에서 실제 failure probability와의 관계를 맞춘 뒤 percentile이나 rank로 결합합니다.
영향도는 충돌 위험, 제품 손상, cycle interruption과 downstream 재작업으로 정의하고, 비용은 사람 라벨 시간과 로봇 재수집 시간을 반영합니다. 높은 불확실성만 고르면 안전하지만 중요하지 않은 시각 변화가 큐를 차지할 수 있습니다.
| 신호 | 묻는 질문 | 장점 | 단독 사용 위험 |
|---|---|---|---|
| 불확실성 | 모델이 자신 없나 | 경계 상태 탐지 | 미보정 점수 |
| 새로움 | 기존 데이터와 다른가 | 분포 확장 | 쓸모없는 OOD |
| 영향도 | 실패 비용이 큰가 | 운영 우선순위 | 빈도 무시 |
| 중복·비용 | 새 정보 대비 비용은 | 예산 효율 | 희귀 고비용 누락 |
반복 자동화 장면에서는 마지막 오류보다 실패가 자라난 구간을 본다
사진과 같은 plate handling에서는 마지막 drop보다 접근 각도, clamp 시점, plate 유무 감지와 장비 정렬 변화가 먼저 나타납니다. event 전후 여러 센서의 timestamp를 맞춰 failure window를 만들고 session 환경도 보존합니다.
같은 실패처럼 보여도 fixture 이동, 물체 편차, 카메라 glare, gripper 마모 원인이 다를 수 있습니다. 영상만으로 분류하지 말고 force, state, maintenance와 calibration 기록을 연결합니다.

군집화는 비슷한 frame이 아니라 비슷한 실패 메커니즘을 묶는 데 쓴다
visual embedding만으로 cluster하면 배경이 같은 장면이 묶이고 서로 다른 접촉 실패가 섞일 수 있습니다. 관측 embedding, action, task phase, contact signal과 outcome을 결합하고 대표 episode를 사람이 검토합니다.
cluster size는 빈도를 보여 주지만 작은 cluster가 덜 중요하다는 뜻은 아닙니다. 희귀 안전 사건과 새 장비 상태는 작은 군집이라도 별도 quota로 보존합니다.
FAIL-Detect 같은 runtime 신호는 후보 생성기이지 자동 정답기가 아니다
FAIL-Detect 공식 프로젝트는 policy input·output에서 failure와 관련된 scalar signal을 만들고 conformal prediction으로 uncertainty를 다룹니다. 실제 시스템에서는 score가 후보를 제안하고 사람 또는 독립 outcome rule이 label을 확정하도록 합니다.
탐지기가 놓친 실패는 후보 풀에 들어오지 않는 selection bias를 만듭니다. task outcome, operator report, safety event와 정기 random sample을 병행해 탐지기의 사각지대를 추정합니다.
사람 검토는 대표 episode와 경계 사례에 집중한다
모든 후보를 순서대로 보는 대신 cluster medoid, 점수 상위, 서로 다른 모델이 불일치한 사례와 random control을 섞습니다. 검토자는 failure type, 시작 시점, 재수집 가능성, label confidence를 남깁니다.
Human-in-the-Loop 로봇 데이터의 intervention reason은 실패 마이닝 label의 중요한 근거가 됩니다. 다만 작업자 개입 성향 차이를 고려해 자동 실패와 사람 판단을 분리합니다.
hard negative는 실패와 닮았지만 정상인 장면을 반드시 포함한다
미끄럼처럼 보이는 정상 재파지, 충돌처럼 보이는 의도된 접촉을 실패로만 학습하면 탐지기가 현장 동작을 자주 멈춥니다. 실패 cluster마다 가까운 정상 episode를 함께 선택해 decision boundary를 가르칩니다.
false positive 비용도 기록합니다. 불필요한 중단, cycle time 손실과 operator alarm fatigue를 failure miss와 별도 축으로 최적화해야 합니다.
액티브 수집은 가장 불확실한 상태를 무작정 재현하지 않는다
로봇 액티브 러닝 원리 리뷰는 정보 획득과 물리 행동을 함께 다룰 때 안전 제약이 필요하다는 점을 설명합니다. 실제 로봇에서는 uncertainty query가 안전 envelope와 reset 가능성을 통과한 경우에만 실행됩니다.
위험한 실패는 simulation, 낮은 속도, soft object, safety fixture나 human demonstration으로 대체합니다. 정보량이 높다는 이유로 손상 가능성이 큰 상태를 현장에서 반복하지 않습니다.
재수집 예산은 cluster 다양성과 예상 성능 이득으로 배분한다
큰 cluster에만 비례 배분하면 이미 흔한 실패가 더 커지고, 모든 cluster에 균등 배분하면 중요하지 않은 noise에 예산이 샙니다. 최소 quota, 영향도, 정보량과 수집 비용을 결합합니다.
로봇 데이터 혼합 비율과 연결해 새 episode가 학습에서 실제로 얼마나 노출되는지 보장합니다. 수집만 하고 sampler가 거의 선택하지 않으면 폐루프가 닫히지 않습니다.
재학습 뒤에는 같은 후보 점수보다 보이지 않은 holdout 실패를 본다
마이닝한 cluster를 train과 test에 동시에 쓰면 모델이 대표 장면을 외운 효과를 일반화로 착각할 수 있습니다. session·object·site 단위로 unseen holdout을 만들고 기존 정상 성능도 함께 재시험합니다.
새 모델이 이전 failure cluster를 해결하면서 다른 오류를 만들 수 있으므로 before·after confusion matrix와 새로운 cluster 출현을 기록합니다. 큐가 비었다는 사실은 실패가 없다는 뜻이 아닙니다.

운영 루프는 후보·결정·데이터·모델·재시험의 계보를 남긴다
각 후보가 어떤 policy version과 session에서 나왔고, 누가 어떤 reason으로 선택·제외했으며, 어느 dataset version과 model run에 들어갔는지 연결합니다. 그래야 성능 개선과 데이터 비용을 추적할 수 있습니다.
로봇 데이터 버전과 계보 관리는 마이닝 큐의 재현성을 지키는 기반입니다. threshold 변경과 cluster model 버전도 결과의 일부로 고정합니다.
| 단계 | 산출물 | 검증 | 중단 조건 |
|---|---|---|---|
| 탐지 | candidate episode | miss·false alarm | score 미보정 |
| 선별 | cluster·priority | 대표성·중복 | 한 유형 편중 |
| 수집 | new labeled data | 안전·label confidence | 위험 재현 |
| 재시험 | holdout result | 기존·신규 failure | 정상 성능 역전 |
로봇 실패 마이닝과 액티브 러닝에서 자주 묻는 질문
실패한 episode는 모두 다시 학습에 넣어야 하나요?
아닙니다. 중복과 잘못된 label을 제거하고 불확실성·새로움·영향도·비용으로 우선순위를 정해 정보가 다른 대표 사례를 선택합니다.
모델 uncertainty가 높으면 실패라고 볼 수 있나요?
후보 신호일 뿐입니다. OOD이지만 안전한 장면도 있고 자신 있게 실패할 수도 있어 outcome rule, 사람 검토와 random audit가 필요합니다.
frame 단위로 마이닝하면 안 되나요?
실패의 원인과 시작 시점을 잃기 쉽습니다. 개입·접촉 변화 전후의 관측과 action을 포함한 episode window가 더 유용합니다.
액티브 러닝은 위험한 상태를 일부러 실행하나요?
정보량이 높아도 안전 envelope를 넘는 query는 실행하지 않습니다. simulation, 저속·fixture, 사람 시범 등 안전한 대체 수집 경로를 사용합니다.
재학습 효과는 어떻게 확인하나요?
마이닝에 사용하지 않은 session·object·site holdout에서 이전 실패와 새 실패를 평가하고 정상 작업 성능의 역전도 함께 봅니다.
실패 점수와 액티브 수집은 로봇 안전 시스템이 아닙니다. 위험 상태의 재현 여부는 승인된 위험성 평가, 보호 장치와 작업 절차가 결정해야 합니다.