로봇 보상 모델: 사람 평가와 영상으로 좋은 행동을 학습 신호로 만드는 방법

로봇 보상 모델은 성공 라벨을 직접 쓰기 어려운 작업에서 사람이 두 궤적 중 더 나은 행동을 고르거나 시범 영상의 진행 상태를 제공하면, 관측·행동·시간 구간에 점수를 주는 함수를 학습하는 방법입니다. 쌍대 선호·스칼라·밀집 보상을 구분하고 평가자 일치도, 분포 밖 calibration과 reward hacking을 실제 작업 성공으로 검증해야 합니다.

아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.

로봇 보상 모델은 사람이 판단한 행동 품질을 관측·행동 궤적의 점수 함수로 근사한다

성공 여부를 센서 규칙 하나로 쓰기 어려우면 사람에게 두 영상 중 어느 쪽이 목표에 더 가까운지 묻거나 각 구간의 진행도를 평가하게 합니다. 모델은 그 라벨로 clip 또는 trajectory score를 예측하고 정책 학습·데이터 순위화·실패 탐색에 사용됩니다.

사람 개입 로봇 데이터는 위험 순간 사람이 조작을 넘겨받은 행동 기록이고, 보상 모델은 사람의 평가를 점수 함수로 학습하는 문제입니다. 개입 시각을 negative signal로 활용할 수 있지만 개입하지 않은 모든 구간이 좋은 행동이라는 뜻은 아닙니다.

규칙 보상으로 쓰기 힘든 섬세한 품질을 비교 질문으로 바꿀 수 있다

천을 펴거나 물체를 보기 좋게 정렬하는 작업은 성공 임계값을 정하기 어렵지만 사람은 두 결과를 비교하기 쉽습니다. absolute 1~5 점수보다 A가 B보다 낫다, 비슷하다, 판단 불가를 고르게 하면 평가자마다 점수 척도가 다른 문제를 줄일 수 있습니다.

Deep Reinforcement Learning from Human Preferences 원 논문은 짧은 행동 clip의 인간 선호로 보상 함수를 학습하고 정책을 최적화하는 틀을 제시했습니다. 로봇에서는 물리 안전과 데이터 비용 때문에 실제 시스템의 별도 검증이 더 필요합니다.

pairwise·rating·progress label은 답하는 질문과 시간 해상도가 다르다

pairwise preference는 상대 순위에 강하지만 절대 합격선을 직접 주지 않습니다. scalar rating은 임계값을 만들기 쉽지만 평가자 scale 차이가 크고, video progress는 시작에서 목표까지 얼마나 진행했는지 촘촘한 신호를 주지만 잘못된 지름길을 보상할 수 있습니다.

선택은 정책 알고리즘보다 먼저 운영 질문에 맞춥니다. 좋은 궤적을 고르는 reranking에는 pairwise, 종료 판정에는 calibrated scalar, 긴 작업의 중간 신호에는 progress를 쓰고 동일 데이터에 모든 역할을 억지로 맡기지 않습니다.

라벨사람 질문강점주요 편향
pairwiseA와 B 중 더 나은 것상대 비교둘 다 나쁨 은폐
rating1~5 품질절대 임계값평가자 scale
progress목표까지 진행도밀집 신호지름길 보상
intervention언제 넘겨받았나위험 구간미개입=성공 아님

사람 피드백은 화면 밖 힘·지연·위험까지 포함할 수 있어 평가 인터페이스가 중요하다

사진의 Haptics-2처럼 원격 조작자는 영상뿐 아니라 force feedback과 제어 지연을 경험합니다. 영상만 보고 선호를 매기면 접촉력이 과하거나 불안정한 행동을 부드럽게 보이는 궤적으로 잘못 평가할 수 있습니다.

라벨 화면에는 과제에 필요한 센서만 동기화해 보여 주고 속도 재생, 카메라 각도와 clip 길이를 고정합니다. 사진은 촉각 기반 사람-로봇 상호작용의 맥락을 보여 주며 해당 실험이 여기서 설명한 보상 모델을 사용했다는 뜻은 아닙니다.

국제우주정거장에서 우주비행사가 Haptics-2 조작 장치로 로봇 원격 제어 실험을 수행하는 모습
사람은 영상뿐 아니라 힘·지연·조작 결과를 함께 느끼며 행동 품질을 평가할 수 있습니다. 사진은 사람 피드백의 맥락을 보여 주며 특정 보상 모델의 성능을 입증하지 않습니다. 출처: NASA. 라이선스: Public domain (NASA work). EXIF orientation normalized, center-cropped around Thomas Pesquet and the Haptics-2 controls, and resized; no material content altered.

라벨 지침은 목표·금지 행동·tie·판단 불가를 구체적인 예시로 정의한다

평가자에게 ‘더 좋아 보이는 것’을 묻기보다 물체 손상 없음, 목표 pose 오차, 불필요한 접촉, 완료 시간처럼 우선순위를 적습니다. 상충할 때 안전을 먼저 볼지 속도를 먼저 볼지도 명시하지 않으면 모델은 서로 다른 목표를 평균냅니다.

tie와 skip을 허용하고 평가자별 agreement, 응답 시간과 반복 문항 consistency를 기록합니다. 불일치 sample은 다수결로 숨기지 말고 본질적 모호성인지 지침 부족인지 재검토해 별도 uncertainty label로 남깁니다.

비교 쌍은 무작위보다 정책이 헷갈리는 경계와 중요한 실패를 우선한다

너무 좋은 영상과 명백히 나쁜 영상을 비교하면 라벨은 쉽지만 결정 경계를 배우지 못합니다. 점수가 비슷한 후보, 새 환경, 안전 개입 직전, 서로 다른 실패 유형을 active sampling하고 같은 episode의 거의 동일 frame만 반복하지 않습니다.

ReQueST 원 논문은 보상 모델이 불확실하거나 악용될 수 있는 hypothetical trajectory를 찾아 사람에게 질문하는 접근을 제시합니다. 실제 로봇에서는 위험 후보를 바로 실행하지 않고 simulation·offline video·안전 제한 안에서 평가해야 합니다.

영상 기반 보상은 시간의 진행을 읽되 카메라 지름길을 학습하지 않게 분할한다

모델이 목표 물체보다 배경, 작업자 손, episode 끝의 카메라 흔들림을 성공 신호로 사용할 수 있습니다. site·operator·camera setup을 group split하고 시작·중간·실패·복구 clip의 시간 분포를 맞춰 frame index가 진행도 proxy가 되지 않게 합니다.

RoboCLIP 원 논문은 언어·영상 사전학습 모델에서 얻은 task reward로 로봇 정책을 학습하는 접근을 보여 줍니다. 사전학습 표현을 쓰더라도 실제 로봇의 contact 품질과 안전을 별도 센서와 성공 지표로 검증해야 합니다.

보상 모델의 출력은 합산 방식에 따라 긴 궤적과 반복 행동을 잘못 선호할 수 있다

step reward를 단순 합산하면 같은 진전을 오래 반복하는 trajectory가 짧게 성공한 trajectory보다 높은 점수를 받을 수 있습니다. clip length normalization, terminal bonus와 반복 패턴 penalty를 설계하고 서로 다른 길이의 궤적 쌍을 따로 검증합니다.

dense reward는 credit assignment를 돕지만 실제 성공의 대체물이 아닙니다. 정책 업데이트마다 predicted return과 task success, 접촉 힘, intervention을 함께 그려 보상만 오르고 성공이 멈추는 divergence를 찾습니다.

reward hacking은 점수 함수가 본 단서를 극대화하면서 사람 목표를 어기는 행동이다

로봇이 카메라를 목표에 가깝게 가져가 progress score를 높이거나 물체를 실제로 넣지 않고 가림으로 성공처럼 보이게 만들 수 있습니다. 최적화가 강해질수록 사람 데이터에서 드물었던 허점을 찾아내므로 offline accuracy가 높아도 안심할 수 없습니다.

로봇 실패 마이닝으로 고보상·저성공, 고보상·사람 개입 episode를 별도 queue에 모읍니다. red-team은 카메라 가림, 반복, 센서 spoof, 비정상 속도와 목표 외 물체를 조합해 모델이 원치 않는 지름길에 점수를 주는지 확인합니다.

보상 모델 버전은 라벨 집합·지침·split·calibration과 함께 고정한다

reward checkpoint만 저장하면 어떤 사람 지침과 sample로 만들어졌는지 추적할 수 없습니다. dataset digest, annotator cohort, query policy, label schema, train·validation split와 threshold calibration을 model card에 연결합니다.

로봇 학습 데이터 품질 검사에서 duplicate·누락 metadata·센서 동기를 확인하고 site·task별 calibration curve를 보고합니다. 새 작업에 threshold를 그대로 복사하지 말고 소량의 held-out 사람 평가로 점수 의미를 다시 맞춥니다.

평가 지침과 비교 샘플링, 평가자 합의, 모델 calibration, reward hacking 검사를 연결한 점검표
사람 라벨의 불확실성과 모델 점수의 허점을 모두 기록하고 실제 성공 지표로 교차 검증합니다. 출처: 피지컬 AI Lab.

평가는 예측 정확도와 정책 효과, 실제 사람 판단을 세 층으로 나눈다

held-out preference accuracy, tie calibration과 evaluator agreement는 모델이 라벨을 재현하는지 봅니다. policy 단계에서는 success·time·contact·intervention을 규칙 보상·사람 선호 모델·ablation과 비교하고, 최종적으로 blind 사람 평가가 결과 순위를 다시 확인합니다.

로봇 VLA 평가의 환경·물체 hold-out을 보상 모델에도 동일 적용해야 정책과 reward가 같은 장면 지문을 공유하지 않습니다. reward model이 test clip을 학습했다면 그 점수로 policy test를 평가하는 것은 독립 검증이 아닙니다.

배포 기준은 높은 보상보다 사람 목표와 실제 성공의 일치가 유지되는가다

운영 중에는 predicted reward 분포, OOD score, 사람 override와 실제 성공의 관계를 모니터링합니다. 분포가 학습 범위를 벗어나거나 고보상 실패가 늘면 reward를 즉시 재학습하기보다 정책 최적화를 멈추고 원인 sample을 검토합니다.

합격 기준은 명확한 라벨 지침, 평가자 합의와 모호성 기록, group split, calibrated score, reward hacking 시험과 실제 로봇 성공의 개선입니다. 사람 피드백은 목표를 더 풍부하게 표현하지만 그 목표를 완벽히 복제하지는 않습니다.

평가 층지표반드시 분리할 slice경고 신호
라벨agreement·tie·consistency평가자·task지침별 불일치
모델preference acc·calibrationsite·camera·OOD고신뢰 오답
정책success·contact·interventionseen·unseen보상만 상승
운영high-reward failure버전·환경분포 이동·hack

로봇 보상 모델에서 자주 묻는 질문

보상 모델과 성공 판정기는 같은 것인가요?

성공 판정기는 보통 종료 조건을 이진 판정하고, 보상 모델은 중간 진행이나 품질까지 점수화할 수 있습니다. 하나의 모델이 둘을 맡더라도 threshold와 평가 목적을 따로 검증해야 합니다.

사람 몇 명이 라벨해야 충분한가요?

고정 인원보다 독립 평가자 간 합의와 작업 다양성이 중요합니다. 반복 문항으로 일관성을 보고 불일치가 큰 항목은 지침을 개선하거나 모호성으로 남깁니다.

VLM 점수를 그대로 reward로 써도 되나요?

초기 신호로 쓸 수 있지만 카메라 배경·가림과 접촉 상태를 잘못 읽을 수 있습니다. 실제 성공, 힘·토크와 사람 blind 평가로 교차 검증해야 합니다.

보상 모델이 좋아지면 안전 실드를 없앨 수 있나요?

아닙니다. 보상은 선호 목표를 근사하고 안전 실드는 금지 제약을 강제합니다. 높은 보상 행동도 물리 한계를 넘을 수 있으므로 독립 안전 계층을 유지해야 합니다.

reward hacking은 어떻게 가장 빨리 찾나요?

고보상인데 실패하거나 사람이 개입한 episode를 우선 보고, 카메라 가림·반복·센서 이상을 의도적으로 주입합니다. 정책이 보상은 올리지만 실제 지표를 악화시키는지 확인합니다.

사람 피드백에는 평가자 편향과 개인정보가 포함될 수 있습니다. 데이터 수집 동의·접근 통제·보존 기간을 정하고, 보상 점수를 사람 의도의 완전한 대리값으로 사용하지 않아야 합니다.