로봇 영상 데이터 증강: 밝기·크롭·시점 변환이 행동 라벨을 깨뜨리는 조건

분류 모델에서 안전한 색 변화나 좌우 반전이 로봇 정책에서는 같은 행동 라벨을 보존하지 않을 수 있습니다. crop은 카메라 내참수를 바꾸고 flip은 좌우 이동과 회전을 뒤집으며, 시점 이동은 보이지 않던 가림을 만듭니다. 로봇 영상 증강은 이미지가 자연스러운지가 아니라 관측 변환 뒤에도 action의 물리적 의미가 맞는지 검증해야 합니다.

아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.

로봇 영상 증강은 label-preserving이 아니라 observation-action 관계를 보존해야 한다

고양이 분류에서는 좌우 반전 뒤에도 클래스가 고양이지만, 로봇 정책에서 화면 오른쪽으로 이동하는 action은 반전 뒤 왼쪽 이동으로 바뀌어야 할 수 있습니다. action을 그대로 두면 동일한 관측 패턴에 반대 명령을 가르칩니다.

로봇 action 데이터의 frame·absolute·delta 정의를 모르면 어떤 영상 변환이 라벨을 보존하는지 판단할 수 없습니다. 증강 명세는 이미지 함수뿐 아니라 action과 calibration을 어떻게 변환하는지 포함해야 합니다.

밝기·대비·색 변화는 기하를 유지하지만 센서와 과제를 벗어나면 의미를 바꾼다

작은 exposure·white balance 변화는 위치 관계를 유지하므로 action을 바꾸지 않는 photometric 증강으로 쓰기 쉽습니다. 다만 색으로 물체를 구분하거나 반사·투명 물체의 접촉을 판단하는 과제에서는 색과 명암이 곧 task signal입니다.

RAD 원 논문은 pixel 기반 제어에서 다양한 image augmentation을 비교했습니다. 효과를 그대로 가져오기보다 실제 카메라 노출 범위와 과제 단서를 기준으로 강도를 정하고 원본 검증셋에서 별도 ablation을 해야 합니다.

crop과 resize는 화면만 자르는 것이 아니라 카메라 내참수 K를 바꾸는 연산이다

왼쪽에서 u0만큼 crop하면 principal point cx가 u0만큼 이동하고 resize 배율에 따라 fx·fy·cx·cy가 함께 바뀝니다. 2D keypoint나 3D projection을 쓰는 정책에서 원래 K를 유지하면 픽셀과 공간 좌표가 어긋납니다.

단순 end-to-end policy라도 crop이 tool tip이나 목표 물체를 잘라내면 동일 action이 관측으로 설명되지 않습니다. workspace mask와 최소 가시성 조건을 두고 유효하지 않은 crop은 버립니다.

증강이미지 변화같이 갱신할 값라벨 위험
brightness광도보통 없음색·반사 단서 손실
crop·resize시야·배율K·keypoint·bbox목표·tool 잘림
flip좌우·상하action 축·회전반대 명령
viewpoint투영·가림camera pose·3D label보이지 않는 상태 생성

실제 로봇 영상은 팔·지면·카메라가 만드는 공동 기하를 담고 있다

사진의 FIDO처럼 카메라 마스트와 로봇 팔을 함께 쓰는 시스템에서 crop과 시점 변화는 팔의 화면 위치와 지면 관계를 동시에 바꿉니다. 배경만 자연스러우면 되는 것이 아니라 변환된 관측에서 원래 action이 여전히 실행 가능한지 봐야 합니다.

증강 결과를 사람이 몇 장 보는 것만으로는 작은 projection 오류를 찾기 어렵습니다. 알려진 3D point를 변환된 이미지에 재투영하고 tool center point·object keypoint 오차를 pixel 단위로 자동 검사합니다.

시험장에서 파노라마 카메라 마스트와 로봇 팔을 펼친 NASA FIDO 로버
영상 기반 로봇은 카메라 투영과 실제 팔 행동을 함께 다룹니다. 사진은 센서·하드웨어 맥락을 보여 주며 특정 증강 기법의 효과를 입증하지 않습니다. 출처: NASA. 라이선스: Public domain (NASA work). EXIF orientation normalized, center-cropped around the FIDO rover arm and panoramic camera mast, and resized; no material content altered.

horizontal flip은 카메라 좌표의 translation과 rotation, gripper 의미까지 함께 뒤집어야 한다

camera frame의 x축이 화면 좌우와 대응한다면 flip 뒤 delta-x 부호를 바꿔야 합니다. 회전은 단순히 한 Euler 성분의 부호만 바꾸기 어려우므로 reflection matrix를 적용해 pose를 변환한 뒤 원하는 표현으로 다시 인코딩합니다.

로봇 간 행동 공간 정규화에서 정의한 frame 변환을 증강에도 재사용해야 합니다. 비대칭 gripper, 한쪽에만 있는 장애물, 좌우가 다른 bimanual task는 물리적 대칭이 아니므로 flip 자체를 금지합니다.

영상 회전은 카메라 roll과 같은지, 세계가 회전한 것인지 먼저 정해야 한다

2D 이미지를 10도 돌리는 연산은 카메라 optical axis 주위 회전처럼 보이지만 화면 경계와 보간이 생깁니다. camera pose를 함께 회전하지 않으면 policy는 기울어진 관측에 원래 world-frame action을 대응시킵니다.

On-Robot Learning With Equivariant Models 원 논문처럼 equivariance를 이용하는 방법은 상태 변환과 action 변환을 같은 군 작용으로 정의합니다. 임의 회전보다 실제 시스템의 대칭을 먼저 식별하는 것이 핵심입니다.

synthetic viewpoint 변화는 원본 이미지에 없던 가림과 뒷면을 만들어 낼 수 없다

homography나 2D warp는 평면 근사에서는 유용하지만 깊이가 다른 gripper와 물체를 새 시점에서 정확히 합성하지 못합니다. 가려졌던 면을 늘려 보이면 실제 정보가 아니라 보간된 픽셀을 action 근거로 제공합니다.

도메인 랜덤화와 달리 실제 영상의 2D warp는 scene geometry를 새로 렌더링하지 않습니다. 큰 시점 변화가 필요하면 multi-view 촬영, depth 기반 reprojection 또는 simulator 렌더링으로 출처와 한계를 구분합니다.

시간축이 있는 로봇 영상은 프레임마다 다른 random transform을 주면 가짜 motion을 만든다

각 프레임에 독립 crop과 brightness를 적용하면 정지한 물체가 흔들리고 조명이 깜박이는 것처럼 보입니다. optical flow와 recurrent policy가 이 변화를 실제 motion으로 해석할 수 있습니다.

trajectory 또는 action chunk 전체에 같은 geometric transform을 적용하고 photometric 변화도 시간적으로 부드럽게 샘플링합니다. 제어 주기와 rolling shutter가 있는 경우 로봇 카메라 rolling shutter·motion blur 조건도 실제 센서 범위 안에서 모델링합니다.

augmentation은 train에만 적용하고 validation은 실제 배포 분포와 stress set으로 나눈다

validation에도 같은 랜덤 증강을 넣으면 성능 변화가 모델 때문인지 평가 난수 때문인지 알기 어렵습니다. 기본 validation은 결정론적 전처리만 쓰고, 별도 stress set에서 노출·blur·crop 강도별 degradation curve를 측정합니다.

DrQ 원 논문RT-1 원 논문은 대규모 시각 제어와 regularization 맥락을 제공합니다. 그러나 로봇 imitation에서는 action 정합성 오류가 추가되므로 control label audit를 별도 통과해야 합니다.

가장 빠른 정합성 검사는 projection·action 왕복·짧은 replay의 세 단계다

먼저 keypoint와 3D point reprojection으로 image·K·camera pose를 검증합니다. 다음으로 action을 증강 frame으로 바꿨다가 원래 frame으로 되돌려 translation·rotation·gripper 오차를 계산합니다.

마지막으로 안전한 짧은 trajectory를 변환 전후 policy로 replay해 방향과 접근면이 일치하는지 봅니다. image loss가 낮아도 action 방향이 반대면 즉시 증강을 차단합니다.

광학 변환과 기하 변환을 구분하고 카메라와 행동 라벨을 함께 갱신하는 점검표
증강마다 관측만 바꿔도 되는지, action·intrinsics·keypoint를 함께 바꿔야 하는지 명시합니다. 출처: 피지컬 AI Lab.

증강 강도는 보기 좋은 범위가 아니라 실제 센서 변동과 task margin으로 정한다

카메라 로그에서 exposure, blur, crop equivalent, white balance의 실제 분포를 추정하고 95% 운영 범위와 극단 stress 범위를 분리합니다. 학습 증강은 현실적인 범위를 중심으로 하고 극단 조건은 robustness 평가에 남깁니다.

DROID 데이터 공식 문서도 학습용 loader에서 normalization과 augmentation을 별도 단계로 다룹니다. dataset 원본과 train-time 변환을 분리해야 같은 원본으로 다른 정책을 공정하게 비교할 수 있습니다.

운영 합격 기준은 이미지 품질이 아니라 action 정합성과 원본·stress 성능의 동시 유지다

증강별로 적용 확률·강도·seed·시간 일관성·action transform 코드를 버전 관리합니다. 원본 validation, 실제 새 session, stress set에서 성공률과 action error를 비교하고 특정 task만 악화되는지 확인합니다.

합격하려면 reprojection 오차 허용 범위, action 왕복 오차, target visibility, 원본 성능 비열화와 stress 개선을 모두 만족해야 합니다. 하나라도 실패하면 증강을 약화하거나 과제별 allowlist로 제한합니다.

검증 층지표합격 기준실패 조치
기하reprojection pxcalibration 허용치K·pose 수정
행동round-trip error제어 해상도 이하axis·rotation 수정
가시성tool·target coverage최소 면적 유지crop 범위 축소
정책원본·stress 성공률원본 유지+stress 개선task별 비활성

로봇 영상 데이터 증강에서 자주 묻는 질문

로봇 영상에도 좌우 반전을 써도 되나요?

물리적으로 좌우 대칭인 과제에서 action 축과 회전을 함께 변환할 때만 안전합니다. 비대칭 gripper·장애물·양팔 역할이 있으면 사용하지 않는 편이 낫습니다.

밝기 증강은 action을 바꾸지 않아도 되나요?

기하 관계는 유지되지만 색·반사·접촉 단서가 과제에 중요하면 라벨의 관측 가능성을 깨뜨릴 수 있습니다. 실제 센서 노출 범위에서 강도를 정합니다.

crop 뒤 카메라 intrinsics도 바꿔야 하나요?

projection이나 3D geometry를 쓰면 반드시 fx·fy·cx·cy를 crop과 resize에 맞춰 갱신해야 합니다. end-to-end policy도 tool과 목표 가시성을 확인해야 합니다.

trajectory 프레임마다 다른 증강을 주면 안 되나요?

독립 geometric transform은 가짜 motion을 만듭니다. 보통 chunk 전체에 같은 crop·rotation을 쓰고 광학 변화도 시간적으로 부드럽게 적용합니다.

증강이 올바른지 무엇으로 검증하나요?

3D point 재투영, action 변환 왕복 오차, 목표 가시성, 안전한 짧은 replay와 원본·stress validation 성능을 함께 확인합니다.

영상 증강은 실제 센서·카메라 보정·로봇 기구학 검증을 대신하지 않습니다. 실제 실행 전에는 변환된 action을 저속 안전 환경에서 확인하고 과제별 금지 조건을 운영 규칙으로 둬야 합니다.