여러 로봇 데이터셋을 한 폴더에 합쳐도 학습기가 보는 비율은 자동으로 공정해지지 않습니다. 에피소드 수가 많은 로봇, 긴 작업, 반복 촬영된 쉬운 성공이 gradient를 차지하면 전체 손실은 내려가면서 드문 작업과 새 로봇 성능은 오히려 떨어질 수 있습니다. 혼합 비율은 파일 개수가 아니라 학습 중 샘플링 확률과 최악 도메인 성능을 설계하는 문제입니다.
아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.
데이터 혼합 비율은 저장 용량 비율이 아니라 매 step의 선택 확률이다
100만 frame 데이터셋과 10만 frame 데이터셋을 이어 붙이면 기본 uniform row sampling에서는 앞쪽 데이터가 열 배 더 자주 학습됩니다. 에피소드 단위 sampler를 쓰면 길이가 짧은 작업이 상대적으로 많아질 수 있어 sampling unit부터 명시해야 합니다.
로봇 데이터 팩토리의 수집량 대시보드와 학습 sampler의 실제 노출량은 다릅니다. epoch, repeat, batch composition과 augmentation까지 포함해 모델이 각 도메인을 몇 번 봤는지 계산해야 합니다.
먼저 로봇·작업·장소·결과를 도메인으로 나눠 쏠림을 보이게 만든다
로봇 이름만으로 묶으면 같은 로봇의 pick-place와 cable routing 차이가 사라지고, 작업만으로 묶으면 camera와 gripper 차이가 가려집니다. 최소한 embodiment, task family, site, data source, success·failure, collection policy를 교차표로 만듭니다.
Open X-Embodiment는 여러 기관과 로봇의 대규모 데이터를 한 저장소에 모았지만 embodiment와 scene 분포가 균일하지 않다는 점도 보여 줍니다. 데이터 다양성은 자동으로 균형을 뜻하지 않습니다.
크기 비례·도메인 균등·온도 샘플링은 서로 다른 편향을 만든다
크기 비례는 데이터가 많은 도메인의 통계를 안정적으로 배우지만 작은 도메인을 잊기 쉽습니다. 도메인 균등은 작은 집합을 과도하게 반복해 노이즈와 중복을 외우게 할 수 있고, 온도 샘플링은 두 극단 사이를 조절합니다.
가중치는 한 번 정한 정답이 아니라 모델·학습 단계·목표 도메인에 따라 달라집니다. 초기 표현 학습과 후반 target robot 적응에서 다른 sampler를 쓰되 변경 시점과 누적 노출량을 기록합니다.
| 방식 | 샘플 확률 | 장점 | 주의점 |
|---|---|---|---|
| 크기 비례 | 데이터 수에 비례 | 큰 집합 통계 안정 | 희소 작업 소실 |
| 도메인 균등 | 도메인마다 동일 | 작은 집합 노출 확보 | 중복 과학습 |
| 온도 샘플링 | 크기 비율을 완화 | 두 극단 조절 | temperature 검증 필요 |
| 성능 기반 | 검증 약점에 더 배분 | 최악 도메인 개선 | 검증 노이즈 추종 |
실제 로봇 데이터는 장비보다 수집 맥락의 차이가 더 큰 도메인을 만들 수 있다
사진의 클린룸 시험과 일상 환경 조작은 조명, 도구, 작업자 접근, 실패 처리 방식이 다릅니다. 같은 로봇 팔이라도 commissioning 단계와 자율 운영 단계의 데이터는 서로 다른 분포로 관리해야 합니다.
site와 session을 무시하고 frame을 무작위로 섞으면 거의 같은 장면이 train과 validation에 나뉘어 성능이 높아 보일 수 있습니다. 혼합 비율을 정하기 전에 split의 독립성을 먼저 지킵니다.

Re-Mix는 평균이 아니라 약한 도메인을 기준으로 가중치를 찾는다
Re-Mix 원 논문은 로봇 imitation dataset의 domain weight를 distributionally robust optimization으로 학습해 최악 도메인 성능을 높이는 접근을 제시합니다. action space 차이 때문에 early stopping, action normalization과 discretization도 함께 사용합니다.
Stanford HAI의 Re-Mix 설명이 강조하듯 데이터 선별과 가중은 모델 크기와 별개의 성능 레버입니다. 다만 논문의 개선 수치를 모든 로봇·모델에 그대로 기대해서는 안 되고 자체 validation domain으로 다시 최적화해야 합니다.
성공과 실패 비율은 실패 frame 수보다 실패 유형의 범위를 먼저 본다
실패를 늘린다고 robustness가 자동으로 좋아지지 않습니다. 같은 그리퍼 미끄럼 1만 건은 camera occlusion, 잘못된 접근, recovery 실패를 대신하지 못하므로 outcome label과 failure taxonomy를 함께 샘플링합니다.
로봇 학습 데이터 품질 검사에서 중복률과 라벨 신뢰도를 확인한 뒤 가중치를 올립니다. 잘못 라벨된 작은 실패 도메인을 과샘플링하면 모델이 정상 장면까지 실패로 배우게 됩니다.
oversampling에는 반복 상한과 augmentation 독립성을 둔다
작은 도메인을 계속 복제하면 batch 수는 늘어도 정보량은 늘지 않습니다. episode별 누적 repeat count를 기록하고 상한을 두며, 같은 원본의 augmentation 여러 개가 한 batch에 몰리지 않게 합니다.
augmentation은 시각 다양성을 늘릴 수 있지만 로봇과 작업 다양성을 만들지는 못합니다. rare robot의 구조와 action 분포를 보완하려면 실제 다른 trajectory나 신뢰 가능한 변환 데이터가 필요합니다.
긴 에피소드가 더 많은 gradient를 받는 문제를 분리한다
frame 단위 sampling은 긴 작업이 같은 episode 수의 짧은 작업보다 더 자주 선택됩니다. episode→window의 두 단계 sampling을 쓰거나 task별 유효 frame을 제한해 한 번의 장기 실패가 전체 학습을 지배하지 않게 합니다.
Action Chunking 데이터에서는 겹치는 window가 거의 같은 미래 action을 반복할 수 있습니다. stride와 window overlap을 노출량 계산에 포함해야 합니다.
혼합 성능은 전체 평균과 도메인별 최악값을 동시에 본다
전체 validation loss는 큰 도메인의 개선으로 작은 도메인 붕괴를 숨길 수 있습니다. robot·task·site·outcome별 success, action error와 calibration을 나누고 worst-k domain과 하위 분위수를 함께 보고합니다.
로봇 VLA 평가처럼 실제 rollout 평가는 고정된 에피소드 재생과 다릅니다. offline 지표가 좋아도 contact timing이 어긋날 수 있으므로 소수의 균형 잡힌 실제 시험을 남깁니다.
학습이 진행되면 필요한 혼합도 바뀌므로 drift를 기록한다
초기에는 공통 시각·언어 표현에 큰 도메인이 도움이 되지만 후반에는 희소 task와 target embodiment가 병목이 될 수 있습니다. 일정 step마다 domain loss와 실제 성능을 측정하고 가중 변경 전후의 누적 샘플 수를 남깁니다.
성능이 나쁜 도메인에 무조건 비율을 올리면 라벨 노이즈나 표현 불가능한 action을 더 반복할 수 있습니다. 데이터 수정, adapter 문제, 모델 용량 부족과 단순 노출 부족을 구분한 뒤 sampler를 바꿉니다.
혼합 변경은 작은 재학습 실험으로 성능 역전을 먼저 찾는다
전체 pretraining 전에 고정된 seed와 짧은 budget으로 크기 비례, 균등, 온도, 성능 기반 후보를 비교합니다. 평균뿐 아니라 이전에 잘하던 도메인이 나빠지는 negative transfer를 확인합니다.
실험마다 dataset version, sampler code, domain 정의, seed와 누적 노출량을 고정합니다. 그렇지 않으면 가중치 효과와 데이터 변경 효과를 분리할 수 없습니다.

운영용 혼합 명세는 목표·상한·중단 조건까지 포함한다
최종 mixture manifest에는 도메인 필터, base count, sampling probability, repeat cap, augmentation, 적용 step 구간과 목표 지표를 적습니다. 데이터가 추가되면 확률을 자동 재계산할지 기존 비율을 고정할지도 결정합니다.
좋은 혼합은 모든 도메인을 같은 비율로 보는 것이 아니라 목표 성능과 데이터 신뢰도를 반영하면서 최악 도메인을 버리지 않는 구성입니다. 배포 대상이 바뀌면 mixture도 새 버전으로 평가합니다.
| 검증 | 필수 기록 | 경고 신호 | 조치 |
|---|---|---|---|
| 노출량 | domain별 sampled windows | 목표 비율과 차이 | sampler·worker 점검 |
| 중복 | episode repeat·overlap | 작은 집합 반복 급증 | cap·stride 조정 |
| 성능 | mean·worst·rare | 평균 상승·최악 하락 | 가중 재탐색 |
| 변경 | manifest·seed·step | 재현 불가 | mixture version 고정 |
로봇 데이터 혼합 비율에서 자주 묻는 질문
데이터셋 크기에 비례해 섞는 것이 가장 자연스럽지 않나요?
큰 도메인의 통계는 안정적이지만 희소 로봇과 작업이 거의 보이지 않을 수 있습니다. 목표별 성능과 반복 위험을 보고 온도·상한·성능 기반 가중을 비교해야 합니다.
작은 데이터셋은 몇 배 oversampling하면 되나요?
고정 배수보다 실제 repeat count, 중복률과 validation 성능으로 정합니다. 정보가 늘지 않는 반복에는 상한을 두고 새 데이터 수집 필요성을 분리합니다.
실패 데이터를 많이 넣으면 복구 성능이 좋아지나요?
실패 유형과 라벨이 다양하고 복구 action까지 연결돼야 합니다. 같은 실패를 반복하거나 잘못 라벨한 데이터를 과샘플링하면 정상 동작도 망가질 수 있습니다.
혼합 비율은 학습 중 바꿔도 되나요?
가능하지만 변경 step, 이전·이후 누적 노출량과 검증 결과를 mixture version에 기록해야 원인을 재현할 수 있습니다.
가장 중요한 평가 지표는 무엇인가요?
전체 평균과 함께 robot·task·site·outcome별 최악 성능과 하위 분위수를 봅니다. 평균만 보면 큰 도메인의 개선이 작은 도메인 붕괴를 숨깁니다.
데이터 혼합 최적화는 안전하지 않은 동작을 허용하는 절차가 아닙니다. 실제 로봇 rollout에는 작업별 안전 제한, 감독과 중단 조건을 별도로 적용해야 합니다.