로봇 VLA 미세조정: 전체 학습·어댑터·LoRA를 언제 선택하나

새 로봇과 작업에 VLA를 맞출 때 전체 파라미터를 모두 업데이트하면 표현력은 크지만 메모리와 망각 위험이 커집니다. LoRA와 어댑터는 학습 비용을 줄이고 원본 모델을 보존하지만 action head·카메라·로봇 몸체 차이가 크면 제한될 수 있습니다. 선택은 GPU 크기보다 어떤 분포가 바뀌었는지와 배포 제약을 기준으로 해야 합니다.

아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.

VLA 미세조정 방식은 파라미터 수보다 어디의 표현이 달라졌는지로 선택한다

새 카메라의 색감만 달라졌는지, 언어 지시가 새로워졌는지, action space와 gripper가 바뀌었는지에 따라 고쳐야 할 층이 다릅니다. 모든 변화를 full fine-tuning으로 해결하면 비용과 catastrophic forgetting을 키울 수 있습니다.

로봇 파운데이션 모델의 backbone, projector, action head와 robot adapter를 분리해 진단합니다. 먼저 frozen probe와 작은 head-only 실험으로 target data가 어느 표현 단계에서 분리되는지 확인합니다.

head-only 학습은 backbone 표현이 충분하고 출력 action mapping만 달라질 때 가장 안전하다

같은 종류의 장면과 언어를 이해하지만 joint order, gripper range 또는 action dimension이 달라진 경우 새 action head와 embodiment adapter만 학습할 수 있습니다. 학습 메모리가 작고 원본 backbone을 그대로 보존합니다.

Octo 공식 프로젝트처럼 여러 embodiment를 adapter 구조로 연결하는 접근은 공통 표현과 로봇별 출력을 분리합니다. 다만 target 장면을 backbone이 제대로 표현하지 못하면 head만으로는 해결되지 않습니다.

LoRA는 기존 weight를 고정하고 저랭크 변화량을 학습해 비용과 배포 단위를 줄인다

attention과 MLP의 weight W에 작은 A·B 행렬의 곱으로 update를 표현하므로 trainable parameter와 optimizer memory가 줄어듭니다. base checkpoint를 보존한 채 작업별 adapter 파일을 관리하기도 쉽습니다.

rank가 너무 작으면 복잡한 변화가 표현되지 않고, 너무 크면 full tuning에 가까운 비용과 과적합이 생깁니다. target module, rank, alpha, dropout과 trainable parameter 수를 기록하고 동일 데이터·step에서 비교합니다.

방식업데이트 범위적합한 변화주요 위험
head-onlyaction head·adapter출력 schemabackbone shift 미해결
LoRA선택 weight 저랭크중간 규모 task·languagerank·target 의존
adapter삽입 모듈·projectormodality·embodiment bridge추론 경로 추가
full전체 weight큰 복합 shift비용·망각·rollback

현장 시범은 미세조정 방식보다 먼저 target robot의 action 의미와 실패 경계를 정의한다

사진처럼 사람이 실제 작업을 가르쳐도 timestamp, camera calibration, action frame과 gripper 정의가 틀리면 어떤 방법도 잘못된 mapping을 학습합니다. target data의 성공만 모으면 recovery와 실패 전 상태도 보지 못합니다.

시범은 task 단계, 물체, 시작 상태, 작업자와 실패 유형으로 나누고 validation 그룹을 먼저 격리합니다. 미세조정 비교는 같은 target split과 evaluation protocol에서 해야 parameter 방식의 차이를 볼 수 있습니다.

제조 현장에서 작업자가 Baxter 로봇 팔에 부품 분류 작업을 시범 보이는 모습
새 로봇 작업 적응에는 target 환경의 시범과 정확한 action schema가 필요합니다. 사진은 데이터 수집 맥락을 보여 주며 특정 미세조정 방식의 우위를 입증하지 않습니다. 출처: U.S. Department of Energy. 라이선스: Public domain (U.S. Department of Energy work). EXIF orientation normalized, center-cropped around the worker teaching Baxter a task, and resized; no material content altered.

OpenVLA는 LoRA와 full fine-tuning 경로를 모두 제공해 같은 모델에서 비용·성능을 비교할 수 있다

OpenVLA 공식 저장소에는 LoRA와 full fine-tuning 실행 경로가 공개되어 있습니다. LoRA는 더 적은 GPU 자원으로 새 task에 적응할 수 있지만 batch, augmentation, action normalization 조건을 맞춰야 공정한 비교가 됩니다.

공식 recipe의 숫자를 자신의 robot에 그대로 약속하지 말고 실제 sequence length, image 수, gradient checkpointing, mixed precision에 따른 peak memory와 throughput을 측정합니다. 재현 가능한 config와 commit을 결과와 함께 보존합니다.

full fine-tuning은 vision·language·action 분포가 함께 크게 바뀔 때 표현력은 크지만 가장 강한 기준선이 필요하다

새로운 센서 modality, 장면 의미, 언어와 정밀 action이 동시에 달라지면 저랭크 update만으로 부족할 수 있습니다. 전체 학습은 모든 층을 바꿀 수 있어 target fit은 높지만 작은 데이터에서 과적합과 원본 능력 손실이 쉽습니다.

OpenVLA 원 논문은 LoRA가 단일 GPU에서 효율적인 적응 경로가 될 수 있음을 보고합니다. 그렇더라도 full과 LoRA의 선택은 target 성능뿐 아니라 source task retention과 추론 비용을 함께 비교해야 합니다.

어댑터는 카메라·언어·action 경계에 명시적 변환층을 두어 로봇별 차이를 격리한다

vision projector, proprioception encoder, action decoder 또는 embodiment token 앞뒤에 작은 모듈을 넣을 수 있습니다. base model은 유지하고 새 로봇의 calibration·state·action schema를 한 경로에 모을 수 있습니다.

로봇 간 행동 공간 정규화의 역변환 규칙과 adapter를 연결하면 공통 VLA output이 로봇별 controller command로 바뀌는 책임이 분명해집니다. adapter만으로 물리 limit와 collision 검사를 대신해서는 안 됩니다.

OFT 같은 recipe는 LoRA 대 full의 이분법보다 action head와 학습 목표 자체를 바꿀 수 있다

parameter-efficient tuning 안에서도 discrete action token을 유지할지 continuous action head와 action chunk를 쓸지에 따라 지연과 성능이 달라집니다. 방법 이름만 비교하지 말고 출력 표현과 inference path를 함께 봅니다.

OpenVLA-OFT 공식 프로젝트는 continuous action과 병렬 decoding을 포함한 최적화된 fine-tuning recipe를 제시합니다. target control frequency와 bimanual 여부가 다르면 vanilla LoRA보다 이러한 구조 변경이 더 중요한 변수가 될 수 있습니다.

source data를 소량 섞는 rehearsal은 망각을 줄이지만 target 비율을 압도하면 적응을 막는다

target data만 반복하면 새 작업은 좋아져도 원래의 물체·언어·장면 능력이 줄 수 있습니다. 대표 source replay를 섞고 target·source validation을 별도로 보되 mixture ratio와 실제 노출량을 기록합니다.

로봇 데이터 혼합 비율의 sampler 원칙을 적용해 많은 source가 작은 target을 덮지 않게 합니다. 초기에는 target 비율을 높이고 후반 retention regularization을 강화하는 schedule도 검증할 수 있습니다.

작은 데이터에서는 trainable parameter보다 독립 episode 수와 validation 격리가 더 중요하다

frame 수가 많아 보여도 같은 몇 개 trajectory를 잘게 자른 데이터라면 LoRA도 쉽게 장면을 암기합니다. episode·object·site 단위 split, augmentation 정합성, early stopping과 checkpoint selection을 먼저 고정합니다.

Hugging Face PEFT LoRA 공식 문서가 설명하듯 LoRA는 효율적인 parameterization이지 데이터 누수나 과적합을 자동으로 해결하는 장치가 아닙니다. rank sweep도 validation test를 반복 열지 않고 결정해야 합니다.

분포 변화 위치와 학습 자원, 망각 위험, 배포 합치기를 비교하는 점검표
GPU 용량만 보지 않고 vision·language·action 중 무엇이 바뀌었는지와 source 성능 보존을 함께 확인합니다. 출처: 피지컬 AI Lab.

평가는 target gain·source retention·calibration·지연을 한 표에서 비교한다

target 성공률만 보면 full tuning이 좋아 보여도 source task가 크게 무너지거나 inference deadline을 놓칠 수 있습니다. target task·unseen object·source suite, action error, failure type와 latency를 함께 측정합니다.

로봇 VLA 평가의 trial protocol을 고정하고 동일 초기 상태·물체·안전 조건에서 비교합니다. 결과는 mean뿐 아니라 worst task와 bootstrap interval을 보고 작은 차이를 과장하지 않습니다.

배포 artifact는 base·adapter·tokenizer·normalization을 하나의 호환 묶음으로 고정한다

LoRA 파일만 저장하고 어느 base revision과 합쳐야 하는지 잃으면 재현할 수 없습니다. base digest, adapter config와 weight, tokenizer, image processor, action stats, robot adapter와 code commit을 release manifest에 묶습니다.

합격 기준은 target 향상, source retention 한계, latency budget, action safety check와 rollback rehearsal입니다. 이 조건을 만족하는 가장 작은 업데이트 방식을 선택하면 실험 속도와 운영 복구가 모두 쉬워집니다.

검증핵심 지표합격 신호선택에 미치는 영향
targetsuccess·action error실질 개선용량 충분 여부
retentionsource suite허용 하락 이내망각 위험
효율VRAM·throughput·latency예산·주기 충족LoRA·adapter 이점
운영merge·manifest·rollback재현·복구 성공배포 복잡도

로봇 VLA 미세조정에서 자주 묻는 질문

VLA 미세조정은 LoRA부터 시작하면 되나요?

대개 좋은 저비용 기준선이지만 action schema만 바뀌었다면 head-only가 더 적합할 수 있고, vision·language·action이 함께 크게 바뀌면 full tuning이나 구조 변경이 필요할 수 있습니다.

LoRA rank는 클수록 좋은가요?

아닙니다. rank가 커지면 표현력과 비용이 함께 늘고 작은 데이터에서는 과적합할 수 있습니다. 동일 split에서 target 성능·source retention·VRAM을 비교해 정합니다.

전체 미세조정이 항상 성능이 가장 높나요?

target fit은 높을 수 있지만 데이터가 작으면 과적합과 catastrophic forgetting이 커질 수 있습니다. source suite와 unseen 조건을 함께 평가해야 합니다.

새 로봇에는 action head만 바꾸면 되나요?

backbone이 장면과 지시를 이미 이해하고 출력 mapping만 다를 때 가능합니다. 카메라·센서·작업 의미까지 달라졌다면 projector나 backbone 적응도 필요합니다.

LoRA adapter만 보관하면 배포를 재현할 수 있나요?

아닙니다. 정확한 base revision, tokenizer, image processor, normalization 통계, action adapter와 코드 commit을 함께 고정해야 합니다.

VLA 미세조정은 실제 로봇 안전 인증이나 제어기 검증을 대신하지 않습니다. 업데이트된 모델은 별도 safety layer, 제한된 시험 공간과 사람 감독 아래 단계적으로 배포해야 합니다.