로봇 행동 토큰화: 연속 관절 명령을 이산 토큰으로 바꾸면 무엇이 달라지나

VLA는 연속 위치·회전·그리퍼 명령을 언어 모델처럼 예측하려고 action을 이산 토큰으로 바꿀 수 있습니다. 이때 bin 수, 범위, 시간 압축 방식이 제어 해상도와 시퀀스 길이, 추론 지연을 동시에 결정합니다. 행동 토큰화는 단순한 숫자 변환이 아니라 어떤 오차와 동작 구조를 모델에 남길지 정하는 설계입니다.

아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.

행동 토큰화는 연속 action을 유한한 기호열로 바꾸고 다시 제어 명령으로 복원하는 계약이다

언어 모델의 출력 head는 discrete vocabulary 확률을 예측합니다. 로봇 action을 같은 방식으로 다루려면 각 관절·말단 이동·회전·gripper 값을 token ID로 encode하고 실행 전에 연속값으로 decode해야 합니다.

VLA의 의미와 구조를 이해할 때 action token은 단어가 아니라 물리 명령의 양자화된 코드라는 점이 중요합니다. token accuracy가 높아도 작은 회전이나 접촉 힘이 잘못 복원되면 실제 성공률은 낮을 수 있습니다.

가장 단순한 방식은 action 차원마다 범위를 정하고 256개 같은 bin으로 나누는 것이다

각 차원의 min·max 또는 quantile 범위를 정한 뒤 값을 가장 가까운 bin ID로 바꿉니다. 구현이 쉽고 기존 language vocabulary에 action token을 추가할 수 있지만 차원 수×시간 길이만큼 token이 늘어납니다.

RT-1 공식 프로젝트는 action 차원을 이산화해 token으로 예측하는 대표 사례입니다. bin 수 자체보다 어떤 범위와 dataset 통계로 경계를 만들었는지가 실제 해상도를 결정합니다.

uniform bin과 quantile bin은 같은 256개 token으로 서로 다른 오차를 만든다

uniform bin은 물리 범위를 같은 폭으로 나눠 해석이 쉽지만 값이 0 근처에 몰리면 많은 bin이 거의 쓰이지 않습니다. quantile bin은 token 사용을 고르게 만들지만 물리적 bin 폭이 달라져 드문 큰 동작에서 오차가 커질 수 있습니다.

translation, rotation, gripper를 같은 규칙으로 묶지 말고 차원별 분포와 제어 민감도를 봅니다. 접촉 직전의 1mm와 자유 공간의 1cm가 같은 위험을 뜻하지 않으므로 task-weighted error도 필요합니다.

방식경계 생성장점주의점
uniform물리 범위 등간격해석·오차 상한 단순희소 bin
quantile학습 분포 누적확률token 사용 균형물리 폭 불균일
learned codebook데이터로 prototype 학습상관 구조 압축codebook collapse
frequency chunk시간 주파수 계수긴 action 압축복원·지연 검증

실제 그리퍼와 카메라가 붙은 말단은 action 차원마다 요구 해상도가 다르다

사진의 Baxter 그리퍼처럼 translation·wrist rotation·open/close가 함께 작동하는 장치는 각 명령의 단위와 허용 오차가 다릅니다. 모든 차원에 같은 bin 폭을 주면 어떤 축은 낭비되고 어떤 축은 접촉 정밀도가 부족해집니다.

제조사 제어 해상도보다 촘촘한 token은 의미가 없고 실제 task margin보다 거친 token은 실패를 만듭니다. 축별 noise floor, controller deadband, saturation과 성공에 민감한 구간을 측정해 범위와 bin을 정합니다.

Baxter 로봇 팔 끝의 카메라와 두 손가락 그리퍼를 가까이서 본 모습
로봇 action은 말단 이동과 회전, 그리퍼 상태처럼 서로 단위와 분포가 다른 값을 포함합니다. 사진은 하드웨어 맥락을 보여 주며 특정 토큰화 성능을 입증하지 않습니다. 출처: Gustavo A. Casañ. 라이선스: CC BY-SA 4.0. EXIF orientation normalized, center-cropped around the Baxter wrist camera and gripper, and resized; no material content altered.

range 밖 값을 clip하면 안전해 보이지만 포화 빈도와 방향 정보가 사라진다

학습 범위보다 큰 action을 마지막 bin에 모두 넣으면 1.1과 3.0이 같은 token이 됩니다. decode 후에는 모두 경계값이 되어 모델이 얼마나 강한 명령을 원했는지 알 수 없고 연속 포화가 생깁니다.

로봇 간 행동 공간 정규화처럼 로봇별 통계를 보존하고 out-of-range token 또는 residual을 둘 수 있습니다. clip rate를 로봇·task·축별로 기록해 새 도메인에서 tokenizer가 깨지는지 먼저 감지합니다.

RT-2식 action-as-text는 언어 모델 decoding을 재사용하지만 유효 token 제약이 필요하다

action을 숫자 또는 reserved token 문자열로 표현하면 VLM을 robot data로 공동 fine-tune하기 쉽습니다. 그러나 일반 단어가 action 위치에 나오거나 차원 순서가 깨지면 decode할 수 없으므로 grammar와 vocabulary mask가 필요합니다.

RT-2 공식 프로젝트는 robot action을 text token으로 표현해 vision-language 모델과 함께 학습하는 방식을 보여 줍니다. 실제 시스템에서는 action 자리별 허용 token과 종료 조건을 강제해 malformed sequence를 막습니다.

token 수는 action horizon과 곱해져 추론 지연을 만든다

7개 차원을 50 step 예측하면 차원별 token 방식은 350개 출력을 요구할 수 있습니다. autoregressive decoding은 이전 token을 기다리므로 긴 sequence가 제어 주기보다 늦어질 수 있습니다.

로봇 Action Chunking은 여러 미래 action을 한 번에 예측하지만 tokenization이 그대로면 출력 길이는 여전히 큽니다. horizon을 늘릴 때는 open-loop 위험뿐 아니라 token 생성 시간과 network jitter를 함께 계산합니다.

FAST는 시간축 action을 주파수 공간으로 바꾼 뒤 압축해 짧은 token열을 만든다

부드러운 로봇 궤적은 인접 step이 강하게 상관되어 있으므로 매 step을 독립 bin으로 표현하면 반복 token이 많습니다. DCT 기반 표현은 저주파 계수에 주요 motion을 모으고 양자화·byte encoding으로 sequence를 줄입니다.

FAST 원 논문RSS 2025 출판본은 고주파·dexterous action에서 단순 per-step binning의 한계를 분석합니다. 압축률이 높아도 급접촉과 gripper 전환 같은 고주파 사건이 보존되는지 별도 확인해야 합니다.

learned codebook은 여러 action 차원의 상관을 묶지만 사용되지 않는 code와 재학습 비용이 생긴다

vector quantization은 손목 이동과 gripper 전환이 함께 나타나는 패턴을 하나의 code로 묶을 수 있습니다. 반면 일부 code만 쓰이는 collapse가 생기면 vocabulary 크기만 크고 표현력은 줄어듭니다.

OpenVLA 공식 저장소처럼 명시적 256-bin 방식은 단순하고 재현하기 쉽습니다. learned tokenizer를 선택한다면 code utilization, entropy, nearest-code distance와 dataset 버전 변경 시 호환성을 추가로 관리해야 합니다.

복원 평가는 평균 MSE 외에 축별 최대 오차·전환 시점·누적 pose drift를 봐야 한다

작은 오차가 50 step 누적되면 말단 위치가 크게 벗어날 수 있고 gripper token 한 step 지연은 물체를 놓칠 수 있습니다. translation, rotation, joint, gripper를 단위별로 나누고 접촉 구간을 별도 평가합니다.

encode→decode 왕복으로 원본 trajectory를 복원한 뒤 FK를 계산해 end-effector drift를 봅니다. 이어서 controller에 넣기 전 acceleration·jerk·limit 위반을 검사하고 필요한 smoothing이 원래 timing을 지우지 않는지 확인합니다.

action 범위와 bin, 시간 압축, 복원 오차와 실제 replay를 검증하는 점검표
토큰 수를 줄이는 효과와 제어 해상도·지연·포화 손실을 같은 기준으로 비교합니다. 출처: 피지컬 AI Lab.

tokenizer 통계와 vocabulary는 모델 checkpoint와 함께 버전 고정한다

같은 token ID 32001이 dataset 버전마다 다른 action bin을 뜻하면 과거 checkpoint를 새 decoder로 실행할 때 위험한 명령이 나옵니다. bin edge, dimension order, frame, dt, gripper rule과 vocabulary mapping을 immutable artifact로 묶습니다.

로봇 데이터 버전·계보 관리에 tokenizer digest와 normalization digest를 연결합니다. 새 tokenizer는 기존 model과 호환되지 않는 breaking change로 취급하고 migration test와 replay 결과를 남깁니다.

선택 기준은 vocabulary 크기가 아니라 복원 오차·시퀀스 길이·제어 성공률의 Pareto 전선이다

후보마다 token/second, compression ratio, 축별 round-trip error, clip rate, inference latency, 실제 task 성공률을 같은 dataset split에서 비교합니다. 단순 binning이 충분한 저주파 task라면 복잡한 tokenizer가 이득이 아닐 수 있습니다.

고주파 bimanual·dexterous task에서는 sequence 압축이 의미 있지만 고주파 사건 손실을 stress test합니다. 최종 합격은 safety limit 안에서 원본 continuous policy 대비 성능과 지연을 동시에 만족하는 경우입니다.

평가 축지표좋은 신호위험 신호
표현utilization·entropycode 고르게 사용collapse·희소 token
복원축별·누적 오차margin 이하접촉 구간 급증
효율tokens·latency주기 내 decodedeadline 초과
실기성공·jitter·limit기준 유지포화·진동 증가

로봇 행동 토큰화에서 자주 묻는 질문

로봇 action은 왜 굳이 토큰으로 바꾸나요?

autoregressive VLM의 discrete output 구조를 재사용하고 language·vision과 공동 학습하기 쉽기 때문입니다. 대신 양자화 오차와 긴 출력 시퀀스를 관리해야 합니다.

256개 bin이면 모든 로봇에 충분한가요?

아닙니다. action 범위, noise floor, controller deadband와 task 정밀도에 따라 다릅니다. 축별 복원 오차와 실제 replay로 결정해야 합니다.

uniform bin과 quantile bin 중 무엇이 더 좋나요?

uniform은 물리 오차를 해석하기 쉽고 quantile은 자주 쓰는 구간의 token 활용도가 높습니다. 실제 task의 민감 구간과 포화율을 비교해 선택합니다.

FAST는 Action Chunking과 같은 것인가요?

관련되지만 다릅니다. chunking은 여러 미래 action을 묶어 예측하는 전략이고 FAST는 그 action sequence를 주파수 공간에서 압축해 token화하는 방법입니다.

tokenizer를 바꾸고 기존 checkpoint를 그대로 써도 되나요?

대개 안 됩니다. token ID와 물리 action mapping이 바뀌면 출력 의미가 달라집니다. vocabulary·bin edge·frame·dt를 checkpoint와 함께 버전 고정해야 합니다.

행동 토큰화는 로봇 제어기의 관절·속도·힘 제한을 대신하지 않습니다. decode된 action은 별도 안전 검증과 rate limit, 충돌 검사 후 실제 하드웨어에 전달해야 합니다.