Action Chunking은 로봇 정책이 다음 제어 한 스텝만 예측하지 않고 앞으로 이어질 여러 행동을 한 묶음으로 예측하는 방법입니다. 고주기 작업의 수백·수천 스텝을 더 짧은 의사결정 단위로 바꿔 오차 누적과 시범의 순간 노이즈를 줄일 수 있습니다. 다만 긴 청크를 그대로 실행하면 외란에 늦게 반응하므로 예측 구간, 실제 실행 구간과 겹치는 예측을 합치는 방법을 함께 설계해야 합니다.
Action Chunking은 긴 작업을 짧은 의사결정 묶음으로 바꾼다
단일 스텝 정책은 현재 관측 s_t에서 다음 행동 a_t를 예측합니다. 행동 청킹 정책은 a_t부터 a_{t+k-1}까지의 시퀀스를 한 번에 예측해 긴 작업의 유효 지평을 대략 청크 단위로 줄입니다. 학습 데이터의 시간 상관관계와 짧은 동작 문맥을 모델이 직접 볼 수 있다는 장점도 있습니다.
ACT는 행동 청킹을 Transformer와 조건부 변분 오토인코더에 결합한 대표 방법입니다. 훈련 때 시범 행동 시퀀스의 스타일 변수를 인코딩하고, 실행 때는 관측 영상과 관절 상태에서 행동 청크를 예측합니다. 여러 시점의 청크가 같은 미래 시각을 예측하면 temporal ensemble로 합쳐 명령을 부드럽게 합니다.
관측에서 미래 행동 묶음이 나오는 순서
관측 수집에서는 카메라 영상과 현재 관절 상태를 같은 시각 기준으로 입력합니다. 청크 예측에서는 Transformer가 앞으로 k개 시점의 관절 또는 말단 행동을 출력합니다. 겹침 정렬에서는 이전 관측에서 예측한 청크와 현재 청크가 가리키는 실제 시각을 맞춥니다.
시간 통합에서는 최근 예측에 더 큰 가중치를 두는 방식 등으로 겹친 행동을 합칩니다. 명령 실행에서는 제한과 보간을 적용한 한 스텝을 하위 제어기에 보내고 다음 관측을 받습니다.
원격조작 시범의 멈춤과 떨림을 덜 따라가는 이유
원격조작 데이터에는 사람의 미세한 손 떨림, 중간 멈춤, 같은 작업을 서로 다른 속도로 수행한 흔적이 들어갑니다. 한 스텝 정책은 순간 행동을 그대로 따라가며 오차가 누적될 수 있지만 청크는 짧은 동작의 방향성을 함께 예측합니다. 그렇다고 잘못된 시범을 자동으로 정리하는 것은 아니므로 품질 라벨과 실패 구간 제거가 필요합니다.
정밀 삽입에서는 카메라 한 프레임의 가림이나 관절 노이즈 때문에 예측이 튈 수 있습니다. 겹치는 여러 청크의 같은 시점 행동을 평균하면 순간 변화가 줄지만, 실제 접촉으로 방향을 급히 바꿔야 할 때는 과거 예측이 반응을 늦출 수 있습니다. 가중치와 청크 길이는 작업의 접촉 시간 척도에 맞춰야 합니다.

유효 지평과 temporal ensemble이 핵심이다
유효 지평 축소에서는 k개 행동을 한 결정으로 묶어 장기 작업의 순차 의사결정 횟수를 줄입니다. 시간 문맥에서는 미래 행동의 상관관계를 함께 학습해 동작 방향과 속도 패턴을 유지합니다.
Temporal ensemble에서는 겹치는 여러 예측을 합쳐 단일 관측 노이즈와 명령 튐을 줄입니다. 폐루프 갱신에서는 매 관측 또는 짧은 실행 구간마다 새 청크를 예측해 외란에 대응합니다.
단일 스텝·고정 청크·재계획 청크의 차이
행동 묶음을 예측한다는 말과 묶음을 끝까지 개방루프로 실행한다는 말은 다릅니다. 실제 구현은 예측 길이와 실행 길이, 재계획 간격을 따로 설정할 수 있습니다.
긴 청크는 일관성과 장기 문맥에 유리하지만 빠른 접촉 변화에 둔감할 수 있습니다. 짧은 청크는 폐루프 반응이 빠르지만 단일 스텝 정책의 누적 오차 문제로 돌아갈 수 있어 작업별 절충이 필요합니다.
| 구성 | 예측 길이 | 실행 방식 | 주요 특성 |
|---|---|---|---|
| 단일 스텝 | 1 | 매 스텝 재예측 | 반응 빠름·누적 오차 |
| 개방루프 청크 | k | k개 모두 실행 | 일관성 높음·외란 취약 |
| 재계획 청크 | k | 일부 실행 후 갱신 | 일관성과 반응 절충 |
| 겹침 앙상블 | k | 여러 청크를 시간 통합 | 부드러움·추가 지연 |
청크 길이는 성공률과 반응 지연을 함께 바꾼다
청크 길이 선택은 오프라인 행동 오차보다 실제 폐루프 성공으로 판단합니다. 작업 성공, 접촉 피크, 명령 jerk, 외란 복구 시간과 추론 빈도를 함께 측정합니다.
같은 모델도 제어 주기가 50Hz인지 200Hz인지에 따라 k=20의 실제 시간이 달라집니다. 청크 길이는 스텝 수와 초 단위를 함께 기록하고 카메라·정책·하위 제어기 주기를 명시해야 합니다.
| 지표 | 청크가 짧을 때 | 청크가 길 때 | 판정 질문 |
|---|---|---|---|
| 명령 연속성 | 관측 노이즈 영향 큼 | 패턴이 부드러움 | jerk가 줄었는가 |
| 외란 반응 | 빠른 갱신 | 과거 계획 영향 | 복구가 늦지 않은가 |
| 추론 부하 | 재계획 빈도 높음 | 빈도 낮출 수 있음 | 최악 지연은 얼마인가 |
| 작업 성공 | 장기 문맥 부족 가능 | 분포 밖 오차 누적 | 새 조건에서도 유지되는가 |
행동 청킹 정책을 구성하는 실제 순서
시간 단위 정리에서는 카메라·정책·행동·하위 제어 주기와 지연을 먼저 측정합니다. 기준 모델 학습에서는 단일 스텝 또는 짧은 청크를 기준으로 성공률과 행동 파형을 확보합니다. 청크 길이 스윕에서는 작업 단계보다 짧은 길이부터 늘리며 성공·jerk·복구를 비교합니다.
겹침 가중치 조정에서는 최근 예측과 과거 예측의 가중치를 바꿔 부드러움과 반응성을 맞춥니다. 외란·가림 시험에서는 물체 이동, 카메라 가림, 접촉 변화에서 재계획이 실제로 작동하는지 봅니다.
행동이 부드러워 보여도 작업에 실패하는 이유
k를 스텝 수로만 기록에서는 제어 주기가 바뀌면 실제 예측 시간이 달라져 결과를 재현할 수 없습니다. 청크 전체 실행에서는 첫 관측 뒤 환경이 바뀌어도 잘못된 행동을 끝까지 수행합니다. 과거 예측 비중 과다에서는 temporal ensemble이 접촉 후 필요한 빠른 방향 전환을 늦춥니다.
패딩 구간 학습에서는 에피소드 끝의 정지·반복 값이 긴 청크에 많이 들어가 조기 멈춤을 학습합니다. 시범 속도 혼합에서는 같은 동작의 시간 정렬이 크게 달라 청크가 평균 속도와 망설임을 배울 수 있습니다.
길이와 겹침을 바꿔 폐루프 성능을 검증한다
길이별 반복에서는 동일 초기 조건에서 여러 k를 충분히 반복해 성공률 신뢰구간을 비교합니다. 행동 파형에서는 속도·가속도·jerk와 관절 제한 근접도를 시간축에서 확인합니다. 접촉 이벤트에서는 접촉 전후의 예측 갱신과 힘 피크, 복구 시간을 비교합니다.
관측 손실에서는 프레임 드롭과 지연에서 청크가 안전하게 감속하거나 유지되는지 봅니다. 새 시범 스타일에서는 훈련과 다른 속도·접근 방향의 시범 조건에서 다중모드 처리를 확인합니다.
ACT의 CVAE와 Transformer를 제어 흐름에서 읽는 법
ACT의 CVAE는 시범에 존재하는 행동 스타일과 비마르코프적 차이를 잠재 변수로 표현하고 Transformer는 영상·상태와 미래 행동 시퀀스를 연결합니다. 실행 시에는 정책 출력이 하위 제어 주기와 같지 않을 수 있으므로 타임스탬프 보간과 관절 제한이 필요합니다.
도식은 각 관측에서 예측한 청크가 미래 시간축에서 겹치고, 같은 시각을 가리키는 여러 행동을 가중해 현재 명령을 만드는 과정을 보여줍니다. 이 구조를 보면 청크 길이와 앙상블 가중치가 왜 반응 지연을 만들 수 있는지 알 수 있습니다.

행동 묶음은 안전한 모션 프리미티브와 다르다
Action Chunking은 데이터의 장기 구조를 이용하지만 작업을 의미 단위로 자동 분할하는 고수준 계획과는 다릅니다. 고정 길이 청크가 집기·삽입 같은 실제 단계 경계와 맞지 않을 수 있습니다.
부드러운 행동은 안전이나 정확성의 충분조건이 아닙니다. 평균화된 명령이 장애물이나 힘 제한을 넘을 수 있으므로 충돌 검사·속도·토크 제한과 실패 감지는 정책 밖에 별도로 둬야 합니다.
Diffusion Policy와 시범 데이터 글을 함께 읽는 방법
이 주제를 더 넓게 이해하려면 Diffusion Policy, 로봇 행동 데이터 수집, 로봇 추론 지연 예산를 함께 읽는 편이 좋습니다. 각 글은 부품, 제어, 데이터 계층을 서로 다른 질문으로 나누어 설명합니다.
본문의 기술 범위는 다음 1차 자료를 기준으로 확인했습니다. ALOHA·ACT 프로젝트은 행동 청킹과 저비용 양팔 원격조작 시스템의 영상·코드·설계를 제공합니다. ACT 원 논문은 Action Chunking, CVAE와 temporal ensemble의 구조와 실제 작업 평가를 설명합니다. ALOHA 공식 구현은 데이터 수집, 정책 학습과 실제 로봇 실행 코드를 제공합니다. 수치와 적용 범위는 각 자료의 시험 조건을 벗어나 일반화하지 않았습니다.
Action Chunking에서 자주 묻는 질문
행동 청크는 모션 프리미티브와 같은가요?
고정 길이 미래 행동을 예측한다는 점은 비슷해 보이지만 의미가 명시된 기술 단위가 아닐 수 있습니다. 학습된 연속 시퀀스라는 점이 다릅니다.
청크 길이는 어떻게 정하나요?
제어 주기와 작업의 접촉 시간 척도를 기준으로 여러 길이를 스윕하고 성공률·jerk·외란 복구·추론 지연을 함께 비교합니다.
청크를 전부 실행해야 하나요?
아닙니다. 미래를 길게 예측해도 일부만 실행하고 새 관측으로 다시 예측할 수 있습니다. 실제 로봇에서는 이 재계획이 중요합니다.
Temporal ensemble은 단순 평균인가요?
같은 미래 시각을 예측한 여러 청크를 정렬한 뒤 최근 예측에 더 큰 가중치를 두는 방식 등이 사용됩니다. 구현에 따라 가중 함수가 다릅니다.
Diffusion Policy도 행동 청킹을 쓰나요?
많은 구현이 행동 시퀀스를 예측하고 일부를 실행하는 receding horizon을 사용합니다. 다만 ACT는 Transformer·CVAE, Diffusion Policy는 반복적 확산 생성이 핵심입니다.
마지막 확인: 2026년 7월 25일. 본문은 공개된 기술 문서와 논문을 기준으로 작성했으며, 제품별 수치와 안전 등급은 제조사 자료와 실제 시험 조건을 함께 확인해야 합니다.