Diffusion Policy는 로봇의 카메라 영상과 상태를 조건으로 미래 행동 시퀀스를 생성하는 모방학습 방법입니다. 이미지 생성의 확산 모델처럼 무작위 행동에서 시작해 여러 단계의 노이즈 제거를 거쳐 시범 데이터에 가까운 행동 청크를 만듭니다. 핵심 장점은 같은 관측에서 왼쪽이나 오른쪽으로 우회하는 여러 유효 행동을 평균내지 않고 분포로 표현할 수 있다는 점이지만, 반복 추론 지연과 데이터 분포 밖 행동은 별도로 관리해야 합니다.
Diffusion Policy는 행동의 한 점이 아니라 분포를 학습한다
일반적인 행동 회귀는 관측 o에서 다음 행동 a의 평균 오차를 줄입니다. 시범에 서로 다른 두 경로가 있으면 평균이 장애물 한가운데나 물체 사이의 실행 불가능한 자세가 될 수 있습니다. Diffusion Policy는 조건부 행동 분포를 모델링해 이 여러 모드를 유지하려고 합니다.
학습에서는 실제 행동 시퀀스에 단계별 노이즈를 넣고 네트워크가 그 노이즈나 깨끗한 행동을 복원하도록 훈련합니다. 추론에서는 무작위 시퀀스에서 시작해 관측 조건을 보며 반복적으로 정제합니다. 출력은 관절 위치·속도, 말단 자세 또는 그 변화량으로 표현할 수 있어 하드웨어 인터페이스와 맞춰야 합니다.
관측에서 행동 청크가 생성되는 순서
관측 인코딩에서는 여러 카메라 영상과 관절 상태, 작업 조건을 고정 길이 표현으로 바꿉니다. 초기 행동 샘플에서는 예측 구간 길이만큼 무작위 행동 시퀀스를 만듭니다. 반복 정제에서는 관측 조건을 사용해 각 확산 단계에서 행동 노이즈를 줄입니다.
행동 청크 선택에서는 제한과 정규화를 적용해 가까운 몇 스텝을 제어 명령으로 보냅니다. 새 관측 재계획에서는 일부 행동을 실행한 뒤 새 영상과 상태로 다음 청크를 다시 생성합니다.
시범 데이터의 여러 성공 경로가 평균으로 뭉개지지 않는 이유
시범 데이터에는 같은 물체를 집어도 접근 방향, 속도, 손목 회전이 여러 형태로 존재합니다. 단일 평균 행동은 이 경로를 섞을 수 있지만 확산 정책은 하나의 일관된 경로를 샘플링할 수 있습니다. 다만 카메라 위치와 행동 좌표계가 세션마다 흔들리면 모델은 유효한 다중모드가 아니라 수집 오류까지 학습합니다.
실제 로봇에서는 추론이 끝날 때까지 관측이 낡아집니다. 이미지 인코딩과 여러 번의 denoising이 100ms 걸리는데 로봇이 빠르게 움직이면 출력 행동은 이미 지난 상태를 기준으로 합니다. 예측 구간, 실행 구간, 재계획 빈도와 하위 제어기 보간을 하나의 지연 예산으로 다뤄야 합니다.

확산 과정과 receding horizon을 함께 이해해야 한다
조건부 생성에서는 현재 관측과 상태가 가능한 행동 분포를 좁혀 작업에 맞는 시퀀스를 만듭니다. 다중모드 표현에서는 서로 다른 성공 경로를 평균내지 않고 각각 높은 확률의 행동으로 유지합니다.
행동 청킹에서는 한 번에 미래 여러 스텝을 예측해 단일 스텝 노이즈와 장기 오차를 줄입니다. 재계획에서는 청크 일부만 실행하고 새 관측으로 다시 생성해 외란과 모델 오차를 보정합니다.
단일 스텝 회귀·ACT·Diffusion Policy의 차이
Diffusion Policy를 평가할 때는 최신이라는 이유보다 데이터와 제어 요구에 맞는지 봐야 합니다. 단일 스텝 회귀와 ACT도 추론 비용과 행동 부드러움에서 유리한 경우가 있습니다.
정밀하고 여러 접근 경로가 있는 작업에서는 생성 분포가 유리할 수 있고, 매우 빠른 반응과 작은 컴퓨팅이 필요한 작업에서는 단순 정책이 더 안정적일 수 있습니다. 같은 데이터·하드웨어·시간 예산에서 비교해야 합니다.
| 정책 | 출력 단위 | 다중모드 처리 | 주요 부담 |
|---|---|---|---|
| 단일 스텝 회귀 | 다음 행동 1개 | 평균화되기 쉬움 | 누적 오차 |
| ACT | 행동 청크 | CVAE 스타일 변수 | 청크 길이·겹침 |
| Diffusion Policy | 반복 생성 행동 청크 | 분포 샘플링 | 추론 단계와 지연 |
| 고전 경로 계획 | 기하·동역학 궤적 | 명시적 후보 탐색 | 정확한 모델·비용 함수 |
성공률과 추론 지연을 같은 표에서 봐야 한다
논문 성공률만 보면 배포 성능을 알기 어렵습니다. 작업 성공, 부분 진척, 추론 지연, 행동 부드러움, 재시도와 안전 제한 위반을 실제 제어 주기에서 함께 기록합니다.
샘플 수를 늘려 가장 좋은 행동만 고르면 오프라인 성공률은 오를 수 있지만 실시간 비용도 증가합니다. 한 번의 추론 시간뿐 아니라 카메라 취득부터 첫 명령이 적용될 때까지 끝단 지연을 측정합니다.
| 지표 | 측정 대상 | 주의점 | 배포 질문 |
|---|---|---|---|
| 작업 성공률 | 완료 조건 충족 | 반복 수·초기 상태 | 보지 못한 배치에서도 유지되는가 |
| 추론 지연 | 관측-행동 출력 | 워밍업·GPU 부하 | 제어 주기 안에 들어오는가 |
| 행동 연속성 | 속도·가속도·jerk | 정규화·보간 영향 | 관절 제한을 넘지 않는가 |
| 복구율 | 외란 뒤 성공 | 재계획 빈도 | 실패를 감지하고 멈추는가 |
로봇 데이터와 모델을 구성하는 실제 순서
행동 표현 결정에서는 관절·말단·델타 명령 중 하드웨어와 작업에 맞는 좌표계와 주기를 정합니다. 시범 품질 점검에서는 시간 동기화, 카메라 고정, 성공 기준과 이상 행동을 세션별로 검사합니다. 예측·실행 구간 설정에서는 청크 길이와 실제 실행 스텝, 재계획 빈도를 지연 예산에 맞춥니다.
안전 래퍼 연결에서는 관절·속도·작업공간 제한과 충돌 검사, 타임아웃을 정책 밖에 둡니다. 분포 밖 시험에서는 새 물체·조명·배치·외란을 분리해 성공률과 실패 모드를 기록합니다.
시뮬레이션에서 되지만 실제 로봇에서 실패하는 이유
훈련 영상만 재생에서는 오프라인 손실과 시각화가 좋아도 폐루프에서 오차가 누적될 수 있습니다. 행동 좌표계 혼합에서는 세션마다 관절·말단·카메라 기준이 달라 모델이 일관된 분포를 배우지 못합니다. 청크 전체를 개방루프로 실행에서는 초기 예측 오차와 외란을 새 관측으로 수정하지 못합니다.
추론 평균만 측정에서는 GPU 경합이나 캐시 미스에서 생기는 최악 지연을 놓칩니다. 실패 시범 무표시에서는 중단·재시도 행동을 성공 경로와 섞어 정책이 망설임을 학습할 수 있습니다.
보지 못한 물체·배치·교란으로 일반화를 검증한다
동일 분포 반복에서는 훈련과 같은 조건에서 기본 성공률과 분산을 충분한 반복으로 측정합니다. 초기 배치 변화에서는 물체 위치·회전·로봇 시작 자세를 격자로 바꿔 성공 영역을 지도화합니다. 시각 변화에서는 조명·배경·가림·카메라 노이즈를 한 변수씩 바꿔 민감도를 봅니다.
외란 주입에서는 물체나 로봇을 안전하게 이동시켜 재계획과 복구 행동을 확인합니다. 지연·부하 시험에서는 GPU를 공유하거나 프레임을 지연시켜 안전 정지와 성능 저하를 확인합니다.
저수준 제어기와 생성 정책을 연결하는 구조
생성 정책의 출력은 바로 모터 PWM이 아니라 하위 위치·속도·토크 제어기가 추종할 목표입니다. 출력 주기 사이를 보간하고 관절 제한과 가속도 제한을 적용하며, 정책이 끊기거나 늦으면 안전한 정지 목표로 전환해야 합니다.
도식은 영상·상태 인코딩, 무작위 행동 시퀀스, 반복 노이즈 제거, 실행 구간 선택, 새 관측 재계획을 보여줍니다. 모델 아키텍처보다 이 시간 흐름을 먼저 보면 추론 지연과 청크 길이가 실제 로봇에 미치는 영향을 이해하기 쉽습니다.

확산 모델이 안전 제약을 자동 보장하지는 않는다
Diffusion Policy는 확률적 생성 모델이므로 같은 관측에서도 출력이 달라질 수 있습니다. 재현성이 필요한 시험은 시드와 샘플 수를 기록하고, 안전 제한은 확률 정책과 독립적으로 결정론적으로 적용해야 합니다.
논문에서 보고한 평균 성능은 특정 데이터·카메라·로봇·작업의 결과입니다. 다른 관절 주기나 엔드이펙터, 시범 품질에서는 같은 개선을 보장하지 않으며 직접 기준 모델과 비교해야 합니다.
행동 청킹과 VLA 평가 글을 함께 읽는 방법
이 주제를 더 넓게 이해하려면 Action Chunking, 로봇 VLA 평가, 로봇 추론 지연 예산를 함께 읽는 편이 좋습니다. 각 글은 부품, 제어, 데이터 계층을 서로 다른 질문으로 나누어 설명합니다.
본문의 기술 범위는 다음 1차 자료를 기준으로 확인했습니다. Diffusion Policy 프로젝트은 조건부 행동 확산, receding horizon과 실험 결과를 공개합니다. Diffusion Policy 원 논문은 모델 구조·학습 목표·12개 작업 평가 조건을 설명합니다. 공식 구현 저장소은 데이터 형식, 학습·평가 구성과 재현 코드를 제공합니다. 수치와 적용 범위는 각 자료의 시험 조건을 벗어나 일반화하지 않았습니다.
Diffusion Policy에서 자주 묻는 질문
Diffusion Policy는 이미지를 생성하나요?
로봇 정책에서는 보통 이미지가 아니라 관측에 맞는 미래 행동 시퀀스를 반복적으로 정제해 생성합니다.
왜 다음 행동 하나가 아니라 청크를 예측하나요?
짧은 시간의 일관된 움직임을 만들고 단일 스텝 노이즈와 장기 누적 오차를 줄이기 위해서입니다. 일부만 실행하고 다시 계획하는 구성이 중요합니다.
같은 관측에서 행동이 달라도 괜찮나요?
여러 경로가 모두 성공이라면 장점입니다. 하지만 안전성과 재현성이 필요한 구간은 샘플링·제약·후보 선택을 통제해야 합니다.
추론이 느리면 어떻게 하나요?
확산 스텝, 모델 크기, 영상 해상도, 청크 길이를 줄이거나 가속 런타임을 쓰고 하위 제어기가 안전하게 보간하도록 설계합니다.
VLA와 같은 개념인가요?
아닙니다. VLA는 시각·언어·행동을 연결하는 모델 범주이고 Diffusion Policy는 행동 분포를 생성하는 정책 방식입니다. VLA의 행동 헤드로 확산 방식을 쓸 수는 있습니다.
마지막 확인: 2026년 7월 25일. 본문은 공개된 기술 문서와 논문을 기준으로 작성했으며, 제품별 수치와 안전 등급은 제조사 자료와 실제 시험 조건을 함께 확인해야 합니다.