로봇 추론 지연은 모델의 forward pass 시간만 뜻하지 않습니다. 카메라가 장면을 노출한 시각부터 프레임 전송·디코딩·전처리·AI 추론·후처리·ROS 메시지·모션 제한·하위 제어기를 거쳐 관절 명령이 실제 적용될 때까지의 끝단 시간을 봐야 합니다. 평균 FPS가 높아도 큐에 오래된 프레임이 쌓이거나 간헐적으로 지연이 길어지면 폐루프 로봇은 과거를 보고 움직입니다.
추론 지연은 센서에서 액추에이터까지의 끝단 시간이다
끝단 지연은 사건이 센서에 들어온 시각과 그 사건을 반영한 명령이 액추에이터에 적용된 시각의 차이입니다. 센서 노출 중간 시각, 프레임 수신, 추론 시작·끝, 메시지 발행, 제어 적용 시각을 같은 단조 증가 시계로 기록해야 각 구간을 합산할 수 있습니다.
처리량은 초당 처리한 프레임 수이고 지연은 한 프레임이 통과하는 시간입니다. 배치를 키우거나 큐를 깊게 하면 처리량은 오르지만 개별 프레임은 기다릴 수 있습니다. 빠른 장애물 회피나 접촉 작업에서는 batch 1과 최신 프레임 우선 정책이 더 중요할 수 있습니다.
한 프레임이 관절 명령으로 바뀌는 순서
노출·센서 처리에서는 광자가 센서에 쌓이고 ISP가 프레임을 만들 때 이미 시간이 지나갑니다. 전송·버퍼에서는 MIPI·USB·Ethernet을 거쳐 메모리 버퍼와 드라이버 큐에 들어갑니다. 전처리·추론에서는 리사이즈·정규화·복사 뒤 GPU 또는 NPU에서 모델을 실행합니다.
후처리·계획에서는 출력을 좌표·행동으로 변환하고 제한·충돌·안전 조건을 적용합니다. 통신·제어 적용에서는 명령이 버스와 하위 루프에 도착해 다음 제어 주기에 반영됩니다.
온보드 컴퓨터에서 복사와 대기가 모델보다 길어지는 이유
온보드 컴퓨터에서는 카메라 프레임을 CPU 메모리에서 GPU 메모리로 복사하고 색 형식과 크기를 바꾸는 비용이 큽니다. zero-copy 경로가 있어도 드라이버·프레임워크·모델 입력 형식이 맞지 않으면 중간 복사가 생깁니다. 프로파일러에서 모델 커널만 보면 이 시간을 놓칩니다.
여러 카메라와 VLA 모델, 기록 기능이 같은 GPU와 메모리 대역폭을 쓰면 대기열이 생깁니다. 열이 오른 뒤 클록이 낮아지거나 메모리 부족으로 재할당이 발생하면 P95와 최대 지연이 급증할 수 있습니다. 실제 배포 전력 모드와 동시 부하에서 측정해야 합니다.

처리량·평균 지연·꼬리 지연을 구분해야 한다
프레임 나이에서는 추론 시작 시 현재 시각과 센서 노출 시각의 차이로 입력이 얼마나 낡았는지 봅니다. 끝단 타임스탬프에서는 센서부터 하위 제어기까지 같은 시계 또는 동기화된 시계를 사용합니다.
최신값 우선에서는 처리하지 못한 오래된 프레임을 쌓기보다 폐기해 대기 지연을 제한합니다. 시간 예산에서는 각 단계에 상한과 여유를 배분하고 초과 시 감속·정지·대체 경로를 정의합니다.
클라우드·엣지·분할 추론의 시간 구조는 다르다
추론 위치는 계산 성능뿐 아니라 네트워크, 개인정보, 가용성과 로봇의 안전 반응에 영향을 줍니다. 같은 모델도 엣지·클라우드·분할 구조에서 지연 분포가 달라집니다.
고수준 언어 계획은 클라우드 지연을 허용할 수 있지만 빠른 시각 서보와 충돌 반응은 로봇 가까이 둬야 합니다. 한 로봇 안에서도 시간 제약에 따라 모델과 제어 계층을 나눌 수 있습니다.
| 구성 | 장점 | 지연 위험 | 적합한 기능 |
|---|---|---|---|
| 온보드 엣지 | 네트워크 독립·낮은 왕복 | 전력·열·메모리 | 인지·정책 폐루프 |
| 로컬 서버 | 큰 GPU·여러 로봇 공유 | 스위치·혼잡·케이블 | 중간 주기 추론 |
| 클라우드 | 확장성·큰 모델 | WAN 변동·단절 | 비실시간 계획·분석 |
| 분할 추론 | 연산 분배 | 중간 특징 전송·복잡성 | 특정 대역폭 조건 |
프레임 나이와 P95·최대 지연을 함께 측정해야 한다
지연 분포는 평균, 중앙값, P95·P99와 최대값을 함께 봅니다. 제어 주기와 안전 타임아웃은 높은 백분위와 최악 상황을 기준으로 설계하고, 처리량은 별도 지표로 둡니다.
카메라 30fps라면 새 프레임 간격만 약 33ms입니다. 모델이 10ms여도 프레임이 큐에서 50ms 기다리면 실제 반응은 60ms보다 길어집니다. 노출 시각 기준의 프레임 나이를 기록해야 합니다.
| 지표 | 시작-끝 | 보여주는 문제 | 권장 기록 |
|---|---|---|---|
| 센서 지연 | 노출-프레임 수신 | 카메라·전송 | 평균·P95·최대 |
| 모델 지연 | 추론 시작-끝 | 런타임·GPU | 워밍업 후 분포 |
| 프레임 나이 | 노출-추론 시작 | 큐·복사·동기화 | 프레임별 |
| 끝단 지연 | 노출-명령 적용 | 전체 폐루프 | 작업 상태별 |
로봇 지연 예산을 만드는 실제 순서
반응 요구 정의에서는 로봇 속도와 허용 위치 오차에서 최대 끝단 지연과 정지 조건을 정합니다. 단계 타임스탬프에서는 카메라·전처리·모델·후처리·통신·제어 적용 지점에 계측을 넣습니다. 큐 정책 설정에서는 버퍼 깊이와 drop-oldest·latest-only 방식을 정하고 프레임 ID를 전달합니다.
최적화 우선순위에서는 가장 큰 구간부터 복사 제거·양자화·해상도·스케줄링을 조정합니다. 최악 부하 시험에서는 모든 센서·기록·모델을 켜고 가열한 상태에서 장시간 분포를 측정합니다.
벤치마크 ms가 실제 로봇에서 재현되지 않는 이유
모델 벤치마크만 인용에서는 카메라·전처리·큐·후처리와 제어 적용 시간이 빠집니다. FPS를 지연으로 사용에서는 처리량이 높아도 깊은 큐와 배치 때문에 한 프레임은 오래 기다릴 수 있습니다. 서로 다른 시계에서는 센서와 GPU·제어기 타임스탬프를 직접 빼 잘못된 음수·편향 지연을 만듭니다.
워밍업만 측정에서는 열 스로틀링·메모리 파편화·동시 부하에서 생기는 꼬리 지연을 놓칩니다. 지연 초과 동작 없음에서는 낡은 행동을 계속 적용해 로봇이 과거 물체 위치로 움직입니다.
부하·열·네트워크를 바꿔 최악 지연을 검증한다
단일 단계 기준선에서는 각 모듈을 단독 실행해 최소 지연과 복사 횟수를 측정합니다. 전체 파이프라인에서는 프레임 ID를 끝까지 전달해 센서부터 명령 적용까지 추적합니다. 동시 부하에서는 다중 카메라·로그·다른 모델과 함께 실행해 자원 경합을 확인합니다.
열 안정에서는 장시간 운전 후 전력·클록·온도와 지연 분포를 함께 기록합니다. 지연 주입에서는 의도적으로 프레임과 네트워크를 늦춰 감속·정지·최신값 복구를 확인합니다.
정책 주기와 하위 제어 주기를 연결하는 구조
상위 VLA가 10Hz로 행동 청크를 만들고 하위 관절 제어기가 1kHz로 추종할 수 있습니다. 두 주기 사이에는 타임스탬프 보간, 명령 유효기간과 워치독이 필요합니다. 새 정책 출력이 늦으면 이전 청크를 어디까지 실행할지와 언제 안전 정지로 전환할지 정해야 합니다.
도식은 센서 노출, 전송·버퍼, 전처리, 모델, 후처리·계획, 통신, 제어 적용을 한 시간축에 놓습니다. 각 블록의 P95와 최대값을 더하기보다 실제 프레임 ID로 끝단을 직접 측정하면 병렬 처리와 대기를 정확히 반영할 수 있습니다.

양자화와 프레임 생략에는 정확도 비용이 따른다
양자화·프루닝·낮은 해상도는 지연을 줄일 수 있지만 작은 물체·접촉 상태·언어 조건의 정확도를 떨어뜨릴 수 있습니다. 전체 평균 정확도뿐 아니라 안전에 중요한 희귀 조건을 다시 평가해야 합니다.
클라우드나 공유 GPU의 지연은 평균값을 계약해도 순간 혼잡과 단절이 남습니다. 지연 상한을 보장할 수 없는 계층은 안전 기능과 빠른 폐루프에서 분리해야 합니다.
VLA 평가와 실시간 제어 글을 함께 읽는 방법
이 주제를 더 넓게 이해하려면 ROS 2 실시간 제어, 로봇 VLA 평가, Action Chunking를 함께 읽는 편이 좋습니다. 각 글은 부품, 제어, 데이터 계층을 서로 다른 질문으로 나누어 설명합니다.
본문의 기술 범위는 다음 1차 자료를 기준으로 확인했습니다. NVIDIA Jetson 소프트웨어 문서은 JetPack·Jetson Linux와 엣지 AI 배포 구성의 공식 문서를 제공합니다. TensorRT 성능 모범 사례은 프로파일링·배치·동시 실행과 지연 최적화 방법을 설명합니다. ROS 2 tracing 튜토리얼은 노드·콜백 실행 흐름과 지연을 추적하는 공식 절차를 제공합니다. 수치와 적용 범위는 각 자료의 시험 조건을 벗어나 일반화하지 않았습니다.
로봇 추론 지연에서 자주 묻는 질문
모델이 10ms면 로봇도 10ms 안에 반응하나요?
아닙니다. 센서 노출·버퍼·전처리·후처리·통신·제어 주기까지 더해야 하며, 추론 시작 시 프레임이 이미 낡았을 수 있습니다.
FPS와 지연은 같은가요?
아닙니다. FPS는 처리량이고 지연은 개별 프레임의 통과 시간입니다. 배치와 큐로 FPS가 높아져도 지연은 늘 수 있습니다.
평균 지연만 보면 안 되는 이유는 무엇인가요?
간헐적 긴 지연이 충돌 회피와 안전 타임아웃을 깨기 때문입니다. P95·P99·최대와 초과 횟수를 봐야 합니다.
프레임을 버려도 되나요?
폐루프 제어에서는 오래된 프레임을 모두 처리하는 것보다 최신 상태를 쓰는 편이 안전할 수 있습니다. 다만 추적 연속성과 센서 동기화 요구를 함께 고려합니다.
클라우드 VLA는 로봇에 쓸 수 없나요?
고수준 계획과 느린 작업에는 쓸 수 있지만 빠른 접촉·안전 반응은 엣지 또는 하위 제어기에 남기고 네트워크 단절 시 대체 동작을 정의해야 합니다.
마지막 확인: 2026년 7월 25일. 본문은 공개된 기술 문서와 논문을 기준으로 작성했으며, 제품별 수치와 안전 등급은 제조사 자료와 실제 시험 조건을 함께 확인해야 합니다.