로봇의 CPU·GPU·NPU가 맡을 작업을 주기, 지연, 메모리 이동과 전력 기준으로 나누고 실제 보드 선택과 프로파일링 순서를 설명합니다.
아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.
온디바이스 컴퓨팅은 연산량이 아니라 마감시간 배치 문제다
로봇용 컴퓨터를 고를 때 CPU·GPU·NPU의 최고 수치만 비교하면 실제 병목을 놓치기 쉽습니다. 카메라 수집, 디코딩, 전처리, 추론, 계획, 통신과 제어가 서로 다른 주기로 움직이므로 각 단계가 언제 끝나야 하는지 먼저 정해야 합니다.
온디바이스는 모든 일을 한 칩에서 처리한다는 뜻도 아닙니다. 빠른 안전·제어 루프는 별도 MCU나 실시간 제어기에 두고, 고수준 인식과 계획은 CPU·GPU·NPU가 맡는 계층형 구조가 흔합니다.
한 프레임이 관절 명령으로 바뀌는 시간을 나눈다
센서 노출과 전송, 메모리 복사, 전처리, 모델 실행, 후처리, 계획과 명령 전송을 하나의 추적 ID로 연결합니다. 모델 벤치마크의 추론 시간은 이 전체 시간 중 일부일 뿐입니다.
프레임 드롭과 큐 적체가 생기면 계산은 빨라도 로봇이 오래된 장면에 반응할 수 있습니다. 로봇 추론 지연 예산에서 설명한 프레임 나이, P95와 최대 지연을 장치별 프로파일에 함께 기록합니다.

CPU는 제어 흐름과 불규칙한 작업을 맡는다
CPU는 드라이버, ROS 2 실행기, 상태 머신, 경로 계획의 분기, 통신과 예외 처리처럼 제어 흐름이 복잡하고 작업 크기가 자주 바뀌는 부분에 적합합니다. GPU가 빠르더라도 작은 연산을 자주 호출하면 커널 시작과 동기화 비용이 더 커질 수 있습니다.
실시간 관절 제어까지 일반 CPU 애플리케이션과 같은 스케줄링 영역에 넣으면 파일 I/O나 메모리 회수 같은 작업이 지터를 만들 수 있습니다. 필요한 경우 비실시간 노드와 제어 루프를 분리해야 합니다.
GPU는 큰 병렬 연산과 유연한 모델에 강하다
GPU는 영상 전처리, 특징 추출, 3D 포인트 처리와 대형 신경망처럼 같은 연산을 많은 데이터에 적용하는 작업에 유리합니다. 지원 연산 폭과 개발 도구가 넓어 새 모델을 빠르게 시험할 때도 선택지가 많습니다.
다만 작은 배치의 로봇 추론에서는 최대 처리량보다 단일 요청 지연이 중요합니다. CPU와 GPU 사이 동기화, 텐서 레이아웃 변환, 메모리 할당과 다른 커널의 경쟁을 포함해 측정해야 합니다.
NPU는 지원되는 연산을 낮은 전력으로 반복할 때 유리하다
NPU는 컴파일러가 지원하는 신경망 연산을 정해진 형식으로 반복 실행할 때 전력 효율을 높일 수 있습니다. 항상 GPU보다 빠르거나 정확한 것은 아니며 모델의 연산자, 정밀도, 동적 입력과 후처리 지원이 맞아야 합니다.
모델 일부가 CPU로 되돌아가는 폴백이 생기면 장치 전환과 복사 비용이 커질 수 있습니다. 변환 로그에서 지원되지 않은 연산, 분할된 그래프와 정밀도 변화를 확인하고 전체 파이프라인으로 비교합니다.
| 작업 | 우선 후보 | 선택 이유 | 주의점 |
|---|---|---|---|
| ROS 2·상태 머신 | CPU | 분기와 I/O가 많음 | 코어 경쟁·지터 |
| 다중 카메라 비전 | GPU | 큰 병렬 텐서 처리 | 복사·동기화 |
| 고정 모델 반복 추론 | NPU | 지원 시 전력 효율 | 연산자·정밀도 제한 |
| 관절 안전 루프 | MCU·실시간 제어기 | 결정적 주기 | AI 가속기와 분리 |
메모리 대역폭과 복사 횟수가 숨은 성능표다
카메라 여러 대, 포인트클라우드, 지도와 대형 모델은 연산기보다 메모리를 먼저 압박할 수 있습니다. 공유 메모리 구조라도 소프트웨어가 버퍼를 새로 만들거나 색 형식을 반복 변환하면 실제 복사가 발생합니다.
제로카피라는 이름만 믿지 말고 주소와 버퍼 소유권, 캐시 동기화와 수명 주기를 추적합니다. 피크 대역폭 대신 센서가 동시에 켜진 지속 부하에서 읽기·쓰기량과 지연 변화를 측정해야 합니다.
전력 모드와 냉각 조건을 성능 설정에 포함한다
로봇은 배터리, 밀폐 하우징, 팬 소음과 먼지 환경 때문에 데이터센터와 같은 냉각을 기대하기 어렵습니다. 짧은 데모에서 나온 최고 성능이 30분 뒤에도 유지되는지 확인해야 합니다.
전력 모드, 클럭, 주변 온도와 팬 곡선을 고정하고 스로틀링 시작 시점과 작업별 전력 소비를 기록합니다. 배터리 수명은 평균 와트뿐 아니라 모터 부하와 컴퓨팅 피크가 겹치는 순간에도 영향을 받습니다.
보드 비교표에는 TOPS보다 실행 조건을 적는다
TOPS는 정밀도와 희소성, 연산 종류가 다르면 직접 비교하기 어렵습니다. 같은 모델, 같은 입력, 같은 정밀도와 같은 전력·냉각 조건에서 끝단 지연과 정확도를 측정해야 의미가 있습니다.
플랫폼 선택은 센서 인터페이스, 메모리 용량, 저장장치, 네트워크, 장기 공급, 안전 요구와 소프트웨어 생태계까지 포함합니다. 모델 하나가 빠른 보드보다 시스템 전체를 안정적으로 배포하고 진단할 수 있는 보드가 현장 비용을 줄일 수 있습니다.
| 판단 축 | 측정값 | 시험 조건 | 탈락 신호 |
|---|---|---|---|
| 반응성 | 끝단 P95·최대 지연 | 센서 전체 활성 | 프레임 나이 증가 |
| 지속 성능 | 30~60분 처리율 | 최악 주변 온도 | 주파수 저하 |
| 메모리 | 최대 사용량·대역폭 | 지도·로그 동시 실행 | OOM·스왑 |
| 배포성 | 빌드·업데이트 시간 | 운영 이미지 기준 | 수동 패치 의존 |
프로파일링은 단계별 타임스탬프와 자원 지표를 묶는다
센서 수신, 전처리 시작·끝, 가속기 제출·완료, 후처리와 명령 발행에 같은 추적 ID를 붙입니다. CPU 사용률, GPU·NPU 사용률, 메모리, 전력과 온도를 같은 시계로 모으면 대기가 어디서 생기는지 볼 수 있습니다.
평균값만 보면 간헐적인 가비지 컬렉션, 파일 기록, 무선 재전송과 열 스로틀링이 숨습니다. 정상·피크·고장 복구 시나리오를 나누고 각 시나리오의 P50, P95, 최대값과 실패율을 비교합니다.

한 칩과 분산 구조는 데이터 이동 비용으로 비교한다
한 SoC는 배선과 복사를 줄일 수 있지만 모든 작업이 같은 전력·열 예산을 경쟁합니다. 분산 구조는 제어와 인식을 격리할 수 있지만 이더넷 전송, 직렬화, 시간 동기화와 장애 모드가 늘어납니다.
경계를 나눌 때는 데이터 크기가 큰 원시 영상보다 의미가 압축된 결과를 보내는 편이 유리할 수 있습니다. 단, 안전 판단에 필요한 원본 품질과 지연을 잃지 않는지 검증해야 합니다.
실패는 연산 부족보다 통합 경계에서 자주 생긴다
드라이버 버전, 가속기 런타임, 커널, 컨테이너와 모델 컴파일러의 조합이 맞지 않으면 성능 회귀나 재현 불가 문제가 생깁니다. 운영 이미지를 고정하고 장치별 호환 표와 되돌리기 절차를 유지합니다.
또한 추론 실패를 빈 출력으로 넘기거나 큐가 밀릴 때 오래된 결과를 계속 쓰면 물리 오류로 이어집니다. 유효 시간, 타임아웃, 폴백과 정지 조건을 계획기와 제어기에 명시합니다.
참고할 공식 자료와 함께 읽을 글
NVIDIA의 최신 구조는 Jetson Software Architecture, 이기종 로봇 연산의 역할 구분은 AMD Robotics Solutions, RB5 계열 문서는 Qualcomm RB5 Documentation에서 확인할 수 있습니다.
플랫폼별 표현은 제조사 자료이므로 같은 수치처럼 단순 비교하지 않았습니다. 시스템 구조는 엣지 AI 로봇, 입력 결합은 로봇 센서 퓨전과 함께 읽으면 좋습니다.
로봇 온디바이스 컴퓨팅에서 자주 묻는 질문
CPU 없이 GPU나 NPU만으로 로봇을 만들 수 있나요?
대부분의 로봇은 드라이버, 통신, 상태 머신과 예외 처리를 위해 CPU가 필요합니다. GPU와 NPU는 특정 병렬 연산과 추론을 가속하는 역할입니다.
TOPS가 높으면 추론 지연도 항상 짧나요?
아닙니다. 정밀도, 연산자 지원, 메모리 복사, 배치, 전력 모드와 냉각에 따라 끝단 지연이 달라집니다.
NPU와 GPU를 동시에 써도 되나요?
가능하지만 모델 분할과 버퍼 이동 비용이 이득보다 클 수 있습니다. 독립 작업을 나누거나 실제 타임라인으로 검증해야 합니다.
메모리 용량과 대역폭 중 무엇이 더 중요한가요?
둘 다 필요합니다. 용량은 모델·지도·버퍼가 들어가는지 결정하고 대역폭은 센서와 텐서가 제시간에 이동하는지 결정합니다.
로봇 보드 시험은 얼마나 오래 해야 하나요?
최악 온도와 전체 센서·로그를 켠 지속 부하에서 스로틀링과 메모리 누수가 드러날 만큼 시험해야 하며, 짧은 데모 결과만으로 판단하면 안 됩니다.
제품 세대와 소프트웨어 버전에 따라 지원 연산과 성능이 달라집니다. 동일 조건의 자체 프로파일을 기준으로 선택해야 합니다.