RAMMP 보조 로봇: Meta DINO·SAM을 휠체어와 로봇팔에 넣는 이유

보조 이동 플랫폼의 화면에 ‘문 열림 버튼을 찾지 못했습니다’라는 경보가 뜨면 문제는 객체 이름 하나로 끝나지 않는다. 카메라 가림, 낮은 대비, 모델 오인식, 네트워크 지연, 사용자 입력을 차례로 확인해야 한다. RAMMP는 이 흐름을 기기 안에서 짧게 만들려는 연구 프로젝트다.

탁자 앞에서 작업하는 PR2 이동형 양팔 로봇
실제 이동형 매니퓰레이터 PR2이며 RAMMP 휠체어 로봇팔은 아닙니다. Meta DINO·SAM 기반 인지나 사용자 보조 성능을 사진이 입증하지 않습니다. 이미지 출처: Wikimedia Commons · 라이선스: CC BY-SA 3.0 · 크레딧: Willow Garage

휠체어의 이동과 로봇팔의 집기는 한 장면을 공유한다

Meta의 공식 소개에 따르면 University of Pittsburgh의 HERL과 ATDev가 주도하는 RAMMP는 이동 플랫폼, 로봇팔, 보조기술 운영체제, 디지털 트윈을 결합한다. 카메라가 문 버튼, 컵, 연석을 찾아 이동과 조작의 맥락으로 넘기는 첫 프로토타입이 실세계 시험 단계로 소개됐다.

이동만 보면 연석과 사람을 피해야 하고, 조작만 보면 컵의 위치와 손잡이를 찾아야 한다. 둘을 합치면 사용자의 몸 위치, 팔의 도달 범위, 플랫폼 경로가 같은 좌표계에서 맞아야 한다. 한 모듈의 작은 오차가 다른 모듈의 접근 실패로 번질 수 있다.

카메라가 본 물체는 조명과 높이에 따라 달라진다

RAMMP 팀은 SAM으로 학습 데이터를 자동 라벨링하고, DINOv2 임베딩으로 미세조정한 경량 RF-DETR 탐지기를 사용한다고 설명한다. 여러 각도, 높이, 배경, 조명을 포함하고 다중 시점 일관성을 높이는 방식이다. DINOv3와 SAM을 엣지 장치에 최적화하는 작업도 함께 언급됐다.

자동 라벨은 사람 라벨링 비용을 줄이지만 오답도 빠르게 복제할 수 있다. 투명한 컵, 반사되는 버튼, 비에 젖은 연석, 휠체어 높이에서 가려진 표지처럼 놓치기 쉬운 조건을 별도 세트로 둬야 한다. ‘360도 인식’이라는 표현은 카메라 배치와 탐지 파이프라인의 범위를 뜻할 뿐 모든 방향의 위험을 항상 정확히 찾는다는 보증이 아니다.

DINO와 SAM은 행동을 직접 결정하지 않는다

DINO 계열은 라벨 없는 영상에서도 재사용할 수 있는 시각 표현을 학습하는 기반으로 쓰이고, SAM은 이미지의 대상 영역을 분할하는 데 쓰인다. RAMMP에서는 이 모델들이 장면을 보는 토대를 제공하지만 휠체어의 속도나 로봇팔의 모터 전류를 직접 정하는 제어기는 아니다.

탐지 결과에는 신뢰도, 위치, 시간 정보가 붙어야 한다. 같은 컵이 프레임마다 다른 물체 ID로 바뀌거나 버튼 위치가 흔들리면 제어 계층이 잘못된 경로를 만들 수 있다. 모델이 모른다고 표시할 기준과 사용자에게 다시 묻는 인터페이스가 정확도 수치만큼 중요하다.

온디바이스 추론은 지연을 줄여도 검증 책임을 없애지 않는다

일상 환경은 통신이 불안정하고 갑자기 사람이 나타날 수 있다. 기기 안에서 영상을 처리하면 왕복 네트워크 지연과 클라우드 중단 의존을 줄일 수 있다. 엣지 AI 로봇의 장점과 제약처럼 응답성과 프라이버시 측면의 이점이 생긴다.

대신 배터리, 열, 메모리, 무게가 제한된다. Meta는 낮은 정밀도, 실용 해상도, 효율적인 배치를 사용하며 경계 정밀도나 특징 세부를 일부 희생할 수 있다고 설명한다. 전력 모드가 바뀌거나 기기가 뜨거워졌을 때 지연과 탐지율이 어떻게 변하는지 같이 시험해야 한다.

온디바이스 처리는 영상이 외부로 나가지 않는 기본 경로를 만들 수 있지만 프라이버시를 자동 보장하지는 않는다. 장애 분석용 클립, 원격지원 화면, 모델 개선용 샘플이 언제 저장·반출되는지와 사용자별 동의·철회·삭제 절차를 정해야 한다. 원본 영상이 없어도 임베딩과 위치 로그가 생활 패턴을 드러낼 수 있어 보존 범위를 따로 점검해야 한다.

팔이 닿지 않거나 바퀴가 미끄러지면 비전 정답도 소용없다

컵을 정확히 찾았더라도 로봇팔의 관절 한계, 휠체어 자세, 테이블 높이 때문에 접근할 수 없을 수 있다. 연석을 탐지했더라도 타이어 접지, 경사, 배터리, 탑승자 무게가 허용 범위를 벗어나면 안전하게 지나지 못한다.

따라서 성공 정의는 탐지 정확도와 일상 활동 완료를 분리해야 한다. 모델이 물체를 찾았는지, 경로가 가능한지, 사용자가 명령을 이해했는지, 실제 작업이 손상 없이 끝났는지를 각 단계에서 기록한다. 연구팀이 사용자·임상의·옹호 단체를 설계에 참여시키는 이유도 벤치마크와 실제 필요가 어긋나지 않게 하기 위해서다.

멈춤은 실패가 아니라 다음 판단을 위한 상태다

보조 로봇에서 불확실한 상황을 억지로 진행하는 것보다 멈추고 사용자에게 확인하는 것이 나을 수 있다. 안전정지는 물리 브레이크만이 아니라 속도 제한, 팔 후퇴, 화면·음성 안내, 보호자 또는 원격 지원 요청까지 이어지는 복구 절차다.

시험 조건관찰할 출력안전한 결과위험 신호
역광 속 문 버튼탐지 신뢰도·좌표 흔들림재촬영 또는 사용자 확인낮은 신뢰도로 바로 접근
이동 중 사람 출현프레임 지연·정지 거리독립 센서로 감속·정지AI 결과만 기다림
컵 일부 가림물체 ID·그립 후보접근 취소·다른 시점 확보잘못된 물체 파지
장치 과열추론시간·프레임률성능 저하 감지 후 제한 모드지연 증가를 숨긴 채 운행
네트워크 단절로컬 기능·로그 상태필수 기능 유지 또는 안전정지클라우드 응답까지 무제한 대기

연구 목표를 임상 결과로 바꾸지 않고 다시 시험한다

ARPA-H의 RAMMP 사업 페이지는 University of Pittsburgh를 주관기관으로, 지원 규모를 최대 4,100만 달러로 표시한다. Meta 글은 최대 4,150만 달러라고 적어 공개 페이지 사이에 차이가 있다. 금액을 하나로 단정하기보다 각각의 공식 표기를 기록하고 최신 계약 문서로 확인해야 한다.

지원금과 컨소시엄은 연구 규모의 신호다. 독립적인 생활 기능 향상, 부상 감소, 장기 사용 만족도나 의료기기 승인 결과는 아니다. 첫 프로토타입의 실세계 시험도 다양한 사용자와 환경에서 반복돼야 한다.

  • 사용자별 카메라 높이·자세·입력 방식에 따른 성능 차이
  • 집·보도·상점처럼 배경이 다른 장소의 오탐·미탐
  • 온디바이스 전력 모드와 열 상태별 지연 분포
  • 잘못된 인식 뒤 사용자 개입과 정상 복귀 시간
  • 개인 영상의 저장·반출·삭제와 모델 업데이트 동의

독자가 이어서 묻는 질문

RAMMP에서 가장 먼저 예상할 실패는 무엇인가?

하나를 확정할 현장 통계는 아직 없다. 초기 시험에서는 조명·가림·카메라 높이 변화로 물체 위치가 흔들리고, 그 오차가 접근 경로에 전달되는 연결 실패를 우선 봐야 한다. 모델 정확도와 실제 활동 완료를 별도로 집계해야 한다.

인식이 틀리면 로봇은 어떻게 복구해야 하나?

낮은 신뢰도에서 속도를 줄이거나 멈추고, 다른 시점으로 재촬영한 뒤 사용자에게 확인하는 단계가 필요하다. 팔과 이동 플랫폼은 독립적인 힘·거리·정지 제한을 유지해야 하며, 반복 실패 시 수동 모드나 지원 요청으로 전환해야 한다.

자료 최종 확인: 2026년 8월 25일