Gemini Robotics On-Device 2란: 인터넷 없이 로봇에서 실행하는 VLA

Gemini Robotics On-Device 2는 로봇의 로컬 장치에서 실행하도록 만든 비전-언어-행동 모델(VLA)입니다. 이미지·자연어·로봇 자체 상태를 받아 관절이나 말단 동작에 연결할 수 있는 수치 행동을 출력한다는 점에서 고수준 계획용 VLM인 ER 2와 다릅니다.

다만 2026년 8월 6일 현재 공개 Gemini API 모델은 아닙니다. Google DeepMind는 접근 상태를 Trusted Testers로 표시하고 조기 접근 대기 명단을 받고 있습니다. 온디바이스라는 이름만 보고 누구나 다운로드할 수 있는 공개 모델로 이해하면 안 됩니다.

On-Device 2는 로봇 안에서 행동을 만드는 모델이다

Google DeepMind 공식 페이지는 네트워크 지연이나 인터넷 연결 없이 로봇에서 로컬로 실행하도록 최적화한 VLA라고 설명합니다. 카메라가 본 장면과 사용자의 지시, 로봇의 현재 자세를 결합해 다음 행동을 계산합니다.

ER 2가 작업 계획과 함수 호출을 만드는 고수준 두뇌라면 On-Device 2는 그 지시를 수치 행동으로 바꾸는 실행층입니다. 두 모델을 조합할 수 있지만 On-Device 2만으로 모든 장기 계획과 안전 판단이 해결되는 것은 아닙니다.

구분On-Device 2ER 2
모델 유형VLAVLM·embodied reasoning
입력이미지, 텍스트, 로봇 고유감각 수치텍스트, 이미지, 영상, 오디오
출력수치 로봇 행동텍스트, 계획, 도구 호출
주요 위치로봇 로컬 장치Gemini API·AI Studio
공개 상태Trusted Testers개발자 공개 프리뷰

입력과 출력이 실제 제어 루프에 가깝다

On-Device 2 모델 카드는 텍스트 명령, 로봇 시점 이미지, 수치 고유감각을 입력으로 적고 출력은 수치 로봇 행동이라고 명시합니다. 학습 데이터도 이미지·텍스트·로봇 센서·행동 데이터로 구성됩니다.

수치 행동이 나온다고 해서 모터 안전이 자동 보장되지는 않습니다. 로봇별 행동 공간 변환, 관절 한계, 충돌 없는 궤적, 힘 제어와 비상 정지는 하위 제어기에서 검증해야 합니다. 엣지 AI 로봇 구조는 모델 추론과 실시간 제어기를 분리해 보는 데 도움이 됩니다.

데이터모델에서의 역할현장 검증
카메라 이미지물체·장면과 작업 상태 파악조명, 가림, 카메라 지연
자연어 지시해야 할 작업의 의미 제공모호한 지시와 금지 행동
고유감각관절·기체의 현재 상태 반영센서 보정과 누락 값
수치 행동다음 로봇 동작 제안관절 한계, 충돌, 힘·속도 제한

빠른 적응은 구글이 공개한 제한된 평가 결과다

공식 페이지는 새로운 로봇에 200개 미만의 예제로 적응할 수 있고 몇 시간의 학습으로 새로운 기체·형상·센서에 맞출 수 있다고 설명합니다. 모델 카드는 SO101과 Dexmate 같은 새 플랫폼에서 이전 On-Device 모델보다 높은 최종 성공률을 보였다고 보고합니다.

이 수치는 구글이 수행한 시뮬레이션·실기 평가의 결과이며 모든 로봇에 필요한 데이터가 200개 미만이라는 보증이 아닙니다. 작업 다양성, 카메라 위치, 행동 공간, 실패 데이터와 안전 제약에 따라 수집량은 달라집니다. 사내 목표는 성공 사례 수가 아니라 실패·경계 조건을 포함한 데이터 커버리지로 잡아야 합니다.

NASA K10 현장 로버 실사진
현장 로봇은 연결 지연과 단절을 견뎌야 하므로 로컬 추론이 유용할 수 있습니다. K10은 On-Device 2 탑재 로봇이 아닙니다. 출처: NASA via Wikimedia Commons. 라이선스: Public domain, NASA work.

지금은 대기 명단과 선정된 테스트 단계다

Google DeepMind 페이지는 상태를 Trusted Testers로 표시하고 조기 접근 신청 링크를 제공합니다. 일반 Gemini API 가격표에 모델 엔드포인트가 있는 ER 2와 달리 On-Device 2는 API 키만으로 즉시 호출하거나 공개 가중치를 내려받는 경로가 안내되지 않았습니다.

도입을 검토한다면 대상 로봇 종류, 온보드 컴퓨팅, 데이터 수집 가능 범위, 추가 학습과 배포 방식, 업데이트·지원 조건을 신청 단계에서 확인해야 합니다. 구글 피지컬 AI 지도에서 공개 API와 제한 접근 모델을 따로 표시한 이유입니다.

공식 모델 카드가 적은 한계를 먼저 본다

모델 카드는 학습 분포 밖 작업과 고자유도 로봇 제어에서 일반화가 제한될 수 있다고 밝힙니다. 주된 평가 범위는 서 있는 양팔 로봇의 조작이며 이동형 플랫폼과 전신 제어의 위험은 현재 평가 범위 밖입니다.

따라서 휴머노이드 보행, 계단, 사람과의 밀접 협업까지 같은 성능을 기대하면 안 됩니다. 작은 고정형 조작 과제에서 시작해 새 물체·가림·센서 오류·잘못된 지시를 단계적으로 늘리고 실패 시 안전 정지와 사람 인계율을 함께 측정해야 합니다.

VLA의 기본 개념과 평가 항목은 VLA와 VLM 비교를 참고할 수 있습니다. 출력 형식이 행동이라는 사실과 행동이 안전하다는 판단은 별개의 문제입니다.

Gemini Robotics On-Device 2란: 인터넷 없이 로봇에서 실행하는 VLA의 핵심 판단을 정리한 판단 카드
Google 공식 자료를 바탕으로 피지컬 AI Lab이 재구성한 편집 카드입니다. 출처: Physical AI Lab. 라이선스: Owned original.

로컬 실행도 개인정보와 안전 설계가 필요하다

로컬 추론은 영상의 왕복 지연과 지속적인 클라우드 전송을 줄일 수 있습니다. 그러나 학습 예제 업로드, 원격 로그, 모델 업데이트, ER 2 도구 호출을 함께 쓰면 데이터가 장치 밖으로 나갈 수 있습니다. 온디바이스라는 이름만으로 모든 데이터가 항상 로봇 안에 남는다고 단정하면 안 됩니다.

카메라에 사람이 들어오는 작업장은 촬영 고지, 보관 기간, 접근권한, 얼굴·문서 비식별화와 삭제 절차를 정해야 합니다. 안전 측면에서는 의미 수준의 ER 모델, 충돌 없는 모션 계획, 힘·균형 제어, 하드웨어 비상 정지를 겹쳐 사용하는 계층형 구성이 공식 모델 카드의 권고와 맞습니다.

자주 묻는 질문

Gemini Robotics On-Device 2를 지금 다운로드할 수 있나요?

공식 페이지는 2026년 8월 6일 현재 Trusted Testers 상태와 조기 접근 대기 명단을 안내합니다. 공개 가중치 다운로드나 누구나 사용하는 Gemini API 엔드포인트는 명시돼 있지 않습니다.

On-Device 2는 인터넷이 완전히 없어도 작동하나요?

모델은 네트워크 제약과 로컬 실행을 위해 설계됐습니다. 다만 실제 시스템이 원격 로그, 업데이트, 클라우드 ER 모델이나 인증을 함께 쓰면 인터넷이 필요할 수 있으므로 제품 전체 아키텍처를 확인해야 합니다.

200개 미만의 예제면 어떤 로봇도 학습할 수 있나요?

그렇게 일반화할 수 없습니다. 200개 미만은 구글이 공개한 특정 적응 사례의 설명입니다. 기체 자유도, 센서 배치, 작업 다양성과 실패 조건에 따라 필요한 데이터와 학습 시간이 달라집니다.

확인한 공식 자료

최종 확인: 2026년 8월 6일