Gemini Robotics-ER 1.6이란: 로봇용 VLM이 맡는 판단과 실행 경계

버전 업데이트: Google은 기존 gemini-robotics-er-1.6-preview 모델을 2026년 8월 31일 종료할 예정이라고 안내했습니다. 현재 후속 모델 Gemini Robotics ER 2가 공개 미리보기로 제공됩니다. 새 모델 ID·요금·이전 범위는 ER 2 요금·API 가이드에서 확인하세요. 종료 일정은 공식 Gemini API 변경 기록 기준이며, 아래 기존 본문은 ER 1.6의 역사적 설명으로 유지합니다.

Gemini Robotics-ER 1.6은 로봇이 카메라와 언어 입력을 바탕으로 물체와 공간 관계를 이해하고, 작업을 나누고, 완료 여부를 판단하도록 만든 로봇용 비전·언어 모델입니다. 관절 토크나 모터 명령을 매 순간 직접 출력하는 VLA와는 역할이 다릅니다. 높은 수준의 판단을 내린 뒤 로봇 함수, 별도의 VLA 또는 안전이 검증된 제어기를 호출하는 쪽에 가깝습니다.

이름의 ER은 embodied reasoning을 뜻한다

ER은 몸을 가진 시스템이 물리 환경을 이해하는 추론을 뜻합니다. 화면 속 물체 이름을 맞히는 데서 끝나지 않고 어느 물체를 집어야 하는지, 어디로 옮길 수 있는지, 작업이 끝났는지를 판단하는 능력이 대상입니다.

Google DeepMind 모델 카드는 Robotics-ER 1.6을 Gemini 3.0 Flash 기반의 비전·언어 모델로 설명합니다. 입력은 텍스트·이미지·오디오·비디오이고 출력은 텍스트입니다. 이름에 Robotics가 붙어도 곧바로 모터 전류를 내보내는 관절 제어기는 아닙니다.

VLM과 VLA의 차이를 먼저 구분해야 한다

VLM은 장면을 보고 언어 또는 구조화된 좌표로 답합니다. VLA는 시각과 지시를 받아 로봇 행동을 출력합니다. Robotics-ER 1.6은 VLM 쪽이며, Gemini Robotics 1.5는 Google이 VLA로 분류하는 별도 모델입니다.

이 차이를 놓치면 “모델 API 하나를 연결하면 로봇이 바로 움직인다”는 잘못된 그림이 생깁니다. 자세한 구분은 VLA와 VLM 차이에서 확인할 수 있습니다.

영상과 언어 입력부터 공간 추론, 작업 계획, 로봇 제어기와 안전 계층까지의 연결 도식
Gemini Robotics-ER 판단과 제어 경계. 출처: 피지컬 AI Lab.

로봇 시스템에서는 고수준 판단 계층에 놓인다

카메라 영상과 작업 지시가 들어오면 ER 모델은 물체 위치, 관계, 접근 순서와 완료 조건을 해석합니다. 그 결과를 좌표, 경로 후보, 하위 작업 목록 또는 함수 호출 인자로 전달할 수 있습니다.

실제 움직임은 역기구학, 궤적 생성, 충돌 회피, 관절 제어와 안전 정지가 이어받습니다. 이 계층은 밀리초 단위로 모터를 제어해야 하므로 응답 시간이 길고 확률적인 언어 모델에 그대로 맡기기 어렵습니다.

점과 경계 상자는 행동을 위한 중간 표현이다

Google AI for Developers 문서는 모델이 물체 위치를 점이나 경계 상자로 반환하는 예를 제공합니다. 좌표는 그 자체로 행동이 아니라 로봇 좌표계로 변환하기 전의 시각적 후보입니다.

이미지의 픽셀 좌표를 실제 3차원 위치로 바꾸려면 카메라 보정, 깊이 정보, 로봇 베이스와 카메라 사이의 좌표 변환이 필요합니다. 로봇 센서가 잘 보정되지 않으면 모델이 올바른 물체를 가리켜도 그리퍼는 다른 곳으로 갈 수 있습니다.

로봇이 물체와 공간을 이해해 이동 궤적을 제안하는 Gemini Robotics-ER 공식 예시
장면 이해 결과를 로봇이 사용할 수 있는 공간 정보와 궤적으로 바꾸는 공식 예시입니다. 모델이 저수준 모터 명령을 직접 생성한다는 뜻은 아닙니다. 출처: Google AI for Developers. 라이선스: CC BY 4.0.

궤적 제안은 충돌 없는 경로 보증이 아니다

공식 문서의 궤적 예시는 장면에서 이동 경로를 점열로 제안하는 능력을 보여 줍니다. 그러나 2차원 이미지 위의 선에는 로봇 링크의 부피, 관절 한계, 케이블 간섭과 동역학 제약이 모두 들어 있지 않습니다.

따라서 제안 경로는 모션 플래너의 입력 또는 힌트로 사용하고, 실제 로봇 모델과 충돌 장면에서 다시 검증해야 합니다. 사람과 가까운 작업이라면 속도·힘 제한과 보호 정지는 별도 안전 계층에서 강제해야 합니다.

여러 카메라를 함께 보면 가려짐을 줄일 수 있다

작업대 카메라는 전체 배치를 보기 좋고 손목 카메라는 접촉 지점을 보기 좋습니다. 한 화면에서는 그리퍼 뒤에 가려진 물체가 다른 화면에서는 보일 수 있습니다.

Google DeepMind 발표는 1.6의 다중 시점 이해와 성공 판정을 주요 개선점으로 제시합니다. 다만 카메라 촬영 시각이 어긋나거나 좌표 관계가 바뀌면 서로 다른 장면을 하나로 잘못 해석할 수 있어 동기화와 외부 파라미터 검수가 필요합니다.

완료 판정은 장기 작업의 분기점이다

로봇이 펜을 꽂았는지, 부품이 끝까지 체결됐는지 확인하지 못하면 다음 단계로 넘어가거나 재시도할 근거가 없습니다. 성공 판정은 단순한 사후 설명이 아니라 작업 상태 기계의 전이를 결정하는 신호입니다.

안전한 운영에서는 모델 답 하나로 성공을 확정하지 않습니다. 위치 센서, 힘 변화, 공정 신호와 영상 판단을 함께 사용하고, 불확실할 때는 재관찰이나 사람 확인으로 보냅니다.

함수 호출은 판단과 실행 사이의 계약이다

Robotics-ER 1.6은 로봇 기능을 함수로 등록해 호출할 수 있습니다. 예를 들어 locate_object, plan_grasp, move_to_pose처럼 입력 형식과 허용 범위를 정해 두면 모델은 작업을 하위 단계로 나누어 도구를 선택합니다.

함수 내부에서는 좌표 범위, 속도, 접근 금지 구역과 장비 상태를 다시 검사해야 합니다. 자연어 모델이 만든 인자를 곧바로 모터 명령으로 변환하지 않는 것이 핵심입니다.

계측기 읽기는 검사 로봇에 가까운 사례다

Google은 압력계, 수위계와 디지털 표시를 읽는 기능을 1.6의 대표 사례로 제시합니다. 로봇이 시설을 순회하며 영상을 모으고 모델이 눈금과 단위를 해석하면 사람이 모든 계기를 직접 방문하는 시간을 줄일 수 있습니다.

이때도 숫자 하나보다 촬영 거리, 반사, 렌즈 왜곡, 허용 오차와 재촬영 규칙이 중요합니다. 발표의 계측기 성공률은 Google의 평가 조건에서 나온 수치이므로 다른 공장과 카메라에서 그대로 재현된다고 볼 수 없습니다.

생각 예산은 정확도와 지연의 교환 조건이다

개발자 문서는 물체 찾기처럼 단순한 공간 작업에는 작은 thinking budget을, 개수 계산과 무게 추정처럼 복잡한 작업에는 큰 예산을 사용할 수 있다고 설명합니다. 추론을 늘리면 비용과 지연도 함께 늘 수 있습니다.

빠른 정지가 필요한 제어 루프에는 맞지 않지만, 수초 단위로 다음 작업을 고르는 감독 계층에는 사용할 여지가 있습니다. 네트워크가 끊기거나 응답이 늦을 때 로봇이 어떤 안전 상태로 들어갈지도 설계해야 합니다.

API 사용 가능과 현장 배포 가능은 다른 말이다

2026년 7월 23일 기준 개발자 문서의 모델 코드는 gemini-robotics-er-1.6-preview입니다. API와 Google AI Studio에서 시험할 수 있다는 뜻과 장기간 고정 버전, 지연 상한, 기능 안전 인증이 보장된다는 뜻은 다릅니다.

현장 적용 전에는 지역 제공 여부, 데이터 전송 정책, 모델 변경 주기, 비용, 장애 대응과 로그 보존을 확인해야 합니다. 통신이 필수라면 엣지 AI 로봇 구조와 비교해 어떤 기능을 로컬에 남길지도 결정해야 합니다.

주요 입력과 출력은 같은 기준으로 시험해야 한다

기능입력출력 예현장 검증 항목
물체 지시이미지·자연어점·경계 상자가려짐·유사 물체·좌표 변환 오차
경로 제안장면·시작·목표2차원 점열3차원 충돌·관절 한계·접근 방향
성공 판정단일·다중 영상완료 여부·근거실패 누락·재시도·센서 교차 확인
작업 분해장기 지시·도구 목록하위 작업·함수 호출인자 제한·권한·중단과 복구

PoC에서는 모델 점수보다 전체 작업 성공률을 본다

벤치마크에서 점을 정확히 찍는 것과 로봇이 물체를 집어 정해진 위치에 놓는 것은 다른 문제입니다. 인식, 좌표 변환, 경로 계획, 그리퍼와 접촉 제어의 오차가 연속해서 쌓입니다.

평가는 장면별 인식 정확도뿐 아니라 작업 성공률, 사람 개입 횟수, 재시도 시간, 위험한 제안 차단률과 통신 장애 복구를 함께 기록해야 합니다. 피지컬 AI의 보기·판단·행동을 계층별로 나누면 실패 위치를 찾기 쉽습니다.

Robotics-ER와 제어 계층의 역할 비교

계층맡는 일시간 범위실패 시 보호
Robotics-ER장면 이해·작업 분해·완료 판정수백 ms~수초재질문·재관찰·함수 호출 거부
모션 플래너충돌 없는 자세와 경로 계산수십 ms~수초경로 없음·한계 초과 반환
실시간 제어기관절 위치·속도·토크 추종밀리초토크 제한·보호 정지
안전 시스템사람·설비 위험 감시독립 주기전원 차단·브레이크·안전 정지

Gemini Robotics-ER 1.6에서 자주 묻는 질문

Gemini Robotics-ER 1.6은 VLA인가요?

아닙니다. 공식 모델 카드는 텍스트를 출력하는 VLM으로 설명합니다. 로봇 함수나 별도 VLA를 호출할 수 있지만 그 자체가 매 시점의 모터 행동을 직접 출력하는 모델은 아닙니다.

API만 연결하면 로봇을 움직일 수 있나요?

좌표 변환, 모션 계획, 관절 제어, 충돌 검사와 안전 정지가 추가로 필요합니다. API 출력은 검증된 실행 계층의 입력으로 제한하는 편이 안전합니다.

여러 카메라를 넣으면 가려짐 문제가 사라지나요?

줄일 수 있지만 사라지지는 않습니다. 카메라 시간 동기화, 설치 위치 보정과 시점별 품질이 나쁘면 서로 모순되는 정보를 만들 수 있습니다.

Robotics-ER 1.6은 로봇 안에서 실행되나요?

공개 개발자 경로는 Gemini API를 사용합니다. 네트워크 지연과 장애를 전제로 로컬 제어와 안전 기능을 분리해야 합니다.

공식 벤치마크 수치를 현장 성능으로 봐도 되나요?

안 됩니다. 공식 발표는 모델 능력을 비교하는 근거이지만 카메라, 물체, 조명과 작업 절차가 다른 현장 성능을 보장하지 않습니다. 자체 반복 시험이 필요합니다.

마지막 확인: 2026년 7월 23일. 모델 제공 상태와 코드는 바뀔 수 있습니다. 본문은 Google 공식 개발자 문서·발표·모델 카드를 기준으로 역할과 한계를 구분했으며, 공개 벤치마크를 독립 검증 결과로 해석하지 않습니다.