Gemini Robotics ER 2란: 구글의 최신 피지컬 AI는 무엇이 달라졌나

Gemini Robotics ER 2는 로봇의 카메라·음성·텍스트를 읽고 작업 순서를 계획하는 고수준 비전-언어 모델(VLM)입니다. 로봇 관절에 보낼 수치 행동을 직접 출력하는 VLA가 아니라, 하위 VLA나 내비게이션 API를 도구로 호출하는 작업 지휘자에 가깝습니다.

2026년 7월 30일 공개된 ER 2의 변화는 연속 영상에서 진행률과 중요한 순간을 찾고, 실패를 감지해 다음 단계를 조정하며, 여러 로봇의 협업을 조율하는 데 있습니다. 전체 구도를 먼저 보려면 구글 피지컬 AI 지도를 함께 읽는 편이 빠릅니다.

ER 2의 자리는 로봇 팔보다 한 층 위다

Google DeepMind 모델 카드는 ER 2를 텍스트·이미지·영상·오디오를 입력받아 텍스트를 출력하는 VLM으로 정의합니다. 장면의 공간 관계와 시간 흐름을 읽고, 긴 작업을 작은 단계로 나누며, 개발자가 등록한 로봇 함수를 선택하는 것이 주된 역할입니다.

따라서 ER 2의 응답만 모터 드라이버에 연결하면 되는 구조가 아닙니다. 실제 이동·파지·힘 제어는 하위 VLA, 로봇 SDK, 충돌 회피기와 안전 제어기가 담당해야 합니다. VLA와 VLM의 차이를 구분하면 이해하는 모델과 수치 행동을 내는 모델을 섞지 않게 됩니다.

ER 2가 하는 일별도로 필요한 것
고수준 추론영상 이해, 단계 계획, 성공·실패 판단, 도구 선택사람이 정한 목표와 안전 규칙
행동 생성등록된 VLA나 로봇 함수를 호출On-Device 2 같은 VLA 또는 자체 행동 정책
실기 제어직접 수치 모터 명령을 내지 않음내비게이션·파지·균형·힘 제어기
기능 안전의미 수준의 제약 확인을 보조비상 정지, 속도 제한, 작업구역 분리, 감독

연속 영상에서 지금 어디까지 왔는지를 본다

ER 2는 정지 이미지 한 장만 판단하는 대신 연속 영상에서 작업 진행을 추적합니다. 구글은 진행률을 다섯 구간으로 분류하고, 붓는 것을 멈추거나 다음 단계로 넘어가야 하는 정확한 영상 순간을 찾는 기능을 공개했습니다. 전구를 조였는지, 봉투 묶기가 끝났는지처럼 완료 기준이 있는 작업에 맞춘 변화입니다.

아래 수치는 모두 구글 공식 발표에 실린 자체 평가입니다. 공개 벤치마크 수치를 다른 공장·조명·카메라·로봇에서도 그대로 재현된 현장 성능으로 읽어서는 안 됩니다.

구글 평가 항목공개 결과해석할 때 남는 한계
진행 구간 분류정확도 57.4%구글이 구성한 과제와 구간 정의 안의 결과
중요 순간 찾기정확도 91.3%어떤 장면·정답 규칙을 썼는지 함께 봐야 함
중요 순간 시간 오차평균 절대 거리 0.96초카메라 지연과 로봇 제어 지연은 별도
실행 속도비교 대상 대비 4배라고 보고비교군과 컴퓨팅 조건이 다른 현장 전체를 대표하지 않음

도구 호출과 여러 로봇의 인계가 넓어졌다

Gemini API 로보틱스 문서는 ER 2가 개발자가 선언한 함수, VLA, 내비게이션 API를 도구로 사용한다고 설명합니다. 영상 스트림을 보면서 다음 행동을 미리 추론하므로 매 단계마다 완전히 멈춰 새 요청을 보내는 방식보다 긴 작업의 연결이 자연스러워지는 것이 목표입니다.

여러 기체가 같은 의미 표현을 공유하고 작업을 넘기는 데모도 추가됐습니다. 한 로봇이 모든 동작을 잘해야 한다는 가정 대신 이동에 강한 기체와 조작에 강한 기체가 역할을 나누는 구조입니다. 다만 이는 구글의 연구 데모이며 서로 다른 상용 로봇을 연결하면 자동으로 호환된다는 뜻은 아닙니다.

PR2 모바일 매니퓰레이터 실사진
PR2처럼 이동 베이스·센서·팔을 가진 로봇도 고수준 계획과 저수준 실행을 나눠 설계합니다. 이 사진은 ER 2 성능을 보여주는 자료가 아닙니다. 출처: Oleg Alexandrov / Wikimedia Commons. 라이선스: CC BY-SA 3.0.

ER 1.6 사용자는 8월 말 전에 모델명을 바꿔야 한다

기존 Gemini Robotics-ER 1.6 설명에서 이어지는 실제 운영 변화는 종료 일정입니다. 구글의 폐기 일정 문서는 gemini-robotics-er-1.6-preview를 2026년 8월 31일 종료하고 gemini-robotics-er-2-preview로 교체하라고 명시합니다.

표준 호출은 gemini-robotics-er-2-preview, 지속적인 오디오·영상과 낮은 지연이 중요한 구성은 gemini-robotics-er-2-streaming-preview를 검토합니다. 이름만 교체한 뒤 끝내지 말고 응답 형식, 함수 호출, 지연, 토큰 비용과 실패 시 동작을 스테이징 환경에서 다시 측정해야 합니다.

공개 API와 현장 배치 승인은 같은 말이 아니다

ER 2는 Gemini API와 Google AI Studio에서 프리뷰로 공개됐고 Gemini Enterprise Agent Platform은 비공개 프리뷰입니다. 공개 접근은 개발자가 모델을 시험할 수 있다는 뜻이지, 구글이 특정 로봇에 대한 생산 배치나 안전 인증을 끝냈다는 뜻은 아닙니다.

모델 카드는 생산·상업·공개 환경에서 신중하게 사용하고 의료·운송 등 안전 필수 작업에는 사용하지 말라고 요구합니다. 생성형 모델은 틀릴 수 있으므로 사람 접근 감지, 비상 정지, 속도·힘 제한, 통신 끊김 시 안전 상태를 별도 계층에서 보장해야 합니다.

장면을 보고 생각하고 행동으로 연결하는 일반 구조는 피지컬 AI의 보기-생각하기-행동하기에서 확인할 수 있습니다. ER 2는 그중 생각하기와 조율의 비중이 큰 모델입니다.

Gemini Robotics ER 2란: 구글의 최신 피지컬 AI는 무엇이 달라졌나의 핵심 판단을 정리한 판단 카드
Google 공식 자료를 바탕으로 피지컬 AI Lab이 재구성한 편집 카드입니다. 출처: Physical AI Lab. 라이선스: Owned original.

이번 발표에서 확인된 것과 아직 모르는 것을 나눈다

확인된 사실은 VLM이라는 모델 유형, 두 개의 프리뷰 엔드포인트, 공식 가격표, ER 1.6 종료일, 구글 자체 평가와 파트너 데모입니다. 특정 공장에서의 가동률, 독립 기관의 재현 결과, 모든 로봇 SDK와의 호환성, 안전 인증은 이번 발표만으로 확인할 수 없습니다.

특히 ER 2와 Gemini Robotics On-Device 2는 대체 관계가 아닙니다. 전자는 고수준 계획을 맡는 VLM이고 후자는 로봇에서 수치 행동을 내는 로컬 VLA입니다. 실제 시스템은 두 모델 또는 동등한 하위 제어기를 계층적으로 조합할 수 있습니다.

자주 묻는 질문

Gemini Robotics ER 2가 로봇 관절을 직접 움직이나요?

아닙니다. 공식 모델 카드는 ER 2의 출력을 텍스트로 명시합니다. ER 2가 계획과 도구 호출을 만들면 별도의 VLA, 로봇 SDK, 모션 제어기가 실제 수치 행동과 모터 제어를 담당합니다.

ER 2는 지금 일반 개발자가 사용할 수 있나요?

2026년 8월 6일 기준 표준·스트리밍 프리뷰 엔드포인트를 Gemini API와 AI Studio에서 사용할 수 있습니다. 프리뷰 모델이므로 제한과 사양이 바뀔 수 있으며 Enterprise Agent Platform은 비공개 프리뷰입니다.

구글이 공개한 91.3% 정확도를 현장 성공률로 봐도 되나요?

안 됩니다. 91.3%는 구글이 공개한 순간 찾기 평가의 정확도입니다. 로봇 전체 작업 성공률이나 독립 현장 성능이 아니므로 대상 영상, 하위 제어기, 지연과 안전 조건을 따로 검증해야 합니다.

확인한 공식 자료

최종 확인: 2026년 8월 6일