보스턴 다이내믹스 Spot과 Gemini Robotics ER 2: 물건 가져오기 데모의 구조

구글의 Spot 물건 가져오기 데모는 Gemini Robotics ER 2가 Spot의 모터를 직접 제어하는 장면이 아닙니다. ER 2가 영상과 자연어를 보며 작업 단계를 고르고, 공개 에이전트 서버가 함수 호출을 Spot의 내비게이션·조작 API로 전달하는 계층형 구성입니다.

이 사례는 Google과 Boston Dynamics가 공개한 연구·개발 데모입니다. Spot 전체 제품군의 기본 탑재, 공동 판매 패키지, Atlas 적용이나 감독 없는 현장 운용을 발표한 것으로 확대 해석하면 안 됩니다.

자연어 한 문장이 네 개의 계층을 지난다

구글 공식 발표는 ER 2가 Spot API의 내비게이션과 매니퓰레이터 움직임을 조율해 간식을 가져오는 데모를 만들었다고 설명합니다. 사용자의 음성 명령, 카메라 영상, 로봇 상태가 에이전트에 들어오고 계획 결과가 등록된 함수로 변환됩니다.

실행 결과와 새 영상은 다시 ER 2로 돌아가 진행 상황과 다음 단계를 판단하는 데 쓰입니다. 이 반복 구조는 피지컬 AI의 보기-생각하기-행동하기를 실제 API 계층으로 나눈 사례입니다.

계층담당 요소데모에서 하는 일
입력Spot 카메라·마이크·상태장면, 사용자 명령, 실행 결과 전달
고수준 판단Gemini Robotics ER 2목표 분해, 다음 도구 선택, 진행 확인
연결Live API 에이전트 서버영상·음성 스트림과 함수 호출 중계
실행Spot SDK·내비게이션·팔 API이동, 팔 전개, 물체 접근과 조작
안전Spot 제어기·작업장 절차·사람제약 확인, 정지, 복구와 감독

ER 2는 행동 계획을 만들고 Spot API가 움직인다

ER 2는 고수준 VLM이므로 간식을 찾아 가져오라는 목표를 장소 이동, 물체 확인, 팔 전개, 파지, 복귀 같은 단계로 나눕니다. 각 단계에서 호출할 수 있는 함수는 개발자가 미리 허용한 Spot 인터페이스 안에 있어야 합니다.

ER 2 개요에서 설명했듯 모델 카드의 출력은 텍스트입니다. Spot SDK가 내비게이션·팔 제어를 실행하고 자체 상태를 반환합니다. 생성형 모델의 판단과 Boston Dynamics의 실시간 제어기를 구분해야 데모의 기술적 의미가 정확해집니다.

ER 2가 맡는 것Spot 쪽이 맡는 것둘 사이의 계약
작업 단계와 도구 선택경로 이동과 자세 제어허용 함수 이름과 인자
영상에서 물체·진행 판단센서 상태와 위치 제공좌표계·상태 형식
실패 후 재계획실행 오류와 결과 반환시간초과·재시도 규칙
사람 질문과 설명비상 정지와 저수준 안전중단·사람 인계 조건

공개 저장소는 데모의 연결 부위를 보여준다

Google Gemini의 robotics-samples 저장소는 Live API 에이전트, Spot 통합, Tinybot 예제를 공개합니다. 에이전트 서버는 WebSocket으로 오디오·영상을 주고받고 도구 호출을 전달하며, Spot 폴더에는 내비게이션·조작·REST API와 배달 애플리케이션이 나뉘어 있습니다.

Boston Dynamics Python 문서는 Spot SDK가 Client·Core·Mission 등의 라이브러리로 구성됨을 보여줍니다. 코드를 공개했다는 사실은 재현 경로를 제공하지만 실제 Spot과 팔·권한·현장 지도·안전 구역 없이 같은 동작이 바로 실행된다는 뜻은 아닙니다.

2022년 행사장에서 시연된 Boston Dynamics Spot
사진은 기본형 Spot을 보여주며 Google의 2026년 ER 2 물건 가져오기 데모 장면이나 매니퓰레이터 구성을 재현하지 않습니다. 출처: Stephen McCarthy / Web Summit via Wikimedia Commons. 라이선스: CC BY 2.0.

물건 가져오기는 한 번의 함수가 아니라 상태 기계다

실제 구현은 명령 이해, 목표 장소 선택, 이동, 물체 탐색, 2D·3D 위치 확인, 팔 전개, 파지, 운반과 전달을 차례로 통과합니다. 각 단계는 성공, 재시도, 사람 질문, 안전 정지 중 하나로 끝나야 다음 단계가 명확해집니다.

연속 영상에서 진행 상황을 보는 ER 2의 장점은 지금 파지가 끝났는가처럼 전환 시점을 판단하는 데 있습니다. 그러나 바닥 미끄럼, 약한 네트워크, 잘못된 물체, 그리퍼 힘과 사람이 갑자기 접근하는 상황은 데모 밖의 시험 항목으로 따로 만들어야 합니다.

Spot 데모로 확인할 수 없는 것도 많다

이번 자료는 구글과 파트너가 구성한 데모이며 독립 비교시험이 아닙니다. 공개 영상 한 번의 성공으로 장시간 성공률, 다양한 건물에서의 일반화, 사람 근처 안전, 전체 비용이나 유지보수 수준을 판단할 수 없습니다.

또한 Boston Dynamics Atlas 2026 가이드의 전동 Atlas와 Spot은 다른 기체입니다. Spot API 데모를 Atlas에 ER 2가 통합됐다는 증거로 쓰면 안 됩니다. 현재 공식 근거는 Spot과 ER 2의 물건 가져오기 구성에 한정됩니다.

구글 피지컬 AI 지도에서도 파트너 로봇과 구글 모델을 별도 층으로 표시합니다. 연구 협력과 상용 제품 계약은 발표 문구가 있을 때만 구분해 업데이트해야 합니다.

보스턴 다이내믹스 Spot과 Gemini Robotics ER 2: 물건 가져오기 데모의 구조의 핵심 판단을 정리한 판단 카드
Google 공식 자료를 바탕으로 피지컬 AI Lab이 재구성한 편집 카드입니다. 출처: Physical AI Lab. 라이선스: Owned original.

재현보다 먼저 정지·권한·데이터 경계를 설계한다

Spot 공식 제품 페이지는 API와 팔을 통한 확장성을 설명하지만 생성형 모델을 안전 제어기로 규정하지 않습니다. 개발자는 함수 허용 목록, 이동 구역, 속도·팔 힘, lease 권한, 시간초과, 비상 정지와 사람 감독을 먼저 구성해야 합니다.

카메라와 음성 스트림을 Gemini API로 보낼 경우 사람 얼굴·대화·시설 정보의 수집 목적과 보관 경로도 검토해야 합니다. 무료 API 데이터 이용 조건은 ER 2 가격·API 글에서 확인하고 실제 현장에서는 비식별 테스트 장면부터 시작하는 편이 안전합니다.

마지막 검수는 로봇이 물건을 가져왔는지만 보지 않습니다. 잘못된 목표를 거절했는지, 통신이 끊기면 멈추는지, 사람 접근 시 누가 정지를 책임지는지, 로그만으로 실패 원인을 재구성할 수 있는지를 함께 확인해야 합니다.

자주 묻는 질문

Spot 데모에서 ER 2가 모터 명령을 직접 생성했나요?

아닙니다. ER 2는 고수준 계획과 함수 호출을 만들고 Spot SDK와 내비게이션·조작 API가 실제 로봇 동작을 실행합니다. 저수준 안전과 모션 제어도 Spot 쪽 계층에 남습니다.

공개 GitHub 코드만으로 Spot 물건 가져오기를 바로 재현할 수 있나요?

코드는 연결 구조와 예제를 제공하지만 실제 Spot, 필요한 팔과 권한, 지도·좌표 설정, Gemini API 접근, 네트워크와 작업장 안전 구성이 별도로 필요합니다. 공개 저장소가 완성된 상용 패키지를 뜻하지는 않습니다.

이번 협업에 Boston Dynamics Atlas도 포함됐나요?

공식 ER 2 발표에서 물건 가져오기 데모로 명시된 기체는 Spot입니다. 이 자료만으로 Atlas 통합, 기본 탑재 또는 공동 상품화를 주장할 수 없습니다.

확인한 공식 자료

최종 확인: 2026년 8월 6일