VLA 섀도 모드와 카나리 배포: 로봇을 움직이기 전에 새 정책을 검증하는 법
새 VLA가 같은 관측에서 어떤 행동을 제안하는지 보되 실제 모터 명령권은 주지 않는 것이 섀도 모드다. 이후 제한된 로봇·작업에만 카나리로 노출하고 기존 정책과 비교해 확대·중단·롤백을 결정하는 운영 구조를 설명한다.
VLA 모델, 로봇 파운데이션 모델, 로봇 학습 모델 정리
새 VLA가 같은 관측에서 어떤 행동을 제안하는지 보되 실제 모터 명령권은 주지 않는 것이 섀도 모드다. 이후 제한된 로봇·작업에만 카나리로 노출하고 기존 정책과 비교해 확대·중단·롤백을 결정하는 운영 구조를 설명한다.
인터넷 연결과 왕복 지연이 제한된 로봇에서 실행하는 On-Device 2의 입력·출력, ER 2와의 역할 차이, 추가 학습과 안전·개인정보 조건을 공식 모델 카드로 정리합니다.
Spot이 자연어 요청을 받고 물건을 찾아 가져오는 공개 데모를 고수준 ER 2, 스트리밍 에이전트, Spot SDK와 안전 제어 계층으로 나눠 읽습니다.
Gemini Robotics ER 2의 무료·유료 토큰 가격과 배치 할인, 표준·Live API 스트리밍 선택, 민감한 로봇 영상 처리와 API 키 보안 조건을 공식 문서 기준으로 안내합니다.
구글이 하나의 완성 로봇을 판매하는 것이 아니라 추론 모델, 로컬 행동 모델, API와 파트너 기체를 연결하는 피지컬 AI 스택을 구축하고 있다는 점을 정리합니다.
구글의 최신 로봇용 고수준 추론 모델 Gemini Robotics ER 2가 무엇을 보고 판단하며, 어떤 제어기는 별도로 필요한지 공식 발표와 모델 카드 기준으로 설명합니다.
NVIDIA GR00T N1.7이 이미지·언어·로봇 상태를 행동으로 바꾸는 구조와 데이터 수집, 후학습, 평가, 배포 과정을 공식 자료로 정리합니다.
VLM은 이미지와 언어를 이해하고, VLA는 그 이해를 로봇 행동으로 이어가려는 모델입니다. 두 모델의 차이를 출력, 데이터, 로봇 적용 관점에서 정리합니다.
로봇 파운데이션 모델은 여러 로봇 작업과 환경에 공통으로 쓰기 위한 기반 AI 모델입니다. LLM, VLA, 기존 로봇 프로그램과의 차이, 아직 어려운 이유를 쉽게 정리합니다.
VLA는 Vision-Language-Action의 줄임말로, 로봇이 보는 정보와 언어 지시를 실제 행동으로 연결하려는 모델 흐름입니다. LLM, VLM과의 차이와 피지컬 AI에서 중요한 이유를 쉽게 정리합니다.