Gemini Robotics 2 전신 제어 벤치마크 읽기: Sharpa 손과 Franka Duo 성적이 뜻하는 것

SharpaWave 손과 Franka Duo의 백분율을 놓고 어느 쪽이 더 낫다고 말할 수는 없다. 두 결과는 로봇 몸체, 말단장치, 과제와 집계 방식이 다르기 때문이다. 다만 Google DeepMind가 같은 Gemini Robotics 2 체크포인트로 세 가지 로봇 구성을 제어했다고 밝힌 점은 여러 몸체로 정책을 옮긴 사례로 볼 수 있다. 그것이 무보정 범용 제어나 현장 재현성을 증명하는 것은 아니다.

이 차트의 쓸모는 승자를 고르는 데 있지 않다. 같은 손 안에서도 전구 풀기와 조이기 결과가 크게 갈리고, 같은 Franka Duo 안에서도 과제군별 결과가 달라진다는 사실을 보는 데 있다. 2026년 7월 30일 Google이 공개한 개발사 평가에는 시행 횟수, 과제별 실패 분류, 평가 분할과 원시 로그가 없고 독립 재시험도 없다. 따라서 백분율은 공개된 과제의 출발점으로 읽고, 반복성과 새로운 물체·배치·로봇으로의 일반화는 별도 시험으로 확인해야 한다.

여러 센서 입력과 후보 행동 경로를 이용해 조작 작업을 수행하는 로봇 파운데이션 모델 개념도
특정 모델의 실제 출력이나 성능 증거가 아닌, 지각·행동 후보·사람 도움 요청의 관계를 설명하기 위한 AI 생성 개념 이미지입니다.

이 차트가 실제로 답하는 질문은 어디까지인가

벤치마크를 읽기 전에 측정 대상을 한 문장으로 고정해야 한다. 공개 페이지가 보여 주는 것은 Google이 선택한 로봇 구성과 과제에서 Gemini Robotics 2가 기록했다는 성공률이다. 사람 수준의 손재주, 공장 가동률, 안전성, 고장 뒤 복구율을 측정한 시험이 아니다. 성공 판정이 완전 성공만 셌는지, 부분 성공이나 사람 개입을 어떻게 처리했는지도 공개 화면만으로 확인되지 않는다.

Google DeepMind의 공식 발표는 하나의 체크포인트가 Apollo 2+SharpaWave, Apollo 2+Inspire, Franka Duo+Robotiq을 제어했다고 설명한다. 공개 사례의 분모는 세 가지 embodiment이지만, 하드웨어별 캘리브레이션·행동 변환·추가 데이터의 범위는 외부에서 재현할 만큼 제시되지 않았다. ‘같은 체크포인트’와 ‘어떤 로봇에도 설정 없이 작동’은 전혀 다른 주장이다.

제품 상태도 해석 범위를 제한한다. 공식 모델 페이지는 2026년 8월 26일 확인 시 Gemini Robotics 2를 private preview로 안내한다. 공개 API의 가격·지원 하드웨어·SLA와 현장 사용자가 같은 결과를 재현할 수 있는지는 이 차트로 알 수 없다. 구글의 로봇 모델 지형부터 보려면 구글 피지컬 AI 구성 안내와 구분해 읽는 편이 낫다.

기존 로봇 벤치마크는 왜 같은 장치와 반복을 요구했나

전통적인 비교 시험은 가능한 한 같은 과제 장치, 물체 초기 위치, 성공 정의와 제한 시간을 사용한다. 각 로봇이 같은 조건을 여러 번 수행해야 성공 횟수와 전체 시행 횟수를 함께 쓸 수 있다. 물체가 달라지거나 초기 자세가 유리해지면 결과가 바뀌므로, 무작위화 범위와 실패 뒤 재설정 절차도 기록한다. 그래야 모델 차이와 시험 환경 차이를 어느 정도 분리할 수 있다.

NIST의 Humanoid Robot Baseline Performance Benchmark는 공통 장치와 정량화된 이동·조작 과제를 통해 비교 가능한 기준을 만들려는 공식 프로그램이다. 이 자료가 Google의 수치를 독립 검증한 것은 아니다. 다만 서로 다른 로봇의 막대를 한 순위표로 묶으려면 과제와 측정 조건을 맞춰야 한다는 원칙을 뒷받침한다.

반복 횟수만 많다고 충분하지도 않다. 같은 물체와 같은 위치를 되풀이하면 암기된 장면에서의 안정성만 높게 보일 수 있다. 평가 물체, 조명, 카메라 시야, 언어 지시와 시작 자세를 학습 분포와 어떻게 분리했는지 밝혀야 한다. 성공률 옆에는 사람 개입, 안전정지, 잘못된 물체 선택, 놓침과 시간 초과를 각각 남겨야 다음 설계 수정으로 연결된다.

같은 체크포인트라는 발표에서 새로 읽을 수 있는 것은 무엇인가

새로운 부분은 하나의 VLA 체크포인트가 서로 다른 몸체와 말단장치에서 동작했다는 개발사 설명이다. 정책이 카메라와 언어 지시를 받아 각 로봇의 행동 공간으로 연결될 수 있음을 보여 주는 사례다. 그러나 외부가 확인할 수 있는 것은 공개된 세 구성뿐이다. 로봇마다 어떤 adapter, 제어 주기, 관절 제한, 좌표 변환과 시범 데이터가 필요했는지는 별도 질문으로 남는다.

Google의 2026년 7월 30일 공식 공개 차트에서 SharpaWave 다지 손은 전구 조이기 36%, 풀기 92%, 쓰레기봉투 묶기 44%, 쓰레받기 32%, 지퍼백 40%로 제시됐다. 이 숫자는 Google 발표이며 실제 시험 기간과 과제별 전체 trial 수, 성공 판정 단위가 공개되지 않았고 독립 검증도 없다. 따라서 평균을 새로 계산하거나 92%를 일반 손조작 성공률로 부르지 않고, 과제별 편차가 크다는 신호로만 읽는다.

같은 공식 모델 페이지에서 Franka Duo는 일반 pick-and-place 74.2%, 다양한 도구 kitting 78.9%, 정밀 삽입 89.6%로 표시된다. 이것도 Google이 공개한 과제군 결과이며 과제 수, trial 수, 집계 가중치와 독립 재시험은 제시되지 않았다. 정밀 삽입 수치를 Sharpa의 전구 풀기와 맞대는 순간 비교 단위가 무너진다. Franka 내부에서 어떤 과제군이 상대적으로 어려웠는지를 묻는 용도로 제한해야 한다.

여러 로봇 결과를 잇기 전에 공통으로 남겨야 할 기록은 무엇인가

몸체가 달라도 평가 원장은 같은 형식이어야 한다. 모델 체크포인트, 로봇·손·그리퍼 버전, 카메라 배치, 제어 소프트웨어, 작업 지시, 물체와 초기 상태를 한 trial ID에 묶는다. 시작부터 종료까지의 영상과 관절·그리퍼 상태, 정책 출력, 안전 제어기의 수정, 사람 개입과 최종 판정을 같은 시간축에 남기면 성공률 뒤의 원인을 추적할 수 있다.

성공 정의도 공유해야 한다. 지퍼백을 닫았지만 위치가 틀렸거나, 도구를 집었지만 지정 슬롯에 놓지 못한 경우를 어떻게 셀지 사전에 정한다. 작업 완료, 부분 완료, 잘못된 완료, 시간 초과, 물체 손상과 안전 관련 중단을 나누면 서로 다른 로봇의 실패 구성을 비교할 수 있다. 한 번의 재시도를 허용했다면 재시도 전후 결과를 합치지 않는다.

일반화 시험에서는 바뀐 조건을 하나씩 표시한다. 처음 보는 물체인지, 위치·조명만 달라졌는지, 새로운 언어 표현인지, 다른 말단장치인지 구분한다. ER 계열의 도구 사용과 제공 경로는 Gemini Robotics ER 2 가격·API 안내에서 따로 다루므로, 여기서는 VLA 계열 차트의 물리 조작 증거만 본다. 제품군 이름이 비슷하다고 평가 결과를 서로 옮겨 붙이지 않는다.

다지 손과 평행 그리퍼는 어디에서 다르게 실패하는가

SharpaWave 과제는 손가락 접촉을 순차적으로 바꾸고 변형 가능한 물체를 다루는 장면을 포함한다. 전구를 푸는 동작과 조이는 동작은 겉보기에 역순이지만, 나사산 진입·끝단 토크·초기 파지와 시야 가림의 조건이 다르다. 공개 수치의 차이가 어느 원인에서 생겼는지는 실패 영상과 힘·관절 로그가 없으면 판단할 수 없다. 손재주가 좋다거나 방향 전환에 약하다는 인과를 숫자만으로 만들지 않는다.

Franka Duo와 Robotiq 그리퍼의 pick-and-place, kitting, insertion은 두 팔의 충돌 회피, 좌표 정합, 물체 위치 추정과 삽입 공차가 핵심일 수 있다. 그러나 ‘정밀 삽입 89.6%’라는 이름만으로 공차, 접촉력, 부품 다양성과 실패 후 복구를 알 수 없다. 그리퍼가 단순하니 문제가 쉽다는 결론도, 수치가 높으니 공장에 바로 쓸 수 있다는 결론도 근거가 없다.

두 계열을 비교하려면 같은 작업 목표를 말단장치별로 공정하게 번역해야 한다. 예를 들어 동일 물체를 동일 위치에 옮기되, 손은 다지 파지이고 그리퍼는 평행 파지라는 차이를 기록한다. 이후 시간, 성공, 손상, 개입과 복구를 같은 정의로 센다. 장치의 장점을 없애는 인위적 시험과 한 장치에만 유리한 시험을 구분하는 검토도 필요하다.

어떤 증거가 더 있어야 일반화 가능성을 판단할 수 있나

현재 공개 자료로 내릴 수 있는 결론은 좁다. 하나의 체크포인트를 세 구성에 적용했다는 회사 사례와 각 구성 내부의 일부 과제 결과는 확인된다. 반면 로봇 간 우열, 새로운 현장의 평균 성공률, 생산성·안전성과 장기 가동성은 확인되지 않는다. 도입 검토자는 높은 막대보다 재현 가능한 시험 패키지를 먼저 요구해야 한다.

  • 공통 과제 장치, 물체 규격, 초기 위치와 제한 시간을 로봇별로 동일하게 문서화한다.
  • 과제별 전체 trial 수, 성공·부분 성공·실패의 판정 규칙과 평가자 일치도를 공개한다.
  • 모델 체크포인트 외에 adapter, calibration, 행동 변환과 추가 학습 데이터의 차이를 밝힌다.
  • 처음 보는 물체·배치·조명·언어 지시를 각각 분리해 일반화 실패를 기록한다.
  • 사람 개입, 안전정지, 잘못된 물체 선택, 놓침, 시간 초과와 손상을 별도 분모로 센다.
  • 평균만 제시하지 말고 반복별 결과와 변동, 최악 사례 및 복구 시간을 함께 남긴다.
  • 성공 영상만 고르지 말고 연속 trial 순서와 제외된 trial 사유를 추적 가능하게 만든다.
  • private preview의 지원 하드웨어·배포 조건이 확정되기 전 가격이나 현장 SLA를 추정하지 않는다.

이 항목이 채워지면 ‘같은 모델이 여러 몸체에 연결됐다’는 흥미로운 사례를 ‘어떤 변화까지 견디는가’라는 검증 가능한 질문으로 바꿀 수 있다. 그 전에는 Sharpa와 Franka의 숫자를 한 줄 순위로 만들지 않는 것이 가장 정확한 읽기다. 공개 차트는 후속 시험의 가설을 만드는 자료이지, 구매 승인이나 현장 합격을 대신하는 성적표가 아니다.

독자가 이어서 묻는 질문

SharpaWave와 Franka Duo를 제대로 비교하려면 최소 어떤 원자료가 필요한가요?

같은 과제 장치와 초기 조건, 과제별 trial 수, 성공·부분 성공·실패 정의, 모델·로봇·말단장치 버전, calibration과 추가 데이터, 연속 trial 영상과 시간 동기화 로그가 필요하다. 사람 개입·안전정지·재시도와 제외 사유도 같은 분모에 남겨야 수치 차이를 하드웨어·정책·시험 조건으로 분해할 수 있다.

공개 성공률이 높아도 일반화에 실패했다고 판단할 조건은 무엇인가요?

처음 보는 물체·위치·조명·지시에서 성능이 급락하거나, 성공률은 유지돼도 개입·재시도·물체 손상·안전 거부가 늘면 일반화가 확인됐다고 보기 어렵다. 학습 분포와 평가 분포가 겹치거나 trial 제외 기준이 불명확한 경우도 결론을 보류해야 한다.

자료 마지막 확인: 2026년 8월 26일