NVIDIA GR00T N1.7이란: 휴머노이드 VLA의 학습·평가·배포 구조

NVIDIA GR00T N1.7은 이미지와 언어 지시, 로봇 상태를 받아 연속적인 로봇 행동을 만드는 휴머노이드용 VLA 파운데이션 모델입니다. 로봇 시범 데이터를 정해진 형식으로 모으고, 특정 로봇과 작업에 맞춰 후학습한 뒤, 오픈루프·시뮬레이션·실기기 평가를 거쳐 배포하는 흐름까지 공식 도구가 연결돼 있습니다.

2026년 7월 13일 확인 기준 NVIDIA Isaac-GR00T 공식 저장소는 N1.7을 Early Access가 아닌 General Availability(GA)로 안내합니다. 다만 GA는 모델과 도구의 배포 상태를 뜻합니다. 어떤 휴머노이드가 처음 보는 공장에서 바로 안정적으로 일한다는 보증은 아닙니다.

GR00T N1.7이 하는 일

GR00T N1.7은 VLA입니다. 카메라 영상과 “노란 통에 부품을 넣어” 같은 언어 지시를 이해하고, 현재 관절 위치와 말단장치 상태를 함께 읽은 뒤 다음 행동 구간을 예측합니다. 답이 문장으로 끝나는 VLM과 달리 출력이 로봇의 움직임으로 이어집니다.

그렇다고 모델 하나가 로봇 전체를 운영하는 것은 아닙니다. 카메라와 관절 센서의 시간 동기화, 좌표계 변환, 충돌 회피, 저수준 제어, 안전 정지, 통신과 작업 관리 시스템은 별도로 연결해야 합니다. GR00T는 이 가운데 장면과 지시를 행동으로 바꾸는 정책 모델의 역할을 맡습니다.

공식 저장소는 기본 체크포인트를 3B 규모로 설명하고, 사전학습에 포함된 로봇 형태에는 제로샷 추론을 시도할 수 있다고 안내합니다. 새로운 로봇이나 작업이라면 자체 데이터로 후학습하는 경로가 기본입니다.

VLM과 행동 모델이 역할을 나누는 구조

N1.7 구조에서는 이미지와 언어가 VLM으로 들어가 장면과 지시의 의미를 압축합니다. 로봇 상태는 별도 경로로 들어오고, 이후 diffusion transformer가 이 정보들을 받아 연속 행동을 생성합니다. VLA와 VLM의 차이가 실제 모델 안에서 어떻게 나뉘는지 보여주는 구조입니다.

GR00T N1.7이 이미지와 언어 지시, 로봇 상태를 VLM과 diffusion transformer를 거쳐 행동으로 바꾸는 구조
출처: NVIDIA Isaac-GR00T 공식 저장소. 이미지·언어·로봇 상태가 VLM과 diffusion transformer를 거쳐 행동으로 바뀌는 구조. 라이선스: Apache 2.0.

공식 도식의 System 2는 상황과 지시를 해석하는 느린 추론 쪽, System 1은 짧은 주기로 행동을 생성하는 쪽을 가리킵니다. 이 명칭은 NVIDIA가 N1.7 구조를 설명하기 위해 사용한 구분입니다. 모든 VLA가 같은 두 모듈과 같은 이름을 쓰는 것은 아닙니다.

diffusion transformer는 한 번에 모터 명령 하나만 내기보다 일정 길이의 행동 구간을 만들고, 잡음에서 연속 행동을 복원하는 방식으로 작동합니다. 실제 로봇에서는 예측한 행동 전체를 무조건 실행하지 않고 일부만 실행한 뒤 새 관찰을 받아 다시 계획하는 방식이 필요합니다.

N1.6에서 달라진 부분

NVIDIA의 2026년 7월 기술 블로그와 공식 저장소는 N1.7의 변화로 새로운 VLM 백본, 상대 말단장치 행동 표현, 사람 영상 사전학습, 배포 도구 확장을 제시합니다.

  • 새 VLM 백본: Cosmos-Reason2-2B를 사용하며 기반 아키텍처는 Qwen3-VL입니다. 이미지 비율을 유지하면서 여러 해상도를 처리하는 방향으로 바뀌었습니다.
  • 상대 EEF 행동: 로봇 손이나 그리퍼의 절대 목표 위치 대신 현재 자세에서 얼마나 움직일지를 표현합니다. 서로 다른 로봇과 사람 영상의 움직임을 같은 변화량 관점으로 맞추려는 선택입니다.
  • 사람 영상 활용: 공식 블로그는 약 3만2천 시간의 실제 시범·사람 중심 영상과 약 8천 시간의 시뮬레이션 데이터를 설명합니다. 저장소는 이 가운데 EgoScale 사람 영상 2만 시간을 별도로 강조합니다.
  • 배포 경로: ONNX와 TensorRT 내보내기, 정책 서버와 클라이언트 구조, 평가와 롤아웃 기록이 정리됐습니다.

이 수치와 개선점은 NVIDIA가 공개한 설명입니다. 학습 데이터의 다양성과 벤치마크 향상이 특정 공정의 반복 성공률을 그대로 뜻하지는 않습니다. 비교하려면 같은 로봇, 같은 카메라, 같은 작업과 같은 평가 조건이 필요합니다.

로봇 데이터는 어떤 형식으로 들어가나

GR00T는 LeRobot v2 형식을 바탕으로 한 데이터 구조를 사용합니다. 한 작업 에피소드 안에 언어 지시, 카메라 영상, 로봇 상태와 행동이 시간 순서대로 맞아야 합니다. 여기에 GR00T 전용 modality.json이 추가돼 어떤 배열이 손 위치인지, 관절인지, 그리퍼인지 알려줍니다.

  • 영상: 로봇이 무엇을 보고 있었는지 기록합니다.
  • 상태: 관절 위치와 속도, 베이스 자세, EEF 자세처럼 현재 몸의 상태를 담습니다.
  • 행동: 다음 시점에 보낸 위치·속도·그리퍼 명령을 기록합니다.
  • 작업 지시: 각 에피소드에서 수행해야 할 일을 언어로 연결합니다.
  • 모달리티 설정: 상태와 행동 배열의 각 위치가 무엇을 뜻하는지 정의합니다.

형식만 맞춘다고 좋은 데이터가 되는 것은 아닙니다. 영상과 관절 로그가 어긋나거나, 원격조작자가 물체를 가리는데 로봇 행동이 늦게 기록되면 모델은 잘못된 대응을 배웁니다. 텔레옵 데이터에서 지연과 시간 동기화가 중요한 이유가 여기서 드러납니다.

또한 추론과 후학습 명령에는 embodiment tag가 필요합니다. 이 태그는 어떤 로봇의 상태·행동 키와 정규화 값을 사용할지 결정합니다. 로봇 이름을 붙이는 장식이 아니라 데이터 배열과 실제 몸을 연결하는 설정입니다.

데이터 수집부터 배포까지 이어지는 흐름

GR00T를 실제로 쓰는 과정은 모델 파일을 내려받는 일보다 길습니다. 공식 워크플로를 현장 기준으로 풀면 다음 순서에 가깝습니다.

GR00T N1.7을 데이터 수집, 미세조정, 오프라인 평가, 실제 로봇 검증으로 이어 적용하는 흐름 도식
GR00T N1.7은 데이터를 모아 로봇별로 조정하고, 오프라인 평가와 실제 로봇 검증을 거쳐야 배포할 수 있습니다. 출처: 피지컬 AI Lab.
  1. 작업과 로봇 범위를 고정합니다. 어떤 물체를 어디에서 집어 어디에 놓을지, 카메라와 그리퍼는 무엇인지 먼저 정합니다.
  2. 시범과 상태 로그를 모읍니다. 텔레옵, 실로봇 시범, 시뮬레이션에서 영상·상태·행동·언어 지시를 함께 기록합니다.
  3. LeRobot 형식으로 변환하고 검수합니다. 실패 에피소드, 시간 지연, 좌표계와 단위, 누락 프레임을 확인합니다.
  4. N1.7을 후학습합니다. 특정 로봇과 작업에 맞게 시각 백본, 프로젝터와 행동 모델을 조정합니다.
  5. 오픈루프·시뮬레이션·실기기 순으로 평가한 뒤 배포합니다. 정책 서버가 관찰을 받고 행동을 반환하도록 연결하고, 현장 제어기와 안전 계층을 둡니다.

이 흐름은 로봇 파운데이션 모델이 왜 완성품이 아니라 출발점인지 보여줍니다. 사전학습 모델이 있어도 데이터 수집과 품질 관리, 후학습, 배포 통합이 사라지지는 않습니다.

오픈루프 평가만으로 실제 로봇을 판단할 수 없다

공식 저장소의 빠른 예시는 기록된 데이터에 N1.7을 적용해 예측 행동과 정답 행동을 비교하는 오픈루프 평가입니다. 모델을 설치하고 데이터 형식을 확인하기에는 좋지만, 로봇이 자기 행동으로 장면을 바꾼 뒤 다음 판단을 이어가는 능력은 보여주지 못합니다.

실제 로봇에서는 첫 동작의 작은 오차가 다음 카메라 영상과 물체 위치를 바꿉니다. 손이 컵을 살짝 밀면 기록 데이터에는 없던 장면이 생기고, 정책은 그 상태에서 다시 회복해야 합니다. 접촉 힘, 제어 주기, 네트워크 지연과 카메라 보정도 결과에 영향을 줍니다.

따라서 오픈루프 다음에는 로봇 시뮬레이터나 폐루프 벤치마크에서 행동을 반복하고, 마지막에는 안전 범위를 좁힌 실기기 시험이 필요합니다. 시뮬레이션 결과도 마찰과 센서 잡음이 다른 현실로 옮기면 달라질 수 있으므로 Sim2Real 실패 조건을 함께 확인해야 합니다.

크로스 엠바디먼트는 바로 호환된다는 뜻이 아니다

N1.7은 여러 형태의 로봇 데이터를 함께 다루는 cross-embodiment 모델입니다. 상대 EEF 행동 공간을 사용하면 팔 길이와 설치 위치가 다른 로봇 사이에서 공통된 움직임 패턴을 배우기 쉬워질 수 있습니다.

하지만 두 로봇의 관절 수, 가동 범위, 그리퍼, 카메라 위치와 제어 주기는 다릅니다. 새 로봇을 연결할 때는 상태와 행동을 정의한 모달리티 설정, embodiment tag, 정규화 통계와 정책 어댑터가 필요합니다. 사전학습에 없던 로봇과 작업은 후학습과 실기기 검증 없이 바로 호환된다고 보기 어렵습니다.

특히 손가락이 많은 휴머노이드 손은 EEF 위치 하나만 맞춘다고 해결되지 않습니다. 접촉 순서와 손가락 힘, 미끄러짐이 중요하므로 손 전체의 상태·행동 표현과 더 촘촘한 시범이 필요할 수 있습니다.

GA라는 말과 현장 준비 상태를 구분해야 한다

공식 저장소는 N1.7을 GA로 표시하고 사전학습 체크포인트, 후학습, 평가와 상용 지원 경로를 안내합니다. NVIDIA 기술 블로그는 기본 N1.7을 Apache 2.0으로 공개된 상용 사용 가능 모델로 설명합니다. 코드와 도식이 있는 저장소도 Apache 2.0입니다.

다만 특정 파생 체크포인트와 데이터셋은 별도 모델 카드와 라이선스를 가질 수 있습니다. 실제 프로젝트에서는 저장소 설명만 보고 일괄 적용하지 말고 내려받는 체크포인트의 모델 카드, 데이터 사용 조건과 제3자 구성요소를 다시 확인해야 합니다.

GA는 안전 인증이나 현장 성능 인증도 아닙니다. 사람 옆에서 움직이는 로봇은 작업 셀 위험 평가, 속도·힘 제한, 비상 정지, 제어기 안전 기능과 운영 절차가 따로 필요합니다. NVIDIA가 공개한 벤치마크 개선 수치도 공급사 측 평가이며, 원하는 공정의 사이클타임과 반복 성공률을 직접 재야 합니다.

어떤 개발팀이 먼저 써볼 만한가

N1.7은 이미 로봇 시범 데이터를 모을 수 있고, 한두 개 조작 작업을 명확하게 정의한 팀에 더 적합합니다. 데이터 변환과 GPU 후학습, 시뮬레이션 또는 안전한 실기기 시험 환경도 필요합니다.

  • 언어 지시와 카메라 입력을 함께 쓰는 조작 작업이 있다.
  • 영상·상태·행동이 동기화된 시범을 확보할 수 있다.
  • 작업 실패를 자동 기록하고 다시 학습 데이터로 돌릴 수 있다.
  • 정책 모델과 저수준 제어·안전 계층을 분리해 통합할 수 있다.
  • 오픈루프 결과를 실기기 성능으로 오해하지 않고 단계별 평가를 할 수 있다.

반대로 데이터 없이 가정의 모든 일을 수행하는 범용 휴머노이드를 바로 만들려는 경우, 안전이 중요한 공정을 모델 출력만으로 제어하려는 경우에는 출발점이 맞지 않습니다. 먼저 작업을 좁히고 성공·실패 기준을 정하는 일이 필요합니다.

GR00T는 모델 하나보다 데이터 파이프라인으로 봐야 한다

GR00T N1.7의 의미는 새 모델 이름 하나에만 있지 않습니다. 텔레옵과 시뮬레이션에서 데이터를 모으고, 형식을 통일하고, 후학습하고, 평가와 배포로 넘기는 경로가 하나의 개발 플랫폼으로 묶였다는 데 있습니다.

현장에서는 이 연결이 더 중요합니다. 로봇 행동 데이터에 실패 장면이 부족하면 모델은 복구를 배우기 어렵고, 데이터는 좋아도 제어 주기와 안전 계층이 맞지 않으면 동작이 불안해집니다. 모델, 데이터, 시뮬레이션과 하드웨어를 따로 평가하면서 다시 연결해야 합니다.

GR00T N1.7을 한 문장으로 정리하면

GR00T N1.7은 이미지·언어·로봇 상태를 연속 행동으로 바꾸는 휴머노이드 VLA이면서, 데이터 수집부터 후학습·평가·배포까지 이어지는 NVIDIA의 로봇 정책 개발 흐름입니다.

GA가 됐다는 사실은 개발자가 사용할 수 있는 코드와 체크포인트, 배포 경로가 정리됐다는 뜻입니다. 실제 현장에서 쓸 수 있는지는 로봇별 데이터, 폐루프 반복 성공률, 지연과 접촉, 안전 계층을 따로 검증한 뒤 판단해야 합니다.

GR00T N1.7에서 자주 묻는 질문

GR00T N1.7은 챗GPT 같은 모델인가요?

언어와 이미지를 이해한다는 점은 비슷하지만 출력이 문장이 아니라 로봇 행동으로 이어지는 VLA입니다. 로봇 상태와 연속 행동 데이터가 추가로 필요합니다.

기본 모델을 내려받으면 바로 휴머노이드를 움직일 수 있나요?

사전학습에 포함된 형태에서는 제로샷 추론을 시험할 수 있지만, 새로운 로봇과 작업은 모달리티 설정, 정책 연결과 후학습이 필요할 가능성이 큽니다. 실기기에서는 안전 제어도 별도로 구성해야 합니다.

휴머노이드가 아닌 로봇 팔에도 사용할 수 있나요?

공식 저장소에는 DROID, LIBERO, SimplerEnv처럼 여러 로봇 형태의 체크포인트와 태그가 나옵니다. 다만 원하는 로봇의 상태·행동 공간을 정의하고 데이터 호환성과 성능을 검증해야 합니다.

오픈루프 평가가 좋으면 실제 로봇도 잘 움직이나요?

그렇다고 볼 수 없습니다. 오픈루프는 기록 데이터 위에서 예측을 비교하므로 자기 행동이 다음 장면을 바꾸는 폐루프 오차와 접촉, 지연, 회복 능력을 충분히 보여주지 못합니다.

GR00T N1.7은 상업적으로 사용할 수 있나요?

NVIDIA 공식 저장소와 2026년 7월 기술 블로그는 기본 N1.7을 GA이자 Apache 2.0 기반의 상용 사용 가능 모델로 안내합니다. 다만 실제로 사용하는 파생 체크포인트, 데이터셋과 제3자 구성요소의 라이선스는 각각 확인해야 합니다.

마지막 확인: 2026년 7월 13일. 이 글은 NVIDIA Isaac-GR00T 공식 저장소, NVIDIA 기술 블로그, GR00T N1 기술 보고서를 확인해 작성했습니다. 학습 시간과 성능 개선 수치는 NVIDIA가 공개한 범위이며 독립적인 현장 검증 결과가 아닙니다.