Unitree UnifoLM-WMA와 VLA 차이: G1·Z1 학습과 배포 흐름

미래 상호작용 예측, 합성 롤아웃, 월드 모델로 강화한 정책이 연구 중심이라면 UnifoLM-WMA-0이 맞습니다. 시각·언어 입력에서 조작 행동을 직접 학습하고 평가하려면 UnifoLM-VLA-0이 더 가까운 출발점입니다.

둘 다 코드와 가중치가 공개된 연구 저장소이지 모든 Unitree 로봇에 바로 꽂는 상용 자율 소프트웨어는 아닙니다. 공개 예제의 로봇, 카메라, 행동 차원과 자신의 G1·Z1 구성이 얼마나 같은지부터 대조해야 합니다.

WMA와 VLA는 학습 문제의 중심이 다르다

UnifoLM-WMA-0은 월드 모델을 두 가지로 사용합니다. 미래 상호작용 영상을 만드는 대화형 시뮬레이션 엔진과, 예측을 행동 헤드에 연결해 정책을 보강하는 의사결정 모드입니다.

UnifoLM-VLA-0은 VLM 백본을 로봇 조작 데이터로 계속 학습하고 행동을 예측합니다. 어느 쪽이 더 최신인가보다, 미래 영상과 직접 행동 중 무엇이 실험 가설의 중심인지가 선택 기준입니다.

판단 항목UnifoLM-WMA-0UnifoLM-VLA-0
핵심 역할월드 예측과 행동 결합시각·언어에서 행동 예측
공개 모드시뮬레이션·의사결정시뮬레이션 평가·실기 추론
예제 데이터Z1·양팔 Z1·G1G1 조작 12종
적합한 연구미래 롤아웃과 정책 보강직접 조작 정책

공개 데이터셋의 몸체와 과제 구성이 서로 다르다

WMA 저장소는 Z1, 양팔 Z1, G1에 걸친 다섯 주 데이터셋과 추가 G1 덱스터러스 암 데이터를 소개합니다. 공식 UnifoLM-WMA-0 Dual 모델 페이지는 다섯 Unitree 데이터셋을 의사결정과 시뮬레이션 모드로 미세조정한 체크포인트라고 설명합니다.

VLA 저장소는 쌓기, 포장, 닦기, 수건 접기 등 G1 조작 데이터 12종을 사용합니다. 이름에 G1이 있어도 실제 그리퍼, 카메라 캘리브레이션, 행동 표현이 같다는 보장은 없습니다.

학습 경로는 실제 로봇에 연결하기 전부터 갈라진다

WMA는 비디오 생성 모델을 월드 모델로 적응시킨 뒤 다운스트림 데이터로 의사결정과 시뮬레이션 모드를 후학습합니다. 필요 없는 모드는 건너뛸 수 있지만 상태·행동·카메라 입력 설정은 데이터와 맞아야 합니다.

VLA는 LeRobot 데이터를 HDF5와 RLDS로 변환하고 데이터셋·혼합을 등록한 뒤 행동 청크, 상태 차원, 정규화를 설정합니다. 원본 영상만 넣으면 안전한 정책이 자동 완성되는 흐름이 아닙니다.

사전 점검이유놓쳤을 때
CUDA·의존성 버전두 저장소 환경이 다름빌드·커널 오류
카메라 뷰·캘리브레이션WMA는 주 시점 제약 명시잘못된 공간 예측
행동·상태 차원로봇 몸체와 일치해야 함무효·위험 명령
정규화·체크포인트학습과 추론 스케일 연결동작 크기 불일치
실내 행사장에 서 있는 Unitree G1 휴머노이드 로봇
이 사진은 Unitree G1의 실제 사진이지만 UnifoLM-WMA 또는 UnifoLM-VLA가 실행 중임을 보여 주지 않으며 Z1 로봇팔도 담겨 있지 않습니다. 출처: Sayanesy / Wikimedia Commons. 라이선스: CC0 1.0.

두 실기 예제 모두 서버와 로봇 클라이언트를 나눈다

WMA 의사결정 예제는 서버에서 추론하고 Unitree 클라이언트가 로봇 관측을 모아 행동을 요청합니다. G1 Dex1 예제 명령에는 행동·관측 호라이즌, 제어 주기와 언어 지시가 포함됩니다.

VLA도 서버 추론과 로봇 클라이언트를 안내합니다. 네트워크, 모델 추론, 저수준 제어는 별도 책임이며 피지컬 AI 보기·생각·행동 루프로 경계를 그리면 오류 추적이 쉬워집니다.

비교보다 먼저 검증할 가설을 하나 고른다

상상한 미래 상호작용이 행동 선택을 개선하는지 또는 합성 롤아웃이 유용한지를 묻는다면 WMA를 씁니다. 언어 지시와 시각 관측이 조작 행동으로 얼마나 잘 이어지는지를 묻는다면 VLA가 맞습니다.

같은 로봇, 과제, 데이터 예산, 성공 기준을 맞추지 않으면 성능 숫자를 직접 비교할 수 없습니다. 직접 정책은 로봇 VLA 평가 방법, 미래 예측은 월드 모델 뜻을 기준으로 시험 항목을 나눕니다.

Unitree UnifoLM-WMA와 VLA 차이: G1·Z1 학습과 배포 흐름의 핵심 판단 네 가지를 정리한 모바일 카드
글의 공식 출처와 비교표를 바탕으로 Physical AI Lab이 제작한 편집 카드입니다. 출처: Physical AI Lab. 라이선스: Owned original.

오픈소스여도 하드웨어별 안전 검증은 남는다

실제 G1·Z1에 연결하기 전에 저장소 커밋, 체크포인트 카드, 로봇 클라이언트, 컨트롤러 모드, 비상정지와 관절 한계를 확인합니다. 오프라인 재생과 시뮬레이션을 먼저 통과시켜야 합니다.

어느 저장소도 모든 Unitree 옵션의 무수정 호환이나 인증된 안전 계층을 보장하지 않습니다. 하드웨어, 펌웨어와 커밋을 결과에 적어 연구 데모가 지원되는 상용 구성처럼 보이지 않게 해야 합니다.

자주 묻는 질문

UnifoLM-WMA는 시뮬레이터뿐인가요?

아닙니다. 대화형 시뮬레이션 기능과 함께 월드 모델을 행동 헤드에 연결하는 의사결정·실기 배포 예제도 제공합니다.

UnifoLM-VLA는 모든 G1 구성에서 작동하나요?

G1 데이터와 실기 흐름이 있지만 카메라, 그리퍼, 행동 차원, 정규화, 컨트롤러와 체크포인트를 실제 구성에 맞춰야 합니다.

처음에는 어느 저장소를 고르면 되나요?

미래 영상과 월드 모델-행동 연구면 WMA, 시각·언어 기반 직접 조작 정책이면 VLA를 고르고 자신의 몸체와 가장 가까운 예제부터 재현하십시오.

확인한 공식 자료

최종 확인: 2026년 8월 7일