미래 상호작용 예측, 합성 롤아웃, 월드 모델로 강화한 정책이 연구 중심이라면 UnifoLM-WMA-0이 맞습니다. 시각·언어 입력에서 조작 행동을 직접 학습하고 평가하려면 UnifoLM-VLA-0이 더 가까운 출발점입니다.
둘 다 코드와 가중치가 공개된 연구 저장소이지 모든 Unitree 로봇에 바로 꽂는 상용 자율 소프트웨어는 아닙니다. 공개 예제의 로봇, 카메라, 행동 차원과 자신의 G1·Z1 구성이 얼마나 같은지부터 대조해야 합니다.
WMA와 VLA는 학습 문제의 중심이 다르다
UnifoLM-WMA-0은 월드 모델을 두 가지로 사용합니다. 미래 상호작용 영상을 만드는 대화형 시뮬레이션 엔진과, 예측을 행동 헤드에 연결해 정책을 보강하는 의사결정 모드입니다.
UnifoLM-VLA-0은 VLM 백본을 로봇 조작 데이터로 계속 학습하고 행동을 예측합니다. 어느 쪽이 더 최신인가보다, 미래 영상과 직접 행동 중 무엇이 실험 가설의 중심인지가 선택 기준입니다.
| 판단 항목 | UnifoLM-WMA-0 | UnifoLM-VLA-0 |
|---|---|---|
| 핵심 역할 | 월드 예측과 행동 결합 | 시각·언어에서 행동 예측 |
| 공개 모드 | 시뮬레이션·의사결정 | 시뮬레이션 평가·실기 추론 |
| 예제 데이터 | Z1·양팔 Z1·G1 | G1 조작 12종 |
| 적합한 연구 | 미래 롤아웃과 정책 보강 | 직접 조작 정책 |
공개 데이터셋의 몸체와 과제 구성이 서로 다르다
WMA 저장소는 Z1, 양팔 Z1, G1에 걸친 다섯 주 데이터셋과 추가 G1 덱스터러스 암 데이터를 소개합니다. 공식 UnifoLM-WMA-0 Dual 모델 페이지는 다섯 Unitree 데이터셋을 의사결정과 시뮬레이션 모드로 미세조정한 체크포인트라고 설명합니다.
VLA 저장소는 쌓기, 포장, 닦기, 수건 접기 등 G1 조작 데이터 12종을 사용합니다. 이름에 G1이 있어도 실제 그리퍼, 카메라 캘리브레이션, 행동 표현이 같다는 보장은 없습니다.
학습 경로는 실제 로봇에 연결하기 전부터 갈라진다
WMA는 비디오 생성 모델을 월드 모델로 적응시킨 뒤 다운스트림 데이터로 의사결정과 시뮬레이션 모드를 후학습합니다. 필요 없는 모드는 건너뛸 수 있지만 상태·행동·카메라 입력 설정은 데이터와 맞아야 합니다.
VLA는 LeRobot 데이터를 HDF5와 RLDS로 변환하고 데이터셋·혼합을 등록한 뒤 행동 청크, 상태 차원, 정규화를 설정합니다. 원본 영상만 넣으면 안전한 정책이 자동 완성되는 흐름이 아닙니다.
| 사전 점검 | 이유 | 놓쳤을 때 |
|---|---|---|
| CUDA·의존성 버전 | 두 저장소 환경이 다름 | 빌드·커널 오류 |
| 카메라 뷰·캘리브레이션 | WMA는 주 시점 제약 명시 | 잘못된 공간 예측 |
| 행동·상태 차원 | 로봇 몸체와 일치해야 함 | 무효·위험 명령 |
| 정규화·체크포인트 | 학습과 추론 스케일 연결 | 동작 크기 불일치 |

두 실기 예제 모두 서버와 로봇 클라이언트를 나눈다
WMA 의사결정 예제는 서버에서 추론하고 Unitree 클라이언트가 로봇 관측을 모아 행동을 요청합니다. G1 Dex1 예제 명령에는 행동·관측 호라이즌, 제어 주기와 언어 지시가 포함됩니다.
VLA도 서버 추론과 로봇 클라이언트를 안내합니다. 네트워크, 모델 추론, 저수준 제어는 별도 책임이며 피지컬 AI 보기·생각·행동 루프로 경계를 그리면 오류 추적이 쉬워집니다.
비교보다 먼저 검증할 가설을 하나 고른다
상상한 미래 상호작용이 행동 선택을 개선하는지 또는 합성 롤아웃이 유용한지를 묻는다면 WMA를 씁니다. 언어 지시와 시각 관측이 조작 행동으로 얼마나 잘 이어지는지를 묻는다면 VLA가 맞습니다.
같은 로봇, 과제, 데이터 예산, 성공 기준을 맞추지 않으면 성능 숫자를 직접 비교할 수 없습니다. 직접 정책은 로봇 VLA 평가 방법, 미래 예측은 월드 모델 뜻을 기준으로 시험 항목을 나눕니다.

오픈소스여도 하드웨어별 안전 검증은 남는다
실제 G1·Z1에 연결하기 전에 저장소 커밋, 체크포인트 카드, 로봇 클라이언트, 컨트롤러 모드, 비상정지와 관절 한계를 확인합니다. 오프라인 재생과 시뮬레이션을 먼저 통과시켜야 합니다.
어느 저장소도 모든 Unitree 옵션의 무수정 호환이나 인증된 안전 계층을 보장하지 않습니다. 하드웨어, 펌웨어와 커밋을 결과에 적어 연구 데모가 지원되는 상용 구성처럼 보이지 않게 해야 합니다.
자주 묻는 질문
UnifoLM-WMA는 시뮬레이터뿐인가요?
아닙니다. 대화형 시뮬레이션 기능과 함께 월드 모델을 행동 헤드에 연결하는 의사결정·실기 배포 예제도 제공합니다.
UnifoLM-VLA는 모든 G1 구성에서 작동하나요?
G1 데이터와 실기 흐름이 있지만 카메라, 그리퍼, 행동 차원, 정규화, 컨트롤러와 체크포인트를 실제 구성에 맞춰야 합니다.
처음에는 어느 저장소를 고르면 되나요?
미래 영상과 월드 모델-행동 연구면 WMA, 시각·언어 기반 직접 조작 정책이면 VLA를 고르고 자신의 몸체와 가장 가까운 예제부터 재현하십시오.
확인한 공식 자료
- Unitree UnifoLM-WMA-0 공식 저장소
- Unitree UnifoLM-VLA-0 공식 저장소
- Unitree UnifoLM-WMA-0 Dual 공식 모델
- Unitree UnifoLM-VLA Base 공식 모델
최종 확인: 2026년 8월 7일