MolmoAct 2 체크포인트 선택법: Base·Think·작업별 모델 차이

MolmoAct 2 체크포인트는 이름이 아니라 목표 로봇의 몸체와 행동 스키마로 선택해야 합니다. 공식 MolmoAct2 저장소는 MolmoAct2와 MolmoAct2-Think를 새 로봇에 미세조정하는 기반 체크포인트로, DROID·BimanualYAM·SO100/101·LIBERO를 특정 플랫폼·벤치마크용 미세조정 모델로 구분합니다.

기본 선택은 새 몸체라면 Base, 장면의 3D 구조를 깊이 토큰으로 명시적으로 추론할 가치가 있으면 Think입니다. 이미 목표가 Franka DROID, 양팔 YAM, SO-100/101 또는 LIBERO와 가까우면 작업별 모델을 검토하되 카메라, 상태 벡터와 제어 표현을 먼저 맞춰야 합니다. 개념 차이는 로봇 파운데이션 모델에서 확인할 수 있습니다.

체크포인트 계열을 네 가지 질문으로 줄인다

첫째 실제 로봇인가 시뮬레이션 벤치마크인가, 둘째 단팔·양팔·저가형 암 중 어떤 몸체인가, 셋째 상태와 행동이 관절 위치인지 말단 자세인지, 넷째 깊이 추론의 추가 계산을 감수할 이유가 있는지 묻습니다.

공식 저장소도 Base를 만능 배포 정책이 아닌 foundation checkpoint라고 부릅니다. 이름이 비슷해도 관절 수, 카메라 순서, 정규화 태그와 행동 단위가 다르면 바로 실행할 수 없습니다.

체크포인트공식 용도가까운 대상주의
MolmoAct2미세조정 기반새 몸체·새 작업추가 데이터와 적응 필요
MolmoAct2-Think깊이 토큰 기반 미세조정3D 추론 가치가 큰 작업계산·지연을 실측
DROID추론·추가 미세조정Franka DROID식 구성절대 관절 자세 스키마 확인
BimanualYAM양팔 추론·미세조정YAM 양팔 구성카메라 순서와 14차원 상태
SO100_101·LIBERO해당 데이터·벤치마크SO 암 또는 LIBERO실물과 시뮬레이션 구분

Base는 가장 범용적인 출발점이지 즉시 제어 정책이 아니다

MolmoAct2 Base는 continuous flow-matching action expert가 붙은 post-trained 기반 모델로 설명됩니다. 목표 로봇의 관측, 상태, 행동과 과제 데이터에 맞춰 추가 미세조정하는 기본 시작점입니다.

Base를 받아 새 그리퍼나 다른 관절 구조에 바로 연결하면 행동 차원, 단위, 정규화와 안전 범위가 어긋날 수 있습니다. VLA 뜻처럼 시각·언어·행동 연결은 몸체별 인터페이스까지 포함해 검증해야 합니다.

Think는 깊이 추론이 필요한 구간에 계산을 쓴다

Ai2 공식 발표는 MolmoAct 2-Think가 깊이 지각 토큰을 추가하고, 공간 구조가 도움 되는 상황에서만 깊이 예측을 라우팅하는 적응형 방식을 설명합니다. 좁은 삽입, 가림과 복잡한 전후 관계처럼 3D 판단이 중요한 과제에서 후보가 됩니다.

그러나 Think라는 이름이 모든 과제의 성공률을 높인다는 뜻은 아닙니다. 깊이 추론이 불필요한 작업에서는 계산과 지연이 늘 수 있으므로 같은 데이터·하드웨어에서 Base와 성공률, p95 지연, 복구를 비교해야 합니다.

고급 파지 손이 장착된 PR2 이동형 조작 로봇
고급 파지 손을 단 PR2 로봇의 실제 사진입니다. MolmoAct 2의 Base·Think 체크포인트, 작업별 모델 또는 평가 결과를 보여 주는 자료는 아닙니다. 출처: Oleg Alexandrov. 라이선스: CC BY-SA 3.0.

작업별 모델은 행동 스키마가 맞을 때 강한 시작점이다

DROID는 필터링된 Franka 혼합 데이터와 절대 joint-pose 제어, BimanualYAM은 양팔 데이터와 절대 joint-pose 제어에 맞춰졌습니다. SO100_101은 SO-100·SO-101 데이터, LIBERO는 Spatial·Object·Goal·Long 스위트 혼합에 맞춘 모델입니다.

비슷한 팔이라고 체크포인트를 그대로 이식하지 말고 관절 순서, 상태 차원, 카메라 이름·순서, 그리퍼 표현, 제어 주기와 정규화 통계를 비교합니다. 한 항목이라도 다르면 변환 계층이나 추가 학습이 필요합니다.

호환성 검사맞아야 할 항목불일치 시 위험
몸체관절 수·순서·가동범위엉뚱한 관절 명령
관측카메라 수·이름·순서·해상도시점 혼동과 분포 이동
상태차원·단위·좌표계정규화 오류
행동joint pose·말단 자세·그리퍼제어기 불일치
시간제어 주기·action horizon지연·불안정·오래된 행동

모델 파일보다 먼저 런타임 요구를 고정한다

Hugging Face 공식 모델 카드는 모델 크기와 안전 주의를 제공하고, 공식 저장소는 설치 의존성, 체크포인트 용량, dtype과 예제 서버의 상태·카메라 형식을 설명합니다. 이 정보는 업데이트될 수 있으므로 배포 직전 현재 커밋에서 다시 확인해야 합니다.

저장소의 예시는 CUDA와 특정 PyTorch 환경, 충분한 GPU 메모리를 전제로 하며 DROID와 YAM의 dtype별 메모리 요구도 다르게 설명합니다. 모델 이름만 보고 GPU를 구매하지 말고 목표 dtype, 카메라 수, 배치, action horizon으로 실제 피크 메모리와 지연을 측정합니다.

MolmoAct 2 체크포인트 선택법: Base·Think·작업별 모델 차이의 핵심 판단 네 가지를 정리한 모바일 카드
글의 공식 출처와 비교표를 바탕으로 Physical AI Lab이 제작한 편집 카드입니다. 출처: Physical AI Lab. 라이선스: Owned original.

벤치마크는 저자 보고 범위 안에서만 비교한다

MolmoAct2 논문은 7개 시뮬레이션·실물 벤치마크와 13개 embodied-reasoning 벤치마크 결과를 보고하고, 공개 데이터·가중치·훈련 코드를 강조합니다. 공식 블로그는 LIBERO post-training에서 Base 97.2%, Think 98.1% 평균 성공률을 제시합니다.

이 수치는 저자 보고 결과이며 다른 로봇, 카메라, 데이터 예산과 현장의 성공률을 보장하지 않습니다. 로봇 VLA 평가처럼 동일한 초기 상태, 반복 수, 실패·개입·지연을 포함한 내부 기준으로 재평가해야 합니다.

안전한 선택 순서는 스키마 검사에서 시작한다

먼저 목표 로봇의 관측·상태·행동 스키마를 문서화하고 가장 가까운 체크포인트를 고릅니다. 오프라인으로 차원과 단위를 검증한 뒤 시뮬레이션에서 행동 제한과 정지, 실제 로봇에서는 낮은 속도·힘으로 단계적으로 시험합니다.

Base와 Think 비교는 같은 데이터와 시드로 수행하고, 작업별 모델은 변환 계층을 명시합니다. 모델 카드가 요구하듯 속도, 작업공간, 토크와 접촉력을 독립 안전 계층에서 제한하고 비상정지와 사람 감독을 유지해야 합니다.

자주 묻는 질문

새 로봇에는 MolmoAct2 Base와 Think 중 무엇을 쓰나요?

일반적으로 Base로 기준선을 만들고, 깊이·가림·공간 관계가 병목인 작업에서 Think를 같은 조건으로 비교합니다. 둘 다 새 몸체에는 데이터 적응과 미세조정이 필요합니다.

DROID 체크포인트를 다른 로봇팔에 바로 쓸 수 있나요?

대개 그대로는 어렵습니다. DROID 모델은 Franka식 절대 관절 자세 제어와 특정 상태·카메라 스키마에 맞춰져 있어 관절, 좌표, 그리퍼와 정규화를 확인하고 필요하면 변환·추가 학습해야 합니다.

LIBERO 98.1%면 실물 로봇도 같은 성공률인가요?

아닙니다. 98.1%는 Ai2가 보고한 Think의 LIBERO post-training 평균입니다. 실물 몸체, 센서, 지연, 접촉과 실패 복구가 다른 현장 성능을 보장하지 않습니다.

확인한 공식 자료

마지막 확인: 2026년 8월 7일