1X 월드 모델은 NEO를 어떻게 움직이나: 영상 예측에서 로봇 행동까지

1X 공식 월드 모델 연구 글에 따르면 두 단계를 거쳐 NEO를 움직입니다. 텍스트 조건부 월드 모델이 짧은 미래 영상을 예측하고, 역동역학 모델이 프레임 사이의 변화를 만드는 행동 궤적을 추정하면 NEO가 이를 실제로 실행합니다.

생성된 픽셀 자체가 모터 명령은 아니며, 이 연구가 모든 집안일의 완전 자율성을 입증한 것도 아닙니다. 1X는 깊이·기하·접촉 오류와 긴 과제의 재계획 문제를 직접 밝히고 있습니다. 개념부터 필요하다면 피지컬 AI 월드 모델 뜻을 먼저 확인할 수 있습니다.

지시문은 미래 영상과 행동 궤적을 차례로 거친다

추론을 시작할 때 시스템은 NEO 카메라의 시작 프레임과 텍스트 지시를 받습니다. 월드 모델이 의도한 미래를 영상으로 펼치고, 역동역학 모델이 그 변화에 필요한 로봇 행동을 뽑아냅니다.

이는 생성 영상을 재생하면 로봇이 그대로 따라간다는 방식이 아닙니다. 픽셀의 변화를 NEO의 관절과 구동 조건에 맞는 명령으로 바꾸는 별도 다리가 필요합니다.

단계입력출력주요 위험
월드 모델시작 프레임·텍스트미래 프레임보이지만 물리적으로 틀린 예측
역동역학 모델생성 프레임 쌍행동 궤적운동학·행동 불일치
NEO 실행추정 궤적실제 움직임접촉·깊이·환경 차이
향후 폐루프새 관측과 기억재계획 행동지연과 복구가 남은 과제

비디오 지식은 NEO 데이터로 두 번 접지된다

1X 월드 모델 기술 논문은 140억 파라미터 생성 비디오 모델을 백본으로 사용했다고 설명합니다. 900시간의 사람 1인칭 영상으로 중간 학습하고, 70시간의 NEO 데이터로 외형과 운동 특성에 맞게 미세조정했습니다.

역동역학 모델은 무작위 놀이를 포함한 400시간의 필터링하지 않은 로봇 움직임 데이터로 학습됐습니다. 이 수치는 공개된 학습 구성이지, 세상의 모든 물체와 방 구조를 학습했다는 의미는 아닙니다.

예측 영상의 성공과 실제 행동의 성공을 따로 잰다

생성 영상에서는 깔끔하게 잡았지만 실제 손은 짧게 닿거나 지나칠 수 있습니다. 1X도 물체 일관성, 깊이, 기하, 접촉을 어기는 낙관적 예측과 단안 영상의 약한 3D 접지를 한계로 적었습니다.

따라서 예측 미래, 추출된 행동, 실제 카메라 결과를 함께 보관해야 합니다. 피지컬 AI의 보기·생각·행동 루프로 어느 단계가 실패했는지 나누면 모든 오류를 월드 모델 탓으로 돌리지 않을 수 있습니다.

증거보여주는 것혼자서는 증명하지 못하는 것
생성 롤아웃의도한 시각적 결과실제 접촉 성공
예측·실행 비교 영상선정 시험의 정성적 정렬전체 배치 성공률
과제별 30회 실행공개 조건의 반복성모든 가정의 성능
미학습 과제의 0이 아닌 성공경험 학습의 출발점범용 가정 자율성
DARPA Robotics Challenge 무대에 선 ViGIR 휴머노이드 로봇
이 사진은 DARPA Robotics Challenge의 ViGIR 로봇이며 1X NEO가 아닙니다. 1X World Model의 영상 예측, 생성 롤아웃 또는 NEO의 실제 동작을 보여 주는 증거가 아닙니다. 출처: Sun L. Vega / DARPA via Wikimedia Commons. 라이선스: Public domain, U.S. Government work.

현재 지연시간은 빠른 반응 과제를 제한한다

1X는 다중 GPU에서 백본이 5초 분량의 영상을 만드는 데 11초, 행동 추출에 1초가 걸린다고 밝혔습니다. 천천히 집는 작업에는 견딜 수 있어도 빠르게 바뀌는 접촉 상황에는 큰 지연입니다.

회사는 5초보다 긴 과제를 위해 빠른 추론, 기억 문맥, 폐루프 재계획이 필요하다고 적었습니다. 한 번 성공한 짧은 클립을 끊김 없는 장시간 집안일 능력으로 확대해서는 안 됩니다.

여러 후보 중 누가 선택했는지도 기록한다

지시문이 실패 뒤에 바뀌었는지, 여러 미래 영상을 만들었는지, 실행할 후보를 사람이 골랐는지 확인해야 합니다. 1X 월드 모델 평가 글은 한 번부터 여덟 번까지 병렬 생성한 실험과 수동·자동 선택 가능성을 공개했습니다.

실행 중의 자율성과 과제 세팅, 초기화, 안전 개입도 분리합니다. 로봇 데모 원격조작 확인법은 사람 개입을 기록하는 데 도움이 되지만, 1XWM 자료가 화면 밖 도움까지 모두 부정하는 것은 아닙니다.

1X 월드 모델은 NEO를 어떻게 움직이나: 영상 예측에서 로봇 행동까지의 핵심 판단 네 가지를 정리한 모바일 카드
글의 공식 출처와 비교표를 바탕으로 Physical AI Lab이 제작한 편집 카드입니다. 출처: Physical AI Lab. 라이선스: Owned original.

범용이라는 문구보다 반복 가능한 시험을 만든다

대표 물체와 홀드아웃 방·지시문을 정하고 완료율, 개입률, 지연, 실패 유형을 반복 기록해야 합니다. 생성 영상 품질은 중간 진단값이고 최종 판단은 실제 로봇의 결과로 내려야 합니다.

공개 연구는 사람·웹 영상의 지식을 NEO 행동으로 연결하는 구체적인 경로를 보여줍니다. 그 의미는 구조와 제한된 일반화 증거에 있으며, '어떤 집에서든 어떤 일이든'이라는 미래 포부를 현재 성능으로 읽는 데 있지 않습니다.

자주 묻는 질문

1XWM이 영상을 모터로 바로 보내나요?

아닙니다. 월드 모델이 미래 프레임을 만들고, 별도로 학습된 역동역학 모델이 프레임 사이에 필요한 행동 궤적을 추정합니다.

생성 영상이 그럴듯하면 실제 행동도 성공하나요?

항상 그렇지 않습니다. 1X는 물체 일관성, 깊이, 기하와 접촉 오류를 보고했으므로 반복 실기 시험이 필요합니다.

NEO가 모든 집안일을 자율 수행한다는 증거인가요?

아닙니다. 공개된 과제의 연구 결과이며 1X도 지연, 장기 재계획과 복구를 향후 과제로 적었습니다.

확인한 공식 자료

최종 확인: 2026년 8월 7일