Physical Intelligence의 공식 π0.7 연구 글은 목표만 지시하는 데서 한발 더 나아가, 그 일을 어떻게 수행할지도 조건으로 줄 수 있는 VLA를 설명합니다. 중간 언어 지시, 원하는 품질·속도 같은 전략 정보, 미래 장면을 나타내는 서브골 이미지가 행동 방식을 구체화합니다.
회사는 미학습 과제 조합, 다른 로봇 몸체로의 전이, 특정 과제에서 전문 정책과 맞먹는 결과를 보고했습니다. 다만 공개된 로봇과 실험 안에서 읽어야 합니다. 모델 계열의 기본은 VLA와 VLM 차이에서 확인하고, 여기서는 π0.7의 조절 방식에 집중합니다.
조절 가능하다는 말은 목표와 방법을 함께 준다는 뜻이다
'주방을 정리해'라는 지시는 가능한 순서와 전략이 너무 많습니다. π0.7은 다음 단계의 언어, 수행 품질과 속도 정보, 시각적 서브골을 받아 서로 다른 행동을 구분하도록 학습됐습니다.
일반 채팅 프롬프트로 모터 수치를 직접 바꾸는 것과는 다릅니다. 학습 중부터 이런 문맥을 선택적으로 포함해 행동 정책이 조건에 반응하게 만든 구조입니다.
| 문맥 신호 | 정하는 내용 | 사용 예 |
|---|---|---|
| 전체 과제 지시 | 최종 목표 | 조리대를 닦아라 |
| 중간 언어 지시 | 다음 의미 단계 | 서랍을 열어라 |
| 에피소드 메타데이터 | 품질·속도·전략 | 빠르고 성공적인 방식 |
| 서브골 이미지 | 가까운 미래의 장면 | 원하는 물체 배치 |
성공과 실패를 포함한 여러 종류의 경험을 섞는다
논문은 로봇 시연, 실패를 포함한 자율 실행, 사람의 1인칭 영상, 웹 멀티모달 데이터를 함께 사용했다고 설명합니다. 자세한 문맥 표지가 섞인 전략을 평균내어 어정쩡한 행동으로 만드는 문제를 줄입니다.
모델은 π*0.6·Recap 계열과 MEM을 이어받아 VLM 백본, 영상 이력 메모리, 행동 전문가를 결합합니다. 경량 월드 모델이 만든 서브골 이미지는 언어로 표현하기 어려운 공간 상태를 보완합니다.
사람의 언어 코칭과 이후의 자율 실행을 구분한다
π0.7 논문의 에어프라이어 실험에서 짧은 제로샷 지시만 준 시도는 일부 단계만 수행하고 끝내지 못했습니다. 사람이 단계별로 언어 코칭하자 나아졌고, 그 기록으로 상위 정책을 미세조정한 뒤에는 서브태스크를 자동 생성했습니다.
따라서 코칭받은 시험과 이후의 완전 자동 시험은 서로 다른 증거입니다. 코칭 영상을 보여주면서 기본 모델이 처음부터 모든 단계를 독립 계획했다고 쓰면 사실관계가 흐려집니다.
| 공개 시험 | 보여준 신호 | 남겨야 할 한계 |
|---|---|---|
| 에어프라이어 | 언어 코칭으로 새 기기 과제 조합 | 초기 제로샷은 완주 실패 |
| 양팔 UR5e 빨래 접기 | 해당 로봇 과제 데이터 없이 전이 | 지정 몸체와 과제 조건 |
| 에스프레소·빨래·상자 | 단일 모델이 지명 전문 정책과 비교 | 모든 조작 과제의 우위 아님 |
| 다양한 언어 명령 | 세밀한 지시 추종 | 무제한 자연어 안전 제어 아님 |

미학습 과제도 이전 지식의 조합으로 푼다
평가 로봇에서 정확히 같은 과제를 시연하지 않았더라도 관련 물체, 동작, 의미는 다른 로봇·사람·웹 데이터에 들어 있을 수 있습니다. 조합적 일반화는 이런 요소를 새 방식으로 묶는 능력이지, 아무 지식 없이 행동한다는 뜻이 아닙니다.
주장을 볼 때는 지시, 물체, 배경, 로봇 몸체, 전체 과제 조합 중 무엇을 홀드아웃했는지 물어야 합니다. 로봇 VLA 평가 방법처럼 분할 단위를 밝히면 결과의 강도를 제대로 비교할 수 있습니다.
상세한 논문 공개와 상용 API 공개는 다르다
2026년 4월 공식 글과 논문은 모델 구조와 실험을 공개하고 연구·응용 협업을 안내합니다. 누구나 호출할 수 있는 셀프서비스 상용 API, 전체 지원 로봇 목록, 서비스 수준 보증을 발표한 것은 아닙니다.
도입을 검토한다면 체크포인트 또는 접근 조건, 연산 요구량, 제어 주기, 안전 인터페이스, 로봇별 적응 작업을 문의해야 합니다. 논문과 영상이 공개됐다는 이유만으로 구매 가능한 제품이라고 쓰면 안 됩니다.

로컬 시험에서는 완료율과 조절 반응을 함께 본다
목표는 그대로 두고 속도, 전략, 서브골만 바꾼 짝지은 프롬프트를 만듭니다. 실제 궤적이 요구 방향으로 달라지면서 성공률과 작업공간 제약을 유지하는지 측정해야 합니다.
홀드아웃 물체와 환경에서 반복 시험하고 복구와 개입도 기록합니다. 로봇 행동 데이터 구성을 함께 보면 선택된 영상 몇 개와 실제 조절 능력을 구분할 궤적 로그를 설계할 수 있습니다.
자주 묻는 질문
π0.7은 무엇 때문에 조절 가능한가요?
중간 언어, 전략 메타데이터, 서브골 이미지를 학습 문맥으로 사용해 해야 할 일뿐 아니라 수행 방식도 조건으로 줄 수 있기 때문입니다.
미학습 과제를 모두 제로샷으로 끝냈나요?
아닙니다. 회사는 조합적 일반화의 초기 신호를 보고했고, 에어프라이어 시험도 초기 제로샷 시도는 완주하지 못해 언어 코칭으로 개선했습니다.
개발자가 공개 π0.7 API를 바로 쓸 수 있나요?
공식 글과 논문은 연구와 협업을 안내하지만, 일반 셀프서비스 상용 API는 발표하지 않았습니다.
확인한 공식 자료
- Physical Intelligence π0.7 연구 글
- Physical Intelligence π0.7 논문
- Physical Intelligence π*0.6·Recap 글
- Physical Intelligence 멀티스케일 임바디드 메모리 논문
최종 확인: 2026년 8월 7일