MIT Masked IRL: 모호한 지시에서 로봇이 조건을 고르는 방법

MIT의 Masked IRL은 모호한 자연어 지시를 곧바로 로봇 행동으로 번역하는 범용 VLA 모델이 아니다. 사람이 보여준 시연과 언어를 함께 사용해 어떤 상태 특징이 목표에 중요하고 무엇이 무관한지 고른 뒤, 그 마스크를 역강화학습(IRL)에 적용하는 방법이다.

물체를 잡기 위해 손을 뻗는 PR2 로봇
실제 PR2 조작 장면이지만 MIT Masked IRL 실험은 아닙니다. 모호한 지시에서 숨은 조건을 선택하는 알고리즘의 성능을 사진이 입증하지 않습니다. 이미지 출처: Wikimedia Commons · 라이선스: CC BY-SA 3.0 · 크레딧: Oleg Alexandrov

비슷해 보이는 두 문제는 답이 다르다

두 개의 LLM도 역할이 다르다. 첫 모델은 시연을 참고해 짧고 모호한 지시를 구체화한다. 두 번째 모델은 구체화된 설명에서 관련 상태 특징을 남기는 마스크를 만든다. 이후 IRL이 시연을 설명하는 보상함수를 학습한다. 어느 단계든 틀리면 잘못된 조건이 보상에 들어간다.

“컵을 상자에 넣어”라는 지시에서 컵 색깔이 중요한지, 상자의 위치가 중요한지, 테이블 색이 중요한지는 문장만으로 분명하지 않을 수 있다. 시연은 어떤 행동이 성공했는지 보여주지만 사람이 우연히 항상 빨간 테이블에서 시연했다면 IRL은 테이블 색을 목표의 일부로 오해할 수 있다.

여기에는 두 문제가 있다. 하나는 지시가 생략한 조건을 보완하는 문제다. 다른 하나는 시연에 반복됐지만 목표와 무관한 조건을 버리는 문제다. Masked IRL은 첫 LLM으로 앞의 문제를, 두 번째 LLM의 상태 마스크로 뒤의 문제를 다루려 한다.

무엇을 살 것인지보다 무엇이 이미 갖춰졌는지 본다

이 연구는 지금 바로 구매해 공장에 설치하는 상용 패키지가 아니다. 필요한 것은 작업 상태를 구조화한 표현, 전문가 시연, 언어 지시, IRL 학습과 로봇 계획 파이프라인이다. 작업자가 쓰는 자연어만 넣으면 모든 센서 상태와 행동 공간이 자동으로 정의되는 제품으로 이해하면 안 된다.

VLA 모델은 시각·언어·행동을 연결하지만 Masked IRL과 목적이 같지 않다. 이 연구는 상태 특징을 고른 보상 학습에 초점을 둔다. 어떤 방식이 맞는지는 과제의 상태가 얼마나 구조화돼 있고 실패 비용과 설명 가능성이 얼마나 중요한지에 달려 있다.

통합 비용은 마스크 앞뒤에 숨어 있다

선택지해결하려는 문제통합 비용주요 위험
규칙 기반 조건 지정중요 상태를 사람이 직접 정의도메인 전문가의 지속 관리놓친 조건과 규칙 폭증
일반 IRL시연에서 보상 추론많은 시연과 상태 설계우연한 상관관계 학습
Masked IRL언어로 관련 상태를 걸러 IRLLLM·마스크·IRL 검증틀린 구체화와 상태 누락
엔드투엔드 VLA관찰·언어에서 행동 생성대규모 데이터·실행 안전 계층설명·보상 경계 불투명

마스크가 선택하려면 먼저 로봇이 사용할 상태 특징이 정의돼 있어야 한다. 물체 종류, 위치, 방향, 접촉, 장애물, 작업 단계가 센서와 일치해야 한다. 카메라 영상에서 무엇을 객체로 볼지, 관찰 누락을 어떻게 표시할지, 시연의 시작과 끝을 어디로 자를지도 사람이 설계한다.

첫 LLM이 지시를 구체화할 때 시연 문맥을 잘못 읽을 수 있고, 두 번째 LLM은 필요한 안전 조건을 ‘무관하다’고 버릴 수 있다. 예를 들어 컵 색은 목표에 무관해도 깨지기 쉬운 재질이나 뜨거운 액체는 행동 제한에 중요할 수 있다. 목표 보상과 안전 제약을 하나의 마스크로 섞지 않는 설계가 필요하다.

운영 위험은 틀린 조건을 확신 있게 고르는 데서 나온다

마스크가 불완전해도 IRL은 남은 상태만으로 일관된 보상을 만들 수 있다. 훈련 지표가 좋아 보여도 중요한 특징이 빠진 정책이 새로운 환경에서 실패할 수 있다는 뜻이다. 따라서 LLM의 설명이 자연스럽다는 이유로 마스크를 신뢰하면 안 된다.

  • 관련 특징 하나를 제거했을 때 행동이 어떻게 바뀌는지 확인
  • 무관 특징의 색·위치·배경을 바꿔 성능 불변성 시험
  • 시연에 없던 안전 제약을 별도 런타임 실드로 적용
  • LLM 버전과 프롬프트가 바뀔 때 마스크 회귀시험
  • 실패·사람 개입 데이터를 학습셋으로 되돌리는 절차

로봇 학습 데이터 품질 점검처럼 시연 편향과 누락을 먼저 찾아야 한다. 모델이 관련성을 잘 골라도 원래 시연이 중요한 예외를 포함하지 않으면 보상은 그 예외를 배울 수 없다.

다른 경로가 더 나은 과제도 있다

상태가 명확하고 규정된 안전 작업은 사람이 조건을 직접 쓰는 규칙 기반 제어가 더 단순할 수 있다. 시연은 풍부하지만 상태 구조화가 어려운 작업은 엔드투엔드 정책이 유리할 수 있다. 반대로 중요한 특징을 설명해야 하고 우연한 배경 변화가 많은 과제라면 Masked IRL의 접근이 유용한 연구 방향이 된다.

연구팀은 제한된 시뮬레이션과 실로봇 과제에서 기준선보다 최대 15% 높은 성능과 최대 4.7배 적은 데이터를 보고했다. 이는 특정 실험의 최대 상대값이다. 열린 가정, 복잡한 공장, 모든 언어 지시에서 같은 향상이 나온다고 확대하면 안 된다.

도입 판단은 마스크를 반증할 수 있을 때 내린다

실험팀은 LLM이 고른 특징 목록과 제외 이유를 보존하고, 도메인 전문가가 필요한 조건을 빠뜨렸는지 검토해야 한다. 이후 관련·무관 특징을 의도적으로 바꾼 반사실 시험을 만든다. 마스크가 맞다면 무관 특징 변화에는 행동이 안정적이고 관련 특징 변화에는 적절히 대응해야 한다.

학습된 보상과 실제 안전 제약은 분리해야 한다. 보상은 목표를 잘 수행하도록 유도하지만 사람 접근, 충돌 힘, 금지 구역과 비상정지는 런타임 안전 실드에서 독립적으로 제한하는 편이 낫다. 모호한 지시를 이해하는 능력이 물리적 안전 인증을 대신하지 않는다.

Masked IRL은 언어가 시연의 ‘무엇이 중요했는가’를 설명하게 해 우연한 상태 상관관계를 줄이는 유의미한 방법이다. 두 LLM의 역할과 IRL을 분리한 설계도 검증 지점을 만든다. 반면 범용 지시 이해, 자동 안전 보장, 상용 가용성, 대규모 실제 환경의 성능은 아직 보류해야 한다.

실제 도입 전에 남는 두 질문

Masked IRL을 지금 상용 제품으로 살 수 있나?

연구 논문과 프로젝트를 바탕으로 구현·검증해야 하는 단계다. 공식 자료에는 완제품 가격, 지원 하드웨어, 서비스 수준이나 공장용 안전 인증이 제시되지 않았다. 연구 코드를 실행하는 것과 운영 가능한 제품을 구매하는 것은 다른 일이다.

한국어 지시나 다른 작업 문화에도 그대로 통하나?

공개 실험만으로는 보장할 수 없다. 언어마다 생략 방식과 작업 표현이 다르고, 공장·가정마다 중요한 상태 특징도 달라진다. 대상 언어와 지역의 실제 작업자가 만든 지시·시연으로 마스크를 재검증하고 안전 제약은 별도로 유지해야 한다.

확인한 1차 자료는 MIT News의 2026년 6월 연구 소개, MIT CSAIL 설명, Masked IRL 논문이다. 수치와 한계는 2026년 8월 25일 확인한 연구 범위에만 귀속했다.