LeRobot v0.6 화면에서 같은 영상과 작업 문장을 Robometer와 TOPReward에 넣으면 둘 다 숫자 하나를 돌려줄 수 있다. 그러나 그 숫자는 같은 방식으로 만들어진 성공 확률이 아니다. Hugging Face의 LeRobot v0.6 공식 릴리스는 두 모델을 통합 보상 모델 API에 포함했지만, Robometer는 학습된 진행도·성공 헤드를 사용하고 TOPReward는 범용 시각언어모델에서 문장이 참이라는 토큰의 로그확률을 읽는다.
이 변화가 사람의 평가를 없앴다는 뜻도 아니다. TOPReward 논문의 0.947은 저자 설정에서 보고한 평균 Value-Order Correlation이며 94.7% 성공 판정 정확도가 아니다. Robometer의 100만 개가 넘는 궤적도 새 공장의 카메라, 물체와 실패 유형을 모두 덮는다는 증거가 아니다. v0.6이 바꾼 것은 두 접근을 같은 인터페이스에서 시험할 수 있게 한 점이고, 현장 합격선을 정하는 일은 여전히 별도의 검증 과제다.

v0.6에서 확인된 변화는 보상 모델을 같은 호출 방식으로 시험할 수 있다는 점이다
LeRobot v0.6은 lerobot.rewards 아래에 통합 API를 두고 Robometer와 TOPReward를 포함했다. 공개 통합은 로봇 궤적 영상과 작업 지시에서 보상값을 얻는 실험을 한 프로젝트 안에서 구성하기 쉽게 만든다. 하지만 오픈소스에 연결됐다는 사실은 원 논문 결과의 독립 재현, 특정 로봇 호환, 현장 임계값 보정이나 생산 승인과 다르다.
변화 전후를 읽을 때는 도구가 제공하는 값과 사용자가 결정해야 하는 값을 나눈다. API는 모델을 불러오고 입력을 맞추며 스칼라 출력을 받는 경로를 제공한다. 작업 성공의 정의, 어떤 프레임이 결정적 증거인지, 오판 비용, 사람이 다시 볼 조건과 안전 관련 신호의 소유자는 현장 검수에 남는다.
평가와 학습에 같은 보상 모델을 사용할 때도 주의가 필요하다. 정책이 특정 모델의 편향에 맞춰 높은 점수를 얻은 뒤 같은 모델로 최종 성능을 재면 오류가 되돌아올 수 있다. 최종 평가는 독립된 사람 판정이나 물체 상태·접촉 결과 같은 다른 신호와 대조해야 한다.
릴리스 문구를 현장 능력으로 바꾸기 전에 증거 범위를 나눈다
v0.6 발표, 프로젝트 문서, 원 논문은 서로 다른 질문에 답한다. 릴리스는 무엇이 통합됐는지, 문서는 구현이 어떤 입력과 출력을 쓰는지, 논문은 저자 실험에서 어떤 학습과 지표를 사용했는지를 보여 준다. 이 세 범위를 섞지 않으면 자동 성공 판정의 현재 위치가 분명해진다.
| 공개 근거 | 확인되는 변화 | 자동으로 증명되지 않는 것 |
|---|---|---|
| LeRobot v0.6 릴리스 | Robometer·TOPReward가 통합 보상 모델 API에 포함됨 | 원 논문 재현, 현장 정확도, 생산 적용 승인 |
| LeRobot Robometer 문서 | 영상·작업 입력, Qwen3-VL-4B 기반 헤드와 스칼라 반환 방식 | 새 카메라·작업에서의 일반화와 임계값 |
| LeRobot TOPReward 문서 | 영상·작업에서 True 토큰 로그확률을 반환하는 Qwen3-VL-8B 기본 구성 | 로그확률을 성공 확률로 읽어도 된다는 보정 |
| 각 원 논문 | 저자 데이터·지표·실험 범위에서 보고된 결과 | 서로 같은 조건의 우열과 외부 현장 재현 |
따라서 v0.6의 날짜는 소프트웨어 통합 상태를 고정하고, 논문 날짜는 학습 방법과 저자 평가의 근거를 고정한다. 어느 한쪽이 다른 쪽의 모든 결과를 승계하지 않는다. 구현 버전과 체크포인트가 바뀌면 같은 이름이라도 다시 확인해야 한다.
Robometer는 학습된 헤드를 쓰고 TOPReward는 토큰의 순서를 읽는다
LeRobot의 Robometer 문서에 따르면 이 통합은 영상 궤적과 작업 설명을 받아 내부적으로 프레임 수준의 진행도와 성공을 예측한다. 기본 구성은 Qwen3-VL-4B 백본 위의 별도 예측 헤드를 사용하고, 보상 API에서는 샘플당 스칼라를 반환한다. 기본 진행도 모드는 마지막 프레임의 진행도 값을 쓴다. 문서에 제시된 최대 프레임 기본값은 8이므로 영상 전체의 모든 접촉과 상태를 자동으로 관찰한다고 볼 수 없다.
Robometer 원 논문은 전문가 진행도 감독과 같은 작업 궤적 쌍의 선호 비교를 결합하고, RBM-1M을 100만 개가 넘는 궤적으로 구성했다고 보고한다. 규모는 학습 근거이지만 대상 현장의 대표성은 별도 질문이다. 카메라 각도, 물체, 실패 분포가 다르면 큰 데이터셋도 중요한 예외를 보지 못할 수 있다.
LeRobot의 TOPReward 문서는 별도 보상 헤드를 학습하기보다 영상에 대해 작업 문장이 참이라는 True 토큰의 로그확률을 읽는 방식을 설명한다. 기본 백본은 Qwen3-VL-8B이고 샘플당 하나의 값을 반환한다. 별도 작업별 보상 학습이 없다는 점은 라벨 검수, 임계값 조정, 계산비용과 실패 감사를 하지 않아도 된다는 뜻이 아니다.
자동 점수는 생산 판정도 안전 신호도 아닌 하나의 관찰 채널이다
두 모델 모두 영상과 언어를 중심으로 판단한다. 카메라에 가려진 접촉, 화면 밖에서 떨어진 물체, 힘만으로 알 수 있는 체결, 작업 문장의 모호함, 보기에는 그럴듯하지만 규격을 벗어난 배치를 놓칠 수 있다. Robometer 문서가 설명하는 입력에는 힘·접촉·정밀 물체 자세 같은 특권 상태가 자동으로 포함되지 않는다. 필요한 경우 로봇 상태와 품질 센서, 사람 검수를 결합해야 한다.
TOPReward 논문은 130개가 넘는 실제 작업에서 Qwen3-VL 기준 평균 Value-Order Correlation 0.947을 보고한다. TOPReward 원 논문의 이 값은 궤적 진행 순서를 얼마나 일관되게 반영하는지 보는 저자 지표다. 성공·실패 이진 분류의 정밀도나 재현율, 오탐률 또는 안전 신뢰도가 아니다. 숫자를 백분율 정확도로 바꾸면 모델 선택과 현장 위험을 모두 왜곡한다.
운영에서는 점수의 사용처마다 오판 비용이 다르다. 학습 데이터 우선순위를 정하는 보조 신호, 실험 영상을 빠르게 선별하는 신호, 작업 완료를 시스템에 확정하는 신호는 같은 임계값을 공유하지 않는다. 사람 보호를 위한 인터록이나 비상정지를 보상 모델 점수 하나에 맡기지 않는다.
알려진 기본값과 현장에서 다시 구해야 할 값을 구분한다
구현 문서는 재현을 시작할 수 있는 기본값을 주지만 현장 합격값은 주지 않는다. 같은 체크포인트라도 샘플링 프레임, 카메라 위치, 지시문 표현과 작업 길이가 바뀌면 점수 분포가 달라질 수 있다. 모델 비교 전에 입력 영상과 지시문, 성공 정의를 고정하고 변경 이력을 남긴다.
| 구분 | 공개 자료로 아는 것 | 대상 현장에서 구할 것 |
|---|---|---|
| Robometer 입력·출력 | 영상+작업, 기본 최대 8프레임, 진행도 또는 성공 스칼라 | 카메라·작업별 보정, 실패 유형별 오탐·누락 |
| TOPReward 입력·출력 | 영상+작업, 기본 최대 16프레임, True 토큰 로그확률 | 점수 분포, 임계값, 문장 표현 변화에 대한 민감도 |
| 논문 지표 | RBM-1M 규모와 TOPReward의 저자 보고 VOC | 독립 홀드아웃에서의 혼동행렬·순서 상관·보정 |
| 운영 적용 | LeRobot의 추론 통합 경로 | 지연·비용, 사람 재검토량, 데이터 드리프트와 롤백 |
| 최종 작업 결과 | 영상·언어 점수 | 물체 상태·접촉·품질 센서와 독립 사람 판정 |
모르는 값은 평균 하나로 메우지 않는다. 정상 성공, 부분 성공, 보기 좋은 실패, 가림, 화면 밖 사건, 잘못된 지시와 안전 관련 실패를 나눠 점수 분포를 본다. 어느 모델도 현장 실패를 모두 포함한다는 전제에서 시작하지 않는다.
다음 검증은 사람 라벨을 없애는 시험이 아니라 가장 필요한 라벨을 찾는 시험이다
자동 평가의 목표는 사람이 볼 영상을 무작정 줄이는 것이 아니다. 어떤 조건에서 자동 점수를 믿을 수 있고 언제 사람이 다시 봐야 하는지 좁히는 일이다. 학습용 데이터와 평가용 데이터를 분리하고, 최종 홀드아웃은 보상 모델이나 정책 조정에 되먹임하지 않는다.
- 작업·사이트·카메라가 겹치지 않는 홀드아웃을 만들고 사람이 독립적으로 성공·부분 성공·실패를 판정한다.
- 전체 평균과 함께 실패 하위유형별 혼동행렬, 정밀도·재현율, 보정과 시간 순서 일관성을 본다.
- TOPReward의 VOC를 성공 정확도로 바꾸지 않고 현장에서도 별도의 이진·다단계 판정 지표를 구한다.
- 가림, 화면 밖 사건, 접촉만으로 알 수 있는 결과와 모호한 지시문을 의도적으로 포함한다.
- 정책 학습에 사용한 보상 모델과 최종 평가자를 분리해 같은 편향이 성과로 되돌아오는지 확인한다.
- 모델·프레임 샘플링·지시문 변경 뒤에는 이전 임계값을 자동 승계하지 않고 회귀 검수를 다시 연다.
검증 영상과 에피소드를 일관되게 묶으려면 LeRobot Dataset v3 구조를 함께 볼 수 있다. 평가 결과를 공장 시스템에 전달할 때는 OPC UA Robotics의 공통 정보 모델처럼 상태 의미와 시각을 명시하되, 보상 점수를 품질 확정이나 안전 상태와 같은 필드로 취급하지 않는다.
독자가 이어서 묻는 질문
Robometer와 TOPReward를 비교할 때 어떤 날짜와 버전을 기준으로 해야 하나요?
LeRobot 통합 범위는 2026년 7월 7일 v0.6 릴리스와 사용하는 문서·코드 버전을 기준으로 고정한다. 학습 방식과 논문 수치는 각각의 원 논문 날짜와 실험 범위에 묶는다. 체크포인트, 프레임 샘플링이나 구현이 바뀌면 같은 모델 이름이라도 현장 검증을 다시 해야 한다.
자료 마지막 확인: 2026년 8월 26일