오픈 보캐뷸러리 로봇 인지: 처음 보는 물체 이름을 실제 조작 대상으로 연결하는 방법
오픈 보캐뷸러리 로봇 인지는 미리 정한 클래스 번호가 아니라 사용자의 물체 이름과 속성 표현을 영상의 영역·마스크에 연결하고, 깊이·카메라 보정으로 3D instance를 만든 뒤 추적·파지 모듈에 넘기는 과정입니다. 텍스트-박스 일치도만으로는 부족하며 동명이인 해소, 3D 일관성, 가림 뒤 재식별과 조작 성공까지 검증해야 합니다.
로봇 데이터셋, 센서, 엣지 AI 하드웨어 정리
오픈 보캐뷸러리 로봇 인지는 미리 정한 클래스 번호가 아니라 사용자의 물체 이름과 속성 표현을 영상의 영역·마스크에 연결하고, 깊이·카메라 보정으로 3D instance를 만든 뒤 추적·파지 모듈에 넘기는 과정입니다. 텍스트-박스 일치도만으로는 부족하며 동명이인 해소, 3D 일관성, 가림 뒤 재식별과 조작 성공까지 검증해야 합니다.
로봇 정책 안전 실드는 학습 모델이 낸 행동을 그대로 모터에 보내지 않고, 충돌·속도·관절·안전 집합 제약을 실행 직전에 검사해 허용하거나 수정하거나 안전 정지로 바꾸는 런타임 계층입니다. 불확실성 점수와 달리 금지 조건을 명시하고, 실드 개입률·최소 안전 여유·작업 성공률을 함께 검증해야 합니다.
로봇 보상 모델은 성공 라벨을 직접 쓰기 어려운 작업에서 사람이 두 궤적 중 더 나은 행동을 고르거나 시범 영상의 진행 상태를 제공하면, 관측·행동·시간 구간에 점수를 주는 함수를 학습하는 방법입니다. 쌍대 선호·스칼라·밀집 보상을 구분하고 평가자 일치도, 분포 밖 calibration과 reward hacking을 실제 작업 성공으로 검증해야 합니다.
로봇 정책은 가장 높은 확률의 행동을 항상 실행하기보다 입력이 낯설거나 여러 행동이 비슷할 때 기권할 수 있어야 합니다. 그러나 softmax confidence 하나로는 실패 확률을 알기 어렵고 임계값을 높이면 도움이 너무 자주 필요합니다. 불확실성 기반 기권은 점수, calibration set, 위험 비용과 사람 인계 절차를 하나의 선택 정책으로 설계하는 문제입니다.
새 로봇과 작업에 VLA를 맞출 때 전체 파라미터를 모두 업데이트하면 표현력은 크지만 메모리와 망각 위험이 커집니다. LoRA와 어댑터는 학습 비용을 줄이고 원본 모델을 보존하지만 action head·카메라·로봇 몸체 차이가 크면 제한될 수 있습니다. 선택은 GPU 크기보다 어떤 분포가 바뀌었는지와 배포 제약을 기준으로 해야 합니다.
VLA는 연속 위치·회전·그리퍼 명령을 언어 모델처럼 예측하려고 action을 이산 토큰으로 바꿀 수 있습니다. 이때 bin 수, 범위, 시간 압축 방식이 제어 해상도와 시퀀스 길이, 추론 지연을 동시에 결정합니다. 행동 토큰화는 단순한 숫자 변환이 아니라 어떤 오차와 동작 구조를 모델에 남길지 정하는 설계입니다.
분류 모델에서 안전한 색 변화나 좌우 반전이 로봇 정책에서는 같은 행동 라벨을 보존하지 않을 수 있습니다. crop은 카메라 내참수를 바꾸고 flip은 좌우 이동과 회전을 뒤집으며, 시점 이동은 보이지 않던 가림을 만듭니다. 로봇 영상 증강은 이미지가 자연스러운지가 아니라 관측 변환 뒤에도 action의 물리적 의미가 맞는지 검증해야 합니다.
로봇 영상의 프레임을 무작위로 나누면 같은 에피소드의 앞뒤 장면, 같은 방의 배경, 같은 물체와 작업자 습관이 학습과 테스트에 동시에 들어갈 수 있습니다. 성공률은 높아져도 새 장소와 새 물체에 대한 일반화는 확인되지 않습니다. 누수를 막으려면 프레임이 아니라 배포 질문에 맞는 그룹 단위로 split을 설계해야 합니다.
로봇 모델 파일만 남기고 학습 데이터 폴더를 날짜로 복사하면 같은 결과를 다시 만들기 어렵습니다. 원본 episode, calibration, 라벨 수정, schema 변환, train·test split, normalization 통계와 학습 run을 불변 식별자로 연결해야 어느 데이터가 모델을 만들었고 문제가 생겼을 때 어디까지 되돌릴지 알 수 있습니다. 데이터 계보는 저장 위치 목록이 아니라 변환 관계와 증거를 추적하는 구조입니다.
로봇 실패를 모두 다시 수집하면 비용이 크고 같은 오류만 반복됩니다. 실패 마이닝은 rollout에서 실제 실패, 실패 직전 징후, 불확실하지만 성공한 장면과 새로운 상태를 후보로 모으고, 불확실성·새로움·영향·검토 비용을 함께 보고 다음 수집 순서를 정합니다. 액티브 러닝의 목표는 어려운 frame을 많이 모으는 것이 아니라 모델의 빈틈을 가장 잘 줄이는 episode를 고르는 것입니다.