ISO TC 299 WG16 휴머노이드 데이터셋 표준: 자세·행동·안전·출처를 어떻게 맞출까

두 휴머노이드 데이터셋을 합칠 수 있는 조건은 용량이 크거나 영상 해상도가 같은지가 아니다. 한쪽의 손 좌표가 손목 기준이고 다른 쪽이 세계 좌표라면 같은 숫자가 다른 자세를 뜻한다. ‘집기’가 한쪽에서는 목표 위치만, 다른 쪽에서는 50개의 관절 명령을 뜻할 수도 있다. 처음 학습하는 팀이라면 데이터 수를 늘리기 전에 의미와 출처를 보존하는 쪽이 맞고, 이미 자체 스키마가 있는 팀이라면 새 초안을 그대로 복사하기보다 생애주기의 차이를 대조하는 쪽이 맞다.

카메라·촉각 센서·엣지 컴퓨터·로봇 관절이 연결된 로봇 공학 시험대 개념도
특정 제품이나 측정 결과가 아닌, 로봇 센서·컴퓨팅·액추에이터 데이터 경로를 설명하기 위한 AI 생성 개념 이미지입니다.

표준 번호보다 먼저 살펴볼 구매 질문

WG16은 ISO/TC 299의 공식 작업반 목록에서 ‘휴머노이드 로봇 데이터셋’을 담당하는 조직으로 확인된다. ISO/CD 26264-1 공식 기록은 이 데이터셋의 계획, 생성·관리, 사용, 보관과 폐기에 이르는 생애주기 틀과 품질·보안·프라이버시의 횡단 요구를 다룬다고 밝힌다. 학습·선택·평가 데이터셋에 적용되고 이족·바퀴형 등 이동 형태와 산업·서비스·의료 영역을 가리지 않는다. 이 공개 범위는 데이터 거버넌스의 질문을 넓히지만, 구체 필드명이나 허용 오차를 무료 초록만으로 정해 주지는 않는다.

구매자는 ‘ISO 호환 데이터’라는 문구 대신 버전이 고정된 스키마, 센서·로봇 구성, 수집 동의와 이용허락, 주석 지침, 품질 보고서, 안전 사건 정의, 학습·검증·시험 분할과 삭제 이력의 전달 여부를 묻는다. 초안 단계에서는 공급자가 어느 조항을 충족했다는 주장보다 원자료에서 파생본까지 계보를 재현할 수 있는지가 더 강한 증거다.

일반 요구와 아직 정해야 할 기술 스키마의 경계

ISO 공개 초록이 확인해 주는 것은 데이터셋 생애주기와 횡단 요구의 존재다. ‘모든 휴머노이드 데이터가 동일한 좌표계·행동 온톨로지·파일 형식을 써야 한다’는 세부 규칙은 확인되지 않는다. 따라서 ISO 26264-1을 특정 저장 형식 인증처럼 설명하면 범위를 넘는다. 최종 원문이 발행되더라도 1부의 일반 요구사항과 프로젝트별 기술 프로필을 구분해야 한다.

비교 사례로 LeRobot의 공식 데이터셋 설명은 영상과 상태·행동 데이터를 동기화해 MP4 또는 이미지와 Parquet로 저장하는 공개 형식을 제공한다. 이는 구현 가능한 데이터 형식의 예이지 ISO 26264-1의 공식 구현이나 모든 휴머노이드에 충분한 스키마가 아니다. 발·손 접촉, 전신 기준 자세, 안전정지, 원격조작과 작업 성공의 의미는 로봇·과업 프로필에서 더 정해야 한다.

데이터를 합치는 비용은 네 종류의 번역에서 생긴다

첫 번역은 시간이다. 카메라 프레임, 관절 상태, 토크, 촉각과 행동 명령을 같은 시계에 맞추고 표본화 시점의 흔들림·누락·지연을 보존한다. 둘째는 공간이다. 세계·베이스·골반·링크·카메라와 말단장치 좌표계의 변환 계보와 교정 버전을 함께 둔다. 원시값을 새 좌표로 변환했다면 원본과 변환 행렬, 사용한 소프트웨어 해시를 남긴다.

통합 축공통 필드검증 질문맞출 수 없을 때 대안
자세좌표계 ID·단위·관절 순서·회전 표현순기구학으로 실물 형상과 일치하는가원래 로봇 몸체별 부호기를 유지
행동명령 주체·공간·주기·제약·완료 조건행동이 목표인지 저수준 명령인지과업 이름과 제어 기록을 분리
접촉·안전접촉 위치·힘·정지 원인·사람 개입실패를 삭제하거나 성공으로 바꾸지 않았는가안전 사건 전용 보조 파일 생성
출처·권리수집자·장소·동의·이용허락·파생 관계재배포·상업학습·삭제 요구가 가능한가권리 불명 자료를 격리
품질누락·동기·교정·주석자 합의도분할별 분포와 오류가 공개되는가통합 대신 데이터셋 설명서로 연결

셋째 번역은 행동 의미, 넷째는 권리다. 두 데이터셋의 행동 차원 수가 같아도 위치 목표와 토크 명령은 섞을 수 없다. 공개 웹 영상에서 얻은 움직임도 실제 로봇 원격조작 로그와 동의·재배포 조건이 다르다. 변환 비용을 피하려고 메타데이터를 버리면 모델은 학습되더라도 결과를 설명하거나 삭제 요청을 이행하기 어려워진다.

운영 중 가장 비싼 오류는 데이터 누수가 아니라 의미 누수다

같은 시연을 잘게 잘라 학습과 시험에 넣으면 장면 배경과 조작자 습관을 외운 모델이 높은 점수를 낸다. 로봇 일련번호, 수집 세션, 장소와 과업 사례를 기준으로 분할 그룹을 만들고 파생 영상 조각도 같은 그룹에 둔다. NIST AI RMF 1.0은 거버넌스·측정·관리 전반에서 맥락과 위험을 다루는 자발적 프레임을 제공한다. 특정 분할 비율을 정해 주지는 않지만 데이터 선택과 성능 주장에 책임 있는 기록이 필요하다는 근거가 된다.

의미 누수는 더 은밀하다. 사람 개입 직전 구간을 삭제하면 모델이 실패 상태를 학습할 기회를 잃고, 비상정지 뒤의 에피소드를 단순 ‘미완료’로만 표시하면 안전 정책 평가가 흐려진다. 성공률, 충돌, 안전정지, 시간초과, 조작자 개입과 하드웨어 고장을 별도 사건으로 보존하고 한 에피소드에 여러 원인이 있을 수 있게 한다.

프라이버시도 얼굴 흐림 처리 한 번으로 끝나지 않는다. 집 구조, 음성, 화면, 약품과 신체 움직임이 사람을 재식별할 수 있다. 원본 접근권한, 파생 특징, 보존기한, 삭제 전파와 모델 재학습 영향까지 생애주기 기록에 넣는다. 의료나 가정 데이터는 적용 법과 기관 윤리 절차를 별도로 확인한다.

한 스키마로 밀어붙이지 않는 대안

로봇의 몸체 구성이 크게 다르면 모든 관절을 하나의 거대한 벡터에 억지로 맞추지 않는다. 공통 상위층에는 과업, 물체, 시간, 세계 좌표계, 안전 사건, 출처 계보와 품질을 두고, 로봇별 하위층에 URDF·관절·센서·행동 공간을 둔다. 모델 입력은 변환기가 바꾸되 원본을 보존한다. 공통 의미가 약한 필드는 ‘알 수 없음’과 ‘해당 없음’을 구분한다.

동작 데이터만 공유할 때는 사람 골격과 로봇 기구학 사이의 재대응을 파생 단계로 명시한다. 원격조작에서는 조작장치 자세, 로봇 목표, 실제 측정 상태를 세 줄로 남긴다. 합성데이터에는 시뮬레이터·자산·물리 매개변수와 무작위화 시드, 현실 데이터와의 상관 결과를 붙인다. 이 구조라면 새로운 로봇 몸체를 추가해도 과거 원본을 다시 쓰지 않는다.

최종 선택 규칙은 재현·권리·안전 세 문턱이다

초기 팀은 공개 형식을 채택하되 자기 로봇 프로필과 데이터 설명서를 먼저 만든다. 여러 회사 데이터를 사는 팀은 공통 온톨로지보다 원본·변환·권리의 전달 조건을 계약에 넣는다. 의료·가정 영역은 재식별과 삭제 요구가 해결되지 않으면 품질이 좋아도 통합하지 않는다. 안전 사건이 누락된 데이터는 일반 행동 사전학습에는 쓸 수 있어도 안전 성능평가의 근거로 쓰지 않는다.

  • 원본 에피소드와 모든 파생본에 안정된 식별자를 준다.
  • 시계·좌표계·단위·로봇 구성을 기계가 읽을 수 있게 고정한다.
  • 행동 목표, 측정 상태와 사람 개입을 서로 다른 채널에 둔다.
  • 수집 동의·이용허락·재배포·삭제 조건을 표본 또는 세션과 결속한다.
  • 분할은 로봇·장소·세션·과업 사례 단위의 누수를 검사한다.
  • 품질·보안·프라이버시와 안전 사건 보고서를 데이터셋 배포 때마다 갱신한다.

ISO 26264-1이 발행 단계로 바뀌면 이 장부를 조항별로 대조한다. 그전에는 ‘표준 준수’를 선언하지 않고 ‘공개 초록의 생애주기 범위를 기준으로 준비했다’고 정확히 표현한다. 휴머노이드 액추에이터 산업 지도처럼 하드웨어 구성이 달라질 때 데이터 스키마와 교정 정보도 함께 버전이 바뀌는지 확인한다.

현장에서 다시 확인할 질문

휴머노이드 데이터셋을 처음 만들 때 가장 먼저 정할 필드는 무엇인가요?

에피소드 식별자, 로봇·센서·소프트웨어 구성, 공통 시간, 좌표계·단위, 과업과 행동 의미, 성공·실패·사람 개입, 출처·권리부터 정한다. 영상 코덱이나 압축률보다 이 의미 필드가 먼저다. 원본과 변환본의 관계도 첫 수집부터 기록해야 나중에 안전하게 합칠 수 있다.

공개 데이터셋이면 출처와 동의 검토 없이 합쳐도 되나요?

안 된다. 공개 열람과 상업적 학습·재배포·파생 데이터 공개 권리는 다를 수 있다. 집·사람·의료 정보는 재식별 위험과 삭제 전파까지 확인해야 한다. 권리나 수집 맥락을 증명하지 못하면 별도 격리하고 모델·평가 근거에서 제외하는 편이 안전하다.

자료 마지막 확인: 2026년 8월 26일