데이터셋 카드와 라이선스는 로봇 데이터 실사의 출발점이지 합격 증명서가 아니다. 구매자는 원본 episode ID와 수집·변환 계보, split 생성 기록, 평가 접근 통제, 삭제 요청 이행을 표본으로 확인해야 한다. 아래 20개 질문은 NIST가 정한 순서형 체크리스트가 아니라, NIST의 제3자 위험관리 원칙과 공개 로봇 데이터셋·격리 평가 사례를 바탕으로 구성한 구매자 실사 틀이다. 각 항목은 ‘출처가 직접 요구하는 것’, ‘공개 사례에서 확인되는 필드’, ‘구매자가 계약·시험으로 추가 확인할 사항’을 구분해 사용한다.

제3자 진술과 구매자 검증을 분리한다
외부 로봇 데이터는 파일 묶음이 아니라 공급망이다. 원시 센서와 행동 로그가 수집되고, 동의·권리 검토를 거쳐 정제·주석·분할되고, 여러 버전과 파생 데이터셋으로 재판매될 수 있다. 구매자는 현재 파일뿐 아니라 이 이동 경로를 재구성할 증거를 받아야 한다. 원본 episode ID, 수집 조직·장비·작업, 변환 코드와 버전, 삭제·수정 이력이 끊기면 나중에 문제 샘플을 찾아 제거하기 어렵다.
NIST AI RMF 핵심 자료는 제3자 데이터와 소프트웨어, 공급망 위험을 조직이 문서화하고 관리해야 할 대상으로 둔다. 여기서 특정 로봇 데이터 구매 절차나 법률 결론을 가져오는 것이 아니다. 제3자 진술을 위험 관리의 끝으로 보지 않고 책임자·검증·모니터링·대응을 연결하는 틀을 적용한다.
문서가 말하는 것과 샘플이 증명하는 것을 나눈다
공급사 포털의 설명을 그대로 표로 옮기지 않는다. 각 주장마다 원본 증거, 표본 추출 방법, 재현 결과와 미확인 범위를 붙인다. 아래 표의 near-duplicate·grouped split·삭제 이행 항목은 모든 공급사에 법적으로 정해진 의무라고 선언하는 것이 아니라, 구매 목적과 위험에 맞춰 계약·시험으로 추가 확인할 사항이다.
| 공급사·문서의 주장 | 요청할 원본 또는 표본 | 구매자가 직접 확인할 것 |
|---|---|---|
| 적법하게 수집됨 | 동의 양식 버전·수집 장소 승인·철회 처리 기록 | 샘플 episode가 당시 승인 범위와 연결되는지 |
| 상업 이용 가능 | 원천별 계약·라이선스·제3자 권리 목록 | 재판매·모델 학습·파생물 배포가 각각 허용되는지 |
| 중복 제거 완료 | episode 해시·유사도 기준·제거 로그 | 해시가 다른 near-duplicate와 연속 프레임 군집 |
| 공정하게 분할됨 | split 생성 코드·시드·그룹 키·버전 | 같은 세션·장소·작업 변형이 양쪽에 섞였는지 |
| 평가셋 비공개 | 접근자·접근 로그·릴리스 절차 | 공급사 모델 선택과 데이터 정제에 평가셋이 쓰였는지 |
| 삭제 요청 반영 | 삭제 티켓·원본·파생·백업 처리와 다음 릴리스 기록 | 표본 ID가 모든 제공본에서 실제로 사라졌는지 |
Hugging Face의 dataset card 문서는 라이선스, 언어, 규모, 생성 방식, 용도와 한계를 문서화할 수 있는 공식 안내다. 카드가 충실하면 실사 질문을 빠르게 만들 수 있다. 그렇더라도 원본 계약, 수집 동의, episode 로그와 평가 접근 이력을 자동으로 증명하지는 않는다. ‘카드 있음’과 ‘증거 확인됨’을 다른 열에 둔다.
provenance는 episode에서 파생본까지 이어지는 계보다
실무에서 provenance는 출처 URL 하나가 아니다. 수집 세션, 로봇·센서 식별자, 캘리브레이션, 소프트웨어 버전, 작업 지시, 운영자·동의 범주, 원시 파일과 변환·주석·필터·분할 단계를 잇는 계보다. 파생본에는 부모 버전과 변환 코드 해시, 실행 설정, 생성 시각을 남긴다. 그래야 특정 카메라의 시간동기 오류나 동의 철회가 발견됐을 때 영향을 받은 모든 episode와 파생본을 찾을 수 있다.
DROID 데이터셋 공식 문서는 공개 데이터의 각 episode 폴더에 building ID·collector ID 같은 메타데이터, trajectory와 카메라 기록을 연결하는 구체적 사례를 보여 준다. DROID의 스키마가 모든 공급사의 필수 표준이라는 뜻은 아니다. 구매자가 문제 샘플을 원시 기록과 수집 맥락까지 추적할 수 있는 식별자·계보를 요구할 때 비교할 1차 사례다.
중복 검사는 파일 해시만으로 충분하지 않을 수 있다. 한 시범을 다른 압축률로 저장하거나 앞뒤를 잘라낸 경우, 여러 카메라 뷰와 같은 세션의 겹치는 창은 해시가 달라도 모델에 비슷한 경험을 줄 수 있다. episode·세션·작업·장소·시간 근접성을 어떤 그룹 키로 묶을지는 데이터 구조와 구매 목적에 따라 구매자가 정할 검증 방법이며, 공급사에 적용되는 보편 표준이라고 쓰지 않는다. 로봇 학습 데이터 품질 검수의 시간 동기와 행동 좌표 확인도 샘플 실사에 포함한다.
평가 독립성은 파일 동일성보다 넓게 점검한다. NIST의 AI Technology Evaluation 격리 평가 환경은 blind data와 sequestered environment로 train/test contamination 위험을 줄이는 공식 사례다. 이를 모든 로봇 공급사의 의무로 일반화하지 않고, 공급사 모델 선택·데이터 정제에 평가셋이 노출됐는지 묻고 필요하면 구매자 비공개 평가셋을 별도로 두는 근거로 사용한다.
권리 문구는 수집 동의와 모델 사용 범위를 대신하지 못한다
파일 라이선스가 있어도 영상·음성·작업장·제품 설계와 제3자 콘텐츠에 별도 권리가 남을 수 있다. 어떤 권리가 실제로 적용되는지는 수집 장소, 사람의 식별 가능성, 계약과 관할에 따라 달라지므로 이 글에서 적법성이나 초상·저작권 범위를 판정하지 않는다. 공급사는 원천별 고지·동의·계약·철회 경로를 제시하고, 구매자는 대상 시장의 개인정보·저작권·고용·영업비밀 전문가에게 확인한다.
영국 ICO의 AI 학습데이터와 개인 권리 안내는 전처리된 학습데이터에도 사실관계에 따라 개인 권리가 이어질 수 있고, 외부 AI 서비스를 조달해도 통제자의 의무가 사라지지 않는다고 설명한다. 이는 영국 데이터보호 문맥이다. 다른 관할의 결론으로 복사하지 않고, 사람 식별 가능 데이터의 삭제·접근 요청을 공급사가 지원할 수 있는지 묻는 공식 사례로만 사용한다.
로봇 데이터 라이선스·동의·재사용 안내에서 권리 항목을 먼저 정리한 뒤, 공급사 실사에서는 이행 증거를 본다. 얼굴 흐림이나 화면 마스킹을 했다고 말하면 처리 코드·버전과 처리 전후 표본, 누락률 점검을 요청한다. 삭제 요청은 원본만 지우는지, 파생 주석·임베딩·합성본·백업과 다음 릴리스에도 반영되는지 확인한다.
계약 종료와 모델 개선 사용도 분리한다. 구매자가 원본을 계속 보관할 수 있는지, 공급사는 고객 피드백과 실패 로그를 다른 상품에 쓸 수 있는지, 문제가 발견된 데이터로 학습한 모델에 어떤 통지·교정 절차가 있는지 적는다. ‘영구적이고 취소 불가능한 사용’처럼 넓은 표현은 실제 필요와 동의 범위에 맞는지 전문가가 검토해야 한다.
확인되지 않은 칸을 낮은 위험으로 바꾸어 쓰지 않는다
실사는 모든 칸을 억지로 통과 처리하는 작업이 아니다. 확인됨, 공급사 진술만 있음, 표본에서 충돌함, 접근 불가, 적용 여부 법률 검토 필요처럼 상태를 나눈다. 미확인은 안전하다는 뜻도 위반이라는 뜻도 아니다. 구매 범위를 줄이거나 추가 증거·보증·감사권·삭제권을 요구할 근거다.
| 증거 공백 | 당장 알 수 없는 것 | 계약·시험에서 줄일 방법 |
|---|---|---|
| 수집 동의 원본 미제공 | 고지 범위·철회 가능성·장소 승인 | 독립 검토, 대상 원천 제외, 진술·보증과 삭제 절차 |
| split 코드·키 미제공 | 세션·작업 near-duplicate와 평가 누수 | 구매자 재분할, 격리 평가셋, 재현 가능한 생성 기록 요구 |
| 원시 episode ID 없음 | 오류 샘플의 부모·파생본 영향 범위 | 새 ID 체계와 계보 매핑 전까지 사용 범위 제한 |
| 평가 접근 로그 없음 | 모델·필터 선택에 평가셋이 노출됐는지 | 새 비공개 평가셋으로 독립 재시험 |
| 삭제 이행 증거 없음 | 백업·파생본·후속 릴리스 잔존 여부 | 삭제 표본 감사와 릴리스 차단 조건 |
| 작업·장비 분포 누락 | 우리 현장 대표성과 실패 사각지대 | 계층 표본·파일럿·외부분포 평가로 제한 검증 |
NIST AI RMF 전체 자원의 Govern·Map·Measure·Manage 구조는 발견한 공백을 책임·맥락·측정·대응으로 연결하는 데 유용하다. 프레임워크 준수 배지가 데이터의 적법성이나 모델 성능을 인증한다고 쓰지 않는다. 우리 조직의 사용 목적과 위험에 맞는 증거를 직접 보관한다.
20가지 질문을 같은 샘플 ID로 끝까지 추적한다
질문서는 회의 메모가 아니라 샘플 검증 기록이어야 한다. 공급사 답변 옆에 근거 유형을 ‘공식·계약 요구’, ‘공개 사례’, ‘구매자 추가 확인’으로 표시하고 증거 파일, 확인자, 확인일, 충돌과 후속 조치를 붙인다. 다음 질문을 원본 episode 몇 건과 파생본까지 따라가되, 질문 자체를 법적 의무나 NIST 인증 항목으로 표시하지 않는다.
- 1. 각 episode를 누가, 언제, 어느 장소와 프로젝트에서 수집했는가?
- 2. 로봇·센서·그리퍼·캘리브레이션·소프트웨어 버전은 무엇인가?
- 3. 작업 지시와 성공·실패·사람 개입 기준은 누가 승인했는가?
- 4. 사람·음성·화면·제품·작업장에 대한 고지와 동의 증거는 무엇인가?
- 5. 동의 철회와 삭제 요청을 접수하고 샘플 ID까지 찾는 경로가 있는가?
- 6. 데이터셋·영상·코드·주석·제3자 자산의 권리는 각각 무엇인가?
- 7. 상업 학습, 재배포, 파생 모델과 고객 간 재사용 범위는 어디까지인가?
- 8. 원시 파일에서 현재 릴리스까지 부모·자식 계보가 이어지는가?
- 9. 정제·마스킹·주석·증강·변환 코드를 버전과 함께 재실행할 수 있는가?
- 10. 파일 해시 중복 외에 episode·세션·연속 프레임 near-duplicate를 어떻게 찾았는가?
- 11. 같은 물체·장소·운영자·경로가 split 양쪽에 섞이지 않게 어떤 그룹 키를 썼는가?
- 12. split 생성 코드·시드·생성일과 변경 이력을 제공할 수 있는가?
- 13. 평가셋 원본과 변형본에 누가 언제 접근했는가?
- 14. 평가 결과가 데이터 필터·모델 선택·프롬프트 조정에 사용됐는가?
- 15. 작업·로봇·센서·환경·성공·실패·개입 분포가 우리 용도를 대표하는가?
- 16. 시간동기·행동 좌표·누락 프레임·캘리브레이션 오류를 어떤 표본으로 검수했는가?
- 17. 공급사 자체 모델 성능과 구매자 독립 평가를 같은 테스트셋으로 섞지 않았는가?
- 18. 오류나 권리 문제가 발견되면 어느 릴리스·고객·파생본에 통지하는가?
- 19. 삭제가 원본·주석·임베딩·합성본·백업·후속 릴리스에 반영됐음을 어떻게 증명하는가?
- 20. 계약 종료 뒤 보존·반출·삭제·감사와 모델 교정 책임은 누구에게 남는가?
답변을 받은 뒤에는 로봇 데이터 팩토리의 수집·거버넌스·평가 흐름에 공급사 데이터를 어느 단계로 넣을지 정한다. 불확실한 원천은 격리하고 별도 평가하며, 계보가 끊긴 샘플을 주 평가셋에 넣지 않는다. 다음 릴리스에서 카드나 라이선스가 바뀌면 과거 실사 결과를 자동 승계하지 않고 변경분을 다시 본다.
로봇 데이터 공급사 실사 실무 질문
데이터 카드, 라이선스 파일, 계약 날짜가 다르면 어느 날짜를 기준으로 보나요?
하나만 고르지 않는다. 각 파일이 어떤 데이터 릴리스와 수집 시점, 이용 행위에 적용되는지 계보로 연결한다. 구매일의 카드가 과거 수집 동의를 바꾸지 않고, 새 라이선스가 이미 제공된 버전에 자동 소급된다고 단정할 수도 없다. 충돌은 공급사 원본과 관할 전문가에게 확인하고 적용 범위를 계약에 남긴다.
자료 마지막 확인: 2026년 8월 26일