로봇 학습 데이터 라이선스·동의·재사용: 영상부터 행동 로그까지

로봇 학습 데이터는 하나의 라이선스로 처리하면 안 됩니다. 수집·학습·결합·재배포·상업 이용 여부를 결정하려면 데이터셋 배포 조건, 수집 코드의 라이선스, 영상·음성·행동 로그에 대한 동의, 장소 촬영 허가, 제3자 자료의 권리를 artifact별로 확인해야 합니다. ‘open-source’ 표시는 이 모든 권한을 자동으로 주지 않습니다.

기술적 변경 이력은 로봇 데이터셋 버전·lineage에서 관리하고, 로봇 action datateleoperation data의 수집 구조는 별도 설계를 따르십시오. 이 글은 운영용 점검 틀이며 법률 자문이 아닙니다. 저작권, database right, 개인정보, 생체정보와 동의 효력은 관할지역마다 다릅니다.

사용하려는 행위와 권리 층을 먼저 나눈다

‘연구용으로 내려받기’와 ‘고객 제품에 학습해 판매하기’, ‘원본을 다시 배포하기’, ‘여러 데이터셋을 합쳐 공개하기’는 서로 다른 행위입니다. 목적, 사용자, 지역, 보관기간, 공개 범위와 수익 활동을 문장으로 고정한 뒤 각 행위에 필요한 권한을 검토합니다.

같은 폴더 안에도 영상, 관절·힘 로그, 언어 annotation, calibration, metadata, 수집 software와 문서가 섞여 있을 수 있습니다. dataset license가 code에 적용된다고, code license가 사람 얼굴과 사업장 촬영 동의를 해결한다고 추정해서는 안 됩니다.

권리 층확인 대상결정 질문증빙
데이터셋원본·metadata·label학습·변형·재배포·상업 이용 허용 여부정확한 license 전문과 version
코드수집·변환·loader배포물에 code가 포함되는가repository license·NOTICE
사람얼굴·음성·신체·operator목적별 동의와 철회 경로가 있는가동의서·privacy notice
장소·제3자사업장·표지·화면·물체촬영·공개·상업 이용 권한이 있는가location release·계약

수집 전에 artifact register와 책임자를 만든다

dataset 단위가 아니라 파일·field·stream 단위로 출처, 수집일, 장치, 사람 포함 여부, 민감도, license, consent ID, 보관기간과 owner를 기록합니다. 원본과 파생본이 연결되지 않으면 삭제 요청이나 조건 변경이 발생했을 때 영향을 받은 checkpoint를 찾을 수 없습니다.

수집 책임자, privacy 담당, security 담당, model owner와 release 승인자의 역할을 분리합니다. 누가 원본을 볼 수 있는지, annotation vendor에 무엇을 보낼 수 있는지, 어느 저장소로 복제되는지와 access log 보관기간도 data flow에 포함합니다.

공식 페이지와 repository의 현재 조건을 함께 읽는다

DROID dataset 공식 페이지는 데이터 범위와 프로젝트 맥락을 확인하는 출발점이고, DROID GitHub repository는 code, 문서와 현재 repository 조건을 확인할 곳입니다. 한쪽의 설명을 다른 구성요소의 허가로 확대하지 말고, 내려받은 날짜와 license file hash를 기록합니다.

LeRobot은 LeRobotDataset v3 문서에서 기술 형식과 구조를 설명하고, community_dataset_v3는 실제 dataset repository의 card와 files를 보여 줍니다. format 문서가 개별 community dataset의 권리를 대신하지 않으므로 각 dataset card와 포함 파일을 다시 확인해야 합니다.

동의는 촬영 허가보다 구체적이어야 한다

동의서에는 수집 목적, 포함되는 sensor stream, 얼굴·음성·신체 움직임, annotation, model training, 외부 공유, 공개 배포, 상업 이용, 보관기간과 철회 방법을 이해할 수 있는 언어로 적습니다. 직원 관계처럼 자유로운 동의가 의심될 수 있는 상황은 별도 법률 검토와 대안을 둡니다.

집, 병원, 공장과 학교는 공간 자체에 별도 접근·기밀·안전 규칙이 있습니다. 얼굴 blur만으로 화면의 고객정보, badge, 도면, 브랜드, 위치 metadata와 음성을 제거했다고 볼 수 없으므로 modality별 de-identification 검증을 합니다.

결합·파생·재배포는 가장 제한적인 구성요소부터 심사한다

Creative Commons license 안내처럼 license마다 attribution, share-alike, noncommercial, no-derivatives 조건이 다릅니다. 정확한 license 이름과 version을 보존하고, 서로 다른 조건을 한 묶음으로 배포할 수 있는지는 호환성 검토를 거칩니다. ‘CC’라는 약어만 기록해서는 판단할 수 없습니다.

model weight가 원본 데이터의 파생물인지, dataset merge가 새로운 database를 만드는지, 공개 embedding이나 feature가 재식별 위험을 남기는지는 관할과 사실관계에 따라 달라집니다. 아래 gate에서 하나라도 불명확하면 공개·상업 release를 보류하고 자격 있는 법률 담당자에게 넘깁니다.

예정 행위필수 확인보류 신호운영 결과
내부 학습목적·접근·보관·학습 허용license 없음·동의 범위 불명격리 또는 승인
dataset 결합license 호환·lineage·중복 사람조건 충돌·출처 손실분리 유지 또는 법률 검토
재배포원본·파생 배포권·attributionthird-party media 포함제외·redact·보류
상업 이용NC 제한·계약·동의 목적open-source만을 근거로 판단서면 승인 후 진행

삭제 요청이 model과 backup까지 추적되게 한다

요청 접수 채널, 본인 확인, 대상 탐색, 법적 보존 예외, 처리 기한과 결과 통지를 정합니다. sample ID가 원본, shard, annotation, cache, mirror, benchmark와 checkpoint training manifest로 이어져야 영향 범위를 설명할 수 있습니다.

완전 삭제가 기술적·법적으로 불가능한 backup은 접근 차단과 만료 일정을 기록하고, 이미 배포된 사본에는 downstream 통지 절차를 적용합니다. 향후 학습 제외, 재학습, model update 또는 사용 제한 중 어떤 조치가 필요한지는 요청 유형과 위험 평가로 결정합니다.

release gate와 정기 재검토로 조건 변화를 잡는다

release 전에는 artifact register 완성도, license 원문, attribution·NOTICE, consent와 location permission, 민감정보 scan, 보안 access, 삭제 경로, downstream 조건을 각각 owner가 서명합니다. 증빙이 없는 항목은 ‘허용’으로 추정하지 않고 차단합니다.

dataset card나 repository license, vendor 계약, 목적, 관할, 수집 sensor 또는 배포 방식이 바뀌면 재검토합니다. 공개 후에도 contact 주소와 version별 권리 기록을 유지하고, 변경된 조건이 기존 model과 배포본에 미치는 영향을 decision log로 남깁니다.

자주 묻는 질문

오픈소스 로봇 데이터면 상업 제품 학습에 바로 써도 되나요?

아닙니다. 정확한 dataset license와 version, code 조건, 영상 속 사람·장소의 동의, 제3자 자료, 계약상 제한을 행위별로 확인해야 합니다.

얼굴을 blur하면 개인정보 문제가 모두 해결되나요?

아닙니다. 음성, 신체 특징, badge, 화면, 위치와 행동 조합으로 식별될 수 있습니다. modality별 위험과 관할 규칙을 검토해야 합니다.

삭제 요청이 오면 학습된 model도 반드시 삭제해야 하나요?

일률적으로 답할 수 없습니다. 적용 법률, 동의·계약, 기술적 추적 가능성과 model 위험을 검토해 재학습, 사용 제한, update 또는 다른 조치를 정해야 합니다.

확인한 공식 자료

마지막 확인: 2026년 8월 7일