로봇 시각·촉각 융합: 가려진 접촉과 미끄러짐을 함께 판단하는 방법

시각은 물체의 전역 자세와 주변 장면을 보지만 접촉 순간에는 손과 물체가 서로를 가립니다. 촉각은 국소 접촉과 미끄러짐에 강하지만 물체 전체 위치를 직접 알려 주기 어렵습니다. 두 센서의 시간·공간 보정, 특징·상태·결정 수준 융합, 불확실성, 모달리티 누락과 ablation 시험까지 설계 기준을 정리합니다.

아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.

시각과 촉각은 같은 물체를 보지만 관측 범위와 실패 방식이 다르다

카메라는 물체의 전역 pose, 주변 장애물과 접근 방향을 제공하지만 조작이 시작되면 손가락과 공구가 물체를 가립니다. 조명 반사, 모션 블러와 깊이 센서의 경계 오류도 접촉 직전 pose를 흔들 수 있습니다.

로봇 촉각 센서 글의 촉각은 닿은 영역의 압력과 변형을 직접 읽지만 센서가 닿지 않은 면과 전역 위치는 알기 어렵습니다. 융합의 목적은 두 값을 평균내는 것이 아니라 각 센서가 잘 보는 상태와 실패를 보완하는 것입니다.

먼저 융합할 공통 상태를 명시해야 모델의 역할이 선명해진다

공통 상태는 작업에 따라 물체 pose, 접촉 여부와 위치, 접촉 법선, 미끄러짐 확률, 파지 안정성 또는 재질 특성이 될 수 있습니다. 모든 특징을 하나의 벡터로 합치기 전에 어떤 출력이 어떤 제어 결정을 바꾸는지 정의합니다.

예를 들어 접근 중에는 시각 pose의 비중이 크고, 첫 접촉 뒤에는 촉각의 접촉 위치와 압력 변화가 중요합니다. 물체를 놓은 뒤에는 다시 시각으로 결과 pose를 확인하므로 작업 단계가 센서 신뢰도를 바꾸는 조건이 됩니다.

작업 단계시각의 주 역할촉각의 주 역할
접근물체 pose·장애물접촉 없음 확인
첫 접촉예상 접촉 위치실제 접촉·법선·압력
조작전역 움직임·가림 추적미끄러짐·국소 변형
완료결과 pose·장면잔류 접촉·놓기 확인

시간 동기화가 틀리면 서로 다른 접촉 사건을 하나로 학습한다

카메라가 30 Hz이고 촉각이 수백 Hz라면 단순한 배열 인덱스 정렬은 같은 시각을 뜻하지 않습니다. 노출 시각, 드라이버 버퍼, 전처리와 네트워크 추론 지연을 포함한 실제 관측 시각을 타임스탬프로 남깁니다.

로봇 시간 동기화 글의 기준대로 가능한 센서는 하드웨어 타임스탬프를 쓰고, 공통 충격이나 접촉 이벤트로 잔여 오프셋을 측정합니다. 훈련과 운영의 지연 분포가 달라지면 모델이 접촉 전 영상을 접촉 후 촉각과 잘못 연결할 수 있습니다.

공간 보정은 카메라 픽셀과 촉각 접촉점을 같은 물체 좌표에 놓는다

카메라 관측은 카메라 프레임, 촉각은 손가락 센서 프레임에 있습니다. 카메라-로봇 외부 보정, 손가락 운동학, 촉각 셀의 표면 위치와 물체 pose를 통해 두 관측을 공통 물체 또는 공구 좌표로 변환합니다.

로봇 좌표계와 TF 글로봇 캘리브레이션 글처럼 좌표 변환의 버전과 잔차를 기록해야 합니다. 소프트한 촉각 표면은 눌릴 때 형상이 변하므로 고정 점 보정만으로 부족하고 압입 깊이에 따른 접촉 위치 편향도 측정합니다.

융합 흐름은 관측 품질을 추정한 뒤 공통 상태로 연결한다

그림의 흐름처럼 시각과 촉각에서 특징을 얻고 시간·좌표를 정렬한 뒤 품질과 불확실성을 붙입니다. 가려짐이 심한 영상이나 포화된 촉각은 같은 가중치로 사용하지 않고 상태 추정기에서 영향력을 낮춥니다.

로봇 센서 융합 글의 원칙대로 관측 모델과 공분산을 명시하면 왜 한 센서를 더 믿었는지 추적할 수 있습니다. 신경망 기반 융합도 센서 마스크와 품질 지표를 입력해 누락을 정상적인 상태로 다루게 합니다.

카메라 물체 자세와 촉각 접촉 압력을 시간 좌표 보정 뒤 상태 추정과 제어로 연결하는 시각 촉각 융합 흐름도
각 센서의 원시값을 바로 연결하지 말고 시간 정렬, 좌표 변환, 품질 추정 뒤 공통 상태와 제어 판단으로 보냅니다. 출처: 피지컬 AI Lab.

초기 융합·특징 융합·결정 융합은 필요한 정렬 수준이 다르다

초기 융합은 영상과 촉각 원시값 또는 가까운 특징을 함께 처리해 세밀한 상관을 학습할 수 있지만 시간·공간 정렬과 데이터 양에 민감합니다. 특징 융합은 각 인코더가 센서별 표현을 만든 뒤 결합하므로 모달리티 차이를 다루기 쉽습니다.

결정 융합은 시각 모델과 촉각 모델의 예측을 마지막에 조합해 고장 격리와 해석이 쉽지만 세밀한 교차 정보를 놓칠 수 있습니다. 시스템 규모보다 목표 상태, 동기화 품질, 센서 누락 요구와 검증 가능성을 기준으로 선택합니다.

접촉과 미끄러짐은 시각의 전역 운동과 촉각의 국소 변화를 함께 본다

촉각 압력 중심 이동과 고주파 진동은 미끄러짐을 빠르게 감지하지만 센서 자체 변형과 로봇 진동도 비슷한 신호를 만들 수 있습니다. 영상의 물체 상대 운동과 손가락 운동을 함께 보면 실제 미끄러짐과 공구 전체 움직임을 구분하기 쉽습니다.

시각·촉각 로봇 조작 연구는 시각과 촉각을 결합한 조작 학습의 한 예를 제공합니다. 현장에서는 데이터셋 점수보다 검출 지연, 작은 미끄러짐의 재현율과 오경보 뒤 제어기 행동을 함께 평가합니다.

가려짐은 오류가 아니라 접촉이 시작됐다는 작업 단계 정보이기도 하다

그리퍼가 물체를 가리면 시각 pose 품질은 떨어지지만 그 시점은 접촉 전환과 가깝습니다. 가려짐 비율이나 검출 신뢰도를 모델에 입력하면 촉각 비중을 올릴 조건으로 사용할 수 있습니다.

로봇 카메라 롤링셔터와 모션 블러 글에서 다룬 영상 품질 저하는 가려짐과 별도로 기록합니다. 모션 블러를 접촉 가림으로 오인하지 않도록 노출·로봇 속도·검출 마스크를 함께 보존합니다.

불확실성은 센서별 신뢰도를 작업 단계에 맞게 바꾸는 장치다

시각 pose의 공분산, 촉각 접촉 분류의 확률, 센서 포화와 드리프트 지표를 상태에 붙이면 제어기가 확신이 낮을 때 속도를 줄이거나 진단 동작을 선택할 수 있습니다. 학습 모델의 softmax 점수만을 보정된 확률로 간주하지 않습니다.

보정용 데이터에서 신뢰도 구간별 실제 정확도를 확인하고 온도, 조명, 물체 재질과 센서 마모가 바뀐 조건에서 다시 평가합니다. 두 센서가 모두 불확실할 때는 평균 예측을 계속 쓰지 말고 정지·재관측·재접촉 상태로 전환합니다.

품질 신호신뢰도 하락 원인권장 대응
시각 pose 공분산가림·반사·블러감속·다른 시점 재관측
촉각 포화·드리프트과압·온도·마모힘 감소·영점 재확인
센서 간 불일치시간·좌표 보정 오류융합 중단·원시 로그 보존
두 센서 모두 불확실OOD·고장·작업 실패정지·후퇴·안전 복구

모달리티 누락을 훈련해야 카메라나 촉각 고장에 무너지지 않는다

훈련 데이터에서 두 센서가 항상 정상이라면 모델은 한 센서의 작은 결측에도 예측이 크게 흔들릴 수 있습니다. 프레임 드롭, 촉각 채널 마스크, 지연 증가와 노이즈를 주입하고 누락 플래그를 명시적으로 입력합니다.

단, 누락 훈련이 고장 상태에서도 모든 작업을 계속하라는 뜻은 아닙니다. 시각 단독 또는 촉각 단독으로 허용할 수 있는 저속 동작 범위를 정하고, 그 범위를 벗어나면 안전 정지하도록 운영 정책을 분리합니다.

점검표와 ablation으로 융합이 실제로 무엇을 개선했는지 밝힌다

그림의 보정·표현·불확실성·검증 순서를 따라 시각 단독, 촉각 단독, 단순 결합과 제안 융합을 같은 데이터 분할에서 비교합니다. 전체 평균뿐 아니라 가려짐, 작은 접촉, 미끄러운 재질과 센서 누락 구간의 차이를 봅니다.

시각·촉각 로봇 정책 연구Meta AI DIGIT 촉각 센서 연구는 두 모달리티의 표현과 실제 촉각 하드웨어를 이해하는 1차 자료입니다. 모델 구조보다 센서와 작업 조건의 범위를 명시해 결과를 해석합니다.

시각 촉각 융합에서 시간 동기화 공간 보정 불확실성 센서 누락 ablation을 확인하는 점검표
전체 성능만 보지 말고 시각 단독·촉각 단독·융합 조건과 센서 누락 조건을 나눠 실제 기여와 고장 내성을 확인합니다. 출처: 피지컬 AI Lab.

운영 검증은 정확도와 함께 지연·고장 감지·복구 성공률을 본다

오프라인 정확도가 높아도 융합 추론이 늦으면 미끄러짐을 잡기 전에 물체가 떨어질 수 있습니다. 센서 취득부터 상태 추정, 제어 명령 반영까지의 종단 지연과 최악 지터를 작업 속도별로 측정합니다.

조명, 가려짐, 투명·반사 물체, 촉각 마모, 온도, 센서 프레임 드롭과 보정 오차를 교차합니다. 정확도, 검출 지연, 오경보, 센서 고장 탐지 시간, 안전 정지와 재파지 성공률을 함께 합격 기준으로 사용합니다.

로봇 시각·촉각 융합에서 자주 묻는 질문

시각과 촉각 값을 바로 이어 붙이면 융합인가요?

형식상 가능하지만 시간·좌표 정렬과 스케일, 누락 처리가 없으면 서로 다른 사건을 학습할 수 있습니다. 공통 상태와 품질 지표를 먼저 정의하는 편이 좋습니다.

촉각이 있으면 카메라는 필요 없나요?

촉각은 닿은 영역에 강하지만 주변 장면과 접촉 전 물체 pose를 보기 어렵습니다. 접근은 시각, 접촉 뒤는 촉각의 비중이 커지는 식으로 역할이 달라집니다.

어떤 융합 방식이 가장 좋은가요?

데이터 양과 동기화 품질, 센서 누락 요구에 따라 다릅니다. 초기·특징·결정 융합을 같은 조건의 ablation으로 비교해야 합니다.

센서 하나가 끊겨도 작업을 계속해야 하나요?

위험도가 낮고 단일 센서로 검증된 제한 동작만 허용합니다. 허용 범위를 벗어나면 감속·정지·후퇴로 전환해야 합니다.

융합 모델은 무엇으로 평가하나요?

정확도 외에 종단 지연, 가려짐·미끄러짐 조건 성능, 센서 누락 내성, 오경보와 안전 복구 성공률을 봅니다.

시각·촉각 융합은 센서 결함을 자동으로 상쇄하지 않습니다. 시간·공간 보정 잔차, 센서 품질과 누락 조건을 측정하고 안전한 단일 센서 동작 범위를 별도로 검증해야 합니다.