로봇 정책의 불확실성과 기권: 모델이 모를 때 멈추거나 도움을 요청하게 하는 방법
로봇 정책은 가장 높은 확률의 행동을 항상 실행하기보다 입력이 낯설거나 여러 행동이 비슷할 때 기권할 수 있어야 합니다. 그러나 softmax confidence 하나로는 실패 확률을 알기 어렵고 임계값을 높이면 도움이 너무 자주 필요합니다. 불확실성 기반 기권은 점수, calibration set, 위험 비용과 사람 인계 절차를 하나의 선택 정책으로 설계하는 문제입니다.