로봇 운영 성능은 성공 장면의 비율이 아니라 정의된 생산시간 동안 얼마나 자주 고장나고, 얼마나 빨리 복구되며, 목표 속도와 양품 생산을 얼마나 유지했는지로 봐야 합니다. MTBF·MTTR·가용도·OEE는 서로 다른 질문에 답하므로 failure와 time base, planned stop, microstop, 품질 손실과 사람 개입을 먼저 정의한 뒤 같은 원장으로 계산해야 합니다.
아래에서는 용어의 차이를 실제 시스템 경계, 실패 조건과 검증 순서로 나눠 살펴봅니다.
MTBF·MTTR·가용도·OEE는 하나의 점수가 아니라 고장 빈도·복구 속도·생산 손실을 나눠 보는 지표다
MTBF는 수리 가능한 장비의 고장 사이 평균 운전시간, MTTR은 복구에 걸린 평균시간을 보는 데 쓰입니다. 가용도는 요구된 시간에 운전 가능한 정도를, OEE는 생산 계획시간 안의 가용성·성능·품질 손실을 함께 봅니다.
ISO 22400-2:2014는 제조운영관리 KPI의 정의·구성요소·시간 거동과 단위를 다룹니다. 표준은 현재 유효하지만 개정 절차가 진행 중이므로 실제 적용 판본을 확인하고 회사의 세부 분류 규칙을 함께 고정합니다.
지표 계산 전에 로봇·셀·라인·플릿 중 어느 경계의 성능을 말하는지 정한다
로봇 controller가 정상이어도 feeder가 막히거나 PLC interlock이 풀리지 않으면 셀은 생산하지 못합니다. 반대로 셀이 redundant robot으로 생산을 계속하면 한 로봇의 고장이 라인 downtime으로 이어지지 않을 수 있습니다.
다중 로봇 작업 할당처럼 fleet가 작업을 재배치하면 robot availability와 service availability가 달라집니다. asset, cell, order와 customer-facing service 지표를 같은 이름으로 합치지 않습니다.
시간 원장은 달력시간·생산 계획시간·요구시간·운전시간·다운타임을 겹치지 않게 분류한다
주말 비가동, 계획 정비, changeover, 작업물 부족, 안전 대기, 고장 수리와 실제 cycle 운전을 하나의 timestamp 원장에 기록합니다. 어떤 시간을 분모에서 제외했는지 공개하지 않으면 서로 다른 공장의 숫자를 비교할 수 없습니다.
event는 시작·종료·원인·영향 범위·owner·자동 복구 여부를 가집니다. 동시에 여러 alarm이 뜨면 최초 원인과 파생 alarm을 구분하고, overlapping downtime을 중복 합산하지 않도록 사건 묶음 규칙을 둡니다.
| 시간 구간 | 예시 | 지표 포함 원칙 | 필수 기록 |
|---|---|---|---|
| 계획 제외 | 휴무·미계획 생산 | 정책 명시 | calendar·schedule |
| 계획 정지 | PM·changeover | planned loss 분리 | 작업·승인 |
| 비계획 정지 | fault·jam·network | availability loss | cause·start/end |
| 운전 손실 | slow cycle·microstop | performance loss | cycle·count |
생산라인 사진에서 보이는 연결성 때문에 로봇 한 대의 alarm 수만으로 운영 가동률을 설명할 수 없다
사진처럼 여러 기계와 이송 장치가 연결되면 upstream 부품 부족, downstream blockage, safety zone 공유와 품질 hold가 로봇 대기 원인이 됩니다. 로봇이 멈춰 있는 시간과 로봇 때문에 라인이 멈춘 시간을 분리합니다.
상태 코드에는 running, starved, blocked, planned stop, safety stop, equipment fault, quality hold와 manual assist를 구분합니다. 모든 비가동을 robot fault로 분류하면 유지보수 우선순위와 투자 판단이 왜곡됩니다.

MTBF는 총 운전시간을 고장 수로 나누되 failure와 repairable boundary를 먼저 고정한다
간단한 집계에서는 관측 기간의 실제 운전시간을 해당 경계의 failure count로 나눕니다. 그러나 protective stop, 작업물 jam, operator pause와 software retry를 모두 failure로 셀지 정책이 다르면 MTBF가 크게 달라집니다.
IEC Electropedia의 MTBF 정의는 고장 사이 운전시간의 기대값으로 설명합니다. 짧은 파일럿의 표본 평균은 이 기대값의 불확실한 추정치이므로 고장 수와 관측시간, confidence를 함께 제시합니다.
MTTR은 수리 공구를 잡은 시간만이 아니라 조직이 복구를 완료할 때까지의 구간을 세분한다
고장 감지부터 대응 시작까지의 대기, 진단, spare 확보, 물리 수리, calibration, validation과 production release를 나눕니다. 어느 구간을 MTTR에 포함하는지 정하고 평균뿐 아니라 median과 90·95 percentile을 함께 보면 긴 꼬리를 숨기지 않습니다.
원격 재부팅 30초와 감속기 교체 8시간을 평균 하나로 합치면 두 종류의 개선 과제가 사라집니다. failure mode, severity, shift, spare availability와 remote/manual recovery별로 층화해 병목을 찾습니다.
가용도는 고장 간 시간과 복구시간의 조합으로 보되 요구시간 기준의 실제 관측치를 함께 둔다
정상상태와 단순 가정을 사용할 때 MTBF/(MTBF+MTTR) 형태의 근사 관계를 쓸 수 있지만 planned downtime, standby, logistic delay와 복잡한 상태가 있으면 실제 요구시간 대비 available time을 직접 계산하는 편이 낫습니다.
로봇 실패 마이닝에서 수집한 episode 실패와 설비 availability failure는 단위가 다릅니다. 정책이 한 번 grasp를 실패해 자동 재시도한 사건도 cycle loss와 서비스 중단 영향으로 각각 기록합니다.
OEE는 가용성·성능·품질의 곱으로 생산 손실을 분해하지만 자동화 지능의 단일 점수는 아니다
가용성은 계획 생산시간에서 정지 손실을, 성능은 운전시간 동안 기준 cycle 대비 속도 손실을, 품질은 생산 수량 중 양품 비율을 봅니다. 이상적인 cycle time과 good unit의 정의가 현실과 맞아야 숫자가 개선 행동으로 이어집니다.
로봇이 빠르게 움직여도 재작업과 손상률이 늘면 OEE 품질 항이 낮아집니다. 반대로 안전 때문에 승인된 감속 모드로 운전하는 시간을 성능 손실로 볼지 기준 cycle을 모드별로 둘지는 공정 정책에 명시합니다.
microstop·자동 재시도·사람 개입을 숨기지 않아야 데모와 무인 운영의 차이가 보인다
10초 미만 정지를 downtime에서 제외하면 jam과 인식 실패가 수천 번 반복돼도 availability가 높게 보일 수 있습니다. microstop count와 총 시간, retry depth, intervention rate와 사람이 개입한 분을 별도 KPI로 둡니다.
로봇 정책의 불확실성과 기권은 안전한 도움 요청을 설계하지만 운영 관점에서는 assist frequency와 response time이 필요합니다. 기권을 실패로만 벌주지 말고 위험 회피와 서비스 영향 두 축으로 평가합니다.
점검표는 MES·PLC·로봇·정비 기록의 시계를 맞추고 이벤트 원장을 재현 가능하게 만든다
NTP/PTP 상태, timezone, controller monotonic clock와 서버 시간을 기록하고 clock jump를 감지합니다. robot alarm, PLC state, order, quality result, maintenance ticket과 operator intervention을 공통 event ID 또는 명확한 시간창으로 연결합니다.
원시 이벤트를 수정하지 말고 분류 규칙 version을 남긴 파생 테이블에서 KPI를 계산합니다. backfill, duplicate, missing end time과 open incident를 표시하고 dashboard 숫자에서 원장 event까지 drill-down할 수 있어야 합니다.

짧은 관측과 고장 없는 기간은 우수한 MTBF 증명이 아니라 검열된 데이터일 수 있다
파일럿 100시간 동안 고장이 없었다고 MTBF가 무한대인 것은 아닙니다. 아직 고장이 관측되지 않은 right-censored 구간과 배치·robot age가 다른 자료를 구분하고 sample size와 관측 exposure를 보고합니다.
로봇 VLA 평가의 task success처럼 실험 지표는 배포 분포와 다를 수 있습니다. 장시간 endurance, shift·payload·제품 variation과 maintenance 상태별 결과를 모아 신뢰구간 또는 보수적 하한과 함께 해석합니다.
운영 성능 인수 기준은 공식이 아니라 동일 정의로 재계산 가능한 데이터·분류·책임 구조다
인수 문서에는 asset boundary, calendar와 production schedule, failure taxonomy, severity, MTBF·MTTR·OEE의 분자·분모, 제외 규칙과 data owner를 적습니다. 목표값에는 관측 기간과 최소 고장·생산 수량도 붙입니다.
합격은 dashboard 집계와 표본 event 재계산이 일치하고, 중복·결측·clock 오류가 관리되며, top loss가 원인·owner·개선조치로 연결되고, hardware·software·공정 변경 전후를 같은 기준 또는 명시된 새 baseline으로 비교할 수 있는 것입니다.
| 지표 | 답하는 질문 | 함께 공개할 것 | 흔한 왜곡 |
|---|---|---|---|
| MTBF | 얼마나 자주 고장? | 운전시간·고장 수 | failure 제외 |
| MTTR | 얼마나 빨리 복구? | 구간 정의·percentile | 대기시간 누락 |
| 가용도 | 요구 때 사용 가능? | 요구시간·planned rule | 분모 축소 |
| OEE | 생산 손실 어디서? | cycle·good unit 기준 | microstop·재작업 은폐 |
로봇 가동률 지표에서 자주 묻는 질문
MTBF가 높으면 로봇이 안전한가요?
아닙니다. MTBF는 고장 빈도에 관한 신뢰성 지표이며 위험도나 기능안전 성능을 직접 뜻하지 않습니다.
보호정지는 모두 고장으로 세야 하나요?
원인에 따라 다릅니다. 정상적인 사람 접근에 따른 보호정지와 센서·논리 결함에 따른 정지를 분리하고 운영 손실은 별도 집계해야 합니다.
MTTR에는 spare 부품 대기시간도 포함하나요?
운영 복구시간을 보려면 포함하는 편이 유용하지만 조직의 공식 정의를 명시해야 합니다. 진단·수리·물류·검증 시간을 나눠 보는 것이 좋습니다.
OEE 하나로 로봇 AI 성능을 평가할 수 있나요?
부족합니다. OEE는 생산 손실 지표이며 task success, 안전 사건, 개입률, 일반화와 모델 품질 지표를 함께 봐야 합니다.
고장이 한 번도 없으면 MTBF는 무한대인가요?
그렇게 단정할 수 없습니다. 관측시간 동안 고장이 아직 보이지 않은 검열 데이터이므로 exposure와 통계적 불확실성을 함께 보고해야 합니다.
MTBF·MTTR·OEE의 세부 정의와 목표는 적용 산업, 계약, ISO 22400 등 최신 표준 원문과 조직의 생산·정비 정책에 맞춰야 합니다. 이 글은 특정 설비의 성능 보증을 대신하지 않습니다.