AgiBot GO-2·GE-2·BFM·GCFM 차이: 조작·월드모델·전신 동작 모델 지도

AgiBot의 GO-2·GE-2·BFM·GCFM은 같은 문제를 푸는 경쟁 모델이 아니다. GO-2는 긴 조작 과제를 계획하고 실행하는 축, GE-2는 행동 뒤 세계가 어떻게 달라질지 시험하는 축이다. BFM은 시범에서 동작을 배우고, GCFM은 텍스트·음성·영상 조건에 맞는 전신 움직임을 만든다. 따라서 “어느 모델이 가장 좋은가”보다 “우리 작업에서 빠진 능력이 무엇인가”를 먼저 물어야 한다.

네 모델은 서로 다른 층을 맡는다

AgiBot은 2026년 4월 17일 파트너 콘퍼런스 발표에서 ‘하나의 로봇 몸체, 세 가지 지능’ 구조 아래 8개 기반 AI 제품을 공개했다. 그중 GO-2와 GE-2는 조작 지능, BFM과 GCFM은 이동·동작 지능에 배치됐다. 같은 발표 안에 등장했다는 이유로 네 모델을 하나의 벤치마크 표에 세울 수는 없다. 입력과 출력, 실패의 의미가 서로 다르기 때문이다.

AgiBot의 공식 발표는 각 모델의 방향을 설명하지만, 고객 현장의 성공률이나 필요한 연산 자원, 지원 로봇 목록을 모두 공개한 자료는 아니다. 아래 표는 발표에서 확인되는 역할과 도입 시 확인해야 할 경계를 나눈 것이다.

모델공식 발표에서 제시한 역할실제 검증에서 확인할 것
GO-2Action Chain-of-Thought를 이용한 장기 조작 과제의 계획·실행지원하는 관측·행동 형식, 로봇 몸체, 실시간 지연
GE-2전략을 시험하고 개선하는 대화형 가상 세계·World Action Model생성 영상의 개연성과 실제 접촉 결과의 일치 정도
BFM한 번의 시범이나 짧은 영상에서 사람 움직임을 모방잡음·시점 변화·몸체 차이에서 동작이 무너지지 않는지
GCFM텍스트·음성·영상에서 맥락에 맞는 로봇 동작 생성관절 한계, 균형, 충돌 회피를 실시간으로 지키는지

이 구분은 제품 이름을 해석하기 위한 출발점이다. AgiBot이 발표한 성능 표현은 회사가 정한 데이터와 조건에서 얻은 결과다. 외부 환경의 장기 운용 성능이나 타사 모델보다 우월하다는 독립 검증으로 확대해서는 안 된다.

GO-2는 긴 조작을 행동 단위로 잇는다

GO-2의 중심은 물체를 한 번 집는 순간 동작보다 여러 단계를 이어 가는 조작이다. 예를 들어 “식탁을 정리하라”는 지시는 컵을 찾고, 손잡이가 보이는지 판단하고, 장애물을 피해서 집은 뒤, 지정된 선반까지 옮기는 연속 과제로 바뀐다. AgiBot은 GO-2를 ViLLA Embodied Foundation Model로 부르며 Action Chain-of-Thought가 계획과 실행을 연결한다고 설명한다.

여기서 문장형 추론이 보인다고 해서 로봇이 항상 올바른 행동을 한다는 뜻은 아니다. 카메라가 가려지거나 물체가 계획과 다른 위치로 움직이면 앞 단계의 오류가 뒤 단계에 누적될 수 있다. 손이 미끄러진 뒤 계속 다음 행동을 실행하는지, 현재 상태를 다시 관측해 계획을 고치는지, 사람이 개입하면 어디서 재개하는지가 긴 과제의 실용성을 가른다.

검증할 때는 최종 성공률만 적지 않는다. 단계별 성공, 잘못 집은 횟수, 재계획 횟수, 원격 개입 시점, 과제 중단 사유를 같은 로그에 남겨야 한다. 지원 액션이 관절 위치인지 속도인지, 행동 청크인지도 제어기 연결 전에 확인해야 한다.

긴 과제는 초반 성공이 오히려 착시를 만들 수 있다. 처음 세 단계가 각각 95%로 잘돼도 열 단계가 연속해서 모두 성공할 확률은 크게 낮아진다. 그래서 과제 길이를 2단계·5단계·10단계로 늘리며 어디서 오류가 누적되는지 보고, 중간에 물체 위치를 바꿔 기존 계획을 버릴 수 있는지도 시험한다. 실패 뒤 처음부터 다시 시작하는 방식과 실패 지점에서 복구하는 방식의 시간 차이도 실제 생산성을 좌우한다.

GE-2는 행동의 결과를 가상 세계에서 시험한다

GE-2는 로봇에게 관절 명령을 직접 내리는 정책이라기보다 행동 이후의 장면과 상태를 예측하는 World Action Model로 소개됐다. 선반 쪽으로 팔을 뻗었을 때 물체와 주변이 어떻게 변할지 여러 후보로 펼쳐 보고, 위험하거나 실패 가능성이 큰 전략을 실제 로봇에 보내기 전에 걸러 내는 용도에 가깝다.

다만 그럴듯한 영상은 정확한 물리 예측과 다르다. 손가락과 컵이 화면상 자연스럽게 만났더라도 마찰계수와 접촉력이 틀리면 실제 컵은 미끄러진다. 천, 액체, 투명 물체, 좁은 틈처럼 시각 정보만으로 상태를 알기 어려운 장면에서는 차이가 더 커진다. GE-2를 평가할 때는 영상 품질보다 예측한 접촉·물체 위치·실패 순위가 실측과 얼마나 맞는지를 봐야 한다.

따라서 GE-2의 출력은 안전 보증서가 아니라 정책을 고르는 추가 근거다. 실제 로봇에서는 힘 제한, 충돌 감시, 비상정지 같은 별도 안전 계층이 계속 작동해야 한다.

월드모델을 선택기에 쓸 때는 예측값의 ‘확신’이 실제 오차와 맞는지도 본다. 자신 있게 틀린 예측은 낮은 확신으로 틀린 예측보다 위험하다. 후보 행동을 세 개 만들었다면 최종 선택만 저장하지 말고 각 후보의 예상 결과와 실제 실행 결과를 함께 보존해야 어떤 상황에서 순위가 뒤집히는지 찾을 수 있다. 예측이 불확실한 장면을 자동 실행 대신 사람 확인으로 보내는 임계값도 파일럿에서 조정한다.

AgiBot GO-2·GE-2·BFM·GCFM 차이: 조작·월드모델·전신 동작 모델 지도의 로봇·자동화 현장 맥락을 보여주는 공개 라이선스 실제 사진
글에서 다루는 로봇·자동화 환경을 이해하기 위한 공개 라이선스 참고 사진입니다. 기사에 이름이 나온 회사의 동일 제품 사진이라는 뜻은 아닙니다. 출처: Jiuguang Wang, own work. 라이선스: CC BY-SA 3.0.

BFM은 짧은 시범에서 몸의 동작을 배운다

BFM은 Behavioral Foundation Model의 약자다. AgiBot은 한 번의 시범이나 짧은 영상에서 사람의 움직임을 곧바로 모방하고, 잡음이 있는 환경에서도 안정적으로 동작하도록 설계했다고 밝힌다. 이는 새로운 동작을 매번 관절 단위로 프로그래밍하는 비용을 낮추려는 접근이다.

실제 난점은 사람의 몸과 로봇 몸이 다르다는 데 있다. 사람의 팔 길이와 관절 범위, 발 간격을 그대로 복사하면 로봇의 가동 범위를 넘거나 균형을 잃을 수 있다. 카메라 한 대로 촬영한 영상에는 가려진 관절과 깊이 정보도 빠진다. 그래서 시범 하나로 동작이 나왔다는 장면과 다른 키·시점·속도에서도 반복되는 능력은 분리해 봐야 한다.

평가는 “비슷해 보이는가”에서 끝내지 않는다. 말단 위치 오차, 관절 제한 위반, 발 미끄러짐, 균형 회복, 시범과 다른 몸체에 옮길 때 필요한 추가 데이터량을 기록하면 BFM의 재사용 범위를 판단할 수 있다.

GCFM은 조건에 맞는 전신 움직임을 생성한다

GCFM은 Generative Control Foundation Model이다. 공식 발표는 텍스트·음성·영상을 입력받아 맥락에 맞는 자연스러운 로봇 동작을 실시간으로 만든다고 설명한다. 공연에서 음악에 맞춰 즉흥 동작을 만들거나, 산업 현장에서 작업 신호에 맞춘 전신 자세를 생성하는 장면이 이 범주에 들어간다.

자연스러움과 안전성은 별도 지표다. 빠른 회전이 보기에는 매끄러워도 발바닥 접촉 여유가 작거나 관절 온도가 급격히 오르면 오래 실행할 수 없다. 사람 가까이에서 움직이는 경우에는 음성 지연이나 잘못 인식한 신호가 예상 밖 동작으로 이어질 수도 있다. 생성 결과를 바로 모터에 보내기보다 관절 한계, 자기 충돌, 작업 구역, 속도·토크 제한을 검사하는 제어기를 사이에 둬야 한다.

현장 시험에서는 동작 다양성뿐 아니라 입력 지연, 중단 명령 반응시간, 30분 이상 반복했을 때의 발열과 자세 누적 오차를 함께 측정해야 한다. 회사의 ‘실시간’ 표현만으로 목표 장비의 프레임률이나 최악 지연을 추정해서는 안 된다.

한 작업 안에서도 네 역할은 순서대로 만난다

컵을 찾아 선반에 넣는 과정을 생각하면 차이가 선명하다. GO-2는 과제를 단계로 나누고 조작 행동을 만든다. GE-2는 후보 행동 뒤 컵과 주변이 어떻게 달라질지 예측해 위험한 경로를 거르는 데 쓸 수 있다. 사람이 시범으로 새로운 허리·팔 협응을 가르쳐야 한다면 BFM이 관련되고, 이동과 상체 자세를 상황에 맞게 생성하려면 GCFM이 관여할 수 있다.

그렇다고 네 모델이 하나의 완제품처럼 자동으로 연결된다는 뜻은 아니다. 각 출력의 좌표계와 주기, 신뢰도 표현이 맞아야 하고, 한 계층이 늦거나 잘못됐을 때 다음 계층을 멈추는 규칙도 필요하다. 월드모델이 “성공 가능성이 높다”고 판단했는데 촉각 센서가 미끄러짐을 감지하면 어느 신호가 우선하는지 시스템 차원에서 정해야 한다.

연결 지점통합팀이 남길 기록실패로 보는 조건
관측에서 계획으로카메라·로봇 상태의 시각과 누락 프레임오래된 관측으로 다음 단계를 시작함
예측에서 행동으로후보별 예측과 실제 결과의 차이잘못된 후보 순위가 반복됨
동작에서 제어로관절 명령 주기와 안전 필터 개입제한 위반 또는 정지 명령 지연
실패에서 복구로재관측·재계획·원격개입 이력같은 오류를 반복하거나 안전 상태로 못 돌아감
AgiBot GO-2·GE-2·BFM·GCFM 차이: 조작·월드모델·전신 동작 모델 지도의 확인된 사실과 해석 경계를 세 항목으로 정리한 한글 카드
공식 자료에서 확인된 내용과 아직 단정할 수 없는 범위를 분리한 편집 카드입니다. 출처: Physical AI Lab editorial. 라이선스: Physical AI Lab original editorial graphic.

발표된 모델과 내려받을 수 있는 자산은 다르다

모델 이름이 공개됐다는 사실과 체크포인트·훈련 코드·평가 도구·상업 라이선스가 모두 제공된다는 사실은 구분해야 한다. AgiBot World의 공식 오픈소스 페이지에는 데이터셋과 모델, 논문 단위의 공개 자산이 나뉘어 있다. 현재 목록에 특정 버전이 보이지 않는다면 발표문만 보고 내려받을 수 있다고 가정해서는 안 된다.

개발팀은 저장소마다 모델 카드, 라이선스, 지원 프레임워크, 요구 메모리, 업데이트 날짜를 따로 보관해야 한다. 연구용 공개와 상업 제품 탑재 허용은 같지 않다. 제공 예제가 특정 AgiBot 몸체를 전제로 한다면 다른 로봇으로 옮길 때 필요한 어댑터와 추가 학습 데이터도 비용에 넣는다.

재현 기록에는 다운로드한 파일의 체크섬, 저장소 커밋, 추론 설정, GPU와 드라이버까지 남긴다. 웹 페이지가 갱신된 뒤 같은 이름의 모델이 바뀔 수 있기 때문이다. 코드가 실행됐다는 사실과 공식 데모 성능이 재현됐다는 사실도 나눈다. 입력 전처리와 후처리, 숨은 원격조작이나 수동 초기화 없이 동일 과제를 반복할 수 있어야 비교 자료로 쓸 수 있다.

AgiBot 공식 홈페이지는 제품군과 문서센터의 최신 진입점이다. 발표 이후 지원 범위가 바뀔 수 있으므로 계약 전에는 웹 설명이 아니라 버전이 명시된 기술문서와 공급사 답변을 기준으로 삼는 편이 안전하다.

모델 선택은 작은 재현 시험에서 시작한다

먼저 해결할 문제를 한 문장으로 고정한다. “여러 단계의 물체 조작을 안정화한다”, “행동 결과를 실제 실행 전에 비교한다”, “짧은 시범을 새 몸체 동작으로 옮긴다”, “입력 조건에 맞는 전신 동작을 만든다” 가운데 하나가 출발점이다. 네 기능이 모두 필요해 보여도 한꺼번에 붙이면 실패 원인을 찾기 어렵다.

피지컬 AI 뜻과 범위, 로봇 파운데이션 모델, Sim-to-Real 핵심 개념을 함께 보면 모델 계층과 현실 검증의 차이를 먼저 정리할 수 있다. 이후 동일한 로봇·물체·조명에서 작은 과제를 반복하고, 가림·센서 지연·물체 위치 변화·통신 단절을 한 번에 하나씩 추가한다.

통과 기준에는 평균 성공률만 두지 않는다. 최악 지연, 안전 필터 개입률, 실패 후 복구 여부, 사람이 준비한 작업, 모델 및 펌웨어 버전을 포함한다. 회사 발표 단계의 모델은 실제 구매 가능한 패키지와 다를 수 있으므로 가격·지원·납기·상업 라이선스는 별도 확인 항목으로 남긴다.

자주 묻는 질문

GO-2와 GE-2 중 어느 모델이 더 좋은가요?

직접 우열을 정할 수 없다. GO-2는 조작 계획과 실행, GE-2는 행동 결과를 예측하는 가상 세계 쪽에 가깝다. 긴 과제가 자주 끊기면 GO-2 계열을, 실제 실행 전 후보 전략을 비교하려면 GE-2 계열을 먼저 검토한다.

BFM과 GCFM은 모두 사람 동작을 만드는 모델인가요?

겹치는 장면은 있지만 출발점이 다르다. BFM은 시범이나 짧은 영상의 동작을 모방하는 데, GCFM은 텍스트·음성·영상 조건에서 맥락에 맞는 동작을 생성하는 데 초점을 둔다.

네 모델을 한 시스템에서 바로 사용할 수 있나요?

공식 발표만으로는 즉시 결합을 보장할 수 없다. 지원 몸체, 관측·행동 형식, 실행 주기, 라이선스와 안전 인터페이스를 모델별로 확인하고 작은 과제부터 연결해야 한다.

확인한 공식 자료

최종 확인: 2026년 8월 23일