중국의 Orca 월드 모델, 액션 레이블 없이도 특화된 로보틱스 성능 구현
중국 연구진의 획기적인 성과가 통합 월드 모델이 직접적인 감독 없이도 로보틱스를 마스터할 수 있음을 증명하며 AI 지능의 근본적인 정의에 도전하고 있습니다. Orca 모델은 비디오를 통해 세상이 변화하는 방식을 관찰하는 것만으로도, AI가 복잡한 물리적 동작을 수행할 수 있는 깊은 내부 이해도를 발달시킬 수 있음을 보여줍니다.
이중 학습 엔진: 무의식 및 의식 모드
Orca는 내부적인 "월드 상태(world state)"를 구축하기 위해 두 갈래의 훈련 방식을 활용함으로써 기존의 특화된 모델들과 차별화됩니다. 첫 번째 방법인 "무의식 학습(unconscious learning)"은 레이블이 없는 125,000시간 분량의 비디오를 처리하는 과정을 포함합니다. 이 단계에서 모델은 추상적인 공간에서 미래의 프레임을 예측하며, 단 하나의 캡션도 없이도 움직임 패턴, 물체의 가려짐(occlusion), 장면의 역동성을 파악할 수 있습니다.
두 번째 방법인 "의식 학습(conscious learning)"은 언어적 지시와 설명을 도입합니다. 비디오를 분할하고 그에 따른 상태 변화에 레이블을 붙임으로써, Orca는 특정 동작과 그 물리적 결과 사이의 인과 관계를 학습합니다. 이러한 결합을 통해 모델은 가공되지 않은 시각적 인지와 고차원적인 언어적 추론 사이의 간극을 메울 수 있습니다.
교체 가능한 지능 모듈을 갖춘 고정된 코어
Orca의 아키텍처는 극도의 다재다능함을 위해 설계되었습니다. 이 모델은 사전 학습된 Qwen3.5 언어-이미지 모델을 "고정된 코어(frozen core)"로 활용합니다. 연구진은 모든 작업에 대해 전체 시스템을 재학습시키는 대신, 이 안정적인 기반에 특화된 경량 "헤드(heads)"를 부착합니다.
- 텍스트 출력: 기존 Qwen3.5 언어 헤드를 사용합니다.
- 이미지 생성: Stable Diffusion 3.5와 연결된 작은 어댑터를 사용하여 내부 월드 상태를 시각적 예측으로 변환합니다.
- 로봇 제어: 월드 상태를 물리적 움직임으로 변환하도록 특별히 훈련된 맞춤형 "Action Expert" 모듈을 활용합니다.
이러한 모듈화 덕분에 모델이 질문에 답하거나, 비디오를 생성하거나, 기계 팔을 제어할 때 관계없이 세상에 대한 핵심적인 이해가 일관되게 유지됩니다.
특화 모델 및 거대 모델을 능가하는 성능
Orca-4B의 성능 지표는 매우 인상적입니다. 텍스트 기반 비디오 벤치마크에서 Orca-4B는 평균 51.8%를 기록하며, Emu3(34B)와 같은 훨씬 더 큰 모델과 DeepSeek-VL2-3B와 같은 특화된 VLM을 능가했습니다. PRICE-V0.1 벤치마크를 통한 이미지 예측 작업에서 Orca-4B는 59.8%를 기록하며 FLUX.2 small과 같은 고성능 생성 모델을 넘어섰습니다.
가장 놀라운 점은, 그릇 쌓기나 설탕 뜨기 등 5가지 조작 작업에서 로봇 액션 데이터로만 구축된 시스템인 $\pi$0.5와 대등한 성능을 보여주었다는 것입니다. 결정적으로, Orca는 방대한 사전 학습 단계에서 액션 레이블을 단 한 번도 본 적이 없음에도 이 성과를 달성했습니다. 심지어 특화 모델들이 반복적인 루프에 빠지기 쉬운 실패한 움켜쥐기(grasp) 상황에서도 재시도를 하는 등 우수한 오류 복구 능력을 보여주었습니다.
이것이 AI의 미래에 중요한 이유
Orca는 현대 로보틱스의 가장 큰 병목 현상 중 하나인 레이블이 지정된 액션 데이터의 만성적인 부족 문제를 해결합니다. AI가 수동적인 관찰을 통해 "세상의 물리 법칙"을 학습할 수 있음을 증명함으로써, 이 연구는 수백만 시간의 수동 레이블링된 원격 조작 데이터 없이도 새로운 환경에 배치될 수 있는 범용 로봇의 길을 열어줍니다.
핵심 요약
- 비지도 기반: Orca는 레이블이 없는 비디오의 "무의식 학습"을 통해 세상의 역동성을 학습하며, 비용이 많이 드는 인간 주석 데이터셋에 대한 의존도를 낮춥니다.
- 모듈형 아키텍처: 고정된 Qwen3.5 코어와 교체 가능한 어댑터를 사용하여 하나의 모델이 텍스트, 이미지, 로봇 제어 모두에서 동시에 뛰어난 성능을 발휘할 수 있습니다.
- 로봇 성능 대등: Orca-4B는 사전 학습 중 액션 레이블에 노출된 적이 없음에도 불구하고 조작 작업에서 특화된 로보틱스 시스템과 대등한 성능을 보여줍니다.