RoboJEPA가 로봇 월드모델의 연산량 스케일링 법칙을 세운다
RoboJEPA: Scaling Robotic Latent World Models
무엇인가
언어 모델과 이미지 생성 모델에서는 손실이 파라미터·데이터·연산에 어떻게 의존하는지가 실증적 스케일링 법칙으로 정리돼 있어서, 예산을 늘렸을 때 얻을 수 있는 이득을 미리 계산할 수 있다. 반면 물리 세계를 다루는 로봇 월드모델에는 이런 예측 가능성이 거의 검증되지 않았다. 기존 잠재 월드모델 연구는 대부분 단일 스케일로만 학습돼 데이터·파라미터·연산에 따른 품질 변화가 규명되지 않았고, 스케일링을 다룬 다른 연구들은 로봇 제어 밖의 생성형 비디오·게임 환경을 대상으로 하거나 월드모델이 아니라 정책을 스케일링하는 쪽이었다. 로봇 상호작용 데이터는 수집 비용이 비싸고 희소하기 때문에, 주어진 연산 예산에서 어떤 능력이 나오는지 미리 아는 것이 특히 중요하다.
어떻게 동작하나
RoboJEPA는 V-JEPA 2.1-G 인코더를 동결해 두고 그 잠재 표현 공간에서 다음 임베딩을 결정론적으로 한 번의 순전파로 예측하는 행동 조건부 월드모델이다. 시각 특징 이력 z≤t, 행동 a≤t, 고유수용 상태 s≤t를 입력받아 ẑ(t+1)을 출력하고, 이 예측을 다시 입력으로 되먹여 자기회귀적으로 여러 스텝을 롤아웃한다. 토큰화는 모달리티별로 따로 인코딩한 뒤 타임스텝 단위로 인터리브한다. 각 뷰의 패치를 선형 계층으로 월드모델 폭 D에 투영하고, 행동과 상태는 로봇 id별 선형 인코더로 D차원으로 만든다. 백본은 ViT로, 프레임 단위 인과적 어텐션 마스크와 최근 8타임스텝까지만 참조하는 국소 어텐션을 쓴다. 위치 정보는 시간·높이·너비·뷰 네 축으로 채널을 나눈 4D RoPE가 담당하고, 여기에 레이어별 학습 가능한 뷰 바이어스를 더해 뷰 순서를 무작위화해도 어떤 뷰인지 알 수 있게 했다. QK 정규화는 데이터와 모델을 키울 때 학습 안정성에 특히 중요했다고 밝힌다. 출력은 D차원을 다시 인코더 차원으로 투영하고 레이어 정규화를 적용해, 학습 신호를 강화하고 학습 시점과 자기회귀 생성 시점의 간극을 줄인다.
무엇과 다른가
학습 목표는 동결 인코더 특징에 대한 토큰별 L1 회귀다. 두 성분을 절반씩 평균하는데, 하나는 시퀀스 전체에서 다음 임베딩을 맞히는 teacher-forcing 손실이고, 다른 하나는 더 짧은 프리픽스만 주고 나머지를 자기회귀적으로 예측하게 하는 손실이다. 후자가 exposure bias를 줄이고 오차 누적을 억제한다. 데이터는 12개 로봇 플랫폼(단팔·양팔·휴머노이드, 실물과 시뮬레이션)에 걸친 23개 공개 조작 데이터셋을 통합한 것으로, 영상 15,022시간 중 6,692시간이 행동과 동기화돼 있고 궤적은 약 287만 개 규모다. 카메라 수, 고유수용 상태 크기, 제어기 종류와 주파수가 제각각인 이기종 데이터를 다루기 위해 GPU를 뷰 수·해상도 조합별 그룹(단일/이중 뷰 × 저해상도 240×320 / 고해상도 480×640)으로 나누고, 그룹 간 스텝 시간을 배치 크기로 맞췄다. 모델은 22M에서 8B 파라미터까지, 학습 연산은 2×10^19에서 9.5×10^22 FLOPs까지 스윕한다.
어떻게 쓰나
플래닝은 목표 이미지 하나를 인코딩한 z_g를 향해 H스텝 행동 시퀀스를 탐색하는 방식이다. 상상 롤아웃의 최종 잠재 특징과 목표 특징 사이 L1 거리를 최소화하는 행동을 cross-entropy method로 찾고, 첫 행동만 실행하는 receding-horizon 방식으로 반복한다. 서브골은 쓰지 않고 단일 이미지 목표만 사용하며, 로봇과 태스크가 달라도 플래닝 하이퍼파라미터는 동일하게 고정한다. 매 스텝 전체 이력을 다시 계산하는 비용을 피하려고 롤링 KV 캐시를 쓰고, 추론 연산을 미리 컴파일해 디스크에 저장했다가 플래닝 시점에 불러오는 추론 엔진을 직접 만들었다. 로봇을 GPU 클러스터에 직접 연결해 다중 GPU로 플래닝을 돌리면 8B 모델도 다단계 플래닝에 수 초가 걸린다.
전제와 한계
핵심 결과는 스케일링 법칙이다. 후보로 1차 멱법칙 L(C)=E+A·C^α, 지수가 연산량의 로그에 따라 선형으로 변하는 2차 멱법칙 L(C)=E+A·C^(α−γ ln C), Broken NSL, Unified NSL을 비교했고, RoboJEPA는 2차 멱법칙을 따른다는 것을 확인했다. 여기서 C는 총 학습 연산(FLOPs), L(C)는 홀드아웃 데이터에서 9스텝 잠재 롤아웃의 토큰별 L1 오차다. 이 법칙은 실물 로봇 데이터인 DROID 홀드아웃과 시뮬레이션 RoboCasa 양쪽에서 성립한다. 평가는 학습에서 보지 못한 장면, 사이드 카메라 하나와 손목 카메라 하나의 2뷰, 초기 관측에서 9스텝 미래 예측으로 고정했다. 22M~2B 구간의 프론티어로 곡선을 피팅하고 그보다 훨씬 큰 스케일로 외삽을 검증한 것이 이 논문의 차별점이다. 오프라인 예측 개선은 다운스트림 플래닝 성공률로 전이되며, 상상 오차는 온라인 플래닝 성능과 강하게 상관돼 실로봇 평가를 대신하는 신뢰할 만한 프록시가 된다. 구체적으로 RoboCasa에서 10^22 FLOPs 이상으로 학습한 모델(2B·4B·8B)만이 non-greedy 플래닝으로 물체 상호작용 과제를 풀 수 있었고, 그보다 작은 모델은 풀지 못했다.
실제 로봇과 시뮬레이션 두 플랫폼에서 5만 에피소드가 넘는 평가를 수행했고, 모델이 커질수록 성공률이 향상되는 추세를 관찰했다. 정성적으로도 행동이 달라지는데, 물체 조작 과제에서 2B 이상 모델만 잡은 뒤에도 그리퍼를 닫은 채 유지해 과제를 끝내고, 더 작은 모델은 도중에 그리퍼를 열어 물체를 떨어뜨리는 일이 잦았다. 예측을 픽셀로 되돌려 보기 위해 Cosmos 토크나이저의 연속 비디오 토큰을 V-JEPA 2.1 특징에 조건화해 디노이즈하는 확산 디코더를 별도로 학습했다. 이 디코더는 V-JEPA가 4프레임 건너뛰기로 인코딩한 사이의 RGB 프레임을 상상해 채워 넣는다. 시각화 결과 큰 모델일수록 롤아웃 전반에서 실제 동역학을 더 정확히 따라가고, 물체 정체성과 미세한 조작 디테일을 보존하며, 여러 카메라 뷰를 서로 일관되게 유지했다. 그리퍼-물체 접촉이나 접기 같은 구조적 변형은 예측기가 충분히 커야 나타나는 창발적 행동이었다. 8B 모델을 DROID에 파인튜닝하면 720p 해상도로 세 카메라 뷰를 동시에 상상할 수 있고, 사이드 카메라 내용이 손목 카메라 상상으로 전파되는 강한 뷰 간 정보 전이도 보였다. 저자들은 조작 능력이 말단 제어, 잡은 물체 조작, 정적 장면 기하 추론, 물체 동역학 순으로 각자의 연산 임계값에서 창발한다고 정리한다.
개발자 입장에서 이 논문의 실용적 가치는 두 가지다. 첫째, 로봇 월드모델을 만들 때 파라미터를 늘릴지 데이터를 늘릴지 판단하는 정량적 근거를 준다. 상상 오차를 오프라인에서 측정하면 실로봇 평가 비용의 상당 부분을 아낄 수 있고, 어느 연산 규모부터 특정 조작 능력이 나오는지도 대략 가늠할 수 있다. 둘째, 학습·배포 코드와 체크포인트가 모두 공개돼 있어 V-JEPA 계열 인코더 위에 자체 로봇 데이터로 예측기를 얹는 레시피를 그대로 참조할 수 있다. 다만 이 법칙은 동결된 V-JEPA 2.1 인코더 위의 동역학 모델에 대한 것이므로, 인코더 자체를 바꾸거나 함께 학습하면 계수가 달라질 수 있다는 점을 전제로 읽어야 한다.
저자들이 명시한 한계도 분명하다. 예측기만 스케일링하고 V-JEPA 2.1 인코더는 동결했기 때문에, 이 법칙은 고정된 표현 위의 동역학 모델을 설명할 뿐 인코더와 예측기를 함께 키울 때의 스케일링은 다루지 않는다. 고정된 코퍼스를 여러 에폭 반복 학습했기 때문에 피팅이 이미 데이터 포화에 가까워, 프론티어를 더 밀어 올리려면 파라미터보다 더 많고 다양한 상호작용 데이터가 필요할 가능성이 크다. 또한 텍스트를 전혀 쓰지 않고 단일 이미지 목표로만 플래닝하며, 플래닝 중 학습된 정책 제안을 활용하지 않고 균일 분포에서 행동을 샘플링한 뒤 월드모델로 우선순위를 매긴다.