행동 라벨 없이 관찰 영상만으로 로봇 정책을 직접 사전학습하는 NAVA-WAM
Native Action-Prior Learning from Videos for World Action Models
무엇인가
월드 액션 모델(WAM)은 미래 시각 동역학과 로봇 행동 예측을 한 모델 안에서 결합해 정책 일반화를 높이려 하지만, 확장성은 행동 라벨이 붙은 로봇 궤적에 묶여 있다. 이런 데이터는 수집 비용이 크고 로봇 기체(embodiment)마다 표준화하기 어렵다. 반면 관찰 전용 영상은 행동 라벨 없이도 물리적 상호작용과 상태 전이에 대한 풍부한 정보를 담고 있다. 기존 연구는 이 영상을 두 갈래로만 활용했다. 하나는 시각·예측 표현을 먼저 학습하고 그 위에 행동 정책을 얹는 방식인데, 영상 사전지식이 시각 중심 표현에 남아 있어 실행 가능한 행동과의 연결이 하류 로봇 학습에서야 만들어지는 간접적 표현→제어 전이가 된다. 다른 하나는 시각 전이에서 잠재 행동을 추론해 중간 감독으로 쓰는 방식인데, 별도의 잠재 행동 모델링 단계가 필요하고 잠재 행동이 목표 관찰을 그대로 베끼는 지름길 해법을 막기 위한 구조적·최적화적 제약이 따라붙는다. 이 제약은 잠재 행동 공간의 표현력을 좁혀 정책에 주는 감독 자체를 약화시킨다. 논문은 여기서 "관찰 전용 영상이 중간 인터페이스 없이 행동 정책을 직접 최적화할 수 있는가"라고 묻고, NAVA-WAM이라는 네이티브 행동 사전(action-prior) 학습을 제안한다.
어떻게 동작하나
구조는 Mixture-of-Transformers(MoT)다. 미래 시각 동역학을 담당하는 Video-DiT(Wan2.2-5B로 초기화)와 연속 로봇 행동을 생성하는 Action-DiT(10억 파라미터, 히든 차원 1024)가 모달리티별 파라미터는 그대로 유지한 채 조인트 어텐션으로 정보를 주고받는다. 각 전문가가 자기 쿼리·키·값을 만들고, 모달리티 m의 쿼리가 두 스트림의 키와 값에 함께 어텐션한다.
무엇과 다른가
사전학습 단계에서 행동 토큰은 로봇 행동으로 감독되지 않는다. 대신 전이 구조화 조인트 어텐션(transition-structured joint attention)을 쓴다. 각 전이 z_{k-1}→z_k마다 깨끗한 이전 상태, 노이즈가 섞인 미래 상태 z_{k,τv}, 그리고 해당 Action-DiT 토큰 묶음을 한 세그먼트로 만들고 어텐션 마스크로 세그먼트끼리 격리한다. 이 마스크 아래에서 Action-DiT는 이전 상태와 미래 상태에 함께 접근해 두 상태 사이 전이의 내부 표현을 형성하는데, 이는 역동역학(inverse dynamics)과 유사한 정보 흐름을 명시적 잠재 행동을 물질화하지 않고 암묵적으로 구현한 것이다. 반대로 노이즈 낀 미래 상태 토큰은 두 시각 상태와 Action-DiT 표현 모두에 어텐션하는데, 이는 순동역학(forward dynamics)에 대응한다. Action-DiT가 미래 상태에 접근하는 통로는 노이즈 낀 버전뿐이라, 깨끗한 예측 타깃을 그대로 복사하는 지름길이 원천적으로 차단된다. Video-DiT는 동결하고 Action-DiT 파라미터만 미래 영상 흐름 매칭(flow matching) 손실로 최적화한다. Video-DiT가 얼어 있으므로 미래 영상 목적함수를 줄이는 일은 조인트 어텐션 경로를 통해 곧바로 Action-DiT를 갱신하며, 이것이 별도 전이 인터페이스 없이 시각 전이에서 행동 사전을 얻는 네이티브 행동 사전 학습이다.
어떻게 쓰나
후학습에서는 행동 라벨이 붙은 로봇 데모로 비디오·행동 흐름 매칭을 함께 최적화해 사전학습된 사전을 기체 특화 제어에 접지시킨다. 이때 크로스 스트림 어텐션을 비대칭으로 바꾼다. Video-DiT 쿼리는 시각 스트림에만 어텐션하고, Action-DiT 쿼리는 시각·행동 스트림 모두에 어텐션한다. 시각 표현이 진화하는 행동 샘플로부터 독립적이 되므로 캐시해 재사용할 수 있다. 추론 시에는 미래 영상과 행동 스트림을 가우시안 노이즈로 초기화하고 첫 디노이징 스텝을 평가하면서 각 레이어의 Video-DiT 키·값을 캐시한 뒤, 이후 디노이징은 Action-DiT만 통과시킨다. 미래 영상을 명시적으로 생성하지 않고도 효율적인 행동 전용 추론이 가능하다.
전제와 한계
실험은 시뮬레이션과 실물 로봇 양쪽에서 이뤄졌다. LIBERO에서 99.0%, 분포 이동이 있는 LIBERO-Plus에서 83.5% 성공률을 기록했다. RoboTwin 2.0에서는 Clean 88.5%, Random 73.6%로, 가장 강한 베이스라인 대비 Clean에서 3.5포인트, Random에서 17.9포인트를 개선했고 Clean→Random 성능 하락 폭도 훨씬 작았다. 실물 Franka FR3에서는 과제별 미세조정 없이 DROID로 후학습한 모델로 15회 중 14회(93.3%) 성공했는데, DreamZero는 10/15(66.7%), π0.5는 8/15(53.3%)였다. 격차가 가장 큰 과제는 큐브를 그릇 왼쪽에 놓는 T1으로, NAVA-WAM은 4/5 성공한 반면 두 베이스라인은 5회 모두 실패했다.
절제 실험은 사전학습 방식과 라벨 효율을 겨냥한다. 동일한 하류 프로토콜에서 태스크당 25개 데모만 쓴 NAVA-WAM이 72.0% 성공률을 낸 반면, 표현 기반 사전학습은 60.6%, 잠재 행동 기반은 65.0%였다. 즉 25개 데모의 NAVA-WAM이 50개 데모로 학습한 베이스라인들을 앞선다. 표현의 행동 관련성을 프로빙한 실험에서도 NAVA-WAM이 모든 프로브 데이터 예산에서 가장 높은 R²를 기록했고, 정성적으로는 Action-DiT가 그리퍼와 조작 대상 같은 상호작용 영역에 집중하는 반면 잠재 행동 베이스라인은 정적인 영역에 흩어진 어텐션을 보였다. 사전학습된 Action-DiT 활성값을 다른 장면에 옮겨 다음 상태를 예측하는 실험에서도 외형과 장면 구성이 크게 달라져도 원래 전이의 움직임이 재현됐다. 추론 비용은 4.30 TFLOPs로 Image-WAM(4.09)이나 Fast-WAM(3.56)과 비슷한 수준이면서 Random 도메인 성공률은 73.6%로 더 높다. 관찰 전용 데이터 규모를 키우면 Random 도메인 성공률이 두 라벨 예산 모두에서 꾸준히 올라간다.
개발자 관점에서 이 논문의 실용적 요점은 두 가지다. 첫째, 행동 라벨이 없는 영상 코퍼스를 정책 사전학습에 직접 투입하는 경로가 열려 있으므로, 로봇 조작 데이터가 부족한 팀은 표현 학습이나 잠재 행동 모델을 따로 만들 필요 없이 하나의 MoT 안에서 사전학습과 후학습을 이어붙일 수 있다. 둘째, 비대칭 어텐션과 시각 KV 캐시 덕분에 배포 시 미래 영상을 생성하지 않는 행동 전용 추론이 가능해, 월드 모델 계열의 무거운 추론 비용을 감수하지 않아도 된다. 다만 실제 도입 전에는 자신의 관찰 영상 도메인이 사전학습 코퍼스(Open X-Embodiment, AgiBotWorld, EgoDex)와 얼마나 겹치는지, 그리고 후학습에 쓸 행동 라벨 데모 수를 어디까지 줄일 수 있는지를 자기 태스크에서 다시 측정해야 한다.
한계와 전제는 방법 서술에 드러나 있다. 원문 발췌에는 별도의 한계 절이 없지만, 사전학습 동안 Video-DiT를 완전히 동결한다는 점, 영상 인코딩을 동결된 시공간 VAE(Wan2.2 계열)에 의존한다는 점, 그리고 전이 세그먼트를 어텐션 마스크로 격리하는 구조가 전제로 깔려 있다. 또한 논문이 내세우는 효율적 추론은 첫 조인트 순전파에서 시각 캐시를 만들어야 성립하므로, 캐시가 유효하지 않은 상황(장면이 크게 바뀌는 폐루프 제어 등)에서의 거동은 이 발췌만으로는 확인되지 않는다.