자아중심 영상 3만 시간도 물체 상호작용 모델링을 못 가르친다
What 30,000 Hours of Ego-centric Video Does Not Teach
무엇인가
월드 모델은 물리 기반 시뮬레이터를 대체할 유력한 후보로 꼽히지만 실제 배포와는 거리가 멀다. 이 논문이 던지는 질문은 구체적이다. 자아중심(ego-centric) 인간 조작 영상만 계속 늘리면 월드 모델이 물체 상호작용을 제대로 배우게 되는가. 기존 연구는 주로 다운스트림 과제 수준의 지표로 답을 내놨다. 정책 순위가 학습된 시뮬레이터와 실제 환경에서 얼마나 일치하는지, 오프라인 액션 예측 오차가 얼마인지 같은 값이다. 저자들은 이런 지표가 지각, 에이전트 움직임, 물체 동역학, 정책 행동의 오류를 한 숫자에 합쳐버려 무엇이 좋아졌는지 알 수 없다고 지적하고, 상호작용 충실도 자체를 직접 측정하는 쪽을 택한다.
어떻게 동작하나
실험은 NVIDIA의 Cosmos 3 비디오 확산 월드 모델을 축으로 한다. 모델 변형은 세 가지다. Edge는 4B 모델로 2B 디노이징 트랜스포머를 처음부터 학습했고, Nano와 Super는 각각 16B, 64B로 8B·32B 트랜스포머를 같은 크기의 사전학습된 Qwen3-VL에서 가져왔다. Edge는 사전학습 방식까지 달라 용량 추세 비교에서 제외하고, Nano와 Super만 초기화를 공유해 순수한 스케일 비교로 쓴다. Super는 학습 비용 때문에 스켈레톤 조건화 버전만 보고한다. 액션 공간은 카메라 포즈 9차원, 양손목 포즈 18차원, 양손 20개 관절 120차원, 어깨·팔꿈치 12차원을 합친 159차원 벡터로 확장했고, VLM과 VAE는 고정한 채 rectified flow matching으로 확산 브랜치만 학습한다.
무엇과 다른가
핵심 설계 중 하나인 스켈레톤 조건화는 에이전트의 기하를 영상 토큰 격자 위에 직접 올린다. 매 프레임에서 21관절 손 두 개와 어깨-팔꿈치-손목 체인을 카메라 내부 파라미터로 영상 평면에 투영하고, 관절과 뼈를 검은 RGB 캔버스에 래스터화한다. 투영은 깊이를 버리므로 색에 깊이를 싣는다. 색상(hue)은 어느 손가락·사지인지를 나타내고, 명도는 거리에 따라 어두워져 스켈레톤이 영상 평면 위치와 3D 방향을 함께 담는다. 이 래스터 시퀀스를 영상과 같은 고정 VAE로 인코딩해 패치로 나눈 뒤, 대응하는 비디오 토큰에 더한다. 학습 데이터는 1.15M개 1인칭 클립, 총 3만 시간(30fps에서 3.24×10^9 프레임, 평균 클립 94초) 규모로, 116개 환경 범주, 1,106개 장면 범주, 32,051개 과제, 14,019명 기여자로 구성되며 어떤 환경 유형도 전체의 8.3%를 넘지 않는다. 이 코퍼스 위에 300, 1k, 3k, 10k, 30k 시간의 중첩 데이터 래더를 만들어 각 예산을 하나의 점진적 학습 런의 체크포인트로 쓴다.
어떻게 쓰나
평가는 분포 밖(out-of-distribution)에서 이뤄진다. 별도 수집 캠페인에서 가져온 평가셋은 플랫폼, 운영자, 사이트가 모두 달라 학습에 등장하지 않으며, 환경 범주의 37%(클립의 4분의 1)가 학습에 없는 유형이다. 이 중 상호작용이 실질적이고 물체 분할이 가능하며 신체 관절 주석이 정확한 150개 클립을 수작업으로 골랐다. 10fps 32프레임, 인스턴스 마스크 11,328개이며 모델은 관측 1프레임과 예측 16프레임, 총 17프레임 윈도우로 평가한다. 지표는 예측 영상과 정답 영상에서 장면 요소를 분할·추적해 마스크 IoU를 평균한 SCS로, 손(에이전트)과 조작 물체에 대해 따로 보고한다. LPIPS는 지각 품질 통제 변수로 쓴다. 마스크 추적 자체가 불완전해 완벽한 예측도 SCS 1.0이 되지 않는데, 정답 영상에서 추적기를 다른 프레임에서 재초기화해 측정한 달성 가능 상한은 에이전트 0.93, 물체 0.90이다.
전제와 한계
결과의 핵심은 두 축이 전혀 다르게 움직인다는 것이다. 에이전트 충실도는 300시간에서 3k 시간 사이에 SCS 0.12가 오르지만 3k에서 30k 사이에는 0.06만 오르고, 포화 곡선을 적합하면 점근선이 0.811이다. 스켈레톤 조건화를 붙이면 300시간짜리 Nano가 조건화 없는 베이스라인이 약 15k 시간에서 도달하는 에이전트 충실도에 닿는다. 데이터로 환산하면 약 50배 절감이고, 이후 두 자릿수 구간에서 추가 이득은 0.06에 그친다. 중요한 건 조건화가 한계에 도달하는 시점을 앞당길 뿐 한계값을 바꾸지는 않는다는 점으로, 두 설계는 0.01 SCS 차이(0.811과 0.800)로 수렴한다. 에이전트를 일찍 포화시킨 덕분에 물체 축을 독립적으로 잴 수 있게 되는데, 이렇게 재면 물체 충실도는 두 자릿수 구간에서 0.09 SCS밖에 오르지 않고 오히려 감속한다(300~3k에서 0.056, 3k~30k에서 0.035). 점근선은 0.565이고 30k 시간에서 이미 그 93%를 실현했다. 지표가 등록할 수 있는 최대치로 정규화하면 에이전트는 86%, 물체는 63%다. 모델 크기를 4배로 키운 Super는 에이전트 충실도에 거의 영향을 주지 않으면서 물체 상한을 0.034 SCS 올리는데, 이 속도로 남은 0.205를 닫으려면 4배 증대가 6번 더, 즉 파라미터로 약 4자릿수가 필요하다.
5장은 감독 신호를 바꿔 물체 상한을 움직일 수 있는지 묻는다. 먼저 기존 상호작용 지향 목적함수인 PhysisForcing을 재구현했지만 10k 시간에서 스켈레톤 베이스라인 대비 개선이 없었다. 그 방법이 전제하는 정적 카메라와 가려지지 않은 물체가 자아중심 조작에서는 성립하지 않기 때문이다. 카메라는 에이전트를 따라 움직이고, 물체는 접촉 순간 바로 그 손에 가려진다. 대안으로 제안하는 것이 물체 중심 적응형 노이즈 스케줄링이다. 첫 프레임에 규칙적 격자 쿼리를 심고 D4RT로 영상 전체를 추적해, 각 점의 3D 변위와 추적 신뢰도에 투영된 손 주변의 소프트 공간 사전을 결합하고 이를 인접 잠재 셀로 확장해 동적 영역 맵을 만든다. 그 영역 안에서 노이즈 레벨을 올려, 디노이징 목표가 국소적 외형 전파로는 만족될 수 없고 문맥과 동역학으로부터 예측해야만 하게 만든다. 구체적으로는 영역별 추가 노이즈 δ를 λ·M_dyn·min(σ, 1−σ)로 정해 잠재를 z+δv로 밀고 타깃을 (1+δ/σ)v로 재조정한다. 유효 노이즈는 σ에서 σ+δ로 올라가지만 모델의 노이즈 레벨 입력은 σ로 유지되고, 짝지어진 타깃은 여전히 같은 깨끗한 잠재를 가리킨다. 10k 시간 절제 실험에서 같은 영역에 손실 가중만 재배치하는 것은 유의미한 개선을 주지 못했고, 노이즈를 올리는 것만이 물체 충실도를 개선한 유일한 개입이었다. 동적 영역 맵을 같은 면적의 무작위 영역으로 바꾸면 이득이 거의 사라져, 효과가 교란 자체가 아니라 감독을 어디로 옮기느냐에서 온다는 것이 확인된다. 최종 구성은 30k 시간에서 0.546 대 0.527로 3.7% 개선하고 점근선을 베이스라인 위로 올리지만, 이득은 모든 예산에서 거의 일정하다. 상한이 올라간 것이지 상한에 접근하는 속도가 빨라진 것이 아니다.
휴머노이드로의 전이도 확인한다. 시뮬레이션 양팔 벤치마크의 11개 과제에서 Cosmos 3 Nano를 미세조정하고, 시작 프레임 하나와 138차원 휴머노이드 상태 궤적을 조건으로 10Hz에서 17프레임을 예측한다. 비교 대상은 자아중심 데이터를 본 적 없는 공개 가중치, 30k 시간으로 사전학습한 +Human, 스켈레톤 조건화와 제안 감독을 함께 쓴 Ours다. 평가는 시연이 아니라 EgoVLA 정책 롤아웃에서 이뤄진다. 자아중심 사전학습은 모든 지표를 올리고 특히 손 SCS를 0.07 올리며, 제안 설계는 그 위에 두 배 이상 기여한다. 다만 이득은 에이전트(+0.17)가 물체(+0.06)보다 크고, 물체 충실도는 모든 변형에서 0.70~0.79로 절대값이 높다. 저자들은 이를 시뮬레이션 환경의 물체가 강체이고 상대적으로 크기 때문으로 본다. 예측 지평선에서 Ours의 손 SCS는 2프레임 0.89에서 16프레임 0.85로 거의 평평한 반면 물체 SCS는 0.82에서 0.71로 두 배 이상 떨어진다.
개발자 관점에서 실무적 결론은 분명하다. 로봇 정책 학습이나 평가용 월드 모델을 만들 때 데이터 양을 늘리는 전략은 에이전트 축에는 빠르게 포화되고 물체 상호작용 축에는 거의 듣지 않는다. 실제 레버는 조건화 설계와 감독 재배치다. 또 하나는 평가 지표다. 전체 프레임 지각 품질이나 다운스트림 성공률 하나로는 무엇이 나빠졌는지 알 수 없고, 이 논문처럼 에이전트와 조작 물체를 분리한 구조 지표를 써야 잔차 오차가 물체에 있다는 사실이 드러난다. 다만 이 지표는 픽셀을 렌더링하는 생성형 월드 모델에만 적용된다.
저자들이 밝힌 한계도 분명하다. 데이터 래더가 두 자릿수 구간에 걸쳐 있고 데이터 양과 최적화 예산을 결합해버려서, 두 요인 각각의 효과가 아니라 함께 스케일할 때 충실도가 어디로 가는지를 보여준다. 작은 예산일수록 비례적으로 적은 최적화 스텝을 받아 수렴에서 멀기 때문에, 각 예산을 수렴까지 학습시키면 곡선 왼쪽이 오른쪽보다 더 올라가 적합된 점근선은 오히려 낮아진다. 즉 보고한 상한은 낙관적이다. 또한 적합 영역이 30k 시간 너머로도 이어진다는 가정 위에 서 있고, 학습셋과 평가셋이 모두 단일 수집 프로토콜에서 나왔으며 평가셋 규모도 제한적이라 자아중심 영상 전체로 일반화하는 데는 한계가 있다. 마지막으로 이 연구는 생성형 월드 모델만 다룬다. 잠재 예측 모델이 상호작용 동역학을 더 잘 배우는지는 픽셀을 렌더링하지 않는 이상 이 충실도 지표로 판정할 수 없는 열린 문제로 남는다.