DART가 동결 표현을 유지한 채 디코드 경로 감독으로 잊힌 운동을 되살린다.

Frozen Flows Forget: Diagnosing and Restoring Lost Motion in a Latent-flow World Model

arXiv2609.28414v1

Xiwen Chen2026-09-23조회 10

무엇인가

이 논문은 잠재 월드모델에서 조작(manipulation)이 가장 의존하는 성질인 운동(motion)이 조용히 사라지는 현상을 다룬다. 구체적으로는 자기지도 인코더를 완전히 동결하고 그 잠재 공간 위에서 흐름(flow)만 학습하는 설계, 그중에서도 LIBERO에 DINOv2 재구성 오토인코더(RAE)를 얹은 ODEWorld를 대상으로 한다. 동결은 학습을 안정화하고 학습 대상 파라미터를 줄여주지만, 학습이 '중요한 것을 보존하도록' 강제할 수 있는 경로를 전부 없애버린다. 그 결과 표준 손실값에는 전혀 드러나지 않지만 관찰자 눈에는 명백한 열화가 나타난다. 오픈루프 롤아웃이 장면을 사실상 정지시켜 두고, 물체를 몇 스텝 만에 순간이동시키며, 지평선 대부분 구간에서 매니퓰레이터 팔을 잃어버린다. 모델이 장면이 움직인다는 사실 자체를 학습 해제(unlearn)해 버린 셈이다.

어떻게 동작하나

저자들은 자연스러운 용의선상인 학습/추론 시간 스케일 불일치를 먼저 배제한다. 롤아웃에 중간 목표를 S개 균등 배치해 조건을 주면 스케일이 원인일 경우 도움이 되어야 하지만, 오히려 오차가 S에 대해 단조 증가한다(L1 11.08 → 47.60, S = 1 → 64, 41개 데모). 전체 데모 구간으로 학습된 흐름에게 목표 근처 조건은 분포 밖이기 때문이다. 실제 원인은 감독 신호에 있다. 시연 하나가 최대 275프레임인데 학습 앵커는 데모당 약 5개뿐이고, 그마저도 잠재 공간에서만 채점된다. 즉 앵커가 희소하고(anchor-sparse) 잠재 전용(latent-only)인 감독은 '지평선 어디에서 변화가 일어나야 하는지'를 전혀 말해주지 않는다. 저자들은 이를 정량화하기 위해 두 지표를 쓴다. 추적 변위 집중도는 물체 변위 중 가장 큰 3개 스텝이 차지하는 비율이고, 프레임 수준 운동 집중도 conc3 = (Σ_{t∈T3} Δ̄_t) / Σ_t Δ̄_t 는 전체 프레임 간 변화 Δ̄_t = mean|x_{t+1} − x_t| 중 상위 3개 스텝의 몫이다. 사전학습된 흐름은 물체를 아예 움직이지 않고, 잠재 전용 손실로 재학습하면 움직이긴 하지만 순간이동한다. 추적 변위의 68%가 3스텝 안에 몰리고, 한 스텝이 물체를 36px나 옮기며, τ=1 목표 조건이 개입할 때까지 매니퓰레이터는 사라져 있다.

무엇과 다른가

제안 방법인 DART(decode-augmented rollout training)는 샘플링 스케줄을 그대로 두고, 감독이 채점되는 공간만 바꾼다. 앵커의 위치와 간격은 유지한 채 잠재 롤아웃 목적함수에 디코드 경로 항 두 개를 더한다. L = L_lat + 0.5 L_dec + 0.5 L_reg 이며, L_lat은 윈도우 구간의 잠재 롤아웃 오차, L_dec = mean|d(ẑ_t) − x_t|는 디코딩된 프레임을 감독하고, L_reg는 예측 프레임과 참조 프레임의 동결된 DINOv2 특징을 프레임별 4개 특징 클러스터로 풀링해 맞춘다. 인코더·디코더·목표 예측기는 모두 동결이고 흐름만 AdamW(학습률 10^-5, 가중치 감쇠 10^-4, 배치 2)로 26,000스텝 학습한다. 핵심은 손실이 '어디에 떨어지는가'다. 두 새 항은 모두 오차를 계산하기 전에 디코딩을 거치므로, 그림에서 보이는 불일치가 곧바로 손실이 되고 그 그라디언트가 디코드 경로를 따라 흐름으로 되돌아간다. 반면 잠재 전용 손실은 잠재값만 비교하기 때문에 그림이 실제로 움직였는지 판단할 수 없다. DART는 세 가지 기준을 동시에 만족해야 한다. 부모보다 낮은 전체 프로토콜 L1, 학습 전에 고정한 목표치 이하의 운동 집중도, 그리고 일반 롤아웃이 나빠지지 않을 것.

어떻게 쓰나

실험은 LIBERO 공식 시연에 대한 오프라인 오픈루프 예측이며, 256×256 해상도에서 64스텝 이미지 목표 롤아웃을 수행한다. 전체 프로토콜은 시연 100개를 채점하고 DART와 잠재 전용 실행을 학습 시드로 짝지으며, hard-5 부분집합은 부모 오차가 가장 큰 5개 시연을 DART 학습 전에 한 번 선정해 모든 변형이 공유하는 스트레스 테스트다. 650개 시연 벤치마크로 스케일도 확인한다. 전체 프로토콜에서 DART는 두 시드 모두 평균과 중앙값 L1에서 부모를 앞선다. 운동 구조 개선은 첫 시드 쌍에서 가장 선명한데, 집중도가 0.145로 내려가고(정답 0.093), 총 운동량이 정답의 11%에서 29%로 올라가며, 최대 단일 스텝 변화가 정답 스케일을 유지해 운동이 새로운 순간이동을 만들지 않고 지평선 전체로 퍼진다. 두 번째 시드는 오차 이득을 유지하면서 운동 변화 폭은 hard-5 실행 간 편차 안에 머문다. hard-5에서는 DART 실행 6개 모두 부모 실행 2개보다 L1이 좋고, 패밀리 평균 집중도가 0.342에서 0.228로 떨어져 6개 중 5개 실행에서 더 강한 부모 실행보다 낫다. 두 손실 가중치를 각각 두 배로 해도 결과가 거의 변하지 않아 0.5로 고정한다. 운동과 장면 내용의 관계도 의미심장하다. 부모에서는 시연별 총 운동량이 정답과 무상관(Spearman −0.07)이어서 얼마나 움직이는지가 실제로 무엇이 움직이는지에 대한 정보를 담지 못하고 모델 자체의 아티팩트였는데, DART는 이 관계를 복원한다(Pearson +0.26).

전제와 한계

절대 수준 비교를 위해 저자들은 외부 월드모델 2개, 오라클 정보 기반 보간, 동결 디코더의 재구성 상한, 그리고 같은 하네스에서 학습한 비디오 예측기라는 네 가지 참조점을 둔다. PSNR과 LPIPS 기준으로 흐름 재학습은 사전학습 흐름(17.7dB)과 오라클 보간(22.0dB) 사이 거리의 37%를 좁히고, DART는 47%를 좁혀 사전학습 흐름보다 약 2dB 높다. 동결 디코더의 재구성 상한(26.7dB)은 남은 여유가 흐름이 만들어내는 잠재에 있음을 알려준다. 가장 정보량이 많은 참조는 SimVP로, 같은 분할에서 시작-목표-보간 조건으로 23.4dB에 도달하고 정답의 운동 타이밍(conc3 0.095 대 0.101)과 장면을 따라가는 운동(Spearman 0.88)을 재현한다. 이는 저자들 시스템을 능가하는데, 즉 과제 자체는 그들이 도달하지 못한 픽셀 수준까지 학습 가능하며 결손은 과제가 아니라 학습 신호에 있다는 뜻이다. 양 끝점만 주고 나머지를 0으로 만든 변형도 0.3dB 미만만 잃고 두 운동 지표를 그대로 재현해, 이 일치는 보간 조건을 통해 새어 들어온 것이 아니라 학습된 것임을 보인다. 650개 시연에서 같은 흐름의 잠재 전용 재학습은 스텝당 L1을 약 27% 줄이고, DART는 이 규모에서도 다시 개선한다. 패밀리당 시드 3개로 모든 DART 시드가 모든 부모 시드보다 낮다(평균 L1 10.36~10.44 대 10.73~11.01). 이득은 앵커 희소성 진단이 예측하는 지평선 끝에서 가장 크고, LIBERO 5개 스위트 전반에서 유지된다.

평가에 관한 예상 밖 발견도 보고한다. 픽셀 L1은 정지를 보상한다. 부분 분해 변형이 가장 분명한 경고다. DART의 영역 손실(프레임 내부에서 계산한 4개 클러스터로 DINOv2 특징을 풀링)을 프레임 간 동일 정체성을 유지하는 부품 분해로 바꾸고, 윈도우를 9로 넓히며 부품 변위 방향 손실을 선택적으로 더한 이 변형은 저자들이 학습한 어떤 변형보다 낮은 L1을 달성하면서 패밀리에서 가장 나쁜 동역학을 보인다. 이유는 미래의 불확실성이다. 다음 프레임으로 그럴듯한 후보가 많고 그 평균은 흐릿하고 거의 정지해 있으므로, L1은 그 평균 근처를 예측할 때 최소화된다. 덜 움직이는 흐름이 L1에서는 더 좋은 점수를 받으면서 자신이 예측해야 할 운동을 파괴한다. L1만으로 순위를 매겼다면 이 변형이 패밀리 최고로 선택되었을 것이고, 그래서 집중도 목표를 학습 전에 고정했다. 운동 크기 격차를 직접 겨냥한 시도도 실패한다. 디코딩된 연속 프레임 차이나 잠재 변위 노름에 운동 크기 항을 추가한 두 변형 모두 통하지 않았다. 잠재 변형은 전체 프로토콜 평균 L1을 그대로 두면서(9.88 대 9.94) 총 운동량을 DART의 3분의 1로 떨어뜨리고 집중도를 악화시켰고, 디코드 변형은 4분의 1 예산에서 집중도를 훼손했다. 크기에 보상을 주면 흐름이 더 정지한 롤아웃 쪽으로 끌려간다는 뜻이다.

실무 관점에서 이 논문이 주는 교훈은 세 가지다. 첫째, 자기지도 인코더를 동결하고 그 위에 dynamics만 학습하는 파이프라인은 학습 손실이 안정적으로 내려가도 운동을 통째로 잃을 수 있으므로, 롤아웃을 눈으로 보고 운동 집중도 같은 지표를 반드시 함께 봐야 한다. 둘째, 감독을 잠재 공간에서만 주면 '언제' 움직여야 하는지에 대한 정보가 사라진다. 디코더가 이미 있다면 디코드 경로에 손실을 걸어 그라디언트가 보이는 공간까지 도달하게 하는 것이 표현을 건드리지 않고도 가능한 최소 개입이다. 셋째, 픽셀 L1이나 PSNR만으로 체크포인트를 고르면 가장 정지한 모델이 선택될 수 있다. 모델 선택 기준을 학습 전에 고정하고, 운동 타이밍과 장면-운동 상관 같은 보조 지표를 평가 프로토콜에 넣어야 한다. 로봇 조작, 자율주행, 비디오 예측처럼 '무엇이 언제 움직이는가'가 과제 성능을 좌우하는 응용에서 특히 중요하다.

저자들이 밝힌 한계도 분명하다. DART는 운동이 '어디서' 일어나는지는 크게 고치지만 '얼마나' 움직이는지는 고치지 못한다. 목적함수 어디에도 변화의 크기를 보상하는 항이 없기 때문에 이 크기 격차는 예상된 결과이며, 크기 항을 추가하는 직접적인 해결책은 오히려 역효과였다. 가장 약한 고리는 중간 프레임이다. 지평선 후반에서 디코딩된 롤아웃 프레임은 PSNR 19~20dB 근처에서 포화되는 반면, 같은 디코더가 정답 잠재를 렌더링하면 약 27dB이므로 결손은 흐름이 만들어낸 잠재에 있다. LPIPS 목적함수, 영역 수준 손실, 속도 크기 프록시, 더 긴 학습 예산, 더 넓은 윈도우는 모두 약 1% 이상의 이득을 내지 못했다. 저자들은 원인으로 두 가지를 든다. 크기 격차 뒤에 있는 평균으로의 회귀, 그리고 인식용으로 튜닝된 DINOv2 잠재가 프레임 선명화에 필요한 텍스처를 버릴 수 있다는 병목 가능성이다. 이에 대응하는 해결책은 목적함수 바깥, 즉 블러를 벌하는 디코더나 인코더 측 잠재 강화, 그리고 광류(optical flow) 감독 같은 운동 크기 교사로 향한다. 또한 진단과 수리는 ODEWorld·LIBERO·DINOv2 RAE라는 특정 조합에서 수행되었고, 절대 비교의 상당 부분은 저자들 자체 하네스 안에서 측정된 값이라는 점도 전제로 깔려 있다.

관련 논문