선형 어텐션 월드 모델의 장거리 망각을 청크 검색으로 줄인다
HLA-WM: Hybrid Linear Attention for Long-Horizon Video World Models
무엇인가
비디오 월드 모델은 카메라 궤적이나 행동에 조건을 걸어 미래 관측을 자기회귀적으로 생성한다. 짧은 구간의 시간적 연속성만으로는 부족하고, 카메라가 멀리 돌아 나갔다가 같은 장소로 되돌아왔을 때 이전에 본 장면 구조를 복원할 수 있어야 한다. 전체 히스토리를 담는 KV 캐시는 과거에 직접 접근할 수 있지만 저장 비용이 롤아웃 길이에 따라 계속 늘어난다. 순환 선형 어텐션은 히스토리를 고정 크기 상태로 압축해 메모리를 크게 줄이는 대신, 먼 장면 정보를 잃는다. 이 논문은 이 맞바꿈을 정면으로 다룬다.
어떻게 동작하나
저자들은 Gated DeltaNet(GDN) 기반 SANA-WM에서 장거리 망각을 실증한다. 청크 단위 순환 업데이트를 S_i = S_{i-1}A_i + B_i로 쓰고 이를 여러 청크에 걸쳐 전개하면, 초기 청크가 쓴 정보 B_i는 이후 모든 전이 행렬 A를 거듭 통과한 뒤에야 먼 미래 장면에 영향을 준다. 저자들은 중간 전이곱의 평균 노름 W_i→j = AvgNorm(A_{i+1}A_{i+2}⋯A_j)로 누적 보존율을 측정한다. 대표 궤적에서 카메라가 청크 3에서 관측한 영역을 크게 한 바퀴 돌아 청크 35에서 근접 시점으로 돌아오는데, 청크 3의 잔존 영향은 0.0416까지 떨어지고 생성된 장면도 이전 관측에서 크게 벗어난다. 문제는 중간 청크 대부분이 다른 시점이라 재방문 장면과 거의 무관한데도 그 전이 행렬이 계속 적용된다는 점이다. GDN의 메모리는 시간 순서로 갱신되는데, 월드 모델에서 정보의 관련성은 공간·기하 근접성으로 결정된다는 근본적 불일치다.
무엇과 다른가
HLA-WM은 이 불일치를 겨냥한 학습 불필요(training-free) 하이브리드 선형 어텐션 프레임워크다. 단일 누적 GDN 메모리를 독립적으로 주소 지정 가능한 청크별 메모리 모음으로 바꾼다. GDN의 아핀 구조 덕분에 청크 i 전체를 하나의 아핀 전이 (A_i, B_i)로 요약할 수 있다. A_i는 그 청크가 기존 메모리를 어떻게 변환하는지, B_i는 그 청크가 새로 쓴 정보를 나타낸다. 이 요약들은 (A_i,B_i)⋆(A_j,B_j) = (A_iA_j, B_iA_j+B_j)라는 결합 규칙을 따르고 이 연산은 결합적이어서, 원래 시각 토큰을 모델에 다시 통과시키지 않고도 임의의 부분집합을 재구성할 수 있다.
어떻게 쓰나
검색은 카메라 기하만으로 이뤄진다. 포즈, 내부 파라미터, 장면 중앙 깊이 추정치로 프러스텀 겹침 프록시를 만든다. 이미지 평면 위치에서 광선을 만들고 중앙 깊이의 0.5배·1배·1.5배 지점에 프록시 3D 점을 찍은 뒤, 다른 청크의 카메라 뷰로 투영해 양의 깊이로 투영되는 비율 V를 구한다. 대칭 점수 R(i,q)=0.5[V(i→q)+V(q→i)]로 순위를 매겨 상위 K개를 고른다. 여기에 첫 청크를 영구 싱크로, 최근 청크를 지역 연속성용으로 항상 포함한다. 카메라 이동 방향 변화가 25도를 넘으면 최근 문맥을 3개 청크로 일시 확장한다. 선택된 청크는 원래 시간 순서로 되돌려 결합 규칙으로 재구성해 S_q^hist = S_0 A_πq + B_πq를 만든다. 이 재구성은 주 GDN 메모리에만 적용되고 카메라 제어와 지역 합성곱 상태는 원래 순환 업데이트를 유지한다. 소프트맥스 어텐션 경로에도 같은 선택 청크 집합을 해당 KV 캐시에 적용하며, 모든 사전학습 파라미터는 그대로 둔다.
전제와 한계
실험은 SANA-WM-Bench(simple/hard 각 80개 카메라 제어 궤적, 961프레임 16fps 약 60초, 1280×704)와 MBench-A(547 샘플, Causal·Human·Environment·Object 4개 서브셋)에서 수행했다. 베이스라인은 공식 1.6B SANA-WM으로, Stage 1에서 4스텝 증류 자기회귀 스트리밍 생성 후 선택적 causal AR 또는 양방향 정제를 거친다. HLA-WM은 Stage 1 메모리만 바꾼다. Stage 1에서 Hard 궤적은 PSNR +0.74dB, SSIM +0.0223, LPIPS -0.0196, 회전 오차 26.0% 감소를, Simple 궤적은 PSNR +0.73dB와 회전 오차 31.0% 감소를 보였다. 정제 후에도 개선이 대체로 유지되는데, 전체 시퀀스 정제는 두 split 모두 6개 지표를 모두 개선하며 PSNR +0.52/+0.46dB, 회전 오차 22.0%/20.1% 감소(Simple/Hard)를 기록했다. 다만 causal AR 정제에서는 Simple 궤적의 TransErr와 CamMC가 소폭 나빠지는 모드 의존적 트레이드오프가 나타난다. MBench-A에서는 세 가지 추론 모드 모두에서 PSNR·SSIM·LPIPS가 개선됐고, Stage 1에서 PSNR +0.84dB, SSIM +0.0303, LPIPS -0.0428, 정제 후 PSNR +0.37dB(causal AR)와 +0.58dB(양방향)를 기록했다.
효율은 60초 문맥에서 히스토리 상태 메모리 2.15GiB로 전체 KV 캐시보다 12배 작고, 평가한 파이프라인에서 추론 처리량 감소는 최대 1.6%다. 히스토리를 토큰 단위가 아니라 청크 단위로 캐시하므로 메모리 사용량이 시각 토큰 수가 아니라 청크 수에 비례한다. 검색 자체는 카메라 메타데이터만으로 동작해 오버헤드가 작다.
개발자 관점에서 이 논문의 실용적 가치는 재학습이나 파인튜닝 없이 기존 순환 선형 어텐션 생성기의 메모리 저장·접근 방식만 교체해 장거리 재방문 일관성을 얻는다는 데 있다. 카메라 포즈, 내부 파라미터, 깊이 추정치가 이미 확보되는 카메라 제어 롤아웃이라면 주소 지정 신호를 추가 학습 없이 만들 수 있다. 다만 기본 설정이 싱크 1개, 최근 1개, 기하 겹침 상위 1개 히스토리 청크라는 점, 회전 임계값 25도, 자기회귀 블록당 잠재 프레임 3개 같은 하이퍼파라미터가 결과를 좌우하므로 자신의 궤적 길이와 카메라 이동 패턴에 맞춰 검색 예산을 조정해야 한다. 어떤 정제 모드를 붙이느냐에 따라 이득 폭과 지표별 방향이 달라진다는 점도 함께 확인해야 한다.
저자들은 학습 불필요 방식이라 얻을 수 있는 이득에 한계가 있다고 밝히고, 선택적 상태 검색을 학습 과정에 통합하는 것을 향후 과제로 제시한다. 또한 검색이 카메라 기하와 FOV 겹침에만 의존하며 가림(occlusion), 가시성, 의미적 관련성을 명시적으로 모델링하지 않는다는 점을 한계로 인정한다. 복잡한 장면에서는 더 풍부하거나 학습된 검색 신호가 필요할 수 있다고 덧붙인다.