WorldAttention이 영상 월드 모델의 계층 KV 캐시로 긴 문맥을 살린다
WorldAttention: An Efficient Attention Architecture for Interactive Video World Models
무엇인가
자기회귀 확산(autoregressive diffusion) 패러다임을 쓰는 텍스트 조건부 인터랙티브 영상 월드 모델은 텍스트 지시에 따라 시간적으로 일관된 환경을 시뮬레이션하는 것을 목표로 한다. 이 논문이 겨냥하는 것은 낮은 지연과 긴 길이의 생성이며, 이는 체화 AI나 시뮬레이션 기반 계획에서 핵심 요구사항이다. 그런데 기존 프레임워크는 계산 복잡도를 묶어두기 위해 슬라이딩 윈도(sliding window)를 쓴다. 그 대가로 과거 문맥을 잘라내기 때문에 장거리 상호작용 능력이 떨어진다. 반대로 전체 이력을 캐시에 그대로 들고 가면 어텐션의 이차 복잡도 때문에 계산 오버헤드가 커지고, KV 캐시가 선형으로 늘어나 GPU 메모리가 결국 포화된다.
어떻게 동작하나
WorldAttention은 이 두 극단 사이에서 시스템 지향적 어텐션 아키텍처를 제안한다. 핵심은 특화 어텐션 커널과 계층적 KV 캐시 관리를 함께 설계하는 공동 설계(co-design)다. 이론적으로 효율적인 구조를 실제 성능으로 옮기려면 커널 수준의 뒷받침이 필요하다는 것이 저자들의 전제다.
무엇과 다른가
첫 번째 구성 요소는 Hybrid Sparse Attention(HSA)이다. 선형 전역 어텐션(linear global attention)을 기본으로 두고, 여기에 헤드 적응적 희소 어텐션(head-adaptive sparse attention)을 덧붙이는 구조다. 모든 헤드가 동일한 방식으로 과거를 참조하는 대신 헤드마다 다른 희소 패턴을 적응적으로 선택하게 해, 전역 문맥과 세부 정보를 함께 유지하려는 설계다. 다만 제공된 원문에는 HSA의 구체적인 수식이나 희소 패턴 선택 기준이 제시되지 않았다.
어떻게 쓰나
두 번째는 Hierarchical KV Cache(HKV)다. 과거의 KV 쌍을 의미적으로 인덱싱된 페이지(semantically indexed pages)로 조직해 다층 메모리(multi-tier memory)에 배치한다. 이를 통해 세밀한 검색(fine-grained retrieval)과 GPU 상주량 제어(controlled GPU residency)를 가능하게 한다. 어떤 KV를 GPU에 남기고 어떤 것을 아래 계층으로 내릴지 통제하겠다는 발상이다. 두 설계는 각각에 맞춘 전용 커널(tailored kernels)로 지원되어 이론적 효율을 실제 성능으로 전환한다.
전제와 한계
실험은 VBench-Long과 InterVBench에서 수행됐다. 저자들이 보고한 주체 일관성(subject consistency) 점수는 VBench-Long 0.9472, InterVBench 0.9668이며, 이를 근거로 기존 최고 성능 방법을 일관되게 앞선다고 주장한다. 다만 제공된 원문에는 베이스라인별 비교 수치, 지연시간과 메모리 사용량, 어블레이션 결과가 제시되지 않아 개선 폭의 크기나 효율 이득의 정도는 확인할 수 없다.
제공된 원문에는 별도의 한계 절이 없다. 저자들이 명시한 전제는 슬라이딩 윈도가 역사적 문맥을 희생한다는 것과, 전체 이력 캐시 유지가 계산과 메모리 양쪽에서 감당하기 어렵다는 것이다. HSA가 희소화를 도입하는 만큼 어떤 문맥이 버려지고 어떤 문맥이 보존되는지, HKV의 페이지 인덱싱과 검색에 드는 비용이 실제로 얼마인지는 원문에서 확인되지 않는다.
실무에서 이 논문이 유용한 지점은 긴 문맥 서빙에서 KV 캐시가 GPU 메모리를 채우는 문제다. 영상 월드 모델에 한정하지 않고 긴 시퀀스를 다루는 자기회귀 생성 서빙에도 같은 구조를 적용할 여지가 있다. 도입을 검토한다면 전체 이력을 유지할 때와 비교해 품질·지연·메모리 곡선이 어떻게 달라지는지, 그리고 공개된 코드에서 커널이 어떤 하드웨어와 배치 크기를 전제하는지부터 확인하는 편이 좋다.