SMI는 MLLM으로 비디오 월드 모델의 장기 공간 메모리를 관리한다
Spatial Memory Intelligence: Endowing World Models with Understanding-Driven Long-Term Memory
무엇인가
비디오 월드 모델은 사용자 행동과 카메라 신호에 조건화해 다음 관측을 예측하는 대화형 시뮬레이터다. 문제는 상호작용이 길어질수록 관측 이력이 계속 메모리에 덧붙는다는 점이다. 모든 관측을 유지하면 중복과 저장 비용이 커지고, 이전에 본 영역을 다시 방문할 때 필요한 기하·의미 증거를 못 찾으면 객체 정체성이나 상태가 바뀌는 불일치가 생긴다. 게다가 새로 생성된 관측 자체에 오류가 있으면 그것이 메모리에 들어가 다음 생성의 참조로 재사용되면서 자기회귀적으로 오류가 증폭된다. 논문은 이 세 가지(메모리 효율, 공간 일관성, 생성 안정성)를 하나의 관리 문제로 묶고, 무엇을 남기고 무엇을 꺼내오고 어떤 새 관측을 신뢰할지를 결정하는 체계적 공간 메모리 관리가 필요하다고 주장한다.
어떻게 동작하나
기존 접근은 크게 세 갈래다. 압축 기반(FramePack, Deep Forcing 등)은 늘어나는 문맥을 유한한 표현으로 요약하지만 장기 일관성에 필요한 세밀한 시각 증거를 버린다. 희소 연산 기반은 어텐션 희소성으로 계산 비용을 줄일 뿐 메모리 관리 자체를 다루지 않는다. 검색 기반은 기하 기반(VMem 등)과 의미 기반(MemFlow 등)으로 나뉘는데, 전자는 가림·동적 콘텐츠·기하 오류에 취약하고 후자는 서로 다른 위치나 시점의 유사 콘텐츠를 구분하지 못한다. 저자들은 이 한계의 근본 원인이 관측들 사이의 관계를 이해하고 그 관계 위에서 추론하는 능력의 부재라고 본다.
무엇과 다른가
제안 방법 SMI는 MLLM을 공간 메모리 관리자로 세우고 관리를 네 개의 원자 연산으로 분해한다. 첫째, 공간 클러스터링은 시간 순서가 아니라 공간 근접성으로 메모리 청크를 묶는다. 카메라 위치·방향으로 후보 클러스터 프로토타입을 추리고, MLLM이 새 청크가 어느 프로토타입에 매칭되는지 판정해 배정하거나 새 클러스터를 만든다. 프로토타입은 같은 클러스터의 다른 항목들에 대한 평균 카메라 투영 커버리지가 가장 큰 항목으로 정한다. 둘째, 클러스터 내 희소화는 클러스터 크기가 임계값 T_s에 도달하면 발동해, MLLM이 중간 항목들을 비교して 중복 청크를 제거한다. 남기는 개수는 미리 고정되지 않고 새 공간 구조·객체 상태·가림 관계를 담고 있는지에 따라 동적으로 결정된다. 셋째, 행동 인지 검색은 현재 카메라 상태와 행동으로 공간 중첩이 큰 K_g개를 먼저 추린 뒤, 최근 문맥과 현재 행동, 후보 메모리를 입력으로 MLLM이 다음 청크 생성에 유용한 이력을 최대 P_r개까지 고른다. 유용한 후보가 없으면 빈 집합을 반환할 수도 있다. 넷째, 신뢰도 인지 필터링은 새로 생성된 청크가 뚜렷한 시각적 드리프트를 보이는지 MLLM이 판정해 admit 또는 discard를 출력하고, 버려진 청크는 메모리에 들어가지 않아 오류 전파를 줄인다.
어떻게 쓰나
학습 데이터는 실제 모델 추론에서 약 1천 개 궤적을 모아 저품질을 걸러내고, 그중 100여 개를 사람이 직접 주석해 시연으로 삼은 뒤 여러 교사 MLLM이 나머지를 라벨링하고 사람이 다시 검수·수정하는 다단계 파이프라인으로 만든다. 이렇게 얻은 데이터로 MLLM을 표준 교차엔트로피로 미세조정한다. 실험은 WorldPlay-1.5의 HY1.5-8B와 Wan2.2-5B 월드 모델 백본에서 수행하고, 이해 모델로는 Qwen3.5-4B를 AdamW, 학습률 2×10⁻⁵, 전역 배치 64로 튜닝했다.
전제와 한계
평가는 VBench(배경 일관성·모션 매끄러움·미적 품질), GPT-5.6-sol 평가자 3개의 블라인드 평가(카메라 제약 장면 일관성, 전반적 시각 품질), 왕복 카메라 궤적의 PSNR/LPIPS 재구성 일관성, 사용자 연구로 구성된다. VBench와 GPT 평가에는 1분 롤아웃 100개를, 재구성 일관성에는 재방문 궤적을 포함한 별도 1분 롤아웃 100개를 쓴다. HY1.5에서 SMI는 베이스 대비 미적 품질을 0.445389에서 0.469357로, GPT 평가 장면 일관성을 51.6053에서 67.0200으로, PSNR을 12.4785dB에서 13.3093dB로 올리면서 메모리 희소도 83.6842%를 유지했다. Wan2.2에서도 같은 경향이 보고된다. 비교 대상은 FoV 기반 검색 베이스라인과 FramePack, Deep Forcing, Mixture of Contexts, VMem, MemFlow이며, 모든 방법이 동일한 초기 관측·행동 시퀀스·시드·문맥 예산을 쓴다.
절제 실험에서는 공간 클러스터링, 클러스터 내 희소화, 신뢰도 인지 필터링을 조합별로 끄면 생성 안정성과 일관성이不同程度로 떨어진다. 특히 공간 클러스터링이 없으면 희소화가 중요한 공간 증거를 버려 일관성이 하락한다. 또 미세조정하지 않은 원본 Qwen3.5-4B는 원자 연산을 안정적으로 수행하지 못해 생성 품질과 일관성이 크게 낮았고, 연산 지향 학습이 이 격차를 메운다.
실무 관점에서 이 논문의 값은 메모리 관리를 손으로 짠 기하 휴리스틱이 아니라 학습 가능한 결정 문제로 재정의했다는 데 있다. 롤아웃이 길어질 때 메모리 예산을 정하고, 재방문 일관성을 유지하고, 생성 오류가 누적되는 것을 막아야 하는 시스템이라면 네 연산을 각각 독립 모듈로 끼워 넣고 어느 조합이 실제 병목을 줄이는지 측정해볼 수 있다. 다만 MLLM 호출이 파이프라인에 추가되므로 초기 롤아웃 구간의 지연을 반드시 재야 하고, 클러스터링 임계값 T_s, 기하 후보 수 K_g, 반환 상한 P_r 같은 하이퍼파라미터가 백본과 장면 분포에 따라 어떻게 튜닝되는지도 확인해야 한다.
저자들이 밝힌 한계는 분명하다. 첫째, SMI는 월드 모델과 종단간 학습되지 않아 백본 자체의 생성 능력을 끌어올리지 못하고, 성능이 기저 생성기의 시각 품질·제어 가능성·안정성에 묶인다. 둘째, 이해 모델과 생성 모델이 서로 다른 표현을 쓰기 때문에 MLLM 기반 메모리 컨트롤러가 추가 연산을 유발하며, 특히 롤아웃 초반에는 희소화로 얻는 절감이 아직 크지 않다. 셋째, 현재 과제 설정은 장기 스트리밍 이해를 명시적으로 다루지 않아 복잡한 장기 의존성이나 논리적 추론이 필요한 메모리 과제에는 부족할 수 있다. 향후 방향으로는 생성·이해·메모리 관리를 공유 표현 공간에서 공동 학습하는 것, 강화학습 도입, 더 포괄적인 데이터셋 구축을 제시한다.