LOCI는 영상 월드 모델의 재방문 장면 복원을 공간 메모리 혼합으로 개선한다

LOCI: Spatial Linear Memory for Streaming World Models

HF Daily2609.40222

Ji Xia, Tingting Liao, Xuezhi Liang2026-09-30

무엇인가

카메라를 조작할 수 있는 영상 월드 모델은 그럴듯한 다음 프레임을 만드는 것만으로는 부족하다. 카메라가 한참 전에 지나간 영역으로 되돌아왔을 때, 모델은 그곳에 무엇이 있었는지 재현해야 한다. 문제는 공간적 관련성이 시간적 최신성과 일치하지 않는다는 점이다. 최근 컨텍스트 밖에 있는 관측 하나가 현재 시점을 복원하는 데 결정적일 수 있다. 기존 방식은 두 갈래로 갈린다. KV 캐시는 관측별 디테일을 그대로 보존하지만 영상 길이에 따라 저장·접근 비용이 계속 늘어나고, 순환 메모리는 고정 크기로 압축되는 대신 개별 과거 관측에 직접 접근할 수 없다.

어떻게 동작하나

LOCI는 이 둘을 한 아키텍처 안에 유지하는 하이브리드 공간 메모리다. 30블록 Wan 비디오 트랜스포머를 청크 인과적 생성에 맞게 개조해, 15개 블록은 청크 내부 소프트맥스 어텐션과 순환 Kimi Delta Attention(KDA)을 결합한 하이브리드 블록으로, 나머지 15개 블록은 과거 키·값을 명시적으로 보관하는 소프트맥스 어텐션 블록으로 둔다. 모든 블록은 UCPE 광선 조건화 카메라 어텐션 브랜치를 별도로 유지하며, 카메라 브랜치는 과거 어텐션 블록과 동일한 보존 프레임을 본다. 같은 보존 프레임 예산에서 메인 어텐션 KV를 30개 층이 아니라 15개 층에만 저장하고, 나머지 15개 층의 이력은 고정 크기 상태로 대체한다. 순환 브랜치가 추가하는 파라미터는 90.7M로 전체 5.38B의 1.7%다.

무엇과 다른가

핵심 절차는 두 가지다. 첫째, PRoPE로 순환 메모리의 쿼리·키·값을 각 토큰의 카메라 기하에 조건화한다. 월드-투-레이 변환과 정규화 내부 파라미터로 만든 사영 변환을 쿼리에는 전치로, 키·값에는 역행렬로 적용하고, 읽기 결과는 다시 역변환해 되돌린다. 시점이 메모리 주소 지정과 저장 내용 양쪽에 들어가는 셈이다. 둘째, 청크 동기식 메모리 동역학이다. 청크의 모든 토큰은 이전 청크가 남긴 상태를 읽고, 쓰기는 토큰 해상도로 델타 규칙을 따라 순차적으로 수행해 새 관측이 같은 키에 이미 연결된 값을 수정하게 한다. 망각을 담당하는 대각 감쇠는 언어 모델용 KDA처럼 토큰마다 적용하지 않고 청크의 첫 토큰에서 청크 평균 표현으로 한 번만 계산한다. 토큰 순서가 아니라 경과한 영상 시간에 따라 망각이 진행되도록 만든 것이다. 스트리밍 시 명시적 저장을 묶기 위해 최근 창과 다양한 과거 시점 뱅크(조건 프레임 싱크 1개, 최근 완료 프레임 최대 8개, 현재 청크 5개, 파노라마 뱅크 최대 20개)를 합쳐 소프트맥스 어텐션이 최대 34개 잠재 프레임만 보게 한다. 버려진 관측은 보관되지 않지만 순환 상태는 그대로 남는다.

어떻게 쓰나

실험은 Wan2.2-TI2V-5B에서 5,000 업데이트로 청크 단위 디퓨전 포싱 학습을 했다. 공개 MIND 메모리 벤치마크에서 LOCI는 제로샷으로, MIND 데이터로 학습된 GIM-World가 보고한 값보다 낮은 MSE와 높은 PSNR·SSIM을 기록했고 LPIPS는 GIM-World(0.630)를 제외한 모든 비교 대상보다 낮았다(0.643). 메모리 세그먼트를 컨텍스트로 준 스트리밍 월드 모델들(8~28B) 중 전 세그먼트 채점 대상에서 네 지표 모두 최고였고, 가장 강한 HY-WorldPlay보다 PSNR이 1.82dB 높았다. 동일한 학습 데이터·레시피·업데이트 수의 full-softmax 베이스라인과 비교하면, 보존 관측 집합이 같은 조건에서 MIND 전체 세그먼트 PSNR이 +0.89dB(95% 구간 [+0.64, +1.15])였고 50개 세그먼트 중 44개에서 더 좋았다. 홀드아웃 Unreal Engine 궤적에서는 재방문 시점 참조 PSNR이 +0.62dB, set A에서 동일 보존 조건일 때 +0.99dB 향상됐다. 전체 이력을 쓰는 경우 같은 길이에서 피크 메모리가 약 30% 낮고 도달 가능한 길이가 157초에서 225초로 늘었으며, 첫 40초 구간에서 영상 1초당 7.2초 대 8.1초로 더 빠르다. 제한된 뱅크를 쓰면 300초를 상수 23.6GiB, 상수 청크 시간으로 스트리밍하고, 같은 접근 조건의 full-softmax(27.6GiB)보다 15% 적은 메모리를 같은 속도(단일 H200에서 영상 1초당 5.4초)로 쓴다.

전제와 한계

분석 파트도 구체적이다. 순환 상태에서 첫 프레임 기준 카메라 요(yaw)가 선형적으로 디코딩되는지 확인했더니 홀드아웃 R²=0.946[0.929,0.960], 중앙 오차 3.6도였고, 좌표 불변 요약(헤드별 특이값과 노름)만 써도 R²=0.941이었다. 카메라 인코딩이 없는 순환 메모리 대비 PRoPE가 이 R²를 +0.646[+0.544,+0.749] 올렸다. 어텐션 분석에서는 공가시 토큰이 이력의 약 0.1%에 불과한데 LOCI의 15개 소프트맥스 층이 이력 어텐션의 11.1%를 그쪽에 배분해 균등 분포 대비 115배 농축을 보였고, full-softmax의 같은 15개 층은 10.45%(108배)였다. 추론 시 청크 간 읽기만 0으로 만들면 하위 소프트맥스 층의 공가시 농축이 떨어져, 순환 읽기가 실제로 하위 쿼리를 안내한다는 증거가 된다. 짧은 구간 재방문에서 DINOv2 특징 거리 기준 최악 5% 패치의 국소 오차는 LOCI가 full-softmax보다 −0.073 낮았고 13개 세그먼트 중 12개에서 더 좋았다. 추론 중 매 청크마다 순환 상태를 초기화하면 이 국소 오차가 +0.021[+0.013,+0.028] 올라가고 선명도도 0.18에서 0.12로 떨어졌다(16개 중 15개 세그먼트).

개발자 관점에서 이 논문이 주는 실무적 신호는 명확하다. 긴 영상이나 긴 상호작용 세션을 다루면서 "과거 관측을 정확히 다시 보여줘야 하는" 요구가 있는 시스템이라면, 모든 층에 KV 캐시를 두는 대신 절반은 고정 크기 순환 상태로 바꾸고 그 읽기를 하위 층 쿼리에 흘려보내는 패턴을 검토할 만하다. 특히 순환 상태에 카메라·포즈 같은 기하 정보를 인코딩해 두면, 시간적 근접성이 아니라 시점 유사성으로 과거를 찾는 주소 지정이 가능해진다는 점이 재사용 가치가 크다. 다만 이득은 상대적이며, 청크 경계에서 상태를 커밋하는 읽기-후-쓰기 스케줄과 청크 단위 망각 주기가 성능의 상당 부분을 좌우하므로 그 스케줄을 그대로 옮겨야 한다는 전제를 확인해야 한다.

저자들이 밝힌 한계도 분명하다. 홀드아웃 궤적은 Unreal Engine으로 렌더링한 것이고 실제 세계 캡처는 평가하지 않았다. 모든 모델의 절대 충실도가 낮아 벤치마크 평균 PSNR이 15dB 미만이므로 개선폭은 상대값으로 읽어야 한다. 5B 백본 하나, 5,000 업데이트의 짧은 파인튜닝 예산만 다뤘다. 두 비교 모델 모두 30개 전 블록에 명시적 이력 카메라 어텐션 브랜치를 유지하므로, 순환 경로가 줄이는 것은 전체 저장 이력이 아니라 메인 어텐션 KV의 절반이다. 순환 상태는 학습 시 노이즈가 섞인 청크 특징으로 만들어지지만 추론 시에는 생성된 청크로 커밋된다는 불일치도 남아 있고, 제한된 희소 모드에서 full-softmax와 속도가 같아지는 것은 별도의 최적화 구현에 의존한다.