CtrlCache가 제어 신호로 인터랙티브 월드 모델 추론을 가속한다

CtrlCache: Accelerating Interactive Video World Models with Control-Aware Caching

arXiv2610.08777v1

Shangye Song2026-10-06

무엇인가

인터랙티브 비디오 월드 모델은 사용자 제어를 연속적으로 받아 끊김 없이 진화하는 시각 환경을 만들어낸다. 최근 시스템들은 짧은 청크를 자기회귀적으로 생성하고 few-step 디노이징으로 샘플링 비용을 줄이지만, 청크 하나를 만들 때도 거대한 diffusion transformer(DiT) 백본을 여러 번 완전히 통과해야 한다. 청크 생성 지연은 곧 사용자가 시뮬레이션 세계에 반응할 수 있는 속도이므로 추론 가속이 핵심 병목이다. DeepCache, FORA, Δ-DiT, PAB 같은 고정 스케줄 캐싱과 TeaCache, EasyCache, FasterCache, ToCa, AdaCache 같은 적응형 캐싱은 재학습 없이 중간 계산을 재사용하지만, 재사용 여부를 모델 내부의 디노이징 동역학만 보고 정할 뿐 제어 전환은 명시적으로 고려하지 않는다. 이 논문이 주목하는 지점은 인터랙티브 생성에는 이미 노출된 신호가 하나 있다는 것이다. 어떤 청크의 제어 입력은 그 청크가 디노이즈되기 전에 도착하므로, 제어에서 스케줄을 유도하면 forward pass를 한 번도 쓰지 않고 계산 배분을 정할 수 있다.

어떻게 동작하나

저자들은 서로 다른 제어 상태에서 인접 청크의 clean latent 유사도를 분석해 두 가지를 관찰한다. 첫째, 액션 변화 지점에서 latent 유사도가 떨어지므로 그 구간에서는 재사용을 보수적으로 적용해야 한다. 둘째, 정상 주행(steady) 구간에서도 거친 장면 배치를 담는 저주파 성분이 세밀한 외형을 담는 고주파 성분보다 청크 간에 더 오래 유지된다. 이 관찰이 "언제 캐시를 재사용하거나 갱신할 것인가"와 "재사용한다면 어떤 내용을 넘겨도 안전한가"라는 두 질문으로 이어진다.

무엇과 다른가

첫 번째 구성 요소인 action-aware scheduling and refresh policy는 들어오는 제어 시퀀스로 각 청크를 initial, transition, turning, steady 네 상태 중 하나로 분류한다. 첫 청크는 initial, 이후 청크는 제어 전환이 있으면 transition, 전환은 없지만 회전 제어가 임계값 τ_turn을 넘으면 turning, 둘 다 아니면 steady다. 전환 여부 T_n은 청크 경계를 넘나드는 연속 제어 입력 쌍의 변화 여부를 최대값으로 판정하고, 회전 여부 R_n은 청크 안 회전 제어 크기의 최대값이 임계값을 넘는지로 정한다. 이때 직전 청크의 마지막 제어 입력을 현재 청크의 0번 입력으로 붙여, 청크 경계에서의 변화와 청크 내부에서의 변화를 같은 규칙으로 잡아낸다. 그다음 {2,…,S−1} 중 선택된 내부 디노이징 스텝 하나에서 완전 계산 여부 G_n을 정한다. initial과 transition 청크는 그 스텝에서 DiT 블록을 완전히 계산해 캐시를 초기화하거나 갱신하고, turning과 steady 청크는 같은 청크에서 가장 최근에 완전 계산된 스텝의 transformer residual을 재사용한다. 재사용은 현재 입력에 캐시된 residual을 더하는 방식(출력 = 입력 + r)으로 이뤄지며, 입력 투영·타임스텝 임베딩·출력 헤드는 그대로 계산하고 무거운 transformer 블록 연산만 건너뛴다. 첫 스텝과 마지막 스텝은 모든 경우에 완전 계산으로 남겨 캐시 초기화와 최종 정련을 보장한다.

어떻게 쓰나

두 번째 구성 요소인 frequency-mixed history prior guidance는 재사용 시 무엇을 넘길지를 다룬다. 직전 청크의 마지막 clean latent 프레임을 3×3 평균 풀링으로 저주파 성분과, 원본에서 저주파를 뺀 고주파 성분으로 분해한다. 그리고 현재 청크의 각 시간 위치 k에 대해 p = w_k × (저주파 + α_k × 고주파) 형태의 history prior를 만든다. 첫 위치는 α_1 = w_1 = 1이라 직전 프레임을 그대로 보존하고, 이후 위치에서는 α가 고주파를 감쇠시키고 w_k가 시간 거리에 따라 두 성분을 함께 줄인다. 이 prior는 첫 디노이징 스텝(s=1)에서 현재 청크의 clean latent 추정값에 (1−λ)·추정값 + λ·prior로 블렌딩된다. 이 안내는 steady 청크에만 켜지는데, 전환이나 지속적 회전 중에는 직전 청크에서 물려받은 기하 구조 자체가 시점 변화로 낡아버릴 수 있기 때문이다. 블렌딩은 샘플러의 기존 타임스텝·노이즈 스케줄을 그대로 쓰므로 추가 DiT forward 비용이 들지 않는다.

전제와 한계

실험은 Matrix-Game 2.0, LingBot-World v1, LingBot-World v2 세 모델에서 각자의 few-step 청크 자기회귀 추론 설정으로 수행했고, 비교 대상은 수정 없는 원본 추론과 대표적인 학습 없는 캐싱 기법인 TeaCache, EasyCache다. 평가는 WBench의 navigation 트랙에서 화질(Quality), 일관성(Cons.), 상호작용 준수(Inter.), 설정 준수(Setting), 물리 준수(Physics)와 이 다섯 차원의 비가중 평균인 Overall로 이뤄졌고, 원본 대비 PSNR·SSIM·LPIPS와 DiT 백본 지연·배속도 함께 측정했다. 모든 실험은 NVIDIA A100 한 장, 시드 42에서 진행됐다.

결과적으로 CtrlCache는 세 백본 모두에서 평가된 방법 중 가장 높은 WBench Overall을 기록하면서 DiT 백본 기준 1.21배에서 1.41배의 가속을 달성했다. Matrix-Game 2.0에서는 Overall을 0.6543에서 0.6786으로 끌어올려 다섯 차원 전부에서 원본을 앞선 유일한 방법이었고, 캐싱 베이스라인 중 가장 좋았던 EasyCache의 0.6625도 넘었으며 PSNR은 EasyCache보다 1.05 높았다. LingBot-World v1과 v2에서는 각각 1.26배, 1.21배 가속을 유지하면서 Overall, PSNR, SSIM, LPIPS 모두 최고 성능을 냈다. 캐싱 베이스라인들이 모든 백본에서 근소하게 더 빠른데, 이는 이들의 재사용 기준이 액션 전환에서도 계산을 건너뛸 자유가 있기 때문이며, CtrlCache는 그 계산을 transition 청크에 쓰는 대신 세 백본 모두에서 가장 높은 설정 준수와 물리 준수를 얻었다. 절제 실험에서는 정책 없이 residual만 재사용하면 Overall이 소폭 오르지만 차원별 편차가 크고 Matrix-Game 2.0의 물리 준수가 원본보다 떨어졌으며, action-aware 정책을 켜면 Overall과 설정·물리 준수가 개선됐다. history prior는 steady 청크에만 적용할 때 Overall이 가장 높았고 turning이나 transition까지 확장하면 성능이 떨어졌다.

실무 관점에서 이 기법은 제어 시퀀스가 디노이징 이전에 확정되는 청크 단위 자기회귀 확산 파이프라인에 바로 얹을 수 있는 training-free 가속이다. 다만 백본별로 회전 임계값 τ_turn, 재사용 스텝 s, 고주파 가중 α, 블렌딩 강도 λ, 시간 가중 w_k를 따로 정해야 한다. 논문의 설정값은 Matrix-Game 2.0의 마우스 제어에 τ_turn = 10⁻⁶, LingBot-World의 yaw/pitch에는 0을 쓰고, 재사용 스텝은 세 모델에 각각 2, 3, 2, α와 λ는 0.5, 시간 가중은 L=3일 때 (1, 0.5, 0.25), L=4일 때 (1, 0.5, 0.25, 0.125)다. 즉 제어 표현과 디노이징 스케줄이 바뀌면 이 값들을 다시 잡아야 한다는 전제를 감안해야 한다.

저자들이 밝힌 한계도 여기에 있다. CtrlCache는 현재 백본별 액션 지표에 의존하고, 재사용 스텝이 각 백본의 디노이징 스케줄에 따라 달라지는 고정값이라는 점이다. 향후 연구로 더 일반적인 제어 표현과 적응적 스텝 선택을 다룰 계획이라고 밝히고 있다.