GRACE가 사전학습 DiT 호환을 지키며 영상 잠재를 8배 압축한다

GRACE: Generation-aware latent compression for efficient video generation

HF Daily2610.10524

Jiyoung Kim, Paul Hyunbin Cho, Jisu Nam2026-10-07

무엇인가

영상 확산 모델의 비용은 Diffusion Transformer(DiT)가 처리하는 토큰 수에 좌우되고, 어텐션 비용은 시퀀스 길이에 대해 제곱으로 늘어난다. 토큰 수는 비디오 오토인코더가 만드는 잠재의 시공간 해상도에 비례하므로 압축률을 올리는 것이 가장 직접적인 가속 방법이다. 문제는 압축률을 올리면 잠재의 표현력이 줄어 재구성 품질이 떨어지고, 이를 채널 수 확대로 메우면 DiT 수렴이 느려져 생성 품질이 나빠진다는 점이다. 게다가 압축된 잠재는 DiT가 학습한 분포와 달라서 사전학습 DiT를 처음부터 다시 학습하거나 큰 비용을 들여 적응시켜야 한다. 저자들의 핵심 통찰은 사전학습 오토인코더와 DiT가 이미 잘 정렬된 생성 파이프라인을 이루고 있으니, 압축 과정에서 이 정렬을 활용하자는 것이다.

어떻게 동작하나

1단계는 사전학습 오토인코더를 이중 잠재(dual latent)로 미세조정한다. 먼저 원본 입력을 공간으로 r_s=2, 시간으로 r_t=2 다운샘플링한 x_low를 동결된 사전학습 인코더에 통과시켜 base 잠재를 얻는다. 이 base는 사전학습 잠재 공간에 앵커 역할을 해서 2단계에서 DiT가 적응할 거리를 줄여준다. 다운샘플링 때문에 base가 담지 못하는 공간 디테일과 프레임 간 움직임은, 사전학습 가중치로 초기화한 residual 인코더가 원본 해상도 영상을 받아 C'=16개 추가 채널로 표현한다. 두 잠재는 채널 축으로 이어 붙여 하나의 압축 잠재를 이루고, 디코더는 전부 미세조정하되 residual 채널은 0으로 초기화해 학습이 사전학습 재구성 품질에서 출발하게 한다. 이미지-투-비디오에서는 압축 잠재가 담지 못하는 디테일을 복원하려고 첫 프레임을 디코더에 함께 넣는다.

무엇과 다른가

이중 잠재만으로는 압축률이 높아질수록 부족하다. residual 채널은 재구성 손실로만 최적화되어, 확산 모델이 그 잠재를 얼마나 쉽게 학습하는지는 반영하지 못한다. 그래서 저자들은 사전학습 DiT의 특징 공간 안에서 압축 잠재를 감독하는 generation-aware alignment를 추가한다. 사전학습 잠재와 압축 잠재를 같은 스케줄에서 뽑은 τ와 각기 다른 ε으로 노이즈화한 뒤 동결된 DiT에 통과시키고, 중간 레이어 특징의 코사인 유사도를 맞춘다. 압축 잠재 쪽은 채널 축이 확장된 입력 투영 W_in^res를 0으로 초기화한 별도 분기를 쓰고, 토큰 수가 적은 특징을 삼선형 업샘플링한 뒤 0으로 초기화한 레이어별 잔차 투영 P_l을 더한다. 감독 대상은 40개 DiT 블록 중 앞 10개다. 재구성 손실과 스케일이 달라 고정 가중치는 불안정하므로, residual 인코더 마지막 합성곱 레이어에 대한 두 손실의 그래디언트 노름 비를 적응 가중치로 쓴다.

어떻게 쓰나

2단계는 오토인코더를 동결한 채 DiT를 압축 잠재에 적응시킨다. DiT의 입출력 투영을 C채널에서 C+C'채널로 확장하고 이 투영들은 전부 미세조정하며, 트랜스포머 블록에는 LoRA를 적용해 적응 비용을 낮게 유지한다. 핵심은 비대칭 디노이징이다. 학습 시 오프셋 δ를 균등분포에서 샘플링하고 u_base = max(û-δ, 0), u_res = min(û, 1)로 두어 base가 항상 덜 손상된 상태에 있게 한다. base는 사전학습 변조 투영 W_mod를, residual은 0으로 초기화한 W_mod^res를 통과시켜 적응이 사전학습 동작에서 시작하게 한다. 두 부분은 한 번의 순전파에서 함께 디노이징되므로 함수 평가 횟수는 늘지 않는다. 추론 시에는 δ=0.15로 고정한다.

전제와 한계

실험은 Wan2.1을 압축 전 파이프라인으로 쓰고, 잠재를 f8t4p2에서 f16t8p2로(공간 16배, 시간 8배) 압축했다. Wan2.1-I2V-14B와 T2V-14B를 Panda-70M에서 학습했고, 480x832x81 해상도·50 샘플링 스텝·단일 A100에서 지연시간을 측정했다. 토큰 수는 32.8k에서 4.3k로 약 8배 줄었고, 지연시간은 T2V 851.5초에서 75.8초, I2V 863.2초에서 77.7초로 11.1배 단축됐다. VBench-T2V 총점은 85.81로 압축 전 83.93을 넘어섰고, 특히 시맨틱 점수가 84.98 대 78.70으로 크게 앞선다. I2V 총점 87.90은 압축 전 파이프라인과 0.02 이내 차이다. 736x1280x81에서는 지연시간이 3361.3초에서 215.6초로 15.5배 줄고, T2V 총점 84.74(압축 전 82.96), I2V 총점 87.84(압축 전 87.88)를 기록해 해상도가 높을수록 이득이 커진다.

저자들이 강조하는 관찰은 재구성이 생성 품질을 결정하지 않는다는 것이다. Step-Video-VAE는 LTX-VAE보다 PSNR이 1.91dB 높지만 VBench-I2V에서 3.01점 낮고, 단일 잠재 베이스라인은 GRACE-VAE보다 1.13dB 높게 재구성하면서도 1.46점 낮다. Video DC-AE와 Step-Video-VAE는 각각 2배, 4배 많은 토큰을 쓰고도 압축 전 파이프라인보다 2.98점, 3.87점 낮다. 같은 사전학습 DiT를 2배 토큰으로 적응시킨 DC-Gen과 비교하면 GRACE가 더 빠르고 모든 VBench 총점에서 앞서며, 480x832x81에서 I2V 점수는 7.23점 차로 앞선다. 다만 736x1280x81에서는 DC-Gen의 품질 점수가 더 높은데, 저자들은 VBench가 쓰는 LAION 미학 예측기가 채도 높은 영상을 더 높게 평가하는 경향 때문이라고 설명한다. LTX-Video는 같은 토큰 수에서 I2V 총점이 더 높지만 세 번째 가이던스 분기 때문에 스텝당 DiT 패스가 늘어 느리다.

어블레이션에서 이중 잠재는 T2V 총점을 1.43, 오프셋은 1.13 올리는 반면 I2V 총점은 0.20, 0.39만 올린다. I2V는 조건 이미지가 이미 앵커 역할을 하기 때문이다. 정렬 손실은 I2V와 T2V 모두를 끌어올리며, 시맨틱 점수를 3.90 올린다. 정렬 대상을 바꾼 실험에서 비디오 파운데이션 모델 V-JEPA 2.1 특징에 맞추면 시맨틱 점수가 78.65에서 80.04로 오르지만, 사전학습 DiT 내부 특징에 맞추면 82.55까지 오른다. 디노이징 순서를 뒤집으면 동기 스케줄보다도 나빠져, base를 앞세우는 방향 자체가 중요하다는 것을 보여준다. 학습 비용은 총 38.5 H200 GPU 데이 예산에서 GRACE가 오토인코더 8.5일, DiT 30일을 쓴다. 참고로 Open-Sora 2.0은 처음부터 학습한 Video DC-AE에 사전학습 DiT를 적응시켰을 때 160개 GPU로도 완전히 수렴하지 않아 흐릿한 영상이 나온다고 보고한다.

개발자 관점에서 이 논문은 이미 배포된 영상 생성 파이프라인의 추론 비용을 줄이는 실무 경로를 제시한다. 핵심은 오토인코더를 재구성 목표만으로 최적화하면 잠재가 DiT가 학습한 분포에서 벗어나므로, DiT의 중간 특징 공간에서 정렬 신호를 주고 base와 residual을 비대칭으로 디노이징하라는 것이다. 다만 이 방법은 사전학습 파이프라인의 base 잠재를 그대로 쓸 수 있다는 전제 위에 서 있고, 비교 대상 오토인코더들은 그 base를 쓸 수 없어 DC-Gen의 공개 구현으로 적응시켰다는 점을 감안해야 한다. 평가는 Wan2.1 계열 두 모델에 한정됐고 지연시간은 단일 A100에서 측정됐다. 논문 본문에는 별도의 한계 절이 없으며, 저자들이 밝힌 전제는 재구성 품질이 비교 대상 중 최고는 아니라는 점, 고해상도에서 DC-Gen의 품질 우위가 채도 편향에서 비롯된다는 점, 그리고 VBench-I2V 평가 프롬프트 확장에 GPT-4o를 사용했다는 점이다.