DC-SAE가 32배 압축에서도 확산 모델 수렴을 앞당긴다
DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence
무엇인가
잠재 확산 모델에서 고압축 토크나이저는 잠재 시퀀스 길이를 줄여 모든 생성 모델의 연산 비용을 낮춘다. 문제는 압축을 세게 걸수록 확산 모델 학습이 어려워져 수렴에 더 많은 스텝이 필요해지고, 결국 포워드 패스에서 아낀 비용이 전체 학습 비용에서 상쇄된다는 점이다. 반대로 사전학습 의미 인코더(DINOv2 등)를 VAE 인코더 대신 쓰는 표현 오토인코더(RAE) 계열은 잠재의 표현력을 높여 수렴을 앞당기지만, 통상 16배 수준의 중간 압축에 머물고 충실한 복원에 필요한 픽셀 수준 디테일을 잃는다. 이 논문은 높은 압축비와 빠른 확산 수렴을 동시에 얻는 토크나이저를 어떻게 설계할 것인가를 다룬다.
어떻게 동작하나
DC-SAE의 핵심은 두 갈래 인코더다. 의미 브랜치는 입력 이미지를 절반 해상도로 리사이즈해 패치화·선형 투영한 뒤 동결된 의미 인코더에 넣어 32배 압축 잠재를 직접 만든다. 저자들은 이를 pre-merge 압축이라 부르며, 이미 추출된 의미 토큰을 사후에 병합하는 post-merge 방식보다 낫다고 주장한다. 픽셀 브랜치는 처음부터 학습하는 제약 없는 고채널 인코더로, 텍스처·색 통계·국소 경계·고주파처럼 의미 인코더가 버리는 정보를 담당한다. 두 잠재는 채널 방향으로 연결되고 경량 투영으로 융합된 뒤 하나의 디코더로 복원된다.
무엇과 다른가
학습 과정에는 픽셀 브랜치가 복원을 독점하지 못하게 하는 장치가 들어간다. 토크나이저 학습 중 픽셀 잠재에 샘플 단위 드롭아웃을 걸어, 픽셀 브랜치가 빠졌을 때 디코더가 의미 구조를 활용하도록 강제한다. 디코더 쪽에는 Spatial DeMerger를 두어 각 압축 토큰을 여러 개의 공간 서브토큰으로 확장한다. 이 확장은 디코더에서만 일어나므로 DiT는 여전히 32x32의 압축 잠재 위에서 동작하고, 고압축의 효율 이득은 그대로 유지된다.
어떻게 쓰나
저자들은 먼저 순진한 접근이 왜 실패하는지 보인다. 의미 인코더를 리사이즈 방식으로 32배까지 밀어붙이면 256x256에서 PSNR이 약 15에 그치고, DiT를 80에폭 학습해도 gFID 7.15에 머문다. 평균 풀링, 동결 merger, 학습 가능한 merger 같은 post-merge 압축은 이보다 더 나쁘다. 반면 의미 잠재와 픽셀 잠재를 결합해 함께 학습하면 같은 80에폭에서 gFID 4.27로, 의미만 쓴 경우(7.15)와 픽셀만 쓴 경우(11.04)를 모두 앞선다.
전제와 한계
주요 수치는 ImageNet 512x512, 32배 공간 압축에서 PSNR 29.79와 gFID 3.37이다. 이전 최고 고압축 토크나이저인 DC-AE의 26.25 PSNR, 7.47 gFID와 비교해 PSNR 13.5%, gFID 54.9% 개선이다. 256x256에서는 재구성 rFID가 0.69에서 0.45로 내려가고, DiT-XL 생성기로 gFID 3.31, Inception Score 180.71을 기록했다. 처리량도 DC-AE 대비 256x256에서 4.64배, 512x512에서 4.75배, 1024x1024에서 4.41배 높다. 16배 압축 설정에서도 RAE의 약 19 PSNR 대비 27.80 PSNR, 0.26 rFID를 낸다.
텍스트-이미지 생성으로도 확장한다. 1.6B 파라미터 DiT와 Qwen3-1.7B 텍스트 인코더를 32배 압축 DC-SAE 위에서 학습해 1024x1024, classifier-free guidance 조건에서 GenEval 0.84, DPG-Bench 86.007을 얻었다. DC-AE 기반 DC-Gen-FLUX.1-Krea-12B보다 GenEval은 0.12, DC-AE-1.5 기반보다는 0.25 높지만, DPG-Bench에서는 DC-AE 베이스라인의 87.073에 미치지 못한다.
구성 요소별 기여도 분석도 눈에 띈다. 의미 성분을 마스킹해도 복원 품질 변화가 거의 없지만 픽셀 성분을 마스킹하면 급격히 나빠진다. 즉 고품질 복원은 사실상 픽셀 브랜치가 담당하고, 의미 브랜치는 DiT가 배우기 쉬운 구조를 제공하는 역할이다. 또 픽셀 오토인코더를 따로 학습해 나중에 의미 잠재를 붙이는 Late-Concat은 재구성은 더 좋지만 생성은 나빠서(80에폭 FID 5.64, 더 이른 체크포인트를 쓴 변형도 5.40), 결합 잠재를 오토인코딩 단계에서 함께 학습하는 것이 이득의 원천이라고 주장한다.
실무에서는 고해상도 이미지·비디오 생성에서 잠재 시퀀스 길이를 줄이면서 DiT 학습 수렴까지 챙기고 싶을 때 참고할 만하다. 토크나이저를 한 번 학습해 동결하면 이후 생성기 학습 비용이 줄어드는 구조이므로, 기존 VAE나 DC-AE 계열 토크나이저를 쓰는 파이프라인의 교체 후보가 된다. 다만 전제를 확인해야 한다. 의미 인코더는 동결해서 쓰는 것이 설계의 출발점이고(DINOv2, QwenViT 계열), 텍스트-이미지 학습 데이터는 내부 데이터 일부와 LAION-COCO 서브셋이라 완전한 재현은 어렵다. 논문 본문에는 별도의 한계 절이 없으며, 저자들이 명시적으로 밝힌 전제는 위와 같은 동결 인코더 사용과 데이터 구성, 그리고 DPG-Bench에서 기존 DC-AE 베이스라인을 넘지 못한다는 점이다.