네 단계로 25단계 교사를 앞서는 픽셀 공간 확산 증류 DMA²

DMA$^2$: Pixel-space Distribution Matching with Adversarial and Anchor Losses

arXiv2609.38156v1

Xin Lin2026-09-29조회 3

무엇인가

확산 모델의 텍스트-이미지 생성은 품질이 좋지만 샘플링 단계가 많아 느리다. 최근 픽셀 공간 확산 모델은 VAE 없이 RGB에서 직접 이미지를 만들어 재구성 한계와 디코딩 아티팩트를 피하지만, 여전히 수십 번의 디노이저 평가가 필요하다. 소수 단계 증류의 표준은 분포 매칭 증류(DMD)인데, 지금까지 텍스트-이미지용 DMD 레시피는 대부분 잠재 확산을 전제로 발전해 왔다. 이 논문은 픽셀 공간 교사를 위해 DMD의 두 인터페이스, 즉 교사 매칭과 실제 데이터 가이던스를 네이티브 RGB에 맞게 다시 설계한 DMA²를 제안한다. RGB에서는 미세 텍스처가 명시적으로 드러나고, 깨끗한 출력이 디코더를 거치지 않고도 사전학습된 시각 표현에 직접 연결된다는 점이 잠재 공간과 다르다.

어떻게 동작하나

첫 번째 설계는 매칭 노이즈 대역이다. 저자들은 실제 이미지와 생성 이미지 1,536쌍을 같은 노이즈 레벨로 노이즈한 뒤 선형 분류기 기반 C2ST로 분리 가능성(ROC-AUC)을 측정했다. 그 결과 거의 깨끗한 저노이즈 구간에서 분리 가능성이 높고 고노이즈에서는 우연 수준에 가까웠다. 이 단서는 하이패스 필터와 32×32 패치 셔플은 견디지만 로우패스에서 약해진다. 즉 넓은 구조가 아니라 고주파의 국소 텍스처 단서다. 생성 단계 t_g ∈ {0,.25,.5,.75} 전반에서 곡선이 거의 겹쳐 하나의 고정 대역으로 충분하다는 것도 확인했다. SDXL 잠재 표현은 노이즈 레벨에 거의 평평한 반면 RGB와 DINOv2 특징은 크게 변하고, DINOv2의 의미 정보는 고노이즈 구간까지 실제/생성 구분력을 유지한다. 그래디언트 시각화에서도 t_m=.35에서는 넓고 일관된 패턴이, .55에서는 희소한 미세 패턴이 나타난다. 이에 따라 DMD 분기에만 매칭 레벨을 t_m ~ U(.02,.35)로 제한하는 DM-Band를 적용한다. 잠재 공간 대조 실험에서 같은 대역은 SDXL-DMD2의 DPG를 67.64에서 63.23으로 떨어뜨렸는데, 이는 DM-Band가 보편적 스케줄이 아니라 네이티브 RGB 전용 처방임을 보여준다.

무엇과 다른가

두 번째 축은 실제 데이터 가이던스다. DMD2는 실제 이미지에 대한 GAN 손실을 추가하는데, 기존 Feature-GAN은 5억6천만(560M) 파라미터짜리 fake-score 네트워크에 적대적 헤드를 붙인다. DMA²의 DINO-Adv는 이 비판자를 적대적 그래디언트 경로에서 제거하고, 8천6백만(86M) 파라미터의 동결된 DINOv2 ViT-B/14를 쓴다. 레이어 {2,5,8,11}의 공간 패치 특징을 1×1 합성곱, GroupNorm, LeakyReLU로 구성된 학습 가능한 헤드(총 1.58M 파라미터)에 넣어 패치 로짓을 만들고 non-saturating softplus 목적함수로 학습한다. 같은 파이프라인에서 스텝 시간이 1.82초에서 0.72초로 약 2.5배 빨라졌다. 기본 가중치는 λ_GAN=.01이다.

어떻게 쓰나

세 번째는 AF-Loss(Anchor-Field Loss)다. DINO-Adv의 패치 판단은 국소적일 뿐 의미 특징 공간에서 분포 수준의 이동 방향을 정해주지 않는다. AF-Loss는 생성 이미지에서 뽑은 정규화된 DINOv2 최종 레이어 CLS 특징에 대해, 여러 대역폭의 커널로 실제 특징 은행 B_r 쪽으로 끌어당기고 생성 특징 은행 B_f로부터 밀어내는 변위장을 만든다. 이 변위는 stop-gradient로 고정된 목표가 되어 생성기를 그 방향으로 한 걸음 옮긴다. 두 은행은 각각 256개로 제한된 FIFO 큐이며 현재 배치와 이전 일곱 배치를 아우른다. 대역폭은 {.02,.05,.2}, 가중치는 λ_AF=.05이고, 학습 파라미터나 추론 시 계산이 전혀 추가되지 않는다. 최종 생성기 목적함수는 L_DMD + λ_GAN·L_GAN + λ_AF·L_AF다. 학습되는 것은 생성기, fake-score 비판자, 적대적 헤드뿐이며 보조 모듈은 추론 시 모두 버린다.

전제와 한계

실험은 1.1B 파라미터 25단계 DeCo 교사를 512×512 해상도에서 증류한다. 학생은 교사에서 초기화해 8개 GPU, 배치 32로 20k 스텝 학습했고, AdamW에 학습률은 생성기 2e-6, fake-score 5e-6, 적대적 헤드 2e-4, 생성기 스텝당 fake-score 5회 갱신, CFG 4.0을 썼다. 학습 데이터는 BLIP3-o 롱 캡션 분할에서 가져온 20만 이미지-캡션 쌍이다. 평가는 DPG-Bench(프롬프트 1,065개, 이미지 4,260장), GenEval(프롬프트 553개, 이미지 2,212장), GenAI-Bench 1,600 프롬프트의 VQAScore, COCO30K 3만 장의 IS·CLIP·recall·NIQE로 했다. 4단계 DMA² 학생은 보고된 일곱 개 지표 모두에서 25단계 교사를 앞서고 평가된 소수 단계 증류기 중 1위다. DPG-Bench 83.692, GenEval 0.8232, VQAScore 0.7146, COCO30K에서 IS 41.01, recall 0.4701, NIQE 2.925를 기록했다. 가장 강한 비교군은 DMDR의 DPG-Bench 83.160, Decoupled DMD의 GenEval 0.8100이다. 1단계에서도 우위가 유지된다. 같은 학습 파이프라인·하드웨어·배치 기준으로 DMA²는 스텝당 0.72초로, DMDR 0.90초, DMD2와 Decoupled DMD 1.82초보다 약 2.5배 빠르다. 같은 레시피는 PixelGen-XXL 백본으로도 전이된다.

절제 실험은 각 신호의 기여를 분리한다. DINO-Adv만으로 DPG-Bench가 81.1에서 82.6, IS가 34.2에서 39.4로 올랐고, AF-Loss 단독은 단일 목적함수 중 가장 높은 DPG-Bench 83.2를 냈다. 둘을 합치고 DM-Band를 빼면 DPG-Bench 83.427, VQAScore 0.7113이다. AF-Loss를 DINOv2 CLS 직접 회귀로 바꾸면 일곱 지표 중 여섯 개가 나빠졌고 DPG 1.12, IS 1.61이 떨어졌다. 즉 이득은 동결 특징 자체가 아니라 분포장 목적함수에서 나온다. DM-Band는 완전한 실제 데이터 분기에 얹었을 때 GenEval을 0.8178에서 0.8232로, IS를 39.52에서 41.01로 올리고 NIQE를 3.307에서 2.925로 낮췄다. 하이퍼파라미터 민감도에서는 λ_AF를 0에서 .05로 올릴 때 개선이 가장 컸고 그보다 키우면 GenEval이 급격히 떨어졌으며, 은행 크기 256이 IS 최고, 커널 반지름에는 비교적 둔감했다.

실무 관점에서 이 논문이 주는 신호는 세 가지다. 첫째, 잠재 확산용으로 튜닝된 증류 레시피를 픽셀 공간 모델에 그대로 옮기면 매칭 노이즈 대역 선택이 어긋날 수 있다. 저노이즈 구간의 그래디언트가 구조·의미가 아니라 국소 텍스처를 따라갈 수 있기 때문이다. 둘째, 네이티브 RGB 출력은 VAE 디코더를 거치지 않고 DINOv2 같은 외부 표현을 바로 붙일 수 있게 해주며, 적대적 비판자를 560M fake-score 네트워크에서 떼어내는 것만으로 스텝 시간을 2.5배 줄일 수 있다. 셋째, AF-Loss처럼 학습 파라미터와 추론 비용이 0인 보조 손실은 기존 DMD 파이프라인에 얹기 쉬운 형태다. 다만 이 수치들은 512×512, 20만 쌍, 20k 스텝, 8 GPU라는 특정 조건에서 나온 것이므로 자체 데이터·해상도·교사 모델에 적용할 때는 DM-Band 대역과 λ_AF, 은행 크기를 다시 스윕해야 한다.

저자가 명시한 전제와 한계도 분명하다. DM-Band는 단계별 스케줄이나 학습 시 분류기, 온라인 추정 없이 손으로 정한 단일 하이퍼파라미터이며, 잠재 공간 대조 실험에서 확인했듯 네이티브 RGB에서만 이득이 나오는 처방이지 보편적인 DMD 스케줄이 아니다. AF-Loss는 교사 감독을 대체하지 않는 보조 목적함수이고, 프롬프트 조건부 교사 감독이 계속 활성화된 상태에서만 작동한다. 실험은 512×512 해상도와 20만 이미지-캡션 쌍, 20k 스텝 예산에 한정되어 있으며 더 큰 해상도나 데이터 규모에서의 거동은 원문에 제시되지 않았다. 또한 모든 보조 모듈은 추론 시 버려지므로 배포 시 추가 비용은 없지만, 학습 시에는 동결 DINOv2 인코더를 별도로 준비해야 한다.