픽셀 디퓨전에 GAN 후학습을 더해 고주파 디테일을 되살린다

Adversarial Training for Pixel Diffusion

arXiv2609.38170v1

Xin Lin2026-09-29조회 3

무엇인가

픽셀 디퓨전은 오토인코더를 거치지 않고 RGB 픽셀을 직접 생성한다. 잠재 디퓨전이 압축 표현을 만들고 별도 디코더로 이미지를 복원하는 것과 달리, 노이즈 제거기가 전역 구조와 미세 디테일을 모두 책임진다. 문제는 수렴한 픽셀 모델이 텍스트 의미와 큰 구도는 잘 잡으면서도 미세 스케일의 자연 이미지 통계는 체계적으로 과소 표현한다는 점이다. 논문은 DeCo 베이스라인의 방사형 파워 스펙트럼 기울기가 α=2.59로, 실제 COCO 이미지의 약 2.19보다 훨씬 가파르다는 것을 근거로 든다. 기울기가 가파르다는 것은 주파수에 따라 에너지가 너무 빨리 줄어든다는 뜻, 즉 고주파가 부족해 이미지가 부드럽고 질감이 없다는 뜻이다. 저자들은 이 잔여 디테일 격차를 분포 충실도·다양성·프롬프트 정합성을 희생하지 않고 교정할 수 있는지 묻는다.

어떻게 동작하나

제안하는 방법은 적대적 후학습이다. 이미 수렴한 모델에서 출발해 원래의 디퓨전 또는 플로 매칭 목표는 그대로 유지하고, 예측된 깨끗한 이미지 x̂0에 힌지 적대적 손실을 추가해 학습을 이어간다. 생성기는 기존 손실에 L_G = w_gan·E[−D(h(ŷ0))]를 더하고, 판별기는 L_D = ½E[relu(1−D(h(y0)))] + ½E[relu(1+D(h(ŷ0)))]를 최소화한다. 여기서 y0는 모델 고유 출력 공간의 정답(RGB 또는 잠재 z0)이고, h는 그 공간을 판별기 입력으로 매핑하는 함수다. 픽셀 모델에서는 h가 항등이고, 디코딩된 RGB를 쓰는 잠재 변형에서는 동결된 VAE 디코더가 h 역할을 한다. 적대적 손실은 신호 비율 게이트 α_t = 1−σ_t ≥ τ를 만족하는, 즉 노이즈가 심하지 않은 타임스텝에만 적용한다. 고노이즈 구간에서는 x̂0가 아직 의미 있는 이미지가 아니어서 판별기가 잘못된 구조 위에 디테일을 밀어 넣을 수 있기 때문이다. 모델 구조와 샘플링 절차는 바뀌지 않는다. 선호 레이블이나 보상 모델을 쓰지 않고, 증류도 하지 않으며, 샘플링 스텝 수를 줄이지도 않는다. 판별기는 동결된 DINOv2·DINOv3·SigLIP 백본에 텍스트 조건 프로젝션 헤드를 붙여 구성한다.

무엇과 다른가

실험은 픽셀 백본 두 개(DeCo, PixelGen)와 잠재 백본 두 개(PixArt-α XL/2 0.61B, SANA 1.6B)에서 진행했다. 모두 공개 체크포인트에서 BLIP3o-60k로 파인튜닝했고, GAN 실행과 no-GAN 대조군은 같은 시작 체크포인트·데이터·학습 기간을 공유한다. DeCo에서 FID는 33.27에서 28.59로, pFID는 27.9에서 24.4로, CMMD는 0.836에서 0.736으로, recall은 0.361에서 0.406으로, TOPIQ는 0.71에서 0.77로, MANIQA는 0.64에서 0.71로, DPG 점수는 81.6에서 83.3으로 개선됐다. PixelGen도 모든 축에서 좋아졌고 DPG 점수는 78.4에서 80.8이 됐다. 주파수 분석에서 DeCo의 중간 대역 파워 비중은 4.9%에서 7.5%로, 고주파 대역은 2.1%에서 3.9%로 늘었고, 고주파 대역 로그 파워는 +0.34 dex 상승하며 기울기가 2.24로 자연 이미지 값에 가까워졌다. PixelGen도 중간 6.6%→8.9%, 고주파 3.9%→6.4%로 같은 방향이다.

어떻게 쓰나

이 효과가 단순한 샤프닝이나 암기, 모드 붕괴가 아니라는 통제 실험도 제시한다. DINOv2 임베딩으로 학습 이미지 6만 장에 대한 최근접 이웃 코사인 유사도를 재면 평균은 +0.0001만 변했고(양쪽 모두 0.586), 최댓값은 GAN 쪽이 오히려 낮았다(0.929 대 0.943). GAN의 고주파 스펙트럼에 맞춰 언샤프 마스크를 튜닝한 대조군은 FID를 32.3까지밖에 못 낮춘 반면 GAN은 28.59를 기록했다. 지각 손실(LPIPS + DINO 특징)과의 비교도 흥미롭다. 지각 손실도 고주파를 늘리고 TOPIQ(0.711→0.749)와 MANIQA(0.636→0.661)를 올리지만, FID는 33.3→34.1로, pFID는 27.9→28.6으로, DPG 점수는 81.6→81.4로 나빠진다. 채도·대비·색감이 함께 떨어지는 도메인 이동이 원인이며, GAN은 이를 유지한다. 참고로 실제 사진은 TOPIQ가 0.57로 가장 낮아, 무참조 화질 지표만으로는 판단할 수 없음을 보여준다.

전제와 한계

가장 실무적으로 중요한 대목은 픽셀과 잠재의 대비다. 같은 절차를 PixArt-α와 SANA에 적용하면 DeCo에서처럼 지표들이 동시에 개선되지 않는다. 디코딩된 고주파 대역 비중은 SANA가 2.2%에서 2.3%로, PixArt가 2.1%에서 1.9%로 거의 변하지 않고, 파워 스펙트럼 기울기도 자연 이미지 값 쪽으로 이동하지 않는다. 선호도 평가에서 잠재 GAN은 50% 기준선을 밑도는 경우가 많다. 저자들은 이를 출력 접근성 문제로 설명한다. 적대적 손실이 바꿀 수 있는 것은 생성기의 고유 출력인데, 잠재 모델에서는 동결된 VAE 디코더가 그 출력과 최종 픽셀 사이를 매개한다. 동일한 크기의 고유 출력 교란에 대해 VAE는 픽셀 항등 매핑보다 3.5~11배 약한 디코딩 고주파 응답을 보였고, VAE 인코딩·디코딩 자체가 실제 이미지의 스펙트럼 기울기를 α=2.48로 가파르게 만들며 약 0.2 dex의 고주파 파워를 제거한다. 기울기가 차단되는 것은 아니지만, 디코딩된 고주파에 영향을 주는 방향의 그래디언트가 크게 감쇠된다는 것이다.

설계 선택에 따른 트레이드오프도 정리한다. 판별기를 스크래치부터 학습한 PatchGAN·StyleGAN은 no-GAN FID 기준선(32.5~33.5) 근처에 머무는 반면, 동결된 사전학습 백본(DINOv2, DINOv2-Large, DINOv3, SigLIP)을 쓴 판별기는 FID 28.6~31.0과 DPG 점수 최대 83.4를 낸다. 노이즈 게이트는 단일 최적값이 없어 운용점을 나눈다. 고정 DINOv2 판별기와 w=0.1 조건에서 t≥0.35는 DPG 점수와 무참조 화질을, t≥0.53은 더 높은 IS와 recall을, 더 넓은 게이트는 CMMD와 pFID를 선호한다. 적대적 가중치 w를 올리면 무참조 샤프니스가 단조 증가하는 대신 분포·정합 지표는 낮은 값에서 더 잘 유지된다. 논문은 이 절제 실험이 경향을 드러내기 위한 것이지 모든 지표를 지배하는 보편적 최적 설정을 찾은 것이 아니라고 명시한다. 또한 잠재 모델에 대한 결론은 실험한 구성에 한정되며, 픽셀 디퓨전에서 적대적 후학습이 성공하는 조건은 (i) 출력 부분공간에 교정 가능한 오류가 있고 (ii) 학습 가능한 출력에서 그 부분공간까지 충분한 국소 접근이 있을 때라는 두 조건 관점을 제안한다.