판별적 표현 기하를 함께 학습해 드리프팅 모델의 원스텝 생성을 개선한다
Learning Discriminative Geometry for Drifting Models
무엇인가
드리프팅 모델(Drifting Models)은 반복적인 분포 정제를 추론이 아니라 학습 단계로 옮겨, 학습이 끝나면 단 한 번의 추론으로 샘플을 만든다. 문제는 복잡한 이미지 데이터셋에서의 성능이 드리프팅 장(field)을 구성하는 표현 공간에 크게 좌우된다는 점이다. 픽셀 공간에서 직접 장을 만들면 샘플 품질이 나쁘고, 사전학습 특징 공간을 쓰면 크게 좋아지는데 그 이유는 설명되지 않았다. 이 논문은 그 격차를 표현의 판별적 기하(discriminative geometry)에서 찾는다. 표현이 유도하는 거리와 국소 이웃이 커널 가중치를 정하고, 그 가중치가 국소 밀도 추정과 드리프트 방향을 결정한다. 고정된 픽셀 기하에서는 배치 KDE 밀도비 추정이 실제 샘플과 생성 샘플을 잘 구분하지 못해 생성기에 주는 감독 신호가 빈약해진다는 것이 저자들의 진단이다.
어떻게 동작하나
제안 방법의 핵심은 지속적 표현 학습(persistent representation learning)이다. 인코더 E_φ를 생성기와 함께 학습하되 배치를 넘어 파라미터를 유지한다. 처음부터 학습하는 설정에서는 E_φ(x) = x + R_φ(x) 형태로 픽셀 차원을 보존하고, R_φ는 경량 확장 잔차 네트워크(DRN) 변형으로 구현해 항등 사상으로 초기화한다. 학습 절차는 교대 방식이다. 생성기 업데이트 전에 실제 배치와 생성 배치(생성 샘플은 stop-gradient)로 K번 인코더를 갱신하는데, 목적함수는 표현 공간의 KDE 로그 밀도비 점수 s(x) = log p̂(E_φ(x)) − log q̂(E_φ(x))를 로짓으로 쓰는 이진 교차엔트로피다. 클래스 사전확률이 같으므로 사후확률이 시그모이드(s)로 표현되고, 별도의 스칼라 헤드 없이 KDE 계산을 통해 그래디언트가 인코더로 흐른다. 이후 φ를 고정하고 새 배치로 특징 공간 드리프트를 다시 구성해 생성기를 회귀시킨다. 인코더는 드리프팅용 표현 공간만 정의하고, 생성기는 계속 픽셀을 출력한다.
무엇과 다른가
이론적 연결도 제시한다. 제안 1에 따르면 조건이 맞을 때 KDE 비율 손실과 드리프트 회귀 손실의 현재 스텝 그래디언트가 동일하며, 그 값은 −(2/B) Σ J_G(z_i)^T J_E(x̂_i)^T V̂_φ(u_i)다. 즉 실제/생성을 구분하는 데 쓰는 KDE 점수가 클리핑 없는 드리프팅에서 생성기 감독을 그대로 공급한다. 또 가우시안 커널에서 V̂_φ(u) = (τ/2)∇_u ℓ_φ(u)이므로, 로그 밀도비의 국소 기울기 크기가 드리프트 속도를 상한 지른다. 저자들은 이 관계에서 속도 클리핑을 도출한다. V̂_clip(u) = V̂_φ(u) / max(1, ‖V̂_φ(u)‖/V_max)로 방향은 유지하고 크기만 V_max 이하로 제한한다.
어떻게 쓰나
실험은 DriftXpress를 따라 U-Net 생성기를 쓰고 SVHN, CIFAR-10, CIFAR-100에서 수행했으며 5만 장 생성 기준 FID와 IS를 보고한다. 통제된 장난감 실험은 2차원 의미 공간의 가우시안 모드 8개에 잡음 차원 30개를 붙인 설정으로, 학습된 표현이 원시 공간보다 목표 모드 주변에서 일관된 드리프트 장을 만들고 의미 좌표 2개만으로 계산한 참조 장과의 코사인 정렬도 훨씬 높았다. CIFAR-10에서는 원시 픽셀, 동결된 MoCo-v2 인코더, 그 인코더의 마지막 잔차 블록을 지속적 표현 학습으로 적응시킨 세 가지를 비교했는데, 픽셀 공간은 KDE 밀도비 정확도가 찬스 수준에 머물렀고 동결 MoCo-v2는 FID와 판별 성능을 함께 개선했으며 마지막 블록 적응이 그보다 더 나았다. 본 벤치마크에서 제안 방법은 세 데이터셋 모두에서 표준(픽셀 공간) 드리프팅을 앞섰고 SNGAN보다도 좋았으며, 사전학습 인코더 없이 FID를 약 82~95% 줄였다고 보고한다. 다만 표 1과 그림 4에 담긴 데이터셋별 구체적 FID·IS 절대값은 제공된 원문 발췌에는 제시되지 않았고, 상대적 개선폭과 5만 장 평가 조건만 확인된다.
전제와 한계
절제 실험은 두 갈래다. CIFAR-10 1만 스텝 내에서 지속성을 어디에 둘지 비교했는데, 표현에 지속성을 주면 성능이 크게 오르지만 스칼라 크리틱에 지속성을 주면 오히려 뚜렷하게 나빠졌다. 립시츠 규제는 인코더의 모든 합성곱에 스펙트럴 정규화를 거는 방식과 드리프트 속도를 직접 자르는 방식으로 나눠 비교했고, 전자는 제약 없는 모델보다 성능을 떨어뜨린 반면 후자는 평가한 모든 예산에서 두 지표를 개선했으며 V_max = 0.005가 가장 좋았다. 표 3은 지속적 표현이 개선의 주된 몫을 차지하고 속도 클리핑이 추가 이득을 준다고 정리한다.
개발자 관점에서 이 논문은 원스텝 생성 파이프라인에서 표현 공간을 고정 자산이 아니라 학습 대상으로 다루라는 지침에 가깝다. 사전학습 인코더가 없는 상황에서도 픽셀 차원을 유지하는 잔차 인코더를 생성기와 교대 학습하면 드리프팅 감독 신호를 살릴 수 있다는 것이 핵심이며, 구현 시에는 인코더 업데이트 횟수 K, 커널 대역폭 τ, 속도 예산 V_max 세 하이퍼파라미터를 우선 확인해야 한다. 특히 V_max는 표현이 학습되면서 드리프트 크기가 요동칠 때 학습을 붙잡아 주는 값으로, 논문은 인코더에 스펙트럴 정규화를 거는 대신 속도를 직접 자르는 쪽을 권한다. KDE 비율 손실과 드리프트 회귀 손실이 같은 그래디언트를 준다는 명제 덕분에, 기존 드리프팅 학습 루프에 인코더 학습 단계를 끼워 넣는 형태로 이식하기도 쉽다.
한계도 분명하다. 저자들은 그래디언트 동등성이 모든 표현이 픽셀보다 낫다는 뜻도, 배치 판별이 강할수록 생성 품질이 보장된다는 뜻도 아니라고 명시한다. 실험 규모도 SVHN과 CIFAR-10/100, U-Net 조합에 머물러 있으며, Deng 등의 대규모 결과를 재현하는 것이 목적이 아니라고 밝힌다. 사전학습 특징 없이 처음부터 학습하는 문제는 선행 연구에서 미해결로 남아 있던 것으로, 이 논문이 그 방향의 한 걸음을 제시하는 수준이다. 윤리 진술에서는 생성 모델 개선 기법이라는 점에서 오용 가능성과 데이터·사전학습 모델의 편향 및 프라이버시 위험을 물려받을 수 있다고 언급한다.