확산 모델의 악성 과적합은 이중 하강 정점이 p~nm으로 밀려 파국적이다
Double Descent and Malign Overfitting in Diffusion Models
무엇인가
딥러닝의 통념은 과매개변수화가 무해하다는 것이다. 파라미터 수 p가 학습 샘플 수 n보다 커져도, 심지어 정규화 없이 학습 데이터를 정확히 보간(interpolation)해도 테스트 오차는 이중 하강(double descent) 곡선을 그리며 다시 낮아진다. 확산 모델도 예외로 보인다. 확산 모델의 학습은 각 노이즈 레벨에서 신경망이 예측한 스코어와 정답 사이의 이차 손실(denoising score matching)을 최소화하는 것으로, 결국 회귀 문제로 환원되기 때문이다. 그런데 실제로는 정반대가 관찰된다. 모델 용량을 키우면 생성 품질이 무너지고 모델이 학습 데이터를 그대로 재현하는 기억화(memorization) 영역으로 들어간다. 이 논문은 이 역설을 해결하는 것을 목표로 한다.
어떻게 동작하나
저자들은 두 갈래의 분석을 결합한다. 하나는 랜덤 특징 신경망(RFNN) 이론이다. s_A(x) = (A/√p) σ(Wx/√d) 형태의 2층 네트워크에서 첫 층 가중치 W는 가우시안으로 뽑아 고정하고, 둘째 층 A만 학습한다. 조정 가능한 파라미터 수는 pd다. 여기에 리지 페널티 (Δ_t λ / pd) ||A||_F²를 더한 DSM 손실의 경험적 위험 최소화 해를, d, n, p가 모두 무한대로 가면서 n/d → ψ_n, p/d → ψ_p, m = O(1)인 비례 극한에서 해석적으로 푼다. 핵심 도구는 가우시안 등가 원리(GEP)로, 비선형 특징 F = σ(WY/√d)를 처음 두 모멘트를 맞춘 선형 대체물 F^GEP = μ₁WY/√d + μ_*Ω로 바꿔준다. 여기서 상수 κ는 같은 샘플의 서로 다른 노이즈 복사본 사이 특징 상관을 담는다. 이를 통해 손실들을 확률 행렬의 유리 다항식으로 표현하고, 리졸벤트 G와 두 트레이스 T₁, T₂를 도입해 학습 손실, 테스트 손실, 경험적 테스트 손실, 그리고 편향-분산 분해를 닫힌 형태로 얻는다. 트레이스는 두 보조 질량변수 (q, r)에 대한 대수 방정식을 풀어 점근적으로 계산된다.
무엇과 다른가
다른 한 갈래는 실제 실험이다. CelebA 그레이스케일 이미지를 32×32로 다운샘플링해 n을 512에서 8192까지, DDPM 스타일 U-Net의 기본 폭 W를 2(약 29K 파라미터)에서 192(약 240M 파라미터)까지 바꿔가며 학습한다. 이 아키텍처에서 p는 W²에 비례한다. 각 이미지에 m개의 고정된 노이즈 실현을 배정해 총 n×m개의 얼린(frozen) 학습 쌍을 만들고, 확산 시간을 1000개 비균일 격자로 이산화한 뒤 Adam으로 최대 2M 스텝 동안 표준 DDPM MSE 손실을 최소화한다. 손실뿐 아니라 FID도 함께 추적한다.
어떻게 쓰나
결과의 핵심은 이중 하강이 존재하되 정점 위치가 다르다는 것이다. 테스트 손실 L_test는 모델 크기 p에 대해 먼저 최소값까지 내려가고, 학습 손실이 0에 가까워지는 보간 임계점에서 정점을 찍은 뒤 다시 내려간다. 그러나 그 정점은 표준 회귀의 p ~ n이 아니라 p ~ nm에 위치한다. 이는 pd개의 읽기 파라미터가 n×m개의 d차원 방정식과 맞아떨어지는 지점이다. 세 구간의 스케일링이 뚜렷하다. p < n에서는 테스트 손실이 p에만 의존하고 n, m과 무관하게 감소한다. n < p < nm에서는 오직 비율 p/n에만 의존하며 증가한다. 정점 높이와 그 이후의 평탄역(plateau)은 n과 무관하다. 중요한 것은 테스트 손실의 상승이 m과 무관하게 p ~ n에서 이미 시작된다는 점이다. U-Net에서도 n과 m이 커지면 정점이 더 큰 p로 이동하며, RFNN의 스케일링이 실험 범위 전반에서 대체로 재현된다. 다만 합성곱 구조의 가중치 공유와 n×m×d개 타깃 사이의 강한 상관 때문에 p와 유효 자유도가 분리되어, 이 관계가 일반적으로 성립한다고 보지는 않는다.
전제와 한계
역설의 해법은 편향-분산 분해에 있다. 작은 p에서는 테스트 손실이 순수한 편향이고, p가 커지면 편향이 줄고 분산이 쌓여 첫 최소값이 만들어진다. 보간 임계점 근처에서 분산이 발산해 정점을 만드는데, 이때 편향은 계속 줄어드는 대신 정점 이전부터 증가하기 시작한다. 정점을 지나면 분산은 고전적 지도학습처럼 감소하지만 편향은 계속 커져 큰 값에서 포화한다. 그 결과 테스트 손실은 첫 최소값보다 높은 평탄역에 머무르고, 확산 시간 t가 작을수록 이 평탄역이 더 높다. 이 악성 과적합의 원인은 학습의 암묵적 정규화가 작동하지 않는 것이 아니라, 잘못된 목표에 작동한다는 데 있다. 학습은 경험적 테스트 손실 L_test^emp, 즉 학습 샘플 중심의 가우시안 혼합에 대응하는 경험적 스코어와의 거리를 줄이는 쪽으로 모델을 밀어붙인다. 그 전역 최소화자는 학습 집합을 기억하는 경험적 스코어이며, n이 d에 대해 지수적으로 크지 않으면 참 스코어와 다르다. 즉 암묵적 정규화는 보간 해 중 가장 좋은 것을 고르지만, 그 잣대가 우리가 실제로 원하는 손실이 아니기 때문에 기억화가 일어난다. 큰 p에서의 잔여 편향은 모델 용량의 한계가 아니라 목적 함수 자체의 성질이며, 용량을 늘려도 메울 수 없다. m의 역할도 명확하다. m = 1은 표준 회귀에 해당하며 ψ_p = ψ_n에서 정점이 생기고 그 이후 테스트 손실이 비과매개변수 최소값 아래로 내려가는 무해한 과적합이다. m을 늘리면 임계점이 ψ_p = mψ_n으로 이동하고, m = 2에서 이미 악성으로 바뀐다. m → ∞ 극한에서는 이중 하강이 사라지고 비과매개변수 영역에 단일 최소값만 남는다. 실제 학습은 m이 매우 크므로(DDPM의 CIFAR-10, EDM의 ImageNet-64에서 m ≈ 2·10³) 정점이 매우 큰 모델 크기로 밀려나고, 우리가 실무에서 관찰하는 과적합은 정점에 이르는 상승 구간, 즉 이미 악성 과적합이 진행 중인 구간에 해당한다.
그렇다고 과매개변수화가 확산 모델에 해롭다는 뜻은 아니다. 정규화와 결합하면 유리하다. RFNN에서 각 p마다 리지 계수 λ를 최적화하면(곡선군의 하한 포락선) 테스트 손실이 ψ_p에 대해 단조 감소한다. 즉 최적으로 정규화된 큰 모델이 정규화되지 않은 어떤 작은 모델보다 낫다. U-Net에서는 명시적 정규화 대신 조기 종료가 같은 역할을 한다. 일반화 시간척도 τ_gen = O(1)과 기억화 시간척도 τ_mem = O(n) 사이의 창 τ_gen ≪ τ* ≪ τ_mem에서 멈추면, 테스트 손실은 보간 정점도 이중 하강도 사라지고 파라미터 수에 대해 단조 감소한다. 흥미롭게도 조기 종료 모델의 FID는 여전히 이중 하강을 보이는데, 저자들은 테스트 손실이 샘플 품질의 불완전한 대리 지표이기 때문이라고 추측하며 FID 자체로 조기 종료하면 사라질 것이라고 본다. 또한 n = 16384, W = 32로 학습한 조기 종료 U-Net에서 m이 커질수록 FID가 빠르게 감소하다 포화한다.
개발자 관점에서 이 논문이 주는 실무적 결론은 세 가지다. 첫째, 확산 모델에서 모델 크기를 키우는 것만으로는 성능이 좋아지지 않는다. p가 n을 넘는 순간부터 편향이 증가하기 시작하므로, 파라미터 수 대비 학습 데이터 수를 반드시 함께 봐야 한다. 둘째, 에폭 수 m이 크면 정점이 멀리 밀려나 문제가 가려질 뿐 사라지지 않는다. 학습 손실이 0에 가까워지는데 샘플이 학습 이미지를 닮아간다면 그것이 신호다. 셋째, 조기 종료나 가중치 감쇠 같은 정규화를 반드시 짝지어야 하며, 그렇게 하면 과매개변수화가 오히려 이득이 된다. 실무적으로는 검증 손실과 FID를 함께 모니터링하고, 일반화 시간척도와 기억화 시간척도 사이에서 멈추는 전략이 유효하다.
저자들이 밝힌 한계도 분명하다. RFNN과 U-Net은 보간 정점 높이의 n 의존성과 U-Net에서만 나타나는 편향 정점에서 차이를 보이며, 이 효과에서 특징 학습(feature learning)이 하는 역할은 향후 과제로 남겨져 있다. 실증 검증은 단일 데이터셋, 중간 규모의 샘플 수, 그리고 최신 모델보다 훨씬 작은 모델에 국한된다. 예측을 실제 규모에서 확인하는 것이 중요한 다음 단계라고 저자들은 명시한다. 또한 노이즈를 고정해 n×m 쌍만 제시하는 설정은 실제 절차의 이상화이며, m = 1과 m = ∞ 사이를 잇는 유한 m 분석이 이 논문의 핵심 기여라는 점도 함께 기억할 필요가 있다.