FuseReg는 인코더 층 융합을 무작위화해 재구성과 생성 격차를 줄이는 정규화다.

FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders

arXiv2609.31620v1

Hongyang Du2026-09-25조회 5

무엇인가

Representation autoencoder(RAE)는 사전학습된 비주얼 인코더의 특징을 재구성과 확산 모델의 잠재 공간으로 재사용한다. 문제는 인코더가 깊이에 따라 서로 다른 특징 계층을 내놓기 때문에, 어떤 층들을 합쳐 하나의 잠재 표현으로 쓸지 정해야 한다는 점이다. 얕은 층은 세밀한 픽셀 디테일을 잘 보존해 PSNR 같은 재구성 지표에 유리하고, 깊은 층은 의미 정보가 풍부해 생성 지표(gFID)에 유리하다. RAEv2는 마지막 k개 층을 단순 합하는 고정 휴리스틱을 쓴다. DINOv3-L 설정에서 k=7에서 k=23으로 늘리면 재구성 PSNR은 22.58dB에서 27.04dB로 오르지만, unguided gFID는 1.65에서 3.01로, guided gFID는 1.06에서 1.25로 나빠진다. 즉 픽셀 품질을 가장 잘 보존하는 융합이 생성하기 가장 쉬운 융합은 아니다. 디코더와 생성기는 서로 다른 예측 문제를 푸는데 하나의 고정된 층 조합이 두 단계를 묶어버리는 것이 이 논문이 말하는 재구성-생성 격차다.

어떻게 동작하나

FuseReg의 방법은 학습 중 인코더 층의 무작위 부분집합을 뽑아 정규화된 평균을 잠재로 쓰는 것이다. 각 학습 예제마다 Bernoulli(1-p) 마스크를 뽑고, 전부 0인 경우를 버린 뒤 마스크된 층 특징의 합을 마스크 합으로 나눠 z_m을 만든다. 정규화가 핵심인데, 기댓값이 전체 층 평균과 정확히 일치하기 때문에 p를 바꿔도 배포 시점의 잠재가 이동하지 않고 층 간 불일치 방향의 분산만 커진다. 이 샘플링을 두 단계에 따로 적용한다. 디코더는 부분집합 융합에서 픽셀을 복원하도록(p_dec), DiT는 부분집합 융합에 노이즈를 섞은 입력에서 전체 층 평균 z_full을 예측하도록(p_dit) 학습한다. 두 단계가 푸는 문제가 다르므로 드롭 비율을 별도로 둔다. 추론 시에는 기본적으로 모든 층을 유지해 전체 층 평균을 쓰고, 부분집합은 강건성 테스트에 쓴다.

무엇과 다른가

이론적 근거도 제시한다. Lemma 1에 따르면 정규화된 부분집합 융합은 평균을 보존하고, 그 분산은 c_K(p)V(x)가 된다. 여기서 V(x)는 층 편차의 공분산이고 c_K(p)는 (K-R)/(R(K-1))의 기댓값이다. 즉 무작위 샘플링은 층들이 공유하는 성분은 건드리지 않고 서로 불일치하는 방향만 흔든다. Proposition 1은 동차 선형 예측기와 제곱오차를 가정하면 디코더 손실에 c_K(p)·tr(DΓD^T) 항이, DiT 손실에 ρ(t)t²c_K(p)·tr(WΓW^T) 항이 더해진다는 것을 보인다. 층 불일치에 민감한 예측에 비용을 매기는 셈이다. Proposition 2는 무작위 부분집합 가중치의 2차 모멘트가 랭크 K인 반면, 입력과 무관한 결정론적 전역 융합의 2차 모멘트는 랭크가 최대 1이라 어떤 고정 융합도 두 모멘트를 동시에 맞출 수 없다는 것을 보인다. 휴리스틱 층 선택이나 학습 가능한 전역 게이트와 근본적으로 다르다는 뜻이다.

어떻게 쓰나

실험은 ImageNet-256, 동결된 DINOv3-L, 후보 층 K=23, 처음부터 학습한 ViT 디코더로 구성된다. PSNR·SSIM·rFID는 5만 장에서, gFID·IS는 클래스 조건부 DiT에서 50 오일러 스텝으로 뽑은 5만 샘플에서 측정한다. 고정 융합 디코더는 자기 학습 융합에서만 강하다. RAEv2 K=23 디코더는 학습 융합에서 27.04dB, rFID 0.18을 내지만 다른 융합에서는 12.51~14.31dB로 떨어진다. 반면 FuseReg 디코더 하나가 k=7, k=23, 단일 층 ℓ11에서 각각 23.77/27.52/25.13dB를 내고 rFID는 0.6 미만이다. 생성기를 고정한 교체 실험에서는 k=23 DiT의 잠재를 그대로 두고 디코더만 바꿔 unguided gFID가 3.01에서 2.21로, k=7 융합에서는 27.73에서 1.92로, guided는 16.35에서 1.42로 줄어든다. 다만 곡선은 단조롭지 않아 k=23에서 guided gFID는 중간 비율에서 1.49까지 잠시 나빠졌다가 p_dec=0.95에서 1.25로 돌아온다. DiT-Base 공동 정규화에서는 베이스라인 gFID 13.96에서 디코더만(0.9, 0) 12.96, 생성기만(0, 0.7) 12.09, 둘 다(0.9, 0.7) 9.93으로 약 29% 개선되며, 두 축의 개별 이득을 더한 것보다 크다. 더 강한 DiT-XL(베이스라인 2.91)에서는 생성기 단독 정규화가 gFID 개선을 내지 못하고 디코더와 함께할 때만 추가 이득이 나온다. p_dit=0일 때 p_dec=0.05에서 gFID가 17.28로 잠시 나빠지는 비단조 구간도 있고, p_dit≥0.5이면 이런 동역학이 안정된다.

전제와 한계

개발자 관점에서 이 논문의 실무적 가치는 인코더를 전혀 건드리지 않고, 아키텍처 변경이나 추가 연산 없이 다운스트림 두 단계의 학습 방식만 바꾼다는 점이다. 재구성 품질과 생성 품질이 서로 다른 층을 원한다는 진단은 RAE 기반 파이프라인에서 흔히 겪는 문제이고, 디코더 하나를 여러 융합 설정에 재학습 없이 쓸 수 있다는 건 배포 시 층 구성을 바꿔가며 실험할 여지를 준다. 다만 p_dec와 p_dit는 모델 스케일, 평가 지표, 가이던스 사용 여부에 따라 최적값이 달라지므로 반드시 함께 튜닝해야 한다. 특히 내부 가이던스는 full 예측과 REPA 예측의 차이에 가이던스 강도를 곱하는 구조라, 한쪽 예측의 층 불일치 민감도를 낮추는 것만으로 가이드 조합 전체의 민감도가 결정되지 않는다는 점을 확인해야 한다.

저자들이 밝힌 한계는 분명하다. 실험이 ImageNet-256, 동결 DINOv3-L, DiT-Base와 DiT-XL, 동일 학습 예산에 한정되어 있어 다른 인코더 계층, 해상도, 데이터 도메인, 더 긴 학습 스케줄로의 전이는 추가 검증이 필요하다. 이론의 샘플링 항등식과 결정론적 전역 융합과의 2차 분리는 명시된 부분집합 분포에 대해 정확하지만, 손실 분해는 동차 선형 예측기와 제곱오차를 가정한 근사이며 비선형 모델에서의 재구성·생성 이득은 경험적으로만 확인되었다. 혼합 재구성 손실과 전체 가이드 샘플링 궤적으로의 확장은 열린 문제로 남는다.