재구성 튜닝된 고차원 시각 특징 공간의 확산 어려움에 대한 해법은 x0-예측이다

On the Diffusibility of High-Dimensional Latents

arXiv2609.28473v1

Chao Feng2026-09-23조회 10

무엇인가

이 논문이 다루는 문제는 표현 오토인코더(RAE) 계열 생성 모델의 잠재 공간 선택이다. 기존 잠재 확산은 VAE 잠재에서 돌아갔지만, RAE는 DINOv2나 SigLIP2 같은 사전학습 의미 인코더의 특징 공간에서 확산을 수행하려 한다. 문제는 이런 인코더가 재구성용으로 학습된 것이 아니라서 텍스트, 미세 텍스처, 작은 객체 같은 고주파 정보를 버린다는 점이다. 저자들은 재구성 손실로 인코더를 파인튜닝하면 그 디테일이 돌아오지만, 그 대가로 표현의 유효 차원이 오히려 줄어들고 이렇게 변한 기하 구조가 생성 단계에 악영향을 준다고 보고한다. 실제로 단일 이미지 오버피팅 같은 단순한 테스트에서도 표준 v-예측 플로우 매칭이 느리게 수렴한다.

어떻게 동작하나

분석의 핵심 도구는 유효 차원이다. 저자들은 ImageNet에서 무작위로 뽑은 20만 개 패치에 대해 L2 정규화된 패치별 특징을 추출하고 평균을 뺀 뒤 SVD를 적용해 특이값을 구한다. 전체 에너지 E = Σσ_j², 상위 k개 성분의 누적 에너지 C(k) = Σ_{i=1..k} σ_i²/E 로 두고, 유효 차원을 R_τ = min{k | C(k) ≥ τ/100}로 정의한다(τ는 90, 95, 99로 평가). 그 결과 DINOv2와 SigLIP2는 전체 특징 차원 대비 유효 차원이 높게 유지되고, ImageNet만으로 사전학습된 DINOv1도 높다. 반면 재구성을 사전학습 목적으로 삼는 MAE는 Instagram-3B급 대규모 데이터로 학습해도 유효 차원이 훨씬 낮다. 재구성으로 파인튜닝한 DINOv2-L 역시 원본보다 유효 차원이 크게 낮아진다. 저자들의 해석은 이렇다. 재구성을 하려면 고주파 정보를 담아야 하고, 자연 이미지가 저차원 매니폴드에 있다는 가정 아래에서 특징이 그 저차원 분포를 흉내내게 된다는 것이다.

무엇과 다른가

이 기하 구조가 왜 v-예측을 망가뜨리는지는 선형 부분공간 모델로 설명된다. 관측 특징을 x0 = Q c0 (Q의 열들이 정규직교 기저, c0는 저차원 진짜 잠재)로 두면, 노이즈가 섞인 입력은 z_t^h = Q((1-t)c0 + t ε_l) + t ε_⊥ 로 분해된다. 여기서 ε_⊥ = (I - QQ^T)ε_h 는 매니폴드에 직교하는 성분이다. 이때 고차원 공간의 v-예측 목표는 v_θ^h(z_t^h,t) = Q v_θ^l(Q^T z_t^h, t) + (1/t)(I - QQ^T) z_t^h 로 갈라지는데, 두 번째 항이 바로 매니폴드 바깥의 직교 잡음 방향이다. h가 l보다 훨씬 크면 모델은 이 항에 상당한 용량을 배분해야 하고, 이것이 최적화 비효율과 표본 품질 저하로 이어진다. 반면 x0를 직접 예측하면 x_θ^h(z_t^h,t) = E[x0|z_t^h] = Q x_θ^l(z_t^l,t) 가 되어, Q c0가 t ε_⊥와 독립이기 때문에 직교 잡음 성분이 수식에서 사라진다. 저자들이 제안하는 변경은 이 하나다. 고차원 재구성 튜닝 특징 공간에서는 velocity 대신 clean representation, 즉 x0-예측을 쓴다.

어떻게 쓰나

구현은 다음과 같다. 손실은 L_Diff = E || (h_{i,0} - x_θ(h_{i,t}, t, y_i)) / t ||² 이고, 수치 불안정을 막기 위해 t를 최소 0.05로 클램프한다. 생성 아키텍처는 MetaQuery, BLIP3-o와 유사하게, 동결된 VLM(Qwen3-VL-2B-Instruct)을 자기회귀 모델로 쓰고 64개의 학습 가능한 쿼리 토큰으로 텍스트 조건을 뽑아 무작위 초기화된 DiT(Lumina-Next 1B, 24층, 층당 24개 어텐션 헤드, 히든 차원 1536)에 넣는다. AdamW 학습률 1e-4, 전역 배치 1024, BLIP-3o 공개 사전학습 데이터(전체 39.3M)의 34M 부분집합, 90k 스텝, 해상도 256×256, A100 64장 또는 H200 32장으로 학습했다. 시간 스케줄은 시프트를 적용해 t_m = α t_n / (1 + (α-1) t_n), α = sqrt(m/n), n = 4096으로 둔다. 토크나이저는 두 가지를 쓴다. 하나는 ImageNet으로 사전학습한 동결 MAE에 RAE의 ViT-XL 디코더를 붙인 것이고, 다른 하나는 ImageNet에서 재구성 학습 중 DINOv2-L 인코더를 언프리즈한 것으로, 붕괴를 막기 위해 의미 보존 손실 L_FT = ||g(I) - g'(I)||² + L_recon 을 함께 쓴다(디코더는 Stable Diffusion VAE와 유사한 구조).

전제와 한계

실험은 COCO-30k FID, GenEval, DPG-Bench로 평가하고 100스텝 오일러 샘플러를 사용한다. 파인튜닝한 DINOv2-L 토크나이저에 대해 네 가지 구성을 비교했는데, 원본 DINOv2-L + v-예측, 파인튜닝 DINOv2-L + v-예측, 파인튜닝 DINOv2-L + x0-예측, 그리고 1024차원을 32차원으로 줄이는 어댑터 + v-예측 저차원 변형이다. 재구성으로 파인튜닝한 뒤 표준 v-예측을 쓰면 GenEval, DPG-Bench, COCO-30k FID 세 지표 모두에서 성능이 떨어진다. 인코더를 언프리즈했으니 더 많은 정보를 담았을 텐데도 확산 모델이 그 특징을 제대로 디노이즈하지 못한다는 뜻이다. x0-예측으로 바꾸면 상대적으로 큰 폭으로 개선되며 원본 DINOv2의 v-예측 결과까지 넘어선다. 저차원 병목 변형은 GenEval과 DPG-Bench 같은 텍스트 정합 지표는 더 좋지만 FID 17.64로 이미지 품질을 잃었고, 병목 없는 고차원 x0-예측은 FID 16.80으로 더 나은 시각적 충실도를 보이면서 경쟁력 있는 정합성을 유지했다. MAE-RAE 토크나이저 실험에서도 x0-예측이 세 벤치마크 모두에서 v-예측을 앞선다. 정성적으로는 'a photo of a pink car' 같은 프롬프트에서 v-예측이 형체가 뭉개진 결과를 내는 반면 x0-예측은 구조적 일관성을 유지한다. 다만 원문에 제시된 표들은 본문에서 개별 수치가 모두 옮겨지지 않았고, 위에 적은 FID 17.64와 16.80 외의 세부 수치는 원문 텍스트에 명시되어 있지 않다. 확장 실험으로 90M 내부 데이터셋으로 학습한 뒤 BLIP3o-60k에서 256 해상도로 파인튜닝하고 512 해상도 변형도 추가했으며, Scale-RAE를 참조 기준으로 삼았다.

개발자 관점에서 이 논문의 실용적 메시지는 명확하다. 의미 인코더 특징을 확산 잠재로 쓰면서 재구성 품질을 올리려고 인코더를 파인튜닝했다면, 학습 목표를 v-예측에서 x0-예측으로 바꾸는 것만으로 수렴 속도와 생성 품질이 달라질 수 있다. 반대로 잠재를 32차원처럼 낮게 압축하는 설계는 텍스트 정합 지표는 올려도 FID로 대표되는 시각적 충실도를 깎는 트레이드오프가 있으니, 두 지표를 함께 보면서 결정해야 한다. 또한 인코더를 재구성용으로 튜닝하는 순간 특징 공간의 유효 차원이 변한다는 점을 전제로, 잠재 차원·시간 스케줄·디코더 구조를 함께 재검토하는 편이 안전하다.

한계와 전제는 저자들이 직접 밝힌 범위 안에서 다음과 같다. 별도 언급이 없으면 모든 실험은 256×256 해상도에서 수행됐다. 유효 차원 붕괴와 v-예측의 느린 수렴 사이의 관계는 저자들 스스로 상관관계로 표현하며, 인과관계를 증명한 것은 아니다. 재구성 튜닝이 생성에 여전히 중요하다는 점은 확인했지만, 사전학습 의미 인코더를 그대로 쓰는 것의 한계도 남아 있고, 저자들은 생성과 이해를 아우르는 통합 모델용 시각 인코더 설계를 향후 과제로 남긴다. 고차원 확산이 저차원보다 본질적으로 어렵다는 점, 그리고 저차원 병목이 정합성과 품질 사이의 상충을 만든다는 점도 논문이 인정하는 제약이다.

관련 논문