iADD가 확산 모델 보상 미세조정에서 정렬과 다양성을 함께 높인다

iADD: Improving Alignment and Diversity in Diffusion Policy Optimization

HF Daily2610.01789

Ashok Prasad Neupane, Saugat Adhikari, Pramish Paudel2026-10-01

무엇인가

확산 모델은 이미지·비디오·3D 생성의 표준이지만, 학습 데이터에 드문 클래스나 사용자가 요구하는 특수 제약에서는 생성 품질이 떨어진다. 추가 데이터 없이 보상 함수만으로 사후학습하는 DDPO 같은 강화학습 기법이 대안으로 떠올랐지만, 순진한 정책 최적화는 모드 붕괴와 전반적 품질 저하를 부른다. 이 논문이 다루는 문제는 정렬(alignment)을 올리면서 다양성(diversity)과 화질을 얼마나 덜 잃는가, 즉 정렬-다양성 트레이드오프다. 저자들은 선호 데이터가 없는 상황에서 이 트레이드오프를 일반적이고 이론적으로 다룬 연구가 부족하다고 지적한다. 기존 접근은 후반 타임스텝만 갱신하거나(B2-DiffuRL), KL 발산으로 정규화하거나(DPOK), 중간 타임스텝을 다듬는 식이었는데, 타임스텝 선택 자체를 이론적으로 정당화한 사례는 없었다는 것이 이들의 출발점이다.

어떻게 동작하나

이론 부분의 핵심은 두 명제다. 명제 1(Generative Reach)은 고정된 갱신 예산 N개 타임스텝에 대해 균일 샘플링이 후반부만 고르는 전략보다 최종 출력의 총 섭동 크기 ‖δx0‖를 더 크게 만든다고 주장한다. 즉 후반 타임스텝만 갱신하라는 기존 결론과 반대로, 이른 타임스텝이 더 큰 지렛대를 가진다. 명제 2(Volume Preservation via Temporal Sparsity)는 전체 타임스텝을 갱신하는 것보다 일부만 희소하게 갱신하는 편이 전역 야코비안의 로그-행렬식으로 측정한 사전 분포의 확률 부피를 더 잘 보존한다고 말한다. 저자들은 이를 모델 용량 관점에서 해석한다. 서로 다른 타임스텝이 이미지 매니폴드의 겹치지 않는 스펙트럼 성분을 담당하므로, 전체 갱신은 RL 옵티마이저의 자유도를 과도하게 늘려 보상만 만족하는 퇴화 해를 찾기 쉬워진다는 것이다. 이 두 결과를 합치면 최적의 커리큘럼이 도출된다. 처음에는 이른 고지렛대 타임스텝의 희소 부분집합만 갱신해 전역 모드를 발견하고, 분포가 안정된 뒤에 갱신 집합 크기를 늘려 국소 디테일을 다듬는 방식이다.

무엇과 다른가

방법 iADD는 여기에 두 번째 축을 더한다. 종말 보상만 쓰는 정책 최적화의 표본 비효율을 줄이기 위해, Feynman-Kac 이론을 학습 시점에 이식한다. 각 경로에 비음수 포텐셜 G_t를 부여해 가중치 w(τ)=∏G_t(x_t,c)를 만들고, 이를 경로 분포에 재가중한다. 구현에서는 x_T에서 시작해 역확산 전이를 분기시켜 부분 궤적 트리를 만들고, 각 분기를 끝까지 완성해 종말 보상을 평가한 뒤 보상이 낮을 것 같은 분기는 가지치기하고 유망한 분기는 복제한다. 이미지 실험 설정은 프롬프트당 입자 k=4개, 5 디노이징 스텝마다 리샘플링, FK 스케일 λ_FK=2.0이다. 타임스텝 커리큘럼은 T_sch={5,10,15,20}의 네 단계로 갱신 타임스텝 수를 점진적으로 늘리며, 각 단계는 10 이터레이션이다.

어떻게 쓰나

실험은 Stable Diffusion v1.4를 UNet LoRA로만 미세조정하고 DDIM 샘플러 T=20, classifier-free guidance w=5.0을 쓴다. 태스크는 세 가지다. 이미지 생성은 동물과 행동의 조합 생성, 색-사물 속성 결합, 공간 관계로 구성되고 "a whale riding a bike", "brown banana", "a cup on tshirt" 같은 프롬프트를 쓴다. 소실점 보정은 "railway tracks" 같은 원근 프롬프트에서 LSD로 선분을 검출하고 소실점 수렴도를 보상(VP Geometry)으로 삼는다. 3D 실내 장면 합성은 MiDiffusion의 연속 도메인 변형과 3D-FRONT 데이터셋을 쓰고, "TV stand facing bed" 공간 보상과 충돌 보상을 각각 최적화한다. 비교 대상은 사전학습 모델, DDPO, B2-DiffuRL, 그리고 추론 시점 기법 AIG, DanceGRPO, BranchGRPO다.

전제와 한계

수치로 확인되는 결과는 다음과 같다. iADD의 FK 기반 증분 커리큘럼을 GRPO식 그룹 상대 이점 정규화와 결합한 iADD+GRPO는 CLIPScore를 DanceGRPO의 0.3886에서 0.4126으로 올리고, 희귀 조건 성공률(Rarity)을 61.67%에서 88.33%로 끌어올리며 LPIPS도 개선한다. 희귀도는 사전학습 참조 분포 보상의 75퍼센타일을 임계값 η로 고정하는데, 이미지 생성은 η=0.34, 소실점 보정은 η=0.64다. 절제 실험에서는 동일 연산량(스테이지 27)에서 희소 갱신이 전체 갱신보다 전체 생성기 로그-부피를 1605 nat 개선했고(−25,963 대 −27,568), 24개 프롬프트-시드 쌍의 짝지은 차이에 대한 표준오차는 437(3.7 표준오차)이었다. 분기와 후반 N개 갱신을 단순 조합하거나 FK만 쓰는 경우 Inception Score 개선은 약 0.016에 그친 반면, 증분 FK-분기 조합은 그보다 훨씬 큰 향상을 냈다. 3D에서는 같은 공간 보상 목표에서 DDPO와 B2-DiffuRL이 충돌률을 더 많이 올렸고 iADD는 더 낮게 유지했다. 사람 평가는 30개 프롬프트에 대해 40명 평가자가 블라인드로 비교해 총 4,800건의 판단을 모았고, iADD가 DDPO와 B2-DiffuRL보다 자주 선호됐다. 정량 평가는 45개 기본 프롬프트에서 체크포인트마다 1,080장을 결정론적 시드로 생성해 측정했다.

개발자 관점에서 이 논문의 실용적 메시지는 두 가지다. 첫째, 보상 기반 확산 모델 파인튜닝에서 "후반 타임스텝만 건드린다"는 통념은 다양성 보존에 불리할 수 있으므로, 갱신 타임스텝을 희소하게 유지하되 이른 시점부터 점진적으로 확장하는 스케줄을 시도할 가치가 있다. 둘째, 종말 보상만으로 학습하는 대신 학습 중 경로를 분기·가지치기해 중간 신호를 만들면 표본 효율과 희귀 조건 성공률을 함께 올릴 수 있다. 다만 이득은 CLIPScore 같은 보상 모델과 Inception Score·LPIPS 같은 다양성 지표를 함께 로깅해야 확인되며, 보상만 모니터링하면 논문이 지적한 리워드 해킹을 놓치기 쉽다. 코드와 프로젝트 페이지가 공개돼 있어 재현도 가능하다.

한계와 전제는 저자들이 직접 밝힌다. 명제 1의 증명에 쓰인 1차 민감도는 타임스텝 의존성을 드러내기 위한 편의적 도구이며, 비교 결론은 확산 스케줄 아래에서 이른 고지렛대 타임스텝의 립시츠 민감도가 더 크다는 조건에 의존한다. 따라서 이 결과들은 정확한 학습 시점의 한계값이 아니라 비교적 예측을 세우는 것이고, 비선형 미세조정 동역학 아래에서의 검증은 실험 5.5절에 맡긴다. 또한 실험은 이미지 생성, 소실점 보정, 3D 장면 합성이라는 세 태스크에 한정되며, 보상 함수가 주어져 있고 선호 데이터가 없는 상황을 전제한다.