블랙박스 생성 AI의 속성 분포를 목표에 맞추는 후처리 알고리즘
Statistical attribute alignment for black-box generative AI via output post-processing
무엇인가
이 논문은 생성 AI가 내놓는 출력의 범주형 속성 분포를 사용자가 지정한 목표 분포에 맞추는 문제를 다룬다. 저자들은 이를 통계적 속성 정렬(statistical attribute alignment, SAA)이라 부른다. 예를 들어 '의사 이미지 생성'에서 성별·인종·연령 같은 보호 속성이 원하는 비율로 나오게 하거나, 합성 데이터가 특정 모집단 구성을 대표하도록 만드는 작업이다. 중요한 전제는 블랙박스 접근이다. 모델 가중치를 받을 수 없고 웹 인터페이스나 API로 반복 질의만 할 수 있는 상황을 가정하며, 속성이 생성되는 원래 확률인 소스 레이트(source rates)도 모른다고 본다. 따라서 재학습이나 파인튜닝 없이, 그리고 소스 레이트를 몰라도 동작하는 후처리 알고리즘이 목표다.
어떻게 동작하나
형식화는 이렇다. 프롬프트 x에 대해 모델 P(·|x)가 출력 y를 내고, 주석자 φ가 y를 k개의 속성 클래스로 사상한다. 소스 레이트 p_i는 φ(Y)=i일 확률이며 사용자에게 알려지지 않는다. 목표는 속성 시퀀스 공간 위의 결합 법칙 ν이고, ν가 곱 법칙일 때 목표 레이트는 q다. 알고리즘은 모델 질의(M-샘플)와 모델을 부르지 않는 추가 무작위화(E-샘플)를 섞어 쓸 수 있으며, 비용은 모델 호출의 기댓값인 M-cost로 측정한다. 즉 목표 법칙을 정확히 또는 지정한 수준으로 근사하면서 M-cost를 최소화하는 소스 레이트 프리 알고리즘을 찾는 것이 목표다.
무엇과 다른가
정확 정렬을 위한 방법이 RDC(random demand coupon collector)다. 먼저 목표 결합 법칙 ν에서 속성 시퀀스를 하나 뽑고, 그 시퀀스가 지금까지 관측한 속성 개수로 실현 가능해질 때까지(즉 시퀀스가 Ω_t에 들어올 때까지) 모델을 계속 호출한다. 논문은 RDC가 소스 레이트를 쓰지 않으면서 거의 확실히 종료하고 보편적으로 정확(universally exact)하다는 것을 보인다(정리 5). m=1일 때는 RDC가 모든 소스 레이트에서 점별 최적이며 비용이 Σ ν_i/p_i다(정리 6). 일반 m에서는 RDC가 최적은 아니지만, 보편적 하한에 O(√m) 항을 더한 값을 넘지 않아 m이 커질수록 1차 최적이 된다(정리 7). 다만 희귀 속성이 있으면 어떤 정확 알고리즘도 max_i (Σ_j ν_j(i))/p_i 이상의 호출을 요구한다(정리 8).
어떻게 쓰나
정확 정렬은 희귀 속성 때문에 호출 비용이 폭발할 수 있어, 저자들은 근사 정렬로 완화한다. 통계적 정렬 불일치(statistical alignment discrepancy)를 목표 분포와의 통계적 거리로 정의하고, RDC의 변형인 TA-RDC(thresholded anytime RDC)가 사용자가 지정한 임의의 불일치 수준을 소스 레이트 없이 달성함을 보인다. 목표가 곱 법칙이고 불일치를 forward KL로 잴 때 TA-RDC는 같은 불일치 제약 아래에서 1차 최적이다. 또 합성 데이터 증강에서는 하나의 생성 데이터셋에서 표본을 골라야 하므로 전체 평균 정렬이 좋아도 개별 데이터셋의 정렬은 나쁠 수 있다는 문제를 지적하고, 관측된 속성 개수가 주어졌을 때의 불일치를 재는 count-conditional 기준과 이를 모든 실현 개수 벡터에 대해 최소화하는 CA-RDC를 제안한다. 이 기준은 통계적 정렬 불일치의 상한을 준다.
전제와 한계
실험은 텍스트-이미지 생성(HiDream-O1-Image, Qwen-Image-2512, Flux-2-dev)과 GPT-5.5 기반 텍스트 생성에서 이뤄졌다. 단체 사진 생성 실험에서 HiDream의 TSI 프롬프트는 on-support rate가 0.028에 그쳤고, 인구통계 하드 프롬프트(HPS)를 써도 0.624로 오르는 데 그쳤으며 준수율은 0.219였다. 즉 입력 프롬프트만으로는 집단 구성 지시를 따르기 어렵다. 후처리를 붙이면 CA-RDC는 상한 예산 n=1000에서 실현 가능 실행의 KL 불일치 3.6×10⁻⁴를 정규화 M-cost 11.85로 달성했고, TA-RDC는 M-cost 11.97에서 8.2×10⁻⁴를 기록했다. 비실현 확률은 n=100에서 0.0043, n=200에서는 10⁻²⁷ 미만으로 떨어졌다.
두 번째 과제는 GPT-5.5로 환자 페르소나를 만드는 합성 데이터 생성이다. 감사 속성은 생성된 ZIP 코드의 CDC 2022 Social Vulnerability Index(SVI) 사분위이며, 네 개 유효 사분위에 균등 분포를 목표로 두고 m=50개 페르소나를 반환한다. 하드 SVI 프롬프팅의 준수율은 0.356에 불과했고, 직접 샘플링하면 고주거비 부담 페르소나 비율이 0.60이었는데 RDC와 anytime RDC 계열은 0.35~0.41로 낮아졌다. 이는 목표 속성을 맞추면 상관된 보조 특성의 분포도 함께 바뀐다는 뜻이다. 카운티 시드 프롬프팅은 1000개 중 18개가 SVI 사분위에 매칭되지 않았다. 하드 SVI 프롬프팅에서는 KL 불일치 0.05 미만을 얻는 데 정규화 M-cost가 약 12 필요했지만, 카운티 시드 프롬프팅에서는 TA-RDC가 1.02로 비슷한 수준에 도달했다. CA-RDC는 n=70에서 실현 가능 실행 KL 불일치 0.013, 비실현 확률 3.8×10⁻²⁰을 기록했다.
개발자 관점에서 이 논문이 주는 실무적 의미는 분명하다. 가중치를 받을 수 없는 API 모델을 쓰면서 출력의 인구통계·라벨 분포를 특정 목표에 맞춰야 하는 경우, 프롬프트 엔지니어링만으로는 부족할 수 있고(하드 프롬프트 준수율 0.219~0.356), 출력 후처리로 분포를 교정할 수 있다. 이미 다른 목표로 정렬된 모델을 새 응용에 맞게 재조정할 때 재학습이 필요 없다는 점도 실용적이다. 다만 속성을 판정하는 주석자 φ가 필요하고, M-cost가 소스 레이트에 의존하므로 실제 배포 전에 목표 속성의 희귀도와 호출 예산을 함께 확인해야 한다. 또한 목표 속성을 맞추면 상관된 보조 특성 분포가 함께 움직인다는 점을 검증해야 한다.
저자들이 밝힌 한계와 전제도 분명하다. 정확 정렬은 지원 조건 supp(ν) ⊆ (supp(p))^m을 요구하고, 희귀 속성이 있으면 호출 수가 커진다. RDC는 일반 m에서 점별 최적이 아니며, TA-RDC도 전체 심플렉스에서 admissible하지 않을 수 있다. 주석자가 노이즈가 있는 경우에는 혼동률 행렬 C를 알고 있다고 가정하고, D_f(Cu‖q)를 최소화하는 프록시 목표 레이트 u*를 구해 사용한다. q ∈ CΔ^{k-1}이면 정확 샘플링이 가능하지만 그렇지 않으면 도달 가능한 가장 가까운 곱 법칙으로 근사한다. 또한 어떤 보호 속성을 어떤 목표 분포로 둘지는 응용마다 다르며, 논문은 특정 선택이 더 낫다고 주장하지 않는다.