APO는 데이터 부족한 LLM 개인화에서 선호 충돌을 클러스터링으로 줄인다

Collaborative Personalized Preference Alignment for LLMs under Data Deficiency

HF Daily2610.05898

Liyan Yang, Yige Yuan, Zhiqin Yang2026-10-05

무엇인가

LLM 응답에 대한 사용자 선호는 문화·경험·가치관에 따라 이질적이고, helpfulness·harmlessness·humor 같은 여러 목표 사이의 절충을 요구한다. 플러그앤플레이 aligner를 개인화하면 되지만 사용자별 선호 피드백이 희소해 처음부터 학습하기 어렵다. 개인화 연합학습은 클라이언트들이 공유 초기화를 함께 학습하고 소량의 로컬 예시로 적응하는 대안이지만, 두 층위의 그래디언트 충돌이 걸린다. 클라이언트 간에는 이질적 선호 때문에 한쪽에 이로운 업데이트가 집계 과정에서 다른 쪽을 방해하고, 클라이언트 내부에서는 목표별 그래디언트가 서로 반대를 가리킨다. 논문은 이 두 충돌을 동시에 다루면서 few-shot 적응이 가능한 초기화를 협력적으로 학습하는 방법을 중심 질문으로 삼는다.

어떻게 동작하나

제안 방법 APO(Approximate Pareto Optimality)는 클라이언트 클러스터마다 하나의 초기화를 학습한다. 첫 단계는 Bottleneck-Adjustment Clustering이다. 기준 상태 w_ref에서 각 클라이언트가 자신의 가중 손실 λ_i^(j)·l_i^(j)(w_ref)를 계산해 내림차순 정렬 순열 Γ를 만들고, 순열이 같은 클라이언트를 1차 클러스터로 묶는다. 병목 목표의 순서가 다르면 집계 방향이 서로를 상쇄할 수 있기 때문이다. 2차로는 조정 벡터 A_i를 기준으로 계층적 클러스터링을 적용해 클러스터 수를 예산 b개로 자른다(Fed-ChatbotPA에서 b=4, UltraFeedback에서 b=8). A_i의 j번째 성분은 λ_i^(j)(log(l̂_i^(j)/(1/m)) − β_i(l))이며, β_i는 선호 가중·정규화된 손실 분포가 균등분포에서 얼마나 벗어났는지를 재는 KL divergence다. 즉 A_i는 선호 균형도(Preference Uniformity)를 가장 빠르게 키우는 방향이고, −A_i 방향으로 가면 클라이언트가 원하는 λ_i^(−1) 광선에 가까워진다. 클러스터 내 방향 분산 H_Cn(w)=Σρ_i‖d_i−d̄_Cn‖²를 줄이는 것이 이 클러스터링의 목적이다.

무엇과 다른가

클러스터 안에서는 두 단계로 초기화를 만든다. Phase I은 EPO에서 착안해 선호 그래디언트 하강과 통제된 상승(controlled ascent)을 결합한다. 선호 균형이 아직 안 맞은 클라이언트(β_i>0)는 balancing descent를, 이미 맞은 클라이언트(β_i=0)는 uniform descent를 쓴다. 구체적으로 μ_i∈S^m에 대한 선형계획을 풀어 μ_i^T G_i^T G_i(A_i·1_βi + 1·(1−1_βi))를 최대화하되, 비병목 목표는 balancing 방향 이상 악화되지 않게(제약 4b), 병목 목표는 아예 악화되지 않게(제약 4c) 강제한다. Phase II는 Per-FedAvg류의 적응 인지 메타학습으로, S-shot 에피소드에 K스텝 적응이 가능하도록 초기화를 반복 정제한다. 새 클라이언트는 자신의 조정 벡터로 클러스터를 배정받아 해당 초기화에서 few-shot 적응만 수행한다.

어떻게 쓰나

이론적으로 저자들은 세 가지를 보인다. Theorem 3.2는 γ_i* > Δ_i‖d_bal,i‖ + L0·B²·τη 조건이 성립하면 클러스터의 공유 방향이 모든 클라이언트에게 동시에 balancing 방향이 되어 선호 균형도가 감소한다는 것을 보인다. Theorem 3.3은 descent-margin 조건(Assumption H.19) 아래 ψ_i(w^T) − ψ_i* ≤ (1−ηc_d)^(T−t0)(ψ_i(w^t0) − ψ_i*) + ε_0,i 형태의 수축을 주며, 반경 ε_0,i = (‖λ_i‖∞/c_d)(B·Δ̄_i + L0B²η/2) + b_i/c_d가 지평선과 무관하게 고정된다는 점을 보인다. Theorem 3.4는 데이터 부족으로 인한 few-shot 적응 갭 δ_0 = (1−αμ_PL·p_-)^K·Δ_0 + (L0·α·p_+²/(2μ_PL·p_-))·(σ_0²/S)를 유도한다. 초기화 오차 Δ_0가 이후 확률적 적응에 어떻게 전파되는지를 정량화한 셈이다.

전제와 한계

실험은 Fed-ChatbotPA(helpfulness, safety)와 UltraFeedback(helpfulness, honesty, truthfulness)에서 Llama-3.2-3B-Instruct와 Qwen2.5-3B-Instruct를 쓰고, ArmoRM-Llama3-8B-v0.1로 채점해 선호 가중 정규화 점수·hypervolume(HV)·inverted generational distance(IGD)를 측정했다. 지원 샘플은 20개뿐이다. 비교 대상은 Base model, RIC, Rewarded Soup, FSPO, DITTO, FedAvg 여섯 가지다. 24개 모델–데이터셋–클러스터 조합 중 APO가 23개에서 최고 Score, 22개에서 최고 또는 동률 HV, 21개에서 최저 또는 동률 IGD를 기록했다. 최강 베이스라인 대비 평균 Score/HV/IGD는 Fed-ChatbotPA+Llama에서 0.78/0.61/0.08 → 0.83/0.63/0.08, UltraFeedback+Llama에서 0.74/0.41/0.12 → 0.79/0.48/0.06, Qwen의 Fed-ChatbotPA에서 0.76/0.56/0.08 → 0.78/0.59/0.06, Qwen의 UltraFeedback에서 0.61/0.26/0.17 → 0.67/0.36/0.05로 바뀌었다. Llama+Fed-ChatbotPA의 IGD 동률이 평균 수준에서 유일하게 엄격한 개선이 아닌 항목이다. 같은 초기화 학습 단계를 공유하는 FedAvg와 비교해도 네 가지 모델–데이터셋 설정 모두에서 세 지표가 개선됐다. 통신 라운드를 바꾼 절제 실험에서는 56개 클러스터–라운드 비교 중 52개가 양수, 1개가 0, 3개가 음수였고 음수 편차는 −1.0pp를 넘지 않았다. 평균 이득은 UltraFeedback +1.8pp, Fed-ChatbotPA +3.3pp이며 라운드 170의 C4에서 +5.3pp, 라운드 200의 C0에서 +8.4pp까지 나왔다. 클러스터링 기준을 원시 선호 벡터에 대한 계층적 클러스터링으로 바꾼 절제에서는 BAC가 8개 클러스터 중 6개에서 평균 점수가 높았고 전체 평균이 0.70에서 0.72, 최고 점수가 0.77에서 0.79로 올랐다(C6·C7에서 각 +0.07). 다만 C0와 C2에서는 계층적 클러스터링이 더 좋았다.

실무적으로 이 논문은 사용자당 선호 피드백이 수십 개 수준인 개인화 서빙에서 참고할 만하다. 핵심 시사점은 두 가지다. 첫째, 사용자 임베딩이나 원시 선호 벡터로 묶는 대신 병목 목표의 순서와 조정 벡터라는 두 기준으로 클라이언트를 나누면 집계 시 간섭이 줄어든다는 것. 둘째, 다목표 손실을 다룰 때 단순 가중합 대신 병목 목표는 악화를 금지하고 비병목 목표는 제한적으로만 희생시키는 선형계획 제약을 걸면 파레토 전선 커버리지(HV, IGD)까지 함께 좋아진다는 것이다. 다만 클러스터 수 b, 통신 라운드, 지원 샘플 수 같은 하이퍼파라미터가 결과에 영향을 주므로 자신의 데이터 분포에서 재확인이 필요하다.

저자들이 밝힌 전제와 한계도 분명하다. Theorem 3.3의 수축은 descent-margin 조건(Assumption H.19)에 의존하는데, 저자들은 이것이 Polyak–Łojasiewicz류 요구사항이며 smoothness·유계 그래디언트·선호 균형·LP 제약 어느 것으로도 함의되지 않아 가정으로 제시한다고 명시한다. 이론은 라운드당 로컬 스텝 1회(τ=1, Phase II는 K=1)를 다루고, few-shot 갭은 클러스터가 조여질 때 엄격한 형태 b_i=0에서만 사라진다. Theorem 3.4의 분석은 새 샘플을 쓰는 이상화된 preconditioned 확률적 적응을 가정한다. 또한 합성 선호 데이터 기반 기존 접근은 실제 사용자의 스타일·어조·맥락의 미묘한 선호를 충분히 담지 못한다는 점을 지적하며, 재현용 소스 코드는 게재 승인 시 공개하겠다고 밝힌다.