사용자는 클러스터로 묶고 개인차는 디코딩에서만 주입하는 계층적 개인화 프레임워크 CARD
CARD: Cluster-level Adaptation with Reward-guided Decoding for Personalized Text Generation
무엇인가
개인화 텍스트 생성은 대화 시스템, 콘텐츠 추천, 광고 같은 응용에서 중요하지만, 세밀한 개인화와 확장 가능한 배포 사이의 긴장이 핵심 난제다. 기존 접근은 크게 두 갈래다. 검색 증강(RAG) 계열은 사용자 이력을 프롬프트에 붙이지만 프롬프트 설계와 검색 품질에 민감하고 생성기가 고정돼 있어 개인화가 얕다. 파라미터 효율적 미세조정(PEFT) 계열은 LoRA 같은 경량 모듈로 더 깊은 사용자 행동을 잡지만, 사용자 수가 늘면 사용자별 파라미터 유지 비용이 커지고 신규 사용자 온보딩에 추가 최적화가 필요하다. 게다가 PEFT는 사용자 선호를 선호 쌍으로 변환해야 하는데, 명시적 주석은 비용이 과도하고 무작위 네거티브 같은 휴리스틱은 주제 내용과 문체 특성을 뒤섞는다. 이 논문은 "그룹 수준 사전지식으로 효율을 얻으면서, 개인 선호는 전적으로 경량 디코딩 시점 제어로 밀어낼 수 있는가"를 질문한다.
어떻게 동작하나
CARD는 개인화 신호가 본질적으로 계층적이라는 통찰, 즉 넓은 선호는 그룹 수준 사전지식으로 공유되고 미세한 뉘앙스는 안정적인 개인차로 나타난다는 관점에 기반한다. 프레임워크는 세 단계로 구성된다. 첫째, 사용자 이력을 고정 인코더로 임베딩해 K-평균으로 K개 클러스터로 나누고, 각 클러스터마다 별도의 LoRA 어댑터를 집계된 인스턴스에 대한 지도 미세조정(교차 엔트로피)으로 학습한다. 이 클러스터 적응은 세밀한 개인화의 종착점이 아니라, 저자원 사용자가 참혹하게 실패하는 것을 막는 안정적이고 비용 분산된 사전지식 역할을 한다.
무엇과 다른가
둘째, 개인화 구성요소를 학습하되 백본과 클러스터 LoRA는 고정한 채, 클러스터 내부의 문체 차이를 부각하는 선호 쌍을 만든다. 각 사용자 상호작용에 대해 정답 사용자 응답을 선호(preferred)로, 같은 프롬프트에 대해 그 사용자의 클러스터 LoRA가 생성한 응답을 비선호(dispreferred)로 둔다. 두 응답은 의미 내용은 같고 문체 실행만 다르므로, 주제 교란에서 순수한 문체 편차를 분리해내는 하드 네거티브가 된다. 클러스터 LoRA 기준 응답 생성은 vLLM 엔진으로 처리한다.
어떻게 쓰나
셋째, 개인화는 디코딩 시점의 경량 조향으로 수행한다. 공유 개인화 헤드 Ψ=(P,U)를 두고, 각 디코딩 스텝에서 행렬 P가 집계된 은닉 상태를 J차원 문체 부분공간으로 투영해 z_t를 만든다. 사용자별로 학습된 경량 선호 벡터 λ_u를 z_t에 원소별 곱으로 적용해 특정 잠재 차원을 증폭·감쇠시킨다. 이어 어휘 매핑 행렬 U가 이 신호를 어휘 공간으로 투영해 클러스터 LoRA 기준 로짓에 저랭크 보정을 더한다(ℓ̃ = ℓ^(c) + βΔℓ). 계산량을 줄이기 위해 보정은 클러스터 로짓 기준 Top-k 후보 토큰에만 적용되어 복잡도가 O(|V|·J)에서 O(k·J)로 줄어든다. 이는 사용자 선호 벡터가 보상 신호처럼 후보 토큰을 재정렬하는, 보상 유도 디코딩으로 해석된다. 학습 목표는 백본과 LoRA를 고정한 상태에서 P, U, 그리고 사용자 벡터 집합 Λ를 Bradley–Terry 쌍별 손실로 최적화하는 것이다. 신규 사용자는 프로필 임베딩으로 클러스터를 배정하고, 백본과 LoRA는 그대로 둔 채 이력에서 λ_u만 추정해 디코딩에 사용한다.
전제와 한계
실험은 단문 개인화용 LaMP와 장문용 LongLaMP 벤치마크를 사용자 분할 설정으로 평가했고, 지표는 ROUGE-1과 ROUGE-L, 추가로 GPT-5.2를 LLM 판정자로 쓰고 인간 평가도 수행했다. 베이스 모델은 Qwen3-8B이며, 비교 대상은 BM25·Contriever 기반 RAG, PAG, 디코딩 정렬 베이스라인 PAD, PEFT 계열 OPPU와 계층적 프레임워크 PROPER, 소프트 프롬프트 생성 PPLUG다. 검색 증강 베이스라인은 모두 동일한 이력 컨텍스트 한도(top-k=4)로 제한해 공정성을 맞췄다. 결과적으로 CARD는 6개 태스크·2개 지표, 총 12개 설정 중 10개에서 1위를 기록했고 나머지 두 설정도 근소한 차이의 준최고였다(LaMP5 R-1 0.459 대 0.464, LongLaMP2 R-1 0.252 대 0.255). LLM 점수 기준으로 비개인화 베이스라인 대비 LaMP-4에서 76.4%, LaMP-5에서 95.5%, LaMP-7에서 113.5% 향상했고, 인간 평가에서는 LaMP-5에서 참조 정답보다도 10.5% 높은 점수를 받았다.
절제 실험은 두 구성요소가 모두 필요함을 보여준다. 사용자 벡터를 제거하면 가장 큰 하락이 발생해 LaMP-4의 R-1이 0.218에서 0.148로 떨어졌다. 반면 그룹 LoRA의 기여는 ROUGE보다 선호 지향 평가에서 훨씬 두드러진다. 그룹 LoRA는 비개인화 대비 LLM 점수를 LaMP-4에서 66.7%, LaMP-5에서 50.0%, LaMP-7에서 56.4% 올렸고, 인간 평가에서는 각각 72.7%, 94.4%, 70.0% 올렸다. 사용자 벡터 분석에서는 개인화 강도가 낮음에서 중간으로 갈 때 품질이 오르지만 더 키우면 사용자 벡터가 생성을 지배해 의미 내용을 덮어쓰며 급격히 나빠진다. 차원도 중간 크기에서 최고 성능을 보이고 그 이상은 노이즈·과적합을 유발하며, 은닉 상태 집계 깊이도 중간 층이 가장 좋다. 저자원 설정에서는 이력을 5개만 남긴 L=5에서도 LaMP-4 R-1이 약 0.216으로 비개인화 약 0.146을 앞섰고, L≈10 부근에서 약 0.219로 정점에 도달해 다른 방법보다 빠르게 선호 신호를 추출했다. 다만 LaMP-7은 이력이 길어질 때 성능이 떨어지는데, 이는 노이즈가 많은 이력이 학습된 사용자 벡터를 약화시키기 때문으로 해석된다. 모델 규모는 Qwen 계열 0.6B에서 32B까지 확장해도 개인화 효능이 유지됐다.
개발자 관점에서 이 논문의 실용적 핵심은 사용자당 저장 오버헤드다. 사용자별 개인화는 J=128 차원의 선호 벡터 λ_u 하나로 압축되며, 백본과 LoRA는 추론 시 고정된다. 저자들은 이 벡터를 사용자 기기에 직접 저장해 온디바이스 개인화에 쓸 수 있고, 원본 사용자 텍스트를 컨텍스트 창에 노출하지 않으므로 프라이버시 보호와 긴 컨텍스트 지연 제거라는 이점이 있다고 주장한다. 다만 실제 도입을 검토한다면 클러스터 수 K, 개인화 강도 β, 벡터 차원 J, 은닉 상태 집계 깊이 같은 하이퍼파라미터가 성능을 좌우한다는 점과, 클러스터 배정을 위한 임베딩 파이프라인과 클러스터 LoRA 학습·선호 쌍 생성·헤드 학습으로 이어지는 다단계 파이프라인 운영 부담을 함께 따져야 한다.
저자들이 밝힌 한계는 네 가지다. 오프라인 그룹 모델링이 비지도 K-평균에 의존하므로 복잡한 사용자 관계나 잠재적 개인화 구조를 온전히 담지 못할 수 있다. 각 사용자를 디코딩 시 단일 선호 벡터로 표현하기 때문에 다양하거나 변화하는 선호를 표현하는 데 한계가 있고, 학습된 차원이 직접 해석 가능하지도 않다. 전체 프레임워크가 경량이긴 하지만 여러 구성요소를 조율해야 하는 다단계 파이프라인이다. 마지막으로 노이즈가 많거나 관련성이 약한 이력은 학습된 사용자 벡터를 악화시켜 개인화 품질을 떨어뜨릴 수 있으며, 이력 필터링이나 관련성 가중, 노이즈 강건 프로필 선택을 향후 과제로 남긴다.