가치 파인튜닝이 다른 가치로 번지는 정도를 학습 전에 예측한다
Predicting Alignment Generalization with Value Representations
무엇인가
LLM 개발자들은 정렬 타깃(alignment target)에 나열된 가치와 행동 특성을 모델에 post-training으로 심는다. 문제는 좁은 행동 집합으로 학습해도 그 효과가 학습하지 않은 맥락과 환경으로 예상치 못하게 번진다는 점이다. 논문이 드는 예로는 공감 능력을 키우는 학습이 음모론 확산이나 문제적 조언으로 이어질 수 있다는 것, 따뜻하고 공감적인 모델 학습이 아첨성(sycophancy)과 높은 오류율로 이어진다는 선행 연구 등이 있다. 그런데 정렬 타깃 설계는 대부분 철학적 논의로 정해지고, 가치들 사이의 상호작용을 실증적으로 다룬 연구는 거의 없다. 이 논문은 alignment generalization prediction, 즉 한 가치를 따르도록 파인튜닝했을 때 학습하지 않은 다른 가치들에 대한 행동이 어떻게 바뀌는지를 학습 전에 예측하는 과제를 세운다.
어떻게 동작하나
저자들은 앤트로픽 헌법에서 뽑은 66개 가치 집합(Constitution)을 쓴다. Jakkli 등이 헌법을 211개 원자적 가치로 분해한 것을 LLM 필터링으로 구체적이고 단일 에피소드에서 평가 가능하며 명확한 대립쌍이 있는 것만 남기고 수작업 검토와 중복 제거를 거쳤다. 학습 방식은 두 가지다. 단일 가치 DPO는 Tulu 3 SFT의 가치 중립 19,748개 예시로 먼저 SFT한 뒤, HH-RLHF, PKU-SafeRLHF, HelpSteer 2, UltraFeedback, WildFeedback, Community-Alignment에서 가치별 선호쌍을 추출해 49개 가치 각각에 4,000쌍씩 DPO를 돌린다. 공개 선호 데이터에 표현이 부족한 나머지 값은 제외됐다. 단일 가치 SFT는 가치마다 5,000개의 합성 프롬프트를 생성하고 가치에 부합하는 응답만 걸러 66개 데이터셋으로 학습한다. 베이스 모델은 Olmo-3-7B, Olmo-3-32B, Qwen-3-8B-Base, Qwen-3-30B-A3B-Base 네 가지다.
무엇과 다른가
가치 준수 여부는 ConflictScope 파이프라인으로 측정한다. 66개 값의 모든 쌍 2,145개 중 문장 임베딩 코사인 유사도가 0.5 이상인 쌍을 걸러 2,029쌍을 남기고, 각 쌍마다 20개의 가치 충돌 시나리오를 생성해 품질 필터링 후 11,188개 평가 시나리오를 얻는다. LLM이 각 시나리오에서 모델 행동이 특정 가치에 얼마나 부합했는지 0~1로 채점하고, 이를 평균 내 가치별 정렬 점수 a_v(M)을 만든다. 일반화 지표 G(v1,v2)는 v1으로 파인튜닝한 모델이 v2에 대해 남은 정렬 격차를 얼마나 메웠는지의 비율로, a'가 a 이상이면 (a'-a)/(1-a), 아니면 (a'-a)/a다. -1은 v1 학습이 v2를 완전히 무너뜨린 경우, 0.5는 기존에 v2에 어긋나던 사례의 절반을 뒤집은 경우다. 이렇게 49×66 일반화 행렬을 만든다.
어떻게 쓰나
예측에 쓸 가치 표현 다섯 가지를 비교한다. Description-Embd는 가치 설명 문장을 all-mpnet-base-v2로 임베딩하는 기존 방식이다. Behavior-Embd는 같은 모델로 프롬프트에 대한 가치 지지 응답과 반대 응답을 임베딩해 차이를 구하고 프롬프트 전체에 평균한다. 나머지 셋은 모델 내부에 접근한다. Weight는 각 프롬프트에서 가치 지지 응답과 반대 응답으로 각각 파인튜닝한 뒤 가중치 차이를 취한다. Persona는 가치 지지와 반대 응답에서 레이어별 평균 활성화 차이를 구해 후보 벡터를 만들고, held-out 질문에서 가장 강하게 스티어링하는 레이어를 고른다. Gradient는 DPO 손실의 잔차 스트림 활성화에 대한 그래디언트를 선호쌍마다 계산해 평균한 것으로, 파인튜닝 시 모델이 업데이트될 방향의 추정치다. 평가는 각 쌍의 표현 코사인 유사도와 G(v1,v2) 사이의 스피어만 순위 상관이다.
전제와 한계
결과는 명확하다. 활성화 기반 방법이 텍스트 설명 기반을 크게 앞선다. 최고 성능 방법은 일반화 행렬과 ρ=0.45의 상관을 보인 반면, 기존 분류체계가 쓰는 문장 임베딩 유사도는 ρ=0.05에 그쳤다. 설명 임베딩의 상관이 이렇게 낮다는 것은 정렬 일반화가 가치 설명 문장에 담기지 않는 행동 패턴에서 비롯된다는 뜻이다. 다만 같은 임베딩 모델을 쓰더라도 가치에 부합하는 행동 예시를 붙인 Behavior-Embd는 상관이 크게 올라간다. 부록에서는 elicitation 데이터의 품질을 높여도 예측 성능이 크게 좋아지지 않아, 일반적인 가치 부합 데이터만으로 충분하다고 밝힌다. 또 8개(베이스 모델 × 파인튜닝 방식) 조합에서 66×66 Persona 유사도 행렬을 계산한 결과 평균 스피어만 ρ=0.84로 매우 유사했다. 모델들이 이 가치들을 비슷하게 표현한다는 것, 즉 모델 독립적인 공유 가치 공간의 초기 증거다.
이 표현은 학습 전 정렬 타깃의 견고함을 예측하는 데도 쓰인다. 49개 파인튜닝 값에서 6개씩 층화 표집해 만든 64개 다중 가치 타깃 각각에 Qwen-3-8B를 DPO로 파인튜닝하고, 반(反)타깃 프리필을 문맥에 주입한 뒤에도 타깃을 따르는 비율(prefill robustness)을 측정했다. 타깃 응집도, 즉 구성 값 임베딩의 평균 쌍별 코사인 유사도와 프리필 견고함의 상관은 Persona 임베딩에서 ρ=0.43(p=5×10⁻⁴)으로 유의했지만, Description-Embd 임베딩에서는 ρ=0.12(p=0.37)로 유의하지 않았다. 어떤 임베딩으로 응집도를 재느냐가 결과를 좌우한다.
마지막으로 ValueMap을 제안한다. 가치 표현을 코사인 거리로 클러스터링해 분류체계를 만드는 파이프라인으로, UPGMA, k-medoids, MDS 위 k-means를 비교하고 우연 수준을 보정한 adjusted silhouette으로 평가한다. Constitution 집합에서 Persona와 k-medoids 조합이 가장 높은 점수를 받았고, 이 파이프라인을 Olmo-3.1-32B-SFT와 실제 사람-LLM 상호작용에서 수집한 266개 값 집합(VITW)에 그대로 적용해 k=4짜리 분류체계를 얻는다. 네 범주는 관계와 정서적 성장을 돕는 attunement, 엄밀한 추론과 객관성을 지지하는 rigor, 사회의 장기 복지와 제3자 고려를 다루는 stewardship, 직업 규범과 지적 정직성을 다루는 integrity다. 이를 기존 Values in the Wild, LitmusValues와 비교했을 때 ValueMap-Olmo-32B가 여러 모델과 파인튜닝 방식의 일반화 행렬에서 가장 높은 adjusted silhouette을 기록했다. 분류체계를 설계할 때 쓴 모델과 값 집합과 다른 모델, 값 집합에서도 앞섰다는 점이 중요하다.
개발자 입장에서 이 논문이 주는 실용적 시사점은 두 가지다. 첫째, 정렬 타깃에 어떤 가치를 함께 넣을지 정할 때 문장 설명의 유사도가 아니라 모델 활성화 기반 표현의 유사도를 보면 학습 후 견고함을 어느 정도 미리 가늠할 수 있다. 둘째, 타깃의 응집도가 높을수록 적대적 프리필에 덜 흔들린다는 신호를 얻었다. 다만 저자들이 밝힌 한계도 분명하다. 가장 좋은 표현도 ρ=0.45 수준으로 합리적으로 예측 가능한 정도이지 정확한 예측기가 아니며, 더 견고한 예측 방법은 향후 과제로 남긴다. DPO 실험은 공개 선호 데이터에 표현이 충분한 49개 값으로 제한됐고, 일반화 행렬의 기준이 되는 ConflictScope 점수는 LLM 채점에 의존한다. ValueMap은 Constitution에서 방법을 고른 뒤 VITW에 추가 튜닝 없이 적용했다는 점도 전제다.