PersonaDose가 활성화 조향 강도를 페르소나 점수 단위로 보정한다
Persona Dosing: Calibrated Activation Steering for Graded Trait Control
무엇인가
활성화 조향은 개입 강도를 정하는 계수를 노출하지만, 그 계수 값 자체에는 행동적 의미가 없다. 같은 계수라도 트레이트와 모델에 따라 전혀 다른 발현 수준을 만들어내기 때문에, 연구자가 '이 정도 강도의 아첨 성향'처럼 행동 단위로 실험을 지정하려면 요청한 강도를 모델 내부 개입으로 옮기는 매핑이 필요하다. 이 논문은 이 매핑을 persona dosing이라 부르고 다룬다. 트레이트 설명이 무엇을 표현할지 정하고, 요청 점수가 행동 루브릭 기준의 목표 평균 강도를 정한다. 여기에는 두 가지 요구가 걸린다. 컨트롤러가 응답의 일관성을 유지하면서 쓸 만한 범위까지 발현을 끌어올리는 coherent reach와, 그 범위 안에서 중간 강도 요청을 새 질문에서도 정확히 실현하는 intensity targeting이다. 저자들은 이 둘을 분리해서 평가한다.
어떻게 동작하나
방법의 골자는 행동 학습과 강도 캘리브레이션의 분리다. PersonaDose는 FLAS의 활성화 필드 아키텍처를 페르소나 발현 응답에 특화한다. 동결된 언어모델의 잔차 스트림에서 은닉 상태 h0를 두고, 트레이트 설명 c에 조건화된 속도장 v(h(t), t, c)가 상태를 flow time T만큼 이동시킨다. 구현은 3단 오일러 스텝이고, 디코더 훅이 생성 중에 변환을 적용하며, 개입 위치는 20번째 디코더 레이어다. 언어모델과 개념 인코더는 학습 내내 동결된다. 학습 데이터는 PV 루브릭에서 트레이트 점수 50 이상인 페르소나 발현 응답이고, 목적함수는 다운스트림 언어모델 손실에 개념 다양성 정규화(가중치 0.1)를 더한 형태다. flow time은 [0.5, 2.0]에서 균일하게 샘플링되며, 시간이 바뀌어도 같은 응답이 supervision으로 유지된다. 즉 응답은 요청 목표 강도와 페어링되지 않는다. 특화 코퍼스는 모델당 1,250행으로, 7개 페르소나 개념에 각 150개씩 1,050행과 일반 리플레이 200행으로 구성된다. Llama는 일반 FLAS 체크포인트에서 초기화하지만 Qwen과 Gemma는 일반 FLAS 사전학습 없이 페르소나 컨트롤러를 학습한다. 일곱 트레이트가 모델 내에서 컨트롤러 하나를 공유하므로 트레이트를 바꿔도 어댑터를 새로 로드할 필요가 없다.
무엇과 다른가
캘리브레이션은 학습이 끝난 뒤에 붙는다. 캘리브레이션 질문으로 유한한 강도 그리드에서 트레이트 발현을 측정하고, 증가 제약을 가한 isotonic 회귀를 적합한 뒤 구간별 선형 보간으로 발현 곡선을 얻는다. 목표 점수 r이 들어오면 적합 곡선을 뒤집어 u*(r) = inf{u : s(u) ≥ r}로 강도를 고른다. 평탄 구간에서는 가장 작은 강도를 택하고, 적합 범위를 벗어난 목표는 테스트 평가 전에 도달 불가로 표시한다. 캘리브레이션은 추론 설정만 바꾸며, 컨트롤러 가중치가 바뀌면 곡선을 다시 측정해야 한다. 같은 루브릭 목표라도 모델마다 다른 강도가 선택된다는 점이 이 설계의 핵심이다. 예를 들어 아첨 40 요청에 Llama는 T=0.3834, Qwen은 1.1116, Gemma는 0.2952를 쓴다.
어떻게 쓰나
실험은 Llama-3.1-8B-Instruct, Qwen3-8B, Gemma-3-4B 세 모델 패밀리에서 evil, sycophantic, hallucinating, optimistic, impolite, humorous, apathetic 일곱 트레이트로 진행됐다. GPT-4.1-mini가 트레이트 발현과 일관성을 각각 로그확률 가중 수치 기대로 독립 채점한다. 트레이트마다 평가 질문 20개를 정렬해 번갈아 배정해 캘리브레이션 10개와 테스트 10개로 나누고, 목표 점수 20, 40, 60, 80을 요청해 모델당 28개의 트레이트-목표 셀을 만든다. 각 도달 가능한 설정에서 테스트 질문마다 응답 10개를 temperature 1, 256토큰 제한으로 생성한다. 비교 대상은 CAA, RepE, 국소 선형 분리 방향 베이스라인, 페르소나 특화 없는 일반 FLAS이며, 모든 개입이 같은 레이어 20 출력과 동일한 질문·응답 수·디코딩 설정·채점 프로토콜을 공유한다. 일관성 바닥을 평균 75로 두었을 때 PersonaDose는 세 모델에서 핵심 트레이트 발현 75.1, 82.3, 86.0을 기록해 CAA의 41.9, 64.0, 68.2를 각각 33.2, 18.3, 17.8점 앞선다. 같은 조건에서 일반 FLAS는 13.3, 46.2, 42.7에 그친다. Llama에서는 아첨 발현이 9.7에서 90.5로, 무례 발현이 1.6에서 72.3으로 올라가고, CAA 대비 개선폭은 Llama의 세 핵심 트레이트에서 38.3, 26.9, 34.6점이다. Qwen과 Gemma에서는 evil에서 개선이 가장 커서 각각 3.3에서 71.5로, 21.2에서 68.9로 상승한다.
전제와 한계
캘리브레이션 질문으로 설정을 고른 뒤 별도의 테스트 질문에서 측정해도 우위는 유지된다. held-out 평균 발현은 75.6, 80.3, 84.8로 CAA의 43.5, 63.3, 68.0보다 높고, 페어 개선폭은 32.1 [26.4, 37.8], 17.0 [10.4, 23.7], 16.8 [12.4, 21.5]다. 다만 평균 일관성은 75.5, 83.2, 79.4였고 일관성 바닥을 테스트에서 유지한 트레이트는 각각 1/3, 2/3, 3/3에 그쳤다. 중간 강도 요청 실험에서는 일곱 트레이트에 대해 평균 타기팅 MAE가 6.1, 6.2, 4.7점이고, 도달 가능한 요청은 28개 중 22개, 20개, 14개였으며 그중 19개, 20개, 13개가 테스트 평균 일관성 바닥도 넘겼다. Qwen의 아첨 트레이트에서 목표 20, 40, 60, 80은 held-out 평균 12.9, 37.1, 56.3, 80.5로 실현됐고 평균 일관성은 88.9에서 92.9 사이였다.
컨트롤러를 계속 학습시킨 뒤에는 캘리브레이션 맵이 달라진다. Qwen 컨트롤러를 이어서 학습하자 held-out 발현이 78.7에서 93.7로 올랐고(페어 이득 15.0 [7.3, 23.3]), 평균 일관성 81.9에서 세 트레이트 모두 바닥을 유지했다. evil 발현은 61.6에서 94.2로, 아첨은 89.5에서 95.6으로, 환각은 85.0에서 91.2로 상승했다. 아첨 60 요청에 대해 초기 체크포인트는 T=1.4864를, 이어 학습한 체크포인트는 T=0.8745를 선택한다. 이어 학습한 Qwen의 핵심 트레이트 도싱은 12개 중 11개 요청이 도달 가능하고 MAE 6.2, 일관성 86.3을 기록했으며, 가장 큰 오차는 evil/80의 10.6점과 hallucinating/80의 15.5점이었다. 같은 조건에서 캘리브레이션된 CAA는 12개 중 8개만 일관성 있는 요청을 지원했고, 각자의 도달 가능 집합에서 평균 일관성 76.5, MAE 8.2를 냈다. 다만 두 MAE는 서로 다른 요청 집합을 덮기 때문에 페어된 정확도 우위를 입증하지는 않는다.
실무에서 이 논문이 주는 가장 직접적인 시사점은 조향 계수를 그대로 노출하지 말고 행동 점수 단위의 인터페이스로 감싸라는 것이다. 같은 '아첨 40'이라도 모델마다 필요한 flow time이 세 배 이상 차이 나므로, 계수 값을 하드코딩하거나 모델 간에 공유하면 요청이 의미를 잃는다. 또 컨트롤러 가중치를 갱신할 때마다 캘리브레이션 곡선을 다시 재야 한다. 평가 파이프라인을 만든다면 도달 가능성, held-out 일관성, 타기팅 오차를 함께 보고해야 한다. Gemma는 MAE 4.7로 가장 정확했지만 도달 가능한 요청이 14개뿐이었고, Llama는 22개를 지원하면서 MAE 6.1이었다. 정확도와 커버리지는 서로 다른 질문에 대한 답이다.
저자들이 밝힌 한계는 분명하다. 평가는 학습된 일곱 트레이트, 짧은 응답, PV 판정 점수에 한정되며 보지 못한 트레이트나 긴 대화로의 일반화는 입증되지 않았다. 도달 가능한 강도 수준은 트레이트마다 다르다. optimistic은 모델마다 도달 가능한 목표가 하나뿐이고 Gemma의 hallucinating은 하나도 없다. 강도가 음수가 아니어서 조향하지 않은 발현 수준보다 낮은 목표는 범위 밖으로 밀린다. 목표는 질문과 샘플 응답 전체의 평균을 지정할 뿐이라 개별 답변이 목표에서 벗어날 수 있고, 일관성은 사실 정확성이나 안전성을 뜻하지 않는다. 스윕 피크는 같은 질문에서 강도를 선택하고 평가하므로, 캘리브레이션에서 정한 일관성 바닥이 테스트 트레이트마다 유지된다는 보장이 없다. 부트스트랩 구간은 컨트롤러를 고정한 조건에서 계산돼 학습이나 판정 변동을 담지 못하고, 캘리브레이션 질문 두 개가 특화 데이터와 겹친다. 컨트롤러 이어 학습은 여러 학습 선택을 동시에 바꾼 것이라 어느 한 변경의 효과로 귀속할 수 없다.