AVPO는 LLM 활성화를 질문 없이 텍스트로 복원하고 선호최적화로 환각을 줄인다
Faithful Activation Verbalization: Reducing Hallucinations in LLM Representation Interpretation
무엇인가
이 논문은 LLM의 은닉 활성화를 사람이 읽을 수 있는 자연어로 풀어내는 활성화 언어화(activation verbalization)의 신뢰성 문제를 다룬다. 기존 Activation Oracle, Natural Language Autoencoders 같은 방법은 설명이 불완전하거나 환각을 포함할 수 있다. 특히 질문 조건부 verbalizer는 표현 읽기와 답변 생성을 한 단계에서 섞기 때문에, 답이 틀렸을 때 정보가 활성화에 없었는지 아니면 답변 과정에서 잃었는지 구분하기 어렵다. AVPO는 질문과 무관한 중간 텍스트 readout을 만들어 이 문제를 검사 가능하게 만드는 것을 목표로 한다.
어떻게 동작하나
AVPO는 두 단계다. 1단계에서 질문 비의존 인버터가 은닉 활성화를 소프트 토큰으로 매핑하고 원문 텍스트를 복원한다. 입력 x를 고정된 donor 모델에 넣고 마지막 non-padding 토큰의 특정 층 활성화 h_l(x)를 얻는다. 인버터는 Q-Former 스타일 어댑터로 h_l(x)를 M=8개의 활성화 의존 컨텍스트 슬롯에 투영하고, K=64개의 학습 가능한 쿼리가 L개 cross-attention 층을 거쳐 디코더 임베딩 공간의 소프트 토큰 프리픽스를 만든다. 고정 지시문 What does this representation encode?와 함께 원문을 자기회귀 cross-entropy로 복원하도록 디코더 LoRA와 어댑터를 학습한다. 이때 손실은 원문과 EOS 토큰에만 걸리고 소프트 토큰과 지시문은 마스킹한다.
무엇과 다른가
이어서 DPO로 인버터를 선호 최적화한다. 보상은 세 가지다. gist 보상 G는 별도 interpreter가 역변환 텍스트만 보고 gist 질문에 답하게 한 뒤 judge가 원문과 비교해 점수화하고, detail 보상 D도 같은 방식으로 세부 질문 정보를 평가한다. anchor 보상 A는 원문과 복원문에서 고유명사와 숫자를 뽑아 F1을 계산한다. 결합 보상은 R = λg G + λd D + λa A이며 가중치는 합이 1이다. 각 활성화마다 여러 후보 복원문을 샘플링해 선호/비선호 쌍을 만들고, SFT 체크포인트를 초기 정책과 참조 정책으로 두고 DPO를 수행한다. 정책의 LoRA와 어댑터는 갱신하지만 디코더 백본과 참조 정책은 고정한다. 반복 DPO에서는 이전 라운드 체크포인트를 초기화와 참조로 다시 쓴다. 2단계에서는 별도 고정 QA 모델이 원문이나 활성화 없이 오직 역변환 텍스트와 질문만 보고 답한다.
어떻게 쓰나
실험은 Llama-3.1-8B-Instruct와 Mistral-Small-24B-Instruct-2501의 마지막 토큰 활성화를 대상으로 했다. 인버터는 donor 자신 또는 더 작은 Qwen3-4B, Qwen3-0.6B를 썼고, Patchscopes, SelfIE, LatentQA, AO, UAV와 비교했다. 데이터는 여섯 텍스트 패밀리로 구성했고 165,760개 학습, 2,172개 검증, 1,560개 테스트 텍스트를 사용했으며 각 텍스트는 64토큰으로 제한하고 Qwen3-14B가 만든 gist 질문과 detail 질문을 하나씩 붙였다. SFT 인버터는 처음에는 질문 조건부 베이스라인보다 낮았지만 DPO 후 크게 올랐다. Llama-3.1-8B 활성화에 Qwen3-4B를 쓴 경우 전체 점수가 SFT 0.389에서 DPO 1라운드 0.472, 검증 선택 체크포인트 0.624로 상승해 AO 0.423, LatentQA 0.475, UAV 0.492를 넘었고, 같은 donor의 self-decoder 0.608도 약간 앞섰다. Mistral-Small-24B에서는 Qwen3-4B가 DPO 전 0.411에서 0.638로 올라 UAV 0.433과 donor-matched LatentQA 0.516을 넘었다. Qwen3-0.6B도 Llama-3.1-8B에서 0.348에서 0.409로 올라 같은 크기 UAV 0.374를 넘었고, Mistral-Small-24B에서는 반복 DPO 후 0.520으로 AO 0.496과 LatentQA 0.516을 넘었다. 논문은 가장 강한 베이스라인 대비 gist와 detail 복원에서 각각 최대 17.1%p, 9.3%p 개선을 보고한다.
전제와 한계
보상 설계와 생성 안정성도 분석한다. 기본 가중치는 (λg, λd, λa) = (0.35, 0.35, 0.30)이다. gist-detail 보상에 anchor를 더하면 Anchor F1이 0.211에서 0.228로 오르고 gist/detail은 중간 정도만 떨어진다. anchor 가중치를 0.7로 올리면 Anchor F1은 0.241까지 오르지만 gist 손실이 커진다. gist-only 보상은 gist와 detail을 각각 0.109, 0.087 올리는 가장 큰 이득을 냈지만 Anchor F1을 낮췄다. 선호 응답만 골라 SFT한 대조군은 미미한 향상에 그쳐, 이득이 DPO의 대조 학습에서 온다는 것을 보였다. 반복 DPO는 gist/detail을 더 올리지만 within-output 반복과 복원문 길이가 늘어나는 대가가 있고, cross-output collapse는 모든 변형에서 1% 미만이었다. 층별로는 후반 층이 일반적으로 더 잘 복원되지만 모든 텍스트 패밀리에 최적인 단일 층은 없었다.
OOD 평가에서 AVPO는 고수준 의미 해석에 강했다. Harmful Requests 250개와 Clinical Summaries 250개를 사용했고, AVPO r4는 유해 요청 의도와 범주에서 최고 점수를 냈으며 임상 주호소에서는 가장 강한 베이스라인과 동률이었다. 두 AVPO 변형은 추가 임상 소견을 QA-trained 베이스라인의 최대 0.04 대비 0.11, 0.12로 약 세 배 더 자주 복원했다. 다만 정확한 이름 복원은 베이스라인보다 낮았고, 대신 이름을 지어내는 비율이 0.87~0.99 대신 0.10으로 훨씬 낮았다. 즉 세부 정보를 환각하기보다 누락하는 보수적 실패 양상이다. DPO는 인구통계학적 정확도(나이, 성별)를 희생해 의미 복원을 늘렸다. 저자들은 한계로 세부 속성 복원이 여전히 어렵고, 반복 DPO의 생성 안정성 저하, 층 선택의 패밀리 의존성, OOD 사례가 제한적임을 들며, 향후 token-level 및 multi-layer 표현과 의미 복원, 어휘 충실도, 생성 안정성을 더 잘 균형 잡는 보상 설계를 계획한다.