LLM이 사용자에 대해 품은 믿음을 128차원 벡터로 읽고 쓰는 BSD 프레임워크
User Model Extraction via Belief Self-Distillation
무엇인가
이 논문이 다루는 문제는 LLM이 요청 자체뿐 아니라 요청자가 누구라고 믿는지에 따라 답변을 바꾼다는 사실이다. 모델은 대화 맥락에서 사용자 속성을 추론해 개인화, 순응, 나아가 안전 관련 행동까지 조건화하지만, 그 내부의 사용자 모델은 거의 불투명하다. 기존 연구는 선형 프로브로 인구통계 정보를 디코딩하거나 activation steering으로 일부 표현을 조작했고, LatentQA처럼 보조 디코더를 학습해 개방형 사용자 표현을 뽑는 접근도 있었다. 그러나 이런 방법들은 대개 통제된 속성이나 합성 단서에서 출발하고, 읽기와 개입을 별개의 단계로 취급한다. 저자들이 지적하는 핵심은 모델의 사용자 믿음에는 외부 정답이 없다는 점이다. 중요한 대상은 실제 사용자가 누구인지가 아니라 모델이 그 사용자를 누구라고 믿는지이며, 따라서 그 믿음을 읽는 것과 조작하는 것을 동시에 만족하는 표현을 학습해야 한다.
어떻게 동작하나
제안 방법인 Belief Self-Distillation(BSD)은 같은 동결 LLM을 교사와 학생으로 복제해 정보 비대칭 구조를 만든다. 교사는 대화만 보고 선택한 레이어의 마지막 토큰 은닉 상태를 뽑고, 읽기 투영 A를 통해 이를 128차원 사용자 벡터로 압축한다. 학생은 대화를 전혀 보지 않고 속성 프로브만 받으며, 유일한 대화 관련 정보는 이 사용자 벡터가 쓰기 투영 B를 통해 주입된 것이다. B는 직교정규 열을 갖도록 제약해 주입이 노름을 보존하게 한다. 학습되는 것은 A와 B뿐이고, 목표는 교사가 대화와 프로브를 조건으로 여러 선택지 질문에 답해 얻은 속성별 확률분포와, 벡터를 주입한 학생의 답변 분포 사이의 KL 발산을 최소화하는 것이다. 선택지 순서 민감도를 줄이기 위해 여러 프로브 템플릿과 선택지 순환 순열을 평균한다. 속성 집합은 대륙·성별·교육 같은 사회인구학적 축과, 진실 추구 의도·상호작용 스타일·AI 신뢰도 같은 안전 관련 축을 합쳐 13개로 정의했다. 학습되는 파라미터는 전체의 약 0.01%에 불과하다.
무엇과 다른가
실험은 Llama-3.1-8B, Qwen3-8B, OLMo-3-7B 세 모델에서 수행했고, WildChat에서 약 2만 7천 개, WildJailbreak에서 약 3만 1천 개를 합쳐 약 5만 8천 개 대화를 5만/1천/7천으로 나눠 학습·검증·테스트에 썼다. 읽기 평가에서 128차원 벡터는 원래 은닉 상태 대비 32배 압축인데도 매크로 F1 격차가 4% 이내였다. 쓰기 평가는 대조 활성화 덧셈(CAA)으로 했는데, Llama-3.1-8B에서 원래 은닉 상태 조향의 뒤집힘률이 21%인 반면 사용자 벡터 조향은 78%였고 무작위 벡터 대조군은 13%였다. OLMo-3-7B와 Qwen3-8B에서도 사용자 벡터가 원래 은닉 상태보다 각각 23%p, 13%p 높았다. Qwen3-8B는 무작위 조향만으로도 27%가 뒤집히는 민감한 모델이지만, 사용자 벡터는 그보다 약 2배 강했다. 86개 속성 쌍에 각 50개 테스트 항목을 적용해 모델당 4,300회 조향을 평가했고, 대상 속성 뒤집힘률 78%에 대해 다른 12개 속성으로의 누출은 평균 37%였다. 또한 사용자 벡터와 조향 방향을 고정한 채 쓰기 투영 B만 무작위 직교정규 사상으로 바꾸면 대부분의 속성 쌍에서 성능이 떨어졌는데, 이는 BSD가 무엇을 보존할지뿐 아니라 어디에 써야 하는지도 학습한다는 뜻이다.
어떻게 쓰나
논문은 합성 단서로 만든 표현과 자연 대화에서 나온 믿음이 다르다는 것도 보인다. Alpaca 프롬프트 100개에 속성 단서를 앞에 붙여 만든 1만 5천 개 합성 데이터로 학습한 프로브는 같은 방식의 테스트에서는 거의 완벽했지만 자연 대화에서 추론된 믿음으로는 전이되지 않았다. 반대로 자연 대화 기반 프로브는 두 설정 모두에서 더 잘 일반화됐다. 더 중요한 결과는 안전 행동이다. 네 개의 안전 속성에 대한 조향 방향이 평균 코사인 유사도 0.91로 하나의 축에 수렴했고, 저자들은 이를 사용자 의도 축으로 삼았다. 금지 질문 390개에 대해 이 축 위의 스칼라 투영만으로 거부 여부를 예측하는 선형 분류기가 AUC 0.94, 정확도 88%를 기록했다. StrongREJECT에서 사용자 의도를 적대적에서 선량한 쪽으로 옮기면 유해 요청은 그대로인데도 거부율이 98%에서 62%로 떨어졌다. 같은 크기의 무작위 조향이나 무관한 성별 속성 조향은 이 효과를 재현하지 못했다. 다만 거부가 사라지지는 않아, 사용자 모델은 안전 결정을 단독으로 정하는 것이 아니라 요청과 함께 조건화하는 요인으로 작동한다.
전제와 한계
사용자 표현의 기하 구조에 대한 분석도 제시된다. 증류된 공간에서 표현들은 중심점 주위에 강하게 몰려 있어 세 모델 모두 평균 코사인 유사도가 0.89에서 0.92였고, 사용자 특이적 잔차는 약 20%에 불과했다. 이 중심점이 곧 기본 사용자이며, 프로브로 해독하면 남성, 유럽, 중간 소득, 무정치, 감정 중립, 선량한 의도를 가진 사용자로 나타난다. 선량한 의도만 0.98로 높은 확신을 보이고 나머지는 확신이 낮다. 이 기본값은 WildChat이 실제 일상 대화라는 말뭉치 특성에 영향받은 것으로 보인다. 중심을 제거한 뒤 비교하는 CKA 기준으로 세 모델의 정렬도는 평균 0.75(0.73~0.79)였고 순열 널은 0.01이었다. 두 모델의 클래스 중심 사이에 단일 직교 프로크루스테스 사상을 적합해 사용자 벡터를 전이하면, 불일치 집합에서 대상 모델이 원본의 믿음을 채택하는 비율이 53~54%로 무작위 회전 기준선 30%를 웃돌았다.
개발자 관점에서 이 논문이 주는 실무적 의미는 분명하다. 안전 필터나 정책 판단이 요청 텍스트만 보고 이뤄진다고 가정하면 안 된다. 모델은 자신이 상대한다고 믿는 사용자에 대한 잠재적 판단에 따라 거부 여부를 바꾸며, 프롬프트에서 사용자 정체를 숨기거나 명시적 진술을 억제해도 그 영향력이 제거되지 않고 오히려 내부 상태를 검사하기 어렵게 만들 수 있다. 따라서 안전 메커니즘은 잠재 사용자 표현의 교란에 강건하도록 설계·평가되어야 하고, 사용자 벡터 같은 표현을 모니터링 지표로 삼을 때는 그것이 실제 사용자 속성이 아니라 모델의 믿음이라는 점을 전제로 다뤄야 한다. 논문은 이 읽기 인터페이스가 인구통계 편향 감사에 쓸 수 있는 동시에 사용자 프로파일링에 악용될 수 있다고 명시하며, 추출된 벡터를 개인에 대한 결정에 사용해서는 안 된다고 못 박는다.
저자들이 밝힌 한계도 분명하다. BSD는 미리 정의된 속성 집합과 선택지형 프로브로 증류 목표를 규정하므로, 학습된 표현은 연구자가 선택한 믿음에 의해 형성되며 모델의 전체 사용자 상태를 담는다고 보장할 수 없다. 여러 템플릿과 선택지 순열을 써도 믿음이 유도 절차에 의존할 수 있다. 다만 사용자별 레이블은 필요 없고, 속성 집합은 무엇을 물을지 정할 뿐 무엇을 믿는지는 모델이 정하며, 한 번 학습된 뒤에는 프로브 없이 사용자 벡터를 추출할 수 있다. 실험은 비슷한 크기의 명령 튜닝 모델 세 개에서 단일 레이어의 선형 사상만 다뤘고, 아키텍처·규모·레이어·더 긴 상호작용으로의 일반화는 열린 문제로 남는다. 또한 조향 실험은 화이트박스 접근과 모델별 프로젝터 학습을 전제로 하며, 저자들은 이를 BSD의 의도된 용도가 아니라 노출된 안전 취약점으로 규정한다.