위협 토큰 5%만 설명해도 전체를 설명한 성공률의 95%를 유지한다

Selecting The Most Informative Tokens in Natural Language Autoencoders

HF Daily2609.37040

Federico Torrielli, Gianluca Barmina, Andrea Blasi Núñez2026-09-29조회 3

무엇인가

언어 모델의 내부 활성화를 사람이 읽을 수 있는 문장으로 번역하는 자연어 오토인코더(NLA)는 감사자가 모델을 들여다보는 통로가 된다. 문제는 비용이다. 설명 하나를 만들려면 자기회귀 생성 루프를 돌려야 하고, Fraser-Taliente 등이 공개한 verbalizer는 활성화 하나당 평균 130토큰, 최대 150토큰을 생성한다. 감사 대상 트랜스크립트는 수백에서 수천 개 위치를 갖기 때문에 모든 위치를 설명하는 것은 실시간 모니터링에 쓸 수 없다. 기존 연구는 관행적으로 위치를 골랐다. 수학 문제에서는 답 직전 마지막 위치만 읽거나, 에이전트 트랜스크립트에서 8개 위치를 균등 간격으로 뽑는 식이다. 이 논문은 어떤 위치를 설명해야 위협에 대한 정보를 얻는지, 그리고 그 위치를 설명 생성 전에 값싸게 고를 수 있는지 묻는다.

어떻게 동작하나

저자들은 설명을 생성하기 전에 계산할 수 있는 점수, 즉 ranker를 정의하고 세 계열 13개 신호를 비교한다. 예측 분포(다음 토큰 확률), 어텐션 패턴, 활성화 벡터다. 활성화 계열에는 벡터 크기와 채널 집중도를 재는 norm_ratio, peak_ratio, dominant_mass와 인접 위치 간 변위를 재는 resid_jump, resid_jump_nla가 있다. 13개 신호는 모두 한 번의 순전파로 얻을 수 있다. 여기에 순전파가 전혀 필요 없는 구조(structure) 베이스라인이 붙는다. 채팅 템플릿에서 얻는 chat role, segment, boundary ordinal, 정규화된 위치 인덱스를 특징으로 로지스틱 회귀를 학습시킨 것이다. 신호는 스케일이 달라서 각 모델·데이터셋마다 중위순위를 [0,1]로 정규화하고, 방향(값이 클수록 on-task인지 작을수록 on-task인지)을 데이터셋·모델별로 맞춘 뒤, 두 신호를 α∈{0.25, 0.5, 0.75}로 섞는다. 13개 단일 신호와 3×C(13,2)=234개 앙상블, 총 247개 후보가 나온다.

무엇과 다른가

실험은 '브리지' 방식이다. 트랜스크립트의 모든 토큰 위치(프롬프트, 응답, 채팅 템플릿 포함)에서 활성화를 설명으로 바꾸고, 판정 모델(DeepSeek-V4-Flash, temperature 0)이 설명 하나만 보고 데이터셋별 예/아니오 질문에 답한다. 이렇게 만든 설명이 총 4,705,657개다. 모델은 Qwen2.5-7B, Gemma-3-12B, Gemma-3-27B, Llama-3.3-70B 네 개, 데이터셋은 프롬프트 인젝션의 OpenPromptInjection·Tensor Trust와 은닉의 Liars' Bench·taboo organisms로 14개 조합이다. 결과는 이렇다. 방향 보정 AUROC의 중앙값은 0.584, 중간 절반은 0.535~0.634, 최대는 0.796이었다. 각 조합에서 가장 강한 신호는 14개 중 11개에서 활성화 벡터에서 나왔고 어텐션 패턴이 3개, 예측 분포는 한 번도 없었다. 그런데 순전파가 필요 없는 구조 베이스라인이 최고 단일 신호보다 pooled AUROC가 14개 중 12개 조합에서 높았고, case-macro AUROC 기준으로도 11개에서 높았다. 설명이 위협에 실제로 집중하는지도 확인했다. OpenPromptInjection에서 주입된 구간 안의 위치는 바깥 위치보다 on-task 설명을 13~66배 더 자주 받았고, Liars' Bench는 l70과 g27에서 각각 8배, 9배였다.

어떻게 쓰나

감사자는 트랜스크립트 하나에 쓸 설명 개수, 즉 예산을 정해야 한다. 위치 1개, 8개, 1%, 5%, 10% 예산에서 정밀도를 재면, 구조 랭커가 선택된 앙상블보다 예산 1개에서 14개 중 11개, 예산 8개에서 12개 조합에서 정밀도가 높았다. on-task 위치가 희소한 10개 조합에서 예산 8개 기준 구조 랭커는 평균 0.491, 앙상블은 0.392, 무작위는 0.191이었다. 데이터셋별로 선택된 앙상블은 OpenPromptInjection이 lookback_ratio+sink_drain(50/50, 전체 pooled 0.754 / held-out case-macro 0.761), Tensor Trust가 resid_jump_nla+w(75/25, 0.682/0.567), Liars' Bench가 dominant_mass+head_disagreement(50/50, 0.722/0.541), taboo organisms가 dominant_mass+norm_ratio(50/50, 0.750/0.775)였다. 위치 5%만 설명했을 때 전체를 설명한 성공률 대비 유지 비율은 구조 랭커 기준 OpenPromptInjection 0.995, taboo organisms 0.958, Tensor Trust 1.000이었고 무작위는 0.761, 0.594, 1.000이었다. Liars' Bench는 0.813으로 낮았는데, 증거가 대화 전체에 흩어져 있기 때문이다. '설명 3개 이상'이라는 더 엄격한 기준에서는 같은 세 수치가 0.785, 0.568, 0.998로 내려간다. 저자들은 관련 설명 하나를 얻는 데 트랜스크립트의 1/20이면 충분하다고 정리한다.

전제와 한계

또 하나의 결과는 verbalizer의 전이성이다. verbalizer는 특정 모델의 활성화를 복원하도록 학습되지만, 감사자가 실제로 받는 것은 그 모델을 파인튜닝한 사본일 수 있다. taboo organisms는 네 모델 각각을 low-rank adapter로 파인튜닝해 비밀 단어(moon, ship, snow)를 암시만 하고 절대 말하지 않게 만든 것이다. 어댑터를 원본 모델에 얹고 verbalizer를 그대로 적용했더니, 12개 organism에서 14~27% 위치의 설명이 비밀 단어를 말했다. 텍스트 역전(text inversion) 반론도 통제했다. 비밀 단어를 요구하는 프롬프트에는 세 단어가 모두 들어 있지 않고, 한 base model의 세 organism은 채팅 템플릿과 사용자 메시지가 동일한 텍스트인데도 자기 단어를 12~25% 위치에서 말했고 다른 organism의 단어는 최대 2.8%에서만 말했다. 같은 텍스트가 세 가지 답을 낸다는 것은 텍스트 역전으로 설명되지 않는다.

실무적으로 이 논문이 주는 지침은 명확하다. 감사 파이프라인에서 설명 예산을 배분할 때 모델 순전파를 돌려 신호를 계산할 필요가 없다는 것이다. 채팅 템플릿에서 얻는 역할·구간 정보만으로 순위를 매겨도 대부분의 조합에서 더 나은 위치를 고른다. 다만 신호의 방향은 데이터셋마다 뒤집힌다. 13개 신호 중 8개가 14개 조합 중 5개 이상에서 소수 방향을 가졌고, entropy만 데이터셋 내 모델 간 방향이 일치했는데 그마저 OpenPromptInjection과 taboo organisms 사이에서 뒤집혔다. 부호를 잘못 적용하면 무작위 선택보다 나쁘다. 또 하나, Tensor Trust처럼 on-task 비율이 이미 0.68~0.86으로 높은 데이터셋에서는 선택기가 더할 여지가 0.14뿐이다. 저자들은 선택기를 고르기 전에 설명 표본으로 기저율을 먼저 재보라고 권한다.

저자들이 밝힌 한계는 두 가지다. 첫째, on-task 라벨이 판정 모델 하나로 만들어졌다. 두 번째 모델과 사람 검토로 라벨 신뢰도를 확인하는 일이 남아 있다. 둘째, 모델당 verbalizer 레이어 하나만, 그리고 비교적 짧은 트랜스크립트만 평가했다. 레이어 간 일반화와 더 긴 에이전트 트랜스크립트로의 확장은 검증되지 않았다. 윤리 성명에서도 은닉 정보 복원이 민감 정보를 노출할 수 있고, 선택적 검사가 위협을 놓칠 수 있다고 명시한다. 이 평가는 설명의 관련성을 측정할 뿐 모델 안전성을 입증하지 않는다.