안전 데이터만으로 LLM 유해 입력을 찾는 국소 희소성 기반 이상 탐지
Local Sparsity Enables Unsupervised LLM Safety Detection
무엇인가
이 논문은 배포 시점의 LLM 안전 분류가 라벨된 불안전 데이터에 의존한다는 전제를 문제 삼는다. 새 탈옥, 라벨 집합에 없던 유해 행동, 처음 보는 도메인 입력처럼 불안전 분포가 배포 중 크게 바뀔 수 있으므로 고정된 불안전 분포에 맞춘 지도 학습은 일반화가 약할 수 있다. 저자들은 대신 안전 데이터만으로 정상성을 모델링하고 비정상 입력을 표시하는 이상 탐지 관점을 택한다. 다만 LLM 활성값은 고차원이라 비지도 이상 탐지가 통계적으로 가능한지 의문이 제기된다. 논문은 선형 표현 가설과 국소 희소성 아래에서는 가능하다고 주장한다.
어떻게 동작하나
핵심 구조는 선형 표현 가설이다. 각 임베딩이 개념 벡터들의 희소 조합이라고 보고, 희소 오토인코더(SAE)로 개념 공간을 근사 복원한다. 잔차 스트림 활성 a^(ℓ)(x)를 SAE 인코더 E로 z(x)로 보내고, z(x)의 0이 아닌 좌표 집합을 활성 지원 φ(x)라 한다. 전역 희소성은 E||z(x)||_0 = s << d2이고, 예시로 (d1,d2,s) ≈ (4096,16384,100)이 제시된다. 더 강한 가정은 국소 희소성이다. 어떤 반경 r0 안의 이웃들에서 활성 지원들의 합집합 크기 s_loc도 d2보다 훨씬 작다. 즉 가까운 점들은 적은 공통 활성 특징을 공유한다. 그래서 이상 탐지는 d2가 아니라 국소적으로 s_loc 차원에서 작동할 수 있다.
무엇과 다른가
제안 프레임워크는 네 단계다. 첫째, 밀집 활성 대신 SAE가 만든 희소 공간 z를 임베딩 공간으로 쓴다. 둘째, 안전 데이터에 K-means를 적용해 국소 이웃을 복원한다. 거리로는 활성 지원만 보는 해밍 거리 ρ_L0 = ||b(x)-b(x')||_0와 크기까지 보는 ρ_Lp = ||z(x)-z(x')||_p, p∈{1,2}를 검토한다. 클러스터 수는 동질성과 클러스터당 표본 수를 절충한다. 셋째, 각 클러스터에서 희소 부분공간을 이진 마스크 m_c로 정하고 m_c ⊙ z(x)로 적용한다. 전역 빈도 마스크는 전체 데이터에서 특징별 활성 빈도 f_j를 구해 상위 k개를 고르고, 클러스터별 빈도 마스크나 LoRA 어댑터 E_c = E + ΔE_c, D_c = D + ΔD_c로 학습한 마스크도 쓴다. 넷째, 테스트 점을 가장 가까운 중심에 배정한 뒤 마스크된 SAE 특징에서 중심 거리 s_dist(x)=||m_{c*} ⊙ (z(x)-μ_{c*})||_p 또는 적응된 인코더-디코더의 재구성 잔차 s_rec(x)=||a^(ℓ)(x)-D_{c*}(m_{c*} ⊙ E_{c*}(a^(ℓ)(x)))||_2로 점수화한다. 구체적 구현은 학습 없는 FreqMask-KM과 클러스터별 LoRA를 학습하는 LearnedMask-LoRA 두 가지다.
어떻게 쓰나
실험은 여섯 개 지시 튜닝 모델에서 수행된다. Qwen2-1.5B, Ministral-8B, LLaMA3-8B, Qwen3-8B, GPT-oss-20B, Gemma 4-26B이며, 잔차 스트림 활성은 각각 20, 20, 25, 30, 20, 25층에서 뽑는다. 안전 데이터는 일반 능력과 지시 수행 데이터, 평가 벤치마크의 안전 부분을 합쳐 모델당 약 206K 예시다. 불안전 범주는 BeaverTails의 유해 콘텐츠 요청, ToxiGen의 독성·혐오 언어, HarmBench의 적대적 공격을 여덟 공격 알고리즘에 걸쳐 모은 것이다. 베이스라인은 전역 Mahalanobis, GMM, One-Class SVM, Deep SVDD, CVDD이고, 참고 상한으로 지도 선형 프로브를 둔다. 지표는 AUROC와 TPR@5% FPR이다.
전제와 한계
결과에서 국소 희소성 방법들은 여러 모델에서 경쟁력이 있다. FreqMask-KM은 Ministral 0.914, LLaMA3 0.937, Qwen3 0.915, GPT-oss 0.900 AUROC를 냈고, LearnedMask-LoRA는 각각 0.896, 0.912, 0.917, 0.919를 냈다. Gemma에서는 FreqMask-KM이 0.856으로 약했지만 LearnedMask-LoRA가 0.904로 가장 좋은 비지도 방법이었다. Qwen3와 GPT-oss에서는 GMM이 0.942와 0.925로 근소하게 앞섰고 국소 방법이 0.025 AUROC 이내로 뒤따랐다. CVDD는 0.665~0.712, Deep SVDD는 0.389~0.665에 그쳤고 Deep SVDD는 시드 표준편차가 최대 0.18이었다. 지도 선형 프로브와는 8B 이상 모델에서 약 0.04~0.08 AUROC 차이가 남았다. TPR@5% FPR은 더 고르지 않아 모델별 최고 방법이 달랐다. Ministral에서는 One-Class SVM 0.694, LLaMA3에서는 FreqMask-KM 0.457, Qwen3와 GPT-oss에서는 GMM 0.639와 0.725, Gemma에서는 LearnedMask-LoRA 0.642였다. Qwen 1.5B에서는 모든 비지도 방법이 AUROC 0.80 미만이었다.
분해 실험은 표현 공간의 중요성을 보여준다. CVDD에 SAE 인코더를 넣기만 해도 평균 AUROC가 0.692에서 0.806으로 올랐고, 여기에 국소 희소 부분공간을 더하면 FreqMask-KM 0.904, LearnedMask-LoRA 0.909에 도달해 전역 밀도 베이스라인인 Mahalanobis 0.893, GMM 0.903과 비슷하거나 앞선다. 큰 모델에서는 마스크가 필요하다는 분석도 제시된다. 국소 유효 차원도 실제로 낮다. 90% 분산을 설명하는 PCA 성분 수 d90의 클러스터별 중앙값은 LLaMA3-8B 22, Qwen3-8B 20, GPT-OSS-20B 17.5로, SAE 차원 d2=16,384의 아주 작은 일부다. 원래 SAE 공간의 d90은 각각 72, 43, 78이었다. LLaMA3-8B에서는 원래 72, 전역 마스크 51, 클러스터별 마스크 22였고, Qwen3-8B에서는 43, 41, 20, GPT-OSS-20B에서는 전역 마스크가 78을 18로 낮추고 클러스터별 마스크가 17.5였다. 추가 모델도 Qwen2-1.5B 36, Ministral-8B 40.5의 중앙값을 보였다.
보정 실험은 실무적 가능성을 키운다. 안전 데이터로 학습한 클러스터 구조에서 불안전 데이터의 클러스터 배정이 매우 불균일해 소수 클러스터에 몰린다는 관찰을 이용한다. 표현을 다시 학습하는 대신 클러스터별 점수를 소량 라벨로 아핀 보정한다. 불안전 데이터 1%와 정상 OOD 데이터 1%를 쓰면 여섯 모델에서 AUROC가 0.265~0.750에서 0.962~0.990으로 오르고, 정상 데이터 오탐률은 0.12~0.92에서 최대 0.041로 줄었다. 계산에는 SAE 뉴런의 1~2%만 쓴다. 개발자 입장에서는 라벨된 불안전 데이터가 없거나 새 공격 범주가 계속 생기는 배포 환경에서 안전 데이터 기반 1차 필터로 검토할 수 있다. 다만 SAE 품질, 안전 데이터의 대표성, 소량 보정 라벨 확보 가능성, 모델별 최적 방법 차이를 확인해야 한다.
이론적으로는 국소 희소성이 표본 복잡도를 낮춘다는 결과를 제시한다. 안전 분포 P0와 불안전 분포 P1, 고정된 표현 z(x)=E(a^(ℓ)(x))를 두고, 안전 표본 D_n으로 전역 빈도 마스크 M과 K-means 중심을 추정한다. 정리 1은 가정 1과 2 아래에서 P0(f_hat_{n,q}(Z) ≠ f_q*(Z) | D_n) ≤ η_{0,n} + L0 ε_n을 보인다. 여기서 ε_n = ρ_n + sqrt(2 s_max/(n π_min))(v + B sqrt(2 log(4K/δ)))이고, nπ_min ≥ 8 log(4K/δ), n ≥ 8 γ^{-2} log(4d2/δ)를 요구한다. 균형 클러스터에서 샘플링 항은 O~(sqrt(K s_max/n))이고, K와 s_max가 s_loc 수준이면 O~(s_loc/√n)이 된다. 마스크 복원은 d2에 로그 의존한다. 다만 이 정리는 SAE 학습 자체나 ρ_n, η_{0,n}의 차원 의존성을 보장하지 않는다. 한계도 분명하다. 지도 선형 프로브와의 0.04~0.08 AUROC 격차는 불안전 분포를 미리 안다는 가정을 버린 비용이다. 비지도 탐지기는 안전 데이터의 학습 표현에 기반하므로 학습 중 과소대표된 정상 영역도 안전성과 무관하게 높은 이상 점수를 받을 수 있다. 지도 탐지기도 정상 분포 이동에 민감하지만, 불안전 분포가 배포 시점에도 대표적이어야 한다는 더 어려운 가정을 추가로 요구한다. 또한 Qwen 1.5B처럼 표현 품질이 낮으면 비지도 탐지 성능이 제한되고, 어떤 단일 방법도 모든 8B 이상 모델을 지배하지 않는다. 결론적으로 논문은 국소 희소성을 활용하면 비지도 LLM 안전 탐지가 실행 가능하며, 더 강한 임베딩이 확보되면 배포 시스템에 쓸 수 있다고 주장한다.