LLM 안전에서 표현 공학은 행동 기반 안전장치를 대체하지 못한다

When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety

HF Daily2609.34771

Tianyi Guan, Jianhui Chen, Liangming Pan2026-09-28조회 2

무엇인가

대규모 언어모델의 안전장치는 두 가지 요구를 동시에 만족해야 한다. 위험한 행동을 줄이는 통제(control)와, 위험이 발생할 때 이를 탐지하는 모니터링(monitoring)이다. 지금까지 통제는 RLHF·DPO 같은 정렬 학습이, 모니터링은 입력과 출력 텍스트를 읽는 텍스트 모니터가 담당해 왔다. 표현 공학(representation engineering)은 이와 달리 모델 내부 표현을 직접 다룬다. 활성값을 수정해 생성을 바꾸는 조향(steering)과, 활성값을 읽어 안전 상태를 판별하는 프로브(probe)가 그것이다. 문제는 이 두 계열이 거의 항상 따로 평가돼 왔다는 점이다. 조향은 다른 조향 기법과만 비교되고, 프로브와 텍스트 모니터는 서로 다른 모델·데이터셋·프로토콜에서 평가돼 상대적 역할을 알 수 없었다. 이 논문은 동일 조건 맞대결 평가로 그 공백을 메운다.

어떻게 동작하나

통제 트랙에서는 DPO와 세 가지 표현 조향 기법을 비교한다. 비교 대상은 대조 활성 덧셈(CAA), Inference-Time Intervention을 따른 프로브 기반 조향, 흐름 기반 조향(flow-based steering)이다. 모델은 Qwen2.5-1.5B-Instruct, Qwen2.5-14B-Instruct, Meta-Llama-3.1-8B-Instruct 세 종류이며, DPO와 조향 기법 모두 PKU-SafeRLHF 데이터를 같은 예시 수로 맞춰 학습한다. 평가 축은 세 가지다. 견고성은 StrongREJECT의 단일 턴 탈옥 공격 성공률(ASR)과 Alpaca-Cleaned로 무해 파인튜닝한 뒤의 안전성 지속력을 본다. 실용성은 MMLU·GSM8K·HumanEval 성능, XSTest 과잉 거부율, 데이터 규모에 따른 확장성을 측정한다. 세분성은 일반 안전과 사이버 범죄·신체 위해·독성 세 영역 사이의 전이를 본다. 유해 순응과 거부 판정은 별도 LLM 심판이 맡는다.

무엇과 다른가

모니터링 트랙에서는 네 가지 표현 프로브를 두 텍스트 모니터와 비교한다. 텍스트 모니터는 LoRA로 파인튜닝한 Qwen2.5-7B-Instruct와 별도 과제 학습 없이 쓴 Qwen3Guard-Stream-4B다. 프로브는 Qwen2.5-32B-Instruct가 생성한 홀드아웃 궤적에서 48번째 층 은닉 상태를 읽는다. 지표는 전체 응답 기준 AUROC·AUPRC와 목표 1%·5% FPR로 보정한 TPR, 스트리밍 탐지의 재현율과 정규화 첫 경보 위치, 그리고 추가 연산량이다. 마지막으로 프로브 신호로 개입했을 때 실제 안전이 회복되는지를 별도로 실험한다. 차단(blocking)과 교정 재생성(corrective regeneration) 두 결합 전략을 DPO와 흐름 조향 모델에 적용한다.

어떻게 쓰나

통제 결과에서 DPO가 가장 강했다. AIM과 거부 억제 두 공격 모두에서, 무해 파인튜닝 전후 모두에서 가장 낮은 ASR을 기록했다. 다만 무해 파인튜닝 후 절대적 ASR 증가폭은 DPO가 가장 컸다(평균 0.271). AIM 공격에서 DPO는 0.027에서 0.436으로 뛰었고, 흐름 조향은 0.308에서 0.602로 올랐다. 거부 억제에서는 DPO 0.132, 흐름 0.159로 비슷했다. 과잉 거부는 흐름 조향이 가장 높아 0.281에서 0.308로 증가했고, DPO는 0.277에서 0.175로 오히려 낮아졌다. CAA와 프로브 기반 조향은 파인튜닝 후 0.164로 기반 모델 0.169에 가까웠다. 능력 면에서 흐름 조향은 MMLU가 0.616으로 기반 모델 0.659보다 크게 떨어졌지만, 파인튜닝 후 거시 평균은 0.722로 기반 모델 0.721과 비슷해졌다. 데이터 확장성은 갈렸다. DPO는 데이터가 늘수록 꾸준히 좋아졌고, CAA와 프로브 기반 조향은 예시를 늘려도 이득이 거의 없었다. 흐름 조향은 고품질 대조 데이터를 쓴 소규모 저데이터 조건에서 DPO에 맞먹거나 앞섰다. 영역 전이는 DPO가 가장 강했고, 흐름 조향은 일반 안전에서 개별 영역으로의 전이가 가장 좋았다. CAA와 프로브 기반 조향은 영역 특화 학습 후 오히려 일반 안전 성능을 떨어뜨릴 수 있었다.

전제와 한계

모니터링에서는 텍스트 모니터가 전체 응답 탐지에서 앞섰다. Qwen3Guard가 AUROC 0.996으로 가장 높았고 AUPRC 0.995로 파인튜닝 텍스트 모니터와 동률이었다. 가장 강한 표현 프로브인 평균 풀링은 AUROC 0.982, AUPRC 0.978로 근소하게 뒤졌다. 보정 운용점에서는 차이가 더 벌어진다. 5% 보정에서 평균 프로브는 TPR 0.986에 FPR 0.190이었고, Qwen3Guard는 TPR 0.968에 FPR 0.056이었다. 스트리밍에서는 Qwen3Guard가 재현율 0.948, 첫 경보 중앙 위치 0.034, 시퀀스 수준 FPR 0.058을 기록해 파인튜닝 텍스트 모니터(재현율 0.575, 위치 0.158)를 크게 앞섰다. 프로브 중에서는 롤링 집계가 재현율 0.913, 중앙 위치 0.143, 시퀀스 FPR 0.017로 균형이 가장 좋았고, 안전 궤적에서 오경보가 모든 모니터 중 가장 적었다. 비용 차이는 압도적이다. 생성 모델의 활성값을 재사용하는 네이티브 구성에서 Qwen3Guard는 롤링 프로브보다 약 7.6×10^5배 많은 주변 FLOPs를 요구한다.

모니터-통제 결합 실험은 실무적으로 가장 중요한 결과다. 5% 보정 임계값에서 프로브 기반 차단은 무해 파인튜닝 후 14B DPO 모델의 평균 ASR을 0.500에서 0.042로 낮춰, 파인튜닝 전 0.058에 근접시켰다. 교정 재생성도 같은 0.042를 냈지만 과잉 거부가 0.108에서 0.120으로 오른 반면, 차단은 0.124였다. 차단은 DPO에서 0.058→0.021, 0.500→0.042로, 흐름 조향에서 0.157→0.038, 0.639→0.056으로 파인튜닝 전후 모두 ASR을 낮췄다. 반면 흐름 조향 강도를 높이는 방식은 일관된 이득이 없었고 일부 임계값에서는 ASR을 오히려 높였다. 교정 재생성은 모델 의존적이어서 더 크고 유능한 모델에서 효과적이었다. 텍스트 모니터를 차단 트리거로 쓴 기준선도 ASR을 낮췄으므로, 이 효과가 표현 프로브에만 국한되지는 않는다.

개발자 관점의 결론은 조건부 선택이다. 안전 데이터가 충분하면 DPO 같은 행동 정렬이 여전히 가장 강한 단독 통제를 제공하고, 데이터가 늘수록 안정적으로 좋아진다. 안전 데이터가 적고 품질이 높다면 흐름 기반 조향이 현실적 대안이 될 수 있지만, 과잉 거부와 능력 저하, 그리고 조향 층 선택에 따른 안전 지속력 민감도를 함께 확인해야 한다. 생성 모델의 활성값에 접근할 수 있다면 표현 프로브는 텍스트 모니터 대비 훨씬 낮은 주변 비용으로 경쟁력 있는 탐지를 제공하며, 특히 롤링 집계가 스트리밍에서 균형이 좋다. 정렬 학습 후 무해 파인튜닝으로 안전성이 무너지는 상황이라면, 재정렬 학습을 한 번 더 돌리는 대신 프로브 기반 차단을 모니터링 계층으로 붙이는 것이 저비용 회복 경로가 될 수 있다. 다만 활성값 재사용이 전제이며, 별도 모델로 응답을 재생해 활성값을 얻는 구성에서는 추가 순전파 비용이 발생한다.

저자가 밝힌 한계도 분명하다. 일부 통제 실험은 단일 학습 시드로 돌려 실행 간 변동성을 포착하지 못한다. 탈옥 평가는 비적응적 공격만 사용하므로, 배포된 방어책에 맞춰 프롬프트를 조정하는 공격자에 대한 견고성은 검증되지 않았다. 또한 평가에 쓰인 벤치마크와 자동 판정은 제한된 배포 위험만 다루므로, 이 결과가 어떤 모델을 안전하다고 인증하는 것으로 해석되어서는 안 된다고 저자들은 명시한다.