증류 방어는 강화학습 한 번이면 무너진다
Distillation Defenses Easily Break After Reinforcement Learning
무엇인가
이 논문은 증류 공격(distillation attack)에 대한 기존 방어 평가가 잘못된 위협 모델에 기반하고 있다고 주장한다. 증류 공격이란 공격자가 클로즈드소스 모델의 추론 트레이스를 대량 수집해 자기 모델을 지도학습으로 훈련시키는 방식으로, 값싸게 최신 성능을 복제하는 수법이다. 문제는 기존 연구와 프런티어 랩의 평가가 모두 증류 직후의 공격자 모델 성능만 측정한다는 점이다. 이는 공격자가 증류 이후 추가 학습을 하지 않는다는 암묵적 가정인데, 저자들은 실제 공격 파이프라인에는 증류 후 강화학습(RL)이 포함될 가능성이 높다고 본다.
어떻게 동작하나
논문의 절차는 세 갈래다. 첫째, 증류와 RL 중 무엇이 더 좋은 성능을 내는지, 그리고 둘을 순차적으로 결합하면 어떤지 비교한다. 둘째, 대표적 방어인 안티디스틸레이션 샘플링(antidistillation sampling)을 사례로 들어 증류 직후 평가와 증류 후 RL 평가를 대조한다. 셋째, 클로즈드소스 API가 전체 추론 트레이스 대신 요약만 돌려주는 상황에서, 약한 '확장기(expander)' 모델로 요약과 최종 답변을 다시 완전한 추론 트레이스처럼 부풀린 뒤 그 데이터로 공격자 모델을 증류하는 단순 공격을 제안한다. 확장기는 별도 학습이 필요 없고, 요약에 담긴 의미 정보만으로 근사 트레이스를 복원한다는 발상이다.
무엇과 다른가
실험 결과는 기존 통념을 뒤집는다. 동일한 문제 집합에 대해 RL로 학습한 모델이 거의 모든 경우 증류만 한 모델보다 정확도(pass@1)가 높았고, 증류 후 RL을 수행한 모델이 두 방법을 각각 단독으로 쓴 것보다 가장 좋았다. 다만 pass@k로 보면 증류가 모델의 '추론 경계'(소프트 성능 상한)를 더 크게 끌어올렸다. 저자들은 증류의 교차엔트로피 손실이 모드 커버링(mode-covering)이라 확률 질량을 넓게 퍼뜨리는 반면, RL은 모드 시킹(mode-seeking)이라 정답에 질량을 집중시키는 차이로 설명한다. 즉 증류는 이후 RL을 부트스트랩하는 역할을 하므로, 최고 성능을 노리는 공격자는 증류+RL을 쓸 것이라는 논리다.
어떻게 쓰나
안티디스틸레이션 샘플링 사례에서는 Qwen2.5-1.5B-RL 교사 모델의 출력을 낮음·중간·높음 수준으로 오염시켜 교사 상대 성능을 각각 10%, 30%, 86% 떨어뜨린 뒤, Qwen2.5-0.5B 학생 모델을 증류했다. 증류 직후에는 오염이 학생 성능을 분명히 낮췄지만, 이후 RL을 돌리면 오염되지 않은 학생과 낮음·중간 오염 학생의 성능이 거의 같아졌고, 심지어 증류 없이 RL만 한 경우보다 성능이 높았다. 높은 수준의 오염만 효과가 남았는데, 이는 방어가 작동한 것이 아니라 교사 자체가 형편없어졌기 때문이라고 저자들은 지적한다.
전제와 한계
요약 재구성 공격은 오픈소스 환경에서 먼저 검증했다. Qwen2.5-14B-RL을 교사로, Llama-3.2-3B-Base를 공격자 모델로, Llama-3.2-3B-Instruct를 확장기로, Qwen2.5-7B-Instruct를 요약기로 사용했다. Minerva와 MATH500 같은 어려운 데이터셋에서 확장된 요약으로 증류한 모델은 증류 직후에는 원본 전체 트레이스로 증류한 모델보다 성능이 낮았지만, RL 이후에는 격차가 사실상 사라졌다. 이어 Claude Sonnet 4.6, GPT-5 mini, Gemini Flash 3.6을 대상으로 같은 공격을 수행했고, Claude와 GPT-5 mini는 Panfilov 등이 공개한 변형 공격으로 전체 트레이스를 추출해 비교 기준으로 삼았다(Gemini는 실험 시점에 해당 취약점이 패치되어 제외). RL 이후 단순 확장 공격은 전체 트레이스 증류와 비슷한 성능 회복을 보였다.
개발자 관점에서 이 논문이 던지는 메시지는 분명하다. 추론 요약, 안티디스틸레이션 샘플링처럼 단일 API 응답 단위로 적용되는 '응답 수준 방어'는 이중용도(dual-use) 문제 때문에 근본적으로 한계가 있다. 요약이 전체 추론의 의미 정보를 담고 있다면 근사 트레이스 복원이 가능하고, 정보를 더 빼면 정당한 사용자(예: 증명을 요청한 연구자)의 경험만 나빠진다. 저자들은 대신 여러 관련 질의를 묶어 보는 '배치 수준 방어'를 유망한 방향으로 제시하지만, 공격자들이 여러 계정과 지역을 나눠 쓰기 때문에 실시간 탐지는 어렵다고 인정한다. 도메인 특화 응답 수준 방어(예: 사이버보안 질의 차단)는 현실적인 절충으로 평가한다.
한계도 저자들이 직접 밝힌다. 모든 실험은 RL 학습이 가능한 3B 이하의 비교적 작은 모델에서 수행됐고, 실제 증류 공격은 훨씬 큰 모델을 쓸 가능성이 있다. 실험 과제도 수학 추론에 국한되며, 장기 에이전트 코딩 같은 다른 검증 가능 과제는 다루지 않았다. 제안한 공격 자체도 최적화되지 않은 단순 버전으로, 더 정교한 공격은 더 좋은 성능이나 더 적은 비용을 낼 수 있다. 또한 프런티어 모델에 대한 공격은 안전 문제와 학습 자원 제약으로 시연하지 않았고, 전체 트레이스 추출 코드는 공개하지 않았다.