SAILS는 세트단위 학습선택으로 백도어 독극물을 강화해 최악 취약성을 드러낸다.
Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
무엇인가
이 논문은 LLM 백도어 데이터 오염 공격에서 '어떤 독극물 예제를 고르는가'가 공격 성공률을 얼마나 좌우하는지를 다룬다. 기존 평가는 모델, 깨끗한 파인튜닝 데이터, 트리거, 목표 행동, 독극물 개수를 고정한 뒤 후보 풀에서 독극물 세트를 무작위로 뽑는 방식을 쓴다. 이 프로토콜은 트리거와 목표 행동, 개수만 정해지면 어떤 세트를 고르든 결과가 비슷하다고 암묵적으로 가정한다. 저자들은 이 가정이 틀렸음을 보인다. LLaMA-3-8B 백도어 세 가지 설정에서 모델과 깨끗한 데이터, 트리거, 목표 행동, 독극물 개수를 모두 고정한 채 세트만 바꿨더니 홀드아웃 공격 성공률(ASR)이 3%에서 80%까지 벌어졌다. 즉 취약성은 트리거나 목표 행동, 개수만으로 결정되지 않고 어떤 세트를 고르느냐에 달려 있으며, 무작위 세트만 평가하는 방어자는 최악의 위험을 크게 과소평가하게 된다.
어떻게 동작하나
저자들은 독극물 선택을 '오라클 예산 제약 하의 세트 최적화'로 형식화한다. 하나의 오라클 질의는 선택한 독극물 세트를 깨끗한 데이터에 더해 모델을 파인튜닝하고 ASR을 재는 전체 실행이며, 스칼라 효용 R(S)를 돌려준다. 공격자는 최대 B번의 질의만 쓸 수 있다. 후보 900개에서 k=9개를 고르는 경우의 수는 C(900,9) ≈ 10^21에 달하지만 실용적 예산은 수백 번 수준이라 전수 탐색은 불가능하다. 자연스러운 대안은 영향 함수, TRAK, 데이터모델 기반 선택처럼 예제를 개별적으로 점수화하는 포인트와이즈 방식이다. 논문은 이 방식의 오차를 정밀도 손실과 가산성 손실로 나눈다. 세트 효용은 R(S) = c + Σ a_i z_i + Σ_{i<j} b_ij z_i z_j + ... 로 전개되는데, 가산적 프록시는 선형항만 남기고 상호작용 계수 b_ij를 버린다. 그래서 중복(b_ij < 0)을 벌하지 못하고 상보성(b_ij > 0)을 활용하지 못한다. 저자들은 단일 포인트와이즈 가산 프록시를 공격적으로 최적화하면 실제 ASR이 오히려 떨어질 수 있다는 것을 실험과 이론 양쪽으로 보인다.
무엇과 다른가
제안 방법 SAILS(Set-level Audit-Informed Iterative Learned Selection)는 제안–점수화–감사(propose–score–audit) 구조를 쓴다. 먼저 무작위로 뽑은 소량의 독극물 세트를 오라클로 평가해 초기 세트 스코어러 R̂(S)를 학습한다(기본값 |D_0| = 500개 라벨). 이후 남은 예산으로 여러 라운드를 돌면서, 매 라운드마다 N개의 후보 k-세트를 만들어 스코어러로 전부 점수화하고, ε-그리디 규칙(기본 ε=0.2, 즉 감사 목록의 20%는 무작위)으로 상위 m개(기본 m=10)의 짧은 목록만 실제 오라클로 감사한다. 감사에서 얻은 라벨을 학습 데이터에 추가해 스코어러를 다시 학습하는 정제 단계를 거치고, 모든 질의를 통틀어 측정 효용이 가장 높았던 세트를 최종 반환한다. 중요한 점은 최종 선택을 스코어러가 아니라 오라클이 한다는 것이다. 스코어러는 최선의 세트를 직접 찾을 필요 없이 강한 세트 하나를 감사 목록 안에 올릴 만큼 높게 순위만 매기면 된다. 논문의 정리 1은 이 감사 목록의 후회(shortlist regret)를 '최선 제안 세트의 과소평가'와 '감사된 세트 중 가장 작은 과대평가'의 합으로 상한 지으며, 최선 제안 세트가 감사되면 후회는 0이 된다. 스코어러는 세트의 텍스트 내용(풀 인덱스 순으로 정렬해 구분자로 이어붙인 직렬화)을 입력받는 DistilBERT 인코더와 회귀 헤드로 구성되며, 피해 모델의 가중치나 은닉 상태에 접근하지 않아도 된다. 또 스코어러 학습과 감사를 분리했기 때문에 값싼 소규모 파인튜닝에서 스코어러를 학습하고 비싼 전체 규모 파인튜닝의 후보 순위 매기기에 재사용하는 규모 전이가 가능하다.
어떻게 쓰나
주 실험은 LoRA로 파인튜닝한 LLaMA-3-8B-Instruct의 세 가지 백도어 설정이다. refusal(날짜 문자열이 앞에 붙으면 거절), command(같은 트리거에 sudo rm -rf 출력), compliance(암호 문구가 앞에 붙으면 유해 요청에 동의)다. 비교 대상은 무작위 선택, 그래디언트 내적/코사인, 바이레벨 영향 함수, TRAK, TRAK+representer, 오라클 그리디다. SAILS는 가장 강한 영향 기반 베이스라인 대비 홀드아웃 ASR을 평균 30%포인트 끌어올렸다. 추가 설정으로는 SmolLM-360M의 refusal 과제(오라클 질의당 약 1분), Qwen3-4B의 코드 생성 백도어(NL2SH-ALFA, 파일 경로 트리거로 공격자 스크립트를 내려받아 실행하는 명령 출력), Qwen3-4B의 WebShop 에이전트 백도어(사용자가 운동화를 요청하면 고가 상품을 구매, 전체 파라미터 파인튜닝), Tinker API를 통한 Kimi-K2.5의 API 전용 파인튜닝을 평가했다. SmolLM-360M에서는 오라클 보상을 향해 생성기를 학습시키는 오라클 가이드 강화학습 베이스라인에 근접하면서도 비용은 훨씬 적게 들었다.
전제와 한계
절제 실험에서 라벨 수 |D| = 200만으로도 |D| = 1500의 개선분 상당 부분을 얻었고 추가 라벨의 이득은 줄었다. 같은 예산에서 무작위 라벨 수집 대신 능동적 수집을 쓰면 ASR이 약 3~8%포인트 좋아졌다. 스코어러 구조는 DistilBERT 기반 BERT MSE(기본), 피해 모델 은닉 상태를 쓰는 Ridge, 쌍별 상호작용을 모델링하는 GNN을 비교했는데, 셋 모두 무작위 대비 오라클 격차의 82~87%를 메웠고 구조 간 차이보다 무작위 대비 개선이 컸다. 텍스트 인코더를 DeBERTa, ModernBERT, LLaMA-8B(LoRA)로 키워도 DistilBERT를 넘지 못했는데, 이는 현재 라벨 예산에서 스코어러 품질이 모델 용량이 아니라 학습 데이터에 의해 병목됨을 시사한다. 학습 목표로는 ASR보다 연속값인 트리거 손실 L_trig가 낫다. refusal에서 무작위 세트의 82%가 ASR 0%라 ASR 라벨은 세트를 잘 구분하지 못한다. 점수화하는 후보 수를 늘리면 ASR이 오르고 N ≈ 10^5 부근에서 이득이 줄어든다. 탐색 전략으로 best-of-N과 그리디 좌표 하강을 비교했는데, 좌표 하강이 refusal(72% 대 67%)과 command(92% 대 88%)에서는 앞섰지만 compliance(54% 대 62%)에서는 뒤졌다. 프록시 점수만 공격적으로 밀면 ASR이 오히려 낮아질 수 있어 저자들은 오라클 감사를 유지한다.
실무 관점에서 이 논문이 주는 메시지는 두 가지다. 첫째, 백도어 방어나 데이터 필터링을 평가할 때 무작위 독극물 세트나 영향 함수 기반 세트만 쓰면 위험을 과소평가한다. 방어 성능을 주장하려면 공격자의 최적화 예산을 명시해야 한다. 둘째, 파인튜닝 데이터 선택 자체를 세트 단위 최적화 문제로 보는 관점은 백도어 공격에만 국한되지 않는다. 목표가 강한 세트 상호작용을 보이고, 오라클 평가가 비싸지만 수백 번은 감당 가능하며, 콘텐츠 특징이 세트 수준 결과를 예측할 수 있을 때 학습된 세트 스코어링이 포인트와이즈 기여도 추정을 앞선다. 논문은 능동 학습, 커리큘럼 설계, 데이터셋 선택 같은 작업도 같은 조건을 만족할 수 있다고 본다. 코드는 공개되어 있다.
저자들이 밝힌 한계는 다음과 같다. 주 실험은 LLaMA-3-8B의 LoRA 파인튜닝에서 명령 수준 백도어 오염을 다루며, 사전학습 데이터 오염이나 RLHF 오염은 평가하지 않았다. 트리거와 목표 행동은 고정되어 있고, 최적 독극물 부분집합은 트리거의 의미적 성질에 의존할 가능성이 있다. 오라클 질의 하나가 전체 파인튜닝·평가 실행이라 단일 H200 기준 미니 약 3분, 전체 약 40분이 걸리고, 실용적 예산 B = 500~3000회는 클라우드 비용으로 대략 75~150달러 수준이다. 미니-투-전체 전이 전략이 비용을 줄이지만 70B 이상 모델로 확장하려면 추가적인 비용 절감이나 더 효율적인 프록시가 필요하다. 또한 SAILS는 공격 성공률만 최적화하는 단일 목표 방식이라 은닉성(데이터 필터링 회피)이나 방어 개입에 대한 견고성은 다루지 않는다. 스펙트럼 시그니처, 강건 집계 같은 최신 능동 방어에 대한 벤치마크도 향후 과제로 남겨두었다.