언어를 바꾸면 되살아나는 LLM 언러닝 구멍을 174개 언어로 측정한다

Linguistic Loopholes in LLM Unlearning: From a 174-Language Benchmark to Coverage-Aware Unlearning

arXiv2609.40286v1

Tyler Skow2026-09-30

무엇인가

LLM 언러닝은 사전학습·파인튜닝 데이터에 포함된 개인정보, 저작권 자료, 나중에 위험해진 지식의 영향을 재학습 없이 제거하는 작업이다. 문제는 최근 모델의 다국어 능력이 좋아지면서 표면적 접근 경로가 언어 수만큼 늘어났다는 점이다. 한 언어에서 사실을 지워도 질의 언어나 요청하는 답변 언어를 바꾸면 잊힌 것처럼 보이던 지식이 다시 열린다. 저자들은 이를 교차언어 구멍(cross-lingual loophole)이라고 부른다. 모든 언어에서 동시에 언러닝하는 우회법은 확장성이 없고, 실험에서 확인되듯 무관한 모델 능력과 다국어 생성 능력에 대한 손상을 키운다.

어떻게 동작하나

논문은 이 문제를 언어 예산 기반 다국어 언러닝(language budgeted multilingual unlearning)이라는 과제로 정식화한다. 망각 감독은 K개의 소스 언어 부분집합에서만 주어지고, 평가는 소스 언어와 감독이 없는 나머지 헬드아웃 언어에서 함께 이뤄진다. 이를 연구하기 위해 Cross-Lingual Unlearning Tensor를 구축했는데, 174개 언어-문자 쌍과 25개 원자적 패러프레이즈 유형, 그 패러프레이즈를 40개 언어로 번역한 데이터를 포함한다. TOFU(합성 저자 프로필 QA, 10% forget 분할)와 LUME(창작 단편·PII 포함 전기·위키백과 실제 전기)를 기반으로 삼았고, 세 모델 패밀리(Tiny Aya, Qwen3, Llama 3)를 27개 언어로 파인튜닝해 81개 단일언어 체크포인트와 22개 다국어 체크포인트, 총 103개 파인튜닝 체크포인트를 만들고 각각에 retain-only 오라클을 짝지었다. 언러닝으로는 287개 체크포인트를 생성했다. 벤치마크의 각 항목은 질의 언어와 답변 언어의 조합인 라우트로 표현되며, 평가 지표는 오라클 정규화 잔여 접근 R=(p_U−p_O)/(p_FT−p_O)이다. 소스 언어에서 동일한 수준의 망각에 도달한 체크포인트만 비교하는 matched source forget 프로토콜(평균 진행률 0.95, 최소 0.90 임계값)을 쓴다.

무엇과 다른가

벤치마크가 드러낸 사실은 여러 가지다. 한 언어로 파인튜닝했을 때 다른 언어로의 접근 상승은 폭넓지만 질의 쪽에 집중되고, 답변까지 다른 언어로 표현해야 할 때 이득이 훨씬 작다. 언러닝 후 전체 텐서에서 대안 접근 라우트 중 같은 망각 수준에 도달하는 비율은 20% 미만으로, 학습과 망각 사이에 교차언어 비대칭이 존재한다. 힌디어를 예로 들면 데바나가리 문자로 질문해 언러닝한 뒤 같은 문자로 평가하면 제거가 약하고, 로마자로 질문해 언러닝한 뒤 데바나가리로 평가해도 마찬가지다. 저자들은 이를 두고 평가된 언러닝 방법들이 의미 경로가 아니라 통사적 경로를 억제하는 것이라고 해석한다. 패러프레이즈 유형별로는 조동사(modal verb) 패러프레이즈가 세 모델 패밀리 모두에서 정답을 가장 잘 노출시켰고, 종속절·문장 양태 변형도 상위에 올랐다. 제거가 특히 어려운 언어로는 저자원 언어 다수와 함께 러시아어와 중국어가 일관되게 꼽혔다.

어떻게 쓰나

COVER(COVerage-guided source selection for multilingual ERasure)는 헬드아웃 망각 예시 없이, 배포 시점에 악성 데이터가 아닌 무해한 캘리브레이션 데이터와 동결된 모델만으로 소스 언어 집합을 고른다. 절차는 이렇다. 캘리브레이션 데이터에서 각 예시의 마지막 프롬프트 토큰 은닉 상태를 디코더 블록별로 코사인 유사도로 비교하고, 소스 언어 예시가 헬드아웃 언어의 자기 대응 번역과 얼마나 유사한지에서 가장 유사한 비대응 예시와의 유사도를 뺀 마진을 계산한다. 두 개의 분리된 캘리브레이션 세트로 민감도를 낮추고 평균낸다. 고정 커버리지 방식은 각 헬드아웃 언어에 대해 선택된 소스 중 최대 마진을 취해 평균을 최대화하는 집합을 고른다. 학습 커버리지 방식은 LangRank에서 착안해 헬드아웃 커버리지의 평균·최소·표준편차, 소스-타깃 쌍 마진의 평균·최소, 각 타깃의 두 번째로 강한 소스 마진 평균 등 6개 특징을 표준화하고, 가중 쌍별 로지스틱 손실과 ℓ2 정규화로 선형 스코어러를 적합한다. 개발용 9개 그리드에서 180개 부분집합 결과를 학습한다. 선택적으로 소스 언어별 가중치를 조정해 헬드아웃 언어에 대한 최소 가중 친화도를 최대화할 수도 있다.

전제와 한계

실험은 세 모델 패밀리를 script-diverse(EN, AR, JA, RU, ES, ZH), Latin-script(EN, DE, ID, SW, TR, VI), low-resource(EN, AR, HA, HI, NE, SW) 세 개의 6언어 세트로 파인튜닝하고, 9개 체크포인트에서 크기 1~3의 41개 부분집합 전부에 SimNPO를 적용해 진행했다. K=3인 20개 삼중 조합을 다섯 가지 데이터 순서로 반복해 순위 일치도를 측정했다. 결과적으로 최선의 언어 부분집합은 균일 선택 대비 헬드아웃 잔여 접근을 14.0~31.4% 개선했고, 저자원 인벤토리에서는 최악의 부분집합이 최선의 부분집합보다 Aya 2.04배, Llama 1.94배, Qwen 1.92배 많은 잔여 접근을 남겼다. COVER는 균일 소스 선택 대비 헬드아웃 평균 잔여 접근을 7.8~27.3% 줄였다. LUME 문서 삭제 요청(173개 문서 그룹)에서는 균일 대비 21.3% 감소로, 고정 커버리지의 3.9%와 이전 요청의 최선 부분집합 재사용의 4.9%를 크게 앞섰다. 행동 지표에서도 COVER는 추출 강도, 완전 누출, 부분 누출에서 대조군을 이겼다. Llama 누출은 32.37%에서 25.72%로, Aya는 29.76%에서 25.57%로 줄었고 Qwen은 동률이었다. 헛소리(gibberish) 비율은 낮게 유지됐고, 무누출·무헛소리·요청 언어만 사용한 답변 비율은 Llama 5.6%p, Aya 4.6%p 늘었다. 사람이 번역한 LORELEI 뉴스 문서(영어·힌디어·스페인어·러시아어·중국어·스와힐리어·벵골어·베트남어 100개 문서)에서도 문서 시작 프롬프트 기준 Aya 6.1%, Qwen 2.6% 잔여 접근 감소를 보였지만, 문서 중간 프롬프트에서는 각각 2.0%, 0.9%로 개선폭이 줄었다.

소스 언어 가중치 실험은 모델 의존적 절충을 보여준다. Qwen에서 EN·AR·ZH 소스 집합에 캘리브레이션 가중치를 적용하면 6개 언어 전체 누출이 34.44%에서 25.65%로 줄고, retain이 80.56%에서 81.44%로 오르며 헛소리도 0.63%에서 0.43%로 감소했다. 헬드아웃 JA·RU·ES의 완전 누출은 39.00%에서 29.59%로 떨어졌다. 반면 Llama는 완전 누출이 31.76%에서 26.33%로 줄었지만 헛소리가 5.69%에서 18.48%로 급증해 유틸리티 비용이 컸다. 실무 관점에서 이 논문이 주는 시사점은 명확하다. 삭제 요청을 처리할 때 감독 언어를 몇 개만 고르더라도 어떤 언어를 고르느냐가 결과를 크게 바꾸며, 개별적으로 강한 소스 언어를 단순히 모으는 것은 좋은 집합으로 이어지지 않는다. 또한 질의 언어와 답변 언어를 분리해 평가해야 하며, 문자 표기(로마자 대 네이티브 스크립트)나 패러프레이즈 유형까지 검증 항목에 넣어야 실제 누출을 잡을 수 있다.

저자들이 밝힌 한계도 분명하다. 소스 가중치 실험은 모델을 가로질러 일반적으로 우월한 캘리브레이션 규칙을 확립하지 못했고, 향후 과제로 남긴다. 언어 부분집합 순위는 요청 간 상관이 강하게 재현되지만 보편적으로 재사용 가능한 최선의 집합을 보장하지는 않는다. Qwen의 요청 B는 교차 요청 상관 ρ=0.668이었지만 상위 5개 부분집합 중 공유된 것은 하나뿐이었다. Latin-script 인벤토리는 중앙값 격차가 2.36~3.05 오라클 정규화 포인트로 script-diverse(5.13~6.40)나 low-resource(7.63~11.33)보다 작아 순위를 판별하기 어려웠다. LORELEI 실험의 개선폭은 합성 벤치마크보다 작고 보존 성능과의 절충이 측정됐다. 또한 모든 언어에 감독을 주는 방식은 유지 지식과 다국어 생성 능력 손상을 키운다는 점도 실험으로 확인했다. 전체 데이터셋은 동료 심사를 거친 뒤 공개될 예정이라고 밝히고 있다.