가중치 교란으로 언어모델의 희귀 실패 확률을 추정하는 Iterative Unalignment
Rare Event Estimation via Iterative Unalignment
무엇인가
이 논문은 자율 에이전트가 긴 호라이즌으로 배포될 때 문제가 되는 꼬리 위험, 즉 고정된 입력(프롬프트)에 대해 언어모델의 자기회귀 생성 과정 자체의 확률적 변동에서 발생하는 희귀 실패 사건의 확률을 추정하는 문제를 다룬다. 목표량은 μ := p(E|x) = E_{y~p(·|x)}[Φ(y)]이며, 여기서 Φ는 궤적의 이진 속성(예: 중요한 데이터를 삭제하는 도구 호출 조합을 냈는가)을 지정하는 지표다. 확률이 10^-9라면 단일 롤아웃에서는 거의 관측되지 않지만, 수십억 사용자가 동시에 에이전트를 돌리는 배포 규모에서는 무시할 수 없다. 순진한 몬테카를로는 이 영역에서 계산적으로 불가능하고, 중요도 샘플링(IS)은 사건 영역에 더 많은 질량을 주는 제안분포 q_δ에서 샘플링한 뒤 p(y)/q_δ(y)로 재가중해 이 부담을 덜어준다. 문제는 커버리지다. 제안분포가 사건 조건부 분포를 왜곡해 q_δ(y|E) ≈ p(y|E)가 깨지면, 즉 일부 사건 궤적을 과소 커버하면 중요도 가중치가 폭발해 분산이 커지거나 추정기가 붕괴한다.
어떻게 동작하나
제안 방법인 Iterative Unalignment(IU)의 핵심은 제안분포를 언어모델 자체의 가중치 교란으로 정의하는 것이다. 즉 q_δ := p_{θ+δ}로 두면, 동일한 파라미터가 모든 디코딩 스텝의 조건부분포를 결정하므로 하나의 교란 δ가 접두사 의존 조건분포 전체를 일관되게 바꾸고, δ ↦ q_δ 사상이 미분 가능하므로 제안 설계가 토큰 시퀀스 공간에 대한 명시적 탐색이 아니라 언어모델 파라미터 공간에서의 경사 기반 최적화 문제가 된다. 논문은 틸팅을 세 수준으로 구분한다. 출력 로짓에 학습 가능한 |V|차원 벡터를 더하는 로짓 수준, 가중치는 고정한 채 은닉 활성에 학습 가능한 오프셋을 더하는 활성 수준, LoRA 등으로 가중치 자체를 교란하는 가중치 수준이며, 저자들은 가중치 공간 틸팅에 집중한다. 또 하나의 설계 결정은 사건 정의와 탐색 신호의 분리다. 사건은 임의의 이진 지표 Φ로 고정하고, 탐색은 미분 가능한 대리 신호 S_δ가 담당한다. 대리 신호는 사건을 정확히 정의하거나 확률을 추정할 필요 없이, 사건과 상관되거나 사건을 가능하게 하는 조건을 포착해 값을 키우면 Φ=1이 더 자주 나오게 하는 방향 신호면 충분하다. 이는 스칼라 점수 g(y) 하나로 사건 정의와 제안 탐색을 동시에 하는 고전적 cross-entropy나 지수 틸팅과 다르다. IU의 목적함수는 두 요소를 결합한다. 미분 가능한 대리 신호가 제안을 사건 쪽으로 밀어 증폭하고, 각 스텝별 발산 정규화 항이 샘플링된 접두사에서 제안이 베이스 모델로부터 얼마나 공격적으로 벗어나는지를 측정한다. 정규화 강도는 유효 표본 크기(ESS)를 온라인 진단 지표로 삼아 조정되며, 이 피드백 루프가 증폭과 추정기 안정성 사이의 균형을 잡는다.
무엇과 다른가
실험은 GPT-2 Small(약 120M 파라미터)과 Gemma-2(약 2.6B 파라미터) 두 모델, 세 가지 사건군(Token Presence, Compositional Token Presence, Profanity Classifier)에 걸쳐 319개 사건을 대상으로 한다. 확률은 10^-9까지 내려가며, 참조 확률은 상대 표준오차 10% 미만으로 계산되었다. 추정기와 사건마다 64,000개 궤적의 평가 예산을 썼고, Token Presence만 훈련과 평가를 합쳐 배치 128 기준 약 2,500만 회의 forward pass가 필요했다. 지표는 quantile log error E_0.95로, 반복 실행의 95%에서 추정값과 참 확률이 몇 자릿수 떨어져 있는지를 측정한다. 이는 유한 표본이 놓치기 쉬운 희귀한 대형 오차를 반영하기 위한 선택이다.
어떻게 쓰나
결과 수치는 다음과 같다. GPT-2 Small, L=50에서 IU는 표시된 모든 오차 임계값에서 순진한 몬테카를로 대비 기하평균 추정기 효율 이득 20,000배 이상을 달성했다. 10^-8 ≤ μ < 10^-7 구간에서는 L=10, 30, 50 모두에서 계산 가중 효율 이득이 800배를 넘었다. 훈련 후 추정당 128개 샘플만으로 10^-9 ≤ μ < 10^-7에 속하는 GPT-2 Small 사건 60개에 대해 로그 오차가 1.17 자릿수에 머물렀다. 가장 희귀한 구간(10^-9 ≤ μ < 10^-8, E_0.95 = 1)에서는 모든 시퀀스 길이에서 기하평균 추정기 효율 이득이 10^6을 넘었다. 사건이 희귀해질수록 이득이 커지고, 길이가 늘어나도 성능이 유지되는데, 저자들은 이를 정규화 항이 스텝별로 촘촘하게 제안분포를 제어해 긴 궤적에서 중요도 가중치 분산을 억제하기 때문으로 본다.
전제와 한계
베이스라인 비교도 구체적이다. IU는 활성 공간 교란(IU AS)과 로짓 교란(IU Logit), cross-entropy 계열(CE AS, CE Logit)보다 정확도 요구가 엄격해질수록 이득을 더 많이 유지했는데, 이는 가중치 공간 교란의 표현력 이점을 시사한다. CE 계열은 긴 시퀀스에서 측정 가능한 이득을 내지 못했다. Dorman 등의 MCMC 기반 방법은 사건 빈도가 ~10^-5 이하인 영역에서 사건 히트를 전혀 기록하지 못해 깊은 꼬리 비교가 불가능했고, Angell 등의 활성 개입 방법은 대표 예시와 사건 히트가 필요해 베이스라인에서 제외되었다(그 원 논문은 10^-4 근처 확률에서 10~20배 이득을 보고한다). Compositional Token Presence에서는 Ordered Sequence 사건에서 최대 2,090배, Conjunctive 사건에서 최대 196배의 추정기 효율 이득을 얻었지만, 세 토큰이 임의 순서로 모두 등장해야 하는 Conjunctive는 여러 유효 순서에 대한 커버리지 유지가 어려워 계산 가중 이득이 35.3배와 11.3배로 줄었다. Profanity Classifier(분류기 점수 f(y) > κ)에서도 L=10, 50 모두 이득을 냈다. Gemma-2에서는 이득이 더 작고 오차가 더 컸는데, 어휘 크기가 256,000 대 50,257로 훨씬 큰 점이 원인일 수 있다고 저자들은 추정한다.
개발자 관점에서 이 논문이 유용한 지점은 명확하다. 안전 튜닝을 마친 모델이 남기는 잔여 실패 확률을 배포 전에 정량화하거나, 리댐팅(입력을 찾는 작업)과 보완적으로 출력 궤적 분포 자체의 실패 빈도를 측정할 때 쓸 수 있는 절차를 제시한다. 다만 도입 전에 확인해야 할 것이 있다. 첫째, 참조 확률을 독립적으로 검증할 수 있는 사건 정의가 필요하다. 논문이 세 사건군을 고른 이유가 바로 낮은 분산의 참조값을 얻기 위해서다. 둘째, 대리 신호 S_δ의 설계가 성능을 좌우하며, 저자들도 이를 향후 개선 과제로 남겼다. 셋째, ESS를 모니터링해 정규화 강도를 조정하는 피드백이 필수적이며, 정확도 요구가 낮을 때는 훈련 비용이 전체 계산 비용을 지배해 샘플 수 차이가 큰 의미를 갖지 않는다. 넷째, IU 제안이 만든 높은 중요도 궤적들이 문법 구조를 유지하면서 사건 조건을 만족한다는 정성 예시는, 확률 추정을 넘어 모델이 그 실패에 도달하는 구체적 경로를 드러내는 용도로도 쓸 수 있음을 보여준다.
저자들이 밝힌 한계는 분명하다. 실제 복잡한 실패에 대해서는 검증 가능한 ground truth 확률이 없어 평가가 어렵고, 더 현실적인 실패와 정밀한 참조 확률을 갖춘 벤치마크가 필요하다고 말한다. Gemma-2와 Compositional Token Presence 결과는 더 큰 모델과 더 복잡한 사건에서 중요도 가중치 제어가 더 어려워질 수 있음을 보여준다. 또한 제안의 유연성을 높이면 사건 증폭에는 유리하지만 좁은 궤적 집합에 질량이 집중돼 커버리지가 나빠질 수 있고, 반대로 제안을 제한하면 증폭 능력이 떨어진다는 근본적 트레이드오프가 남는다. 평가가 두 모델 규모로 제한된 것도 반복 추정의 분산을 측정하려면 막대한 샘플링이 필요하기 때문이며, Dorman 등과의 비교에서는 상대 방법에 IU의 N=128 추정 전체 비용의 1.38배에 해당하는 예산을 보수적으로 부여했다는 점도 함께 밝히고 있다.