1차 근사 모델로 파인튜닝 망각 확률을 사전에 상한한다
When Can First-Order Models of Fine-Tuning Bound Forgetting?
무엇인가
파인튜닝은 모델이 원래 알고 있던 사실을 잊게 만든다. 이 논문은 망각을 사후에 측정하는 대신, 파인튜닝이 시작되기 전에 각 보호 대상 사실별로 이번 런이 그 사실을 잊게 만들 확률의 상한을 계산할 수 있는지 묻는다. 기존 연구는 어떤 예제가 잊힐지 순위를 매기지만, 순위만으로는 개별 사실이 살아남을 확률을 알 수 없다. 저자들은 LoRA 파인튜닝과 SGD, 그래디언트 클리핑 조합을 다룬다.
어떻게 동작하나
실험 설정은 두 단계 파인튜닝이다. 태스크 A가 보호할 사실을 가르치고(합성 사실 320개 중 64개 보호), 이어서 태스크 B가 같은 형식의 새 연관 128개를 학습한다. CounterFact 데이터에서는 사전학습 모델이 이미 정답을 맞히는 64개 사실을 보호하고 태스크 A를 건너뛴 뒤, 다른 주체에 대한 반사실 재작성 256개로 태스크 B를 학습한다. 모든 모델은 4비트 가중치 위에 rank 8 LoRA를 모든 선형 계층에 적용하고, 태스크 B는 배치 8(CounterFact는 4), 그래디언트 클리핑 노름 1인 SGD로 학습한다. 각 사실의 margin은 정답 로그확률에서 가장 강한 오답 로그확률을 뺀 값이고, 지평 T=40(한 연구는 80) 스텝 안에 margin이 0 아래로 떨어지면 망각으로 정의한다. 참조 런에서 margin이 계속 양수인 사실만 적격 사실로 취급하고, 조건당 32개(초기 두 조건은 24개) 테스트 런으로 망각 빈도를 잰다.
무엇과 다른가
제안 방법의 핵심은 시작 상태에서만 측정하는 유한차분 프로브다. 시작 상태에서 16개 보호 사실의 margin 그래디언트 주방향으로 정규직교 기저 8개를 만들고, 각 섭동 시점 s와 이후 시점 t에 대해 ±0.02 크기 섭동을 가한 뒤 같은 미니배치 순서를 재생해 margin 변화를 측정해 응답 계수 q를 얻는다. 이로부터 섭동 u가 t시점 margin을 q^T u만큼 바꾼다는 1차 응답 모델을 세운다. 이 모델은 홀드아웃 섭동에서 상관계수 0.974~0.998(6개 체크포인트, 3개 모델 패밀리, 15/15 검증 런 통과)을 기록했고, 학습률 0.008~0.012에서도 0.939~0.995였다. 기저를 무작위 저랭크로 잡으면 상관이 0.057로 떨어지고, Adam에서는 약 10스텝 뒤 선형성이 깨진다. 프로브는 섭동 시점부터 T까지 런을 재생하므로 O(k|G|T) SGD 스텝이 들고, 지평의 제곱으로 늘어난다.
어떻게 쓰나
그런데 이렇게 정확한 모델로 만든 망각 예측 5개가 새 데이터에서 모두 실패했다. 저자들은 결합 논증으로 오차를 누적 국소 오차와 국소 모델이 검증된 영역을 벗어날 확률로 분리하고, Qwen3-0.6B에서 망각 하나가 검증된 최대 파라미터 변화의 약 18배 변화를 요구한다는 것을 보인다. 그래서 대신 margin의 선형 대리 모델이 경계 B0=0.01 아래로 처음 내려갈 확률을 Freedman·Azuma 최대 마팅게일 부등식으로 상한한다. 상한은 a(참조 런 margin과 경계 사이 거리), c(증분 한계), V(예측 가능 2차변동), 그리고 R(런 동안 응답 계수가 얼마나 변하는지)로 구성되며, a'=a−R>0일 때 Azuma 상한은 exp(−a'^2/(2Tc^2)), Freedman 상한은 exp(−a'^2/(2(V+ca'/3)))가 된다. 값이 0.05 미만이면 그 사실을 인증한다. R=0으로 두면 단순화 Freedman 상한이 된다.
전제와 한계
사후 분석에서 단순화 Freedman 상한은 적격 사실의 80.1%를 인증했지만 41개 조건 중 7개에서 위반됐고, 위반된 14개 사실은 전부 R ≥ a였다. R을 유지하는 완전 Freedman 상한은 R < a인 사실만 인증하며 모든 조건에서 지켜졌다. 위반 사실에서 테스트 런 간 최종 margin의 표준편차는 응답 모델 예측의 중앙값 14.6배였고, R < a 사실에서는 1.6배였다. 즉 실패는 단순화가 아니라 1차 모델 자체의 붕괴다. 시점별 계수를 쓰는 per-time 상한도 112개 조건에서 74.5%를 인증했지만 5개 조건에서 위반됐고, 위반된 14개 사실은 모두 R ≥ a였다. 완전 상한은 적격 사실의 31.2%만 인증해 Azuma(22.1%)보다는 많지만 단순화 상한보다 훨씬 적다. 조건 단위로 분기하는 screened bound는 이전 조건에서 모든 실패를 막았지만 새 시작 상태에서 무너졌다.
새 시작 상태에 대한 전향 연구는 6개 조건 집합(Qwen3-0.6B, Llama-3.2-1B, Qwen3-1.7B, Qwen3-8B 합성 사실, Qwen3-0.6B·Llama-3.2-1B CounterFact) 33개 조건과 T=80 지평 연구, Qwen3-14B 연구로 구성됐다. screened bound는 평가 가능한 31개 조건 중 5개에서 위반(허용 4개)되어 기준을 통과하지 못했는데, 중앙 표준화 margin이 32~56인 조건을 Freedman 분기에 배정한 것이 원인이었다. 반면 47개 조건 전체에서 단순화 상한이 위반된 19개 사실은 모두 R ≥ a였고, 완전 상한·Azuma·사실별 규칙·margin 임계값은 모든 조건에서 지켜졌다. 사전 등록 확증 연구 19개 조건에서 완전 상한은 위반 0건이었고, 두 번째 확증 연구 24개 조건에서도 위반 0건(허용 3건)이었다. 풀링하면 완전 상한이 인증한 사실은 34,256개 (사실, 테스트 런) 쌍에서 0번 잊혔고, 상한이 허용한 값은 130.8회였다. R < a 사실만 보면 44,976쌍에서 0번이다. 전체 연구에서 인증률은 사실별 규칙 33.2%, 완전 상한 19.9%, Azuma 16.4%, margin 임계값 11.5%였고, 태스크 B 정확도는 평균 25.3%포인트 올랐다.
실무적으로 이 결과는 같은 업데이트를 하나의 시작 상태에서 여러 번 돌리는 상황, 예컨대 하나의 공유 모델을 여러 사용자에게 맞춤 적용할 때 유용하다. 시뮬레이션으로 0.05 수준 인증을 받으려면 95% 신뢰도에서 59번의 생존 런이 필요한데, 프로브 비용은 T=40에서 중앙값 38 테스트 런, T=80에서 68 테스트 런이다. 다만 저자들이 명시한 한계가 크다. 모든 상한은 선형 대리 모델에 대한 것이고 실제 margin으로 옮기는 잔차는 정량화되지 않아 실제 모델에서의 보장은 경험적 발견이며, 분산 추정치도 대부분의 사실에서 낮다. 완전 상한은 R ≥ a인 사실을 전부 배제하는데 그중 대부분은 모든 테스트 런에서 살아남았고, 그런 사실을 인증하려면 테스트 런을 따라가도 정확한 모델이 필요하다. 32개 테스트 런과 64개 사실에 대한 Bonferroni 보정에서는 상한 0.05인 사실이 8번 이상 잊혀야 위반으로 잡히므로 단일 조건은 큰 초과만 검출한다. 결과는 SGD, 40·80 스텝 지평, 조건당 64개 사실에 한정되며 Adam과 전체 파인튜닝은 미해결로 남는다.