태스크 벡터 분산으로 모델 병합 붕괴를 미리 예측하고 PRISM으로 복구한다
Predicting and Repairing Merge Collapse in Large Language Models
무엇인가
같은 사전학습 체크포인트에서 파인튜닝한 특화 모델들을 가중치 수준에서 합치는 모델 병합은 재학습 없이 여러 도메인 능력을 한 모델에 담는 실무 기법이다. 태스크 산술(Task Arithmetic)은 특화 모델과 베이스의 차이인 태스크 벡터를 평균해 베이스에 더한다. 문제는 일부 병합이 베이스 모델보다 훨씬 아래로 붕괴하는데, 기존 병합 연산자는 평가를 돌리기 전까지 아무 경고도 주지 않는다는 점이다. 저자들은 이 붕괴를 예측하는 통계량 하나와, 그 통계량으로 보정되는 복구 연산을 함께 제안한다.
어떻게 동작하나
출발점은 앙상블의 ambiguity decomposition 항등식이다. 각 가중치 좌표에서 평균이 제거하는 평균제곱 파워는 특화 모델들 사이의 분산과 정확히 같다. 저자들은 이 분산을 간섭(interference)이라 부르고, 평균을 계산하는 같은 패스에서 함께 구한다. 간섭은 부호가 반대인 값들이 상쇄되는 cancellation과, 한 특화 모델만 움직이고 나머지가 0 근처에 머무는 one-sided drift를 포함한 dispersion으로 나뉜다. 작업용 노이즈 모델 아래에서 병합이 주입하는 교란은 병합 계수 c와 간섭의 제곱근에 비례해 커지며, 여기서 병합 전에 계산 가능한 스크리닝 점수 c√(Ī/K)가 나온다. 7B 모델에서 이 통계량 계산은 CPU 약 2분이면 끝난다.
무엇과 다른가
복구 연산 PRISM은 순서를 뒤집는다. 기존 prune-then-merge 계열이 각 태스크 벡터를 미리 잘라낸 뒤 평균하는 것과 달리, PRISM은 먼저 평균을 내고 그 합의(consensus)를 레이어마다 소프트 임계처리한다. 임계값은 λ_l = κσ_l√(2 log n_l), σ_l = √(Ī_l)로, 웨이블릿 축소의 Donoho–Johnstone 보편 임계값을 그대로 쓰고 κ=1.0으로 고정한다. 즉 임계값이 데이터가 아니라 그 레이어의 간섭에서 결정된다. 좌표의 절댓값이 λ_l을 넘을 때만 살아남고, 살아남은 값은 λ_l만큼 줄어든다. 투영 행렬 좌표의 0.1% 미만만 살아남으면 keep-rate 바닥을 적용해 임계값을 낮춘다. 여기에 ρ-게이트가 붙는다. 전체 간섭 중 상쇄에서 온 비율 ρ가 0.1 미만이면 λ_l=0으로 두고 평균을 그대로 반환한다. 즉 한쪽만 움직이는 유용한 드리프트는 건드리지 않는다. 기본 설정에서 PRISM은 MLP 투영(gate/up/down_proj)에만 적용하고 어텐션은 베이스 값을 유지하는데, 어텐션까지 확장해도 6개 태스크 평균 차이는 0.1pp 이내라고 밝힌다.
어떻게 쓰나
실험은 Qwen2.5, Llama-3.1, Mistral-7B, DeepSeek-7B 네 계열에서 K∈[2,8]인 22개 병합 구성으로 이뤄졌다. 결과는 붕괴(destructive) 아니면 무해(harmless) 둘로만 갈렸고 중간 사례가 없었다. 7개가 붕괴, 15개가 무해였는데, 간섭 점수는 붕괴 7개 중 5개를 임계값 1.9×10⁻³ 위로 잡아냈고 무해한 15개는 하나도 넘지 않았다. 반면 기존 병합 연산자들이 겨냥하는 부호 충돌 통계량은 오히려 역예측적(anti-predictive)이었다. 저자들은 통계량과 임계값을 고정한 뒤 14개 병합의 결과를 평가 전에 예측해 12개를 맞혔고, 그중에는 continued pretraining으로 임계값을 넘긴 특화 모델 쌍의 붕괴도 포함된다. 수학+코드 특화 모델 병합에서 PRISM은 6개 태스크 평균 기준 Task Arithmetic, TIES, DELLA를 최소 6.7pp 앞섰고, HumanEval에서는 Task Arithmetic이 13.4로 떨어지는 동안 최소 25.0pp 앞섰다. Qwen2.5-1.5B에서는 Task Arithmetic이 완전히 붕괴했고 PRISM이 가장 강한 베이스라인을 3.5pp 앞섰다. 벤더 네이티브 EvalPlus 평가에서 Task Arithmetic, TIES, DELLA, DARE, LEWIS, SLERP는 네 개 코딩 지표 모두 0.3 이하, Model Stock이 0.6이었지만 PRISM은 코딩 능력을 유지했다.
전제와 한계
계수 스윕에서 PRISM은 c 전 구간에서 64.8~68.0% 평균을 지켰다. c=0.7에서 비교 대상 네 베이스라인은 베이스보다 19~33점 아래로 떨어지며 perplexity가 100에서 961까지 치솟았다. c=1.0 생성 평가에서 Task Arithmetic, TIES, DELLA는 GSM8K에서 0점, LEWIS는 17.4였다. 데이터 의존 베이스라인과의 비교도 흥미롭다. AdaMerging은 비라벨 C4 텍스트로 엔트로피 최소화와 계수 스윕을 거쳐 최고 67.9를 기록해 PRISM의 67.8과 동률이었다. Greedy Soup은 특화 모델을 하나도 더하지 않고 베이스를 반환했고, Fisher 가중 평균은 47.5로 떨어졌다. 데이터 없는 경쟁자 중 Iso-C는 기본 설정에서 붕괴해 튜닝 후 66.6, WUDI-Merging은 모든 구성에서 발산했다. SLERP(t=0.5)는 노름 스케일 평균의 1.27배를 써서 붕괴했고, Model Stock은 2.4배 보간 축소를 적용하고도 14.8pp를 잃었다. 저자들은 단순 보수적 축소가 아니냐는 반문도 실험으로 다룬다. PRISM이 쓰는 업데이트 노름은 평균의 2.2%에 불과한데 베이스라인들은 46~285%를 쓴다. 같은 노름으로 맞춘 대조군은 붕괴는 피했지만 그 노름을 좌표의 85.1%에 퍼뜨리는 반면, PRISM은 임계처리로 남긴 0.1%에 집중한다. 그 결과 HumanEval에서 PRISM 65.9, 대조군 62.2, 베이스 62.8이었다. 절제 실험에서는 같은 임계값에서 소프트 임계처리가 하드 절단보다 6개 태스크 평균 4.4pp 높았고, 절단의 비용은 텍스트 생성 과제에 집중돼 GSM8K 19.2pp, HumanEval 최대 28.6pp인 반면 5개 객관식 벤치마크 평균은 1.4pp였다. κ를 0.25에서 3까지 바꿔도 평균 변동은 0.5pp 이내였다.
개발자 입장에서 가장 쓸모 있는 부분은 병합 전 스크리닝이다. 공개 체크포인트를 합치기 전에 태스크 벡터 분산만 계산하면 위험한 병합을 몇 분 만에 걸러낼 수 있고, 임계값 아래에서는 그냥 평균을 쓰면 된다. 실제로 15개 무해 구성 전부가 임계값 아래여서 평균을 유지했고, Llama-3.1-8B에서 R1-Distill과 Tulu-3의 단순 평균은 베이스 59.3 대비 62.6을 기록했다. 코드 특화 모델이 없는 공개 쌍 28개도 모두 임계값의 절반 아래였다. 저자들은 또 continued pretraining을 계속할수록 점수가 대략 학습 토큰 수의 제곱근으로 커진다는 것을 Qwen2.5-1.5B 특화 모델 두 개(일본어 웹 텍스트, PubMed 초록)로 보였다. 학습률 10⁻⁴에서 8개 체크포인트가 10억 토큰의 무해한 끝점을 지나고, 외삽하면 약 75억 토큰에서 임계값을 넘고 360억 토큰 근처에서 붕괴 군집 하단 4.17×10⁻³에 도달한다. 학습률을 5배로 올리면 추가 10억 토큰 안에 그 군집에 들어가는데, 각 특화 모델의 자체 도메인 perplexity는 오히려 좋아진다(일본어 16.7→12.2, PubMed 7.2→7.0). 즉 특화 모델 개별 성능만 보면 안전해 보이는 훈련이 병합 가능성은 망가뜨릴 수 있다.
한계도 분명하다. 예측 점수는 특화 모델들이 공통 신호와 독립적인 zero-mean 교란을 공유한다는 작업용 노이즈 모델에 기대고 있으며, Ī를 실제 분산 v_l의 경험적 대리값으로 쓰는 것은 저자들이 명시한 모델링 선택이다. PRISM의 기본 적용 범위는 MLP 투영으로 제한되고, ρ-게이트 임계값 0.1은 이 실험 설정들에서 0.093과 0.229 사이의 어떤 값이든 같은 결정을 낸다는 정도의 근거만 제시된다. 무엇보다 윤리 진술에서 저자들은 병합이 구성 모델들의 약점까지 합칠 수 있고, 파라미터 업데이트를 잘라내는 과정에서 취약한 안전 정렬이 제거되거나 특화 모델 간에 충돌하는 편향이 증폭될 수 있다고 경고한다. 이 논문의 스크리닝과 평가는 능력 벤치마크만 다루고 안전 행동은 측정하지 않으므로, 병합 모델을 배포하기 전에는 별도의 안전·정렬 평가가 필요하다는 것이 저자들이 밝힌 전제다.