언어모델의 자기수복은 이미 있던 상쇄 가중치가 드러난 현상이다

Every Ablation Is a Dose: Counterweights and the Semblance of Self-Repair

arXiv2610.02173v1

Areeb Ahmad2026-10-01

무엇인가

언어모델의 특정 컴포넌트를 제거(ablation)하면 다른 컴포넌트가 조정을 일으켜 행동이 일부 살아남는 현상이 반복적으로 관찰돼 왔다. 이를 자기수복(self-repair)이라 부르는데, 가장 체계적인 기존 연구는 이 현상이 노이즈가 많고 단일한 설명을 갖기 어렵다고 결론지었다. 이 논문은 반대로 단일한 원인이 있다고 주장한다. 삭제 이전에 이미 존재하던 이득(gain), 즉 상쇄 가중치(counterweight)가 삭제로 인해 드러난 것이라는 설명이다. 회로 발견, 귀인(attribution), 언러닝 평가가 모두 ablation 결과에 의존하기 때문에, 이 해석은 해당 도구들의 신뢰성 문제와 직결된다.

어떻게 동작하나

핵심 장치는 대조쌍 위에 정의된 하나의 좌표축이다. 대조 프롬프트 쌍 (x, x')에 대해 코어 방향 c의 활성값 a(x), a(x')를 중간점 m = (a(x)+a(x'))/2와 대조 Δ = a(x')-a(x)로 분해하고, 코어를 a(λ) = m - (λ/2)Δ 로 매개한다. λ=+1은 원래 클래스의 clean 활성값, λ=-1은 반대 클래스 활성값으로의 스왑, λ=0은 클래스 차이가 없는 중간점이다. 이 축 위에서 기존의 zero/mean/resample ablation은 실험자가 고른 값이 아니라 데이터가 정한, 보정되지 않은 한 점에 불과하다.

무엇과 다른가

측정은 두 단계 개입을 중첩한다. 1차 개입 π_λ는 코어를 m - (λ/2)Δ로 고정하는 것이고, 2차 개입 sec_r^b는 그렇게 만들어진 세계 b 안에서 하위 방향 r의 계수를 파트너 프롬프트 x'에서의 값으로 패치하는 것이다. 추정량은 r의 자연스러운 판독을 개입했을 때 지워지는 판정 마진, 즉 E_r^b(x) = D(x;b) - D(x;b, sec_r^b)이며, 두 패스 모두 같은 세계에서 돌기 때문에 1차 개입의 이동이 상쇄된다. 이 값이 양수면 r이 판정을 지지하고, 음수면 반대한다.

어떻게 쓰나

λ가 |λ|≤1 구간에 있을 때, 하위 방향 r의 판정 기여도는 E_r^c(λ) = own_r^c + γ_r λ 라는 아핀 관계를 따른다. 기울기 γ_r은 삭제 여부와 무관하게 모델에 고정된 결합 계수이고, 부호가 음수면 상쇄 가중치, 양수면 릴레이(relay)다. Llama-3-8B-Instruct, Gemma-2-9B-it, Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3 네 모델의 사실 판정(true/false) 과제에서, 코어가 도달할 수 있는 81개 방향 중 68개가 두 클래스 모두에서 0이 아닌 기울기를 보였다. 그중 52개가 상쇄 가중치, 16개가 릴레이였다. λ=+1, 0, -1 세 지점으로 적합한 직선은 학습에 쓰지 않은 λ=±1/2 지점을 방향별 응답 범위의 중앙값 9% 이내로 예측했고, 패밀리별 out-of-sample R²는 0.65에서 0.91이었다.

전제와 한계

코어 자체는 매우 작다. Llama에서는 뉴런 하나(L18.n11065), Gemma(L28.n2046, L33.n4294), Qwen(L22.n13149, L24.n14758), Mistral(L20.n14286, L19.n8228)에서는 각각 두 개이며, 이들이 clean 상태의 총 효과 중 52.7~56.6%를 담당한다. γ_r의 크기는 실험 설계의 인공물이 아니라 체크포인트 가중치에서 예측된다. 코어의 쓰기 벡터와 하위 방향의 읽기 행 사이의 코사인 유사도를 2,000개의 랜덤 리더에 대해 z-점수화한 wiring alignment z_r은 |γ_r|과 Spearman ρ 0.55~0.82로 상관했고, 네 모델을 Fisher 방법으로 결합하면 p≈10^-10이었다. GPT-2 Small의 IOI 회로에서도 개입이 도달하는 헤드 10개 중 7개가 법칙을 따랐고, 그 7개는 전부 상쇄 가중치였다. 특히 copy suppression 헤드로 알려진 L10.h7의 |γ_r|은 0.886으로 다음으로 큰 값의 7배였다.

이 관점에서 기존 ablation은 dose 축 위의 한 점으로 흡수된다. 코어에 a:=v 클램프를 걸면 λ(v) = 2(m-v)/Δ에 놓이는데, zero ablation은 2m/Δ에, mean ablation은 프롬프트 쌍마다 다른 위치에 떨어진다. IOI의 두 코어 네임 무버에 대해 mean ablation은 중앙값 기준으로 중립 dose(+0.03, -0.00)에 놓이지만, L9.h9는 8%만이, L9.h6은 40%가 on-manifold 윈도 밖에 떨어진다. 즉 어떤 헤드를 지우느냐에 따라 법칙이 적용되지 않는 프롬프트 비율이 달라진다. LayerNorm 재정규화는 감사된 동원 효과의 최대 4.5%만 설명했다.

실무적으로 이 논문은 ablation 기반 해석에 경고를 던진다. 회로 발견, 귀인, 언러닝 평가에서 컴포넌트를 지우고 그 효과를 읽는 방식은 지워진 컴포넌트의 중요도를 과소평가하고 그 역할을 오귀인할 수 있다. 특히 후기 레이어에서 발견되는 '보상 컴포넌트'는 새로 켜진 것이 아니라 원래부터 코어에 반대 방향으로 결합해 있던 요소일 수 있다. 따라서 ablation 결과를 해석할 때는 어떤 dose가 적용됐는지, 그리고 그 dose가 자연 활성 범위 안에 있는지 확인해야 한다.

저자들이 밝힌 한계는 분명하다. 하나의 과제, 하나의 답 위치, 단일 토큰에서 읽는 True/False 판정만 연구했다. 생성 과제를 포함한 다른 과제로 일반화되는지는 열린 문제다. 코어, 상쇄 가중치, 릴레이는 모두 의미가 읽히는 단일 의미(monosemantic) 가중치 공간 방향에서 찾았지만, 반드시 그럴 필요는 없다. 두 개의 코어를 가진 모델에서는 하위 상쇄 가중치가 어느 한 코어보다 결합 개입에 더 강하게 반응했는데, 이는 분산된 컴포넌트로부터의 결합 가능성을 시사하며 전수 매핑은 향후 과제로 남는다. GPT-2 IOI 실험의 벤치도 한 모델의 헤드 10개로 작아, 계수가 법칙대로 작동하는지는 검증하지만 일반화 범위는 말해주지 않는다. 또한 L11.h10은 유일하게 곡선 응답을 보였는데, 매개 헤드인 L10.h7을 코어에 함께 클램프하면 |β_r/γ_r|가 2.608에서 0.292로 떨어지고 R²가 0.413에서 0.972로 올라 법칙이 회복된다.