파인튜닝 망각은 지식 삭제가 아니라 되돌릴 수 있는 접근 차단이다

When Forgetting is not Catastrophic: On the Mechanics of Spurious Forgetting

arXiv2610.08718v1

Vedant Palit2026-10-06

무엇인가

언어모델을 새 데이터로 계속 학습시키면 이전에 습득한 지식과 능력이 손상되는 파국적 망각은 이미 널리 보고된 현상이다. 그런데 성능 하락이 곧 지식 소실은 아니다. 다른 프롬프트로 물으면 되살아나기도 하고, 옛 예제 몇 개만 다시 보여주면 되돌아오기도 한다. 이 논문은 그중에서도 특히 명확한 사례를 다룬다. 새 사실만 학습해도 옛 사실의 재현율이 붕괴했다가, 같은 새 사실을 계속 학습하는 것만으로 부분적으로 회복되고, 그 뒤에야 서서히 침식되는 궤적이다. 저자들이 던지는 질문은 하나다. 언제 망각은 파국적이지 않은가. 이들은 이미지 분류나 강화학습 전반이 아니라 사실 지식(factual knowledge)에 범위를 좁힌다. 합성 전기(synthetic biographies)를 쓰면 모델이 아는 사실을 정확히 지정할 수 있고, 새 사실이 이전에 본 적 없다는 것과 옛 사실과의 관계를 통제할 수 있어서 '출력하지 못함'과 '저장되지 않음'을 분리해 측정할 수 있기 때문이다.

어떻게 동작하나

실험 설정은 이렇다. 트랜스포머를 겹치지 않는 두 전기 집합 A와 B에 한 번에 사전학습시켜 모든 사실을 재현하게 만든 뒤, 리플레이 없이 새 인물들의 전기로 파인튜닝한다. 새 전기 집합은 두 종류를 비교하는데, C는 A와 B 모두와 겹치고 B′는 B하고만 겹친다. C로 파인튜닝하면 전형적인 파국적 망각이 나타난다. 새 사실을 배우는 동안 A와 B의 재현율이 완만하고 꾸준히 떨어진다. 반면 B′로 파인튜닝하면 B의 재현율은 거의 영향받지 않는데 A는 세 단계를 그린다. 새 사실이 학습되기 훨씬 전에 재현율이 급격히 떨어지는 붕괴, A가 학습 데이터에 전혀 다시 등장하지 않는데도 새 사실이 습득되면서 부분적으로 돌아오는 회복, 그리고 파국적 망각처럼 느리게 계속되는 침식이다.

무엇과 다른가

저자들은 이 궤적을 재현하는 최소 연상 기억 모델을 제시한다. 각 사실은 키에서 값으로의 사상이고, 키는 모든 사실이 공유하는 단위 벡터 μ와 사실별 무작위 벡터 e_i를 α로 섞어 만든다(k_i = √α·μ + √(1−α)·e_i). 값은 어휘를 반으로 나눠 A는 한쪽, B는 다른 쪽에서 뽑고, 새 사실 B′는 B와 같은 쪽에서 뽑는다. 모델은 RMS 정규화를 사이에 둔 2층 네트워크에 소프트맥스 판독부를 붙인 형태로, 트랜스포머의 마지막 선형층들에 대응한다. 세 가지 재료가 모두 필요하다. 키의 공유 구조가 약해지면 붕괴가 느려져 완만한 망각만 남고, 새 값이 어휘 전체에서 뽑히면(C로 파인튜닝한 경우) 마찬가지로 완만한 망각만 남으며, 정규화가 없거나 ReLU로 대체하면 옛 사실이 붕괴한 뒤 영영 회복되지 않는다.

어떻게 쓰나

메커니즘은 이렇게 정리된다. 새 사실에 대한 경사 하강은 그 사실과 비슷한 키를 가진 모든 은닉 상태를 함께 밀어낸다. 키들이 공통 성분을 공유하므로 새 사실들의 오차가 공통 성분을 가지면 모든 은닉 상태가 같은 방향으로 이동하고, 고차원에서 사실별 성분은 거의 직교하므로 이동량은 α에 비례하는 공통 이동으로 근사된다. 이 공통 이동은 은닉 상태들의 상대적 기하 구조는 대체로 보존한 채 판독부를 통해 새 답변이 몰려 있는 어휘 절반을 편들어, 반대쪽에 답을 둔 A의 사실들을 복호화할 수 없게 만든다. 정규화는 이 효과를 증폭한다. 이동이 은닉 상태 노름의 대부분을 차지하면 정규화가 모든 상태를 이동 방향으로 회전시켜 개별 정보를 눌러버린다. 회복은 정규화 때문에 일어난다. 새 사실의 개별 성분이 정답을 가리키기 시작하면, 즉 개별 마진이 음에서 양으로 바뀌면 같은 항이 이동을 되돌린다. 논문은 이동 크기 s의 동역학을 s˙ = α√d·σ(σγ̄_sh − sγ̄_ind)/(s²+σ²)^{3/2}, s(0)=0 형태로 유도한다. 공유 마진 γ̄_sh는 초반에만 작용하고, 개별 마진 γ̄_ind가 부호를 바꾸는 시점에 이동이 정점을 찍는다. 정규화가 없으면 두 번째 항이 사라져 이동을 되돌릴 힘이 없고 붕괴가 영구화된다. 한편 붕괴 이후에도 사실별 변위는 계속 누적되며, 이것이 느린 침식을 만든다. 즉 망각은 모두가 공유하는 가역적 접근 상실과 개별 사실의 느린 침식이 겹친 것이고, 파국적인 것은 두 번째뿐이다.

전제와 한계

통제된 트랜스포머에서도 같은 구조가 확인된다. 판독부 입력에서 옛 사실 표현의 변위를 공통 이동과 사실별 잔차로 분해하면, 공통 이동은 빠르게 커져 붕괴 바닥에서 정점을 찍고 회복기에 부분적으로 되돌아오는 반면 사실별 이동은 더 느리게 자라 결국 공통 이동을 추월한다. 로짓에서 공통 성분만 빼면 붕괴가 완전히 사라지고 완만한 하락만 남으며, 공통 성분만 남기면 붕괴와 회복이 그대로 재현된다. 학습률과 배치 크기를 바꾸면 붕괴 바닥의 위치가 스텝 기준으로 3배까지 움직이지만 새 사실 정확도는 거의 같은 지점에서 나타난다. 즉 붕괴의 끝은 학습 스텝 수가 아니라 새 사실의 학습 정도가 결정한다. 다만 붕괴의 깊이는 학습률이 클수록 깊어지는데, 이는 경사 흐름 분석의 예측 밖에 있는 효과다.

사전학습 언어모델에서도 검증한다. OLMo 2 1B가 파인튜닝 전에 정확히 답하던 CounterFact 사실을 옛 사실로 삼고, 리플레이 없이 새 사실 문서로 파인튜닝한다. 새 답변은 추적 중인 옛 사실의 답변과 첫 토큰을 공유하지 않게 해서, 새 답변이 옛 사실이 쓰지 않는 출력 공간 영역을 차지하도록 만든다. 새 사실이 합성 개인(가상의 이름에 실제 회사·도시·국가·언어를 무작위로 부여)이면 통제 실험의 궤적이 그대로 나타난다. 붕괴, 회복, 침식이다. 새 개인 수를 4배로 늘리면 붕괴가 더 오래가고 더 깊어진다. 반면 새 사실이 실제 제품(EntityQuestions에서 제조사를 모르는 제품)이면 옛 사실은 회복되지 않고 계속 하락한다. 제품 종류가 제조사 종류를 암시하듯 주체가 답을 예측하는 정보를 담고 있으면 공유 방향이 영역 안에서 답을 고르는 데도 계속 도움이 되어, 이동이 끝내 철회되지 않기 때문이다. 가중치 개입 실험도 있다. 각 가중치 업데이트의 최상위 특이 방향을 빼면 붕괴가 대부분 사라지고 완만한 침식만 남으며, 같은 노름의 무작위 rank-one 행렬을 빼는 대조군은 재현율을 전혀 바꾸지 못한다. 실제 제품 조건에서는 학습이 끝내 되돌리지 못한 옛 사실 대부분이 복원되는데, 이는 그 하락이 삭제가 아니라 철회되지 않은 이동이었음을 뜻한다. 이 편집은 새 사실 재현율도 떨어뜨리지만, 새 사실이 어느 정도 학습된 뒤에는 편집된 모델이 같은 새 사실 정확도에서 원래 학습된 모델보다 옛 사실을 더 많이 재현한다. 원문 본문에는 정확도·재현율의 구체적인 수치나 표의 숫자가 제시되지 않았고, 위에 적은 배수와 단계 서술이 정량적으로 언급된 전부다.

실무적으로 이 논문이 주는 시사점은 분명하다. 새 도메인 데이터로 파인튜닝한 뒤 옛 능력이 떨어졌다고 곧바로 지식이 삭제됐다고 결론 내리면 안 된다. 특히 새 데이터가 특정 출력 영역에 몰려 있고 옛 지식과 키 구조를 공유한다면, 하락의 상당 부분은 되돌릴 수 있는 접근 차단일 수 있다. 저자들이 제시하는 진단은 두 가지다. 옛 사실 표현의 변위를 공통 성분과 개별 성분으로 분해해 보고, 공통 성분을 빼거나 각 가중치 업데이트의 최상위 특이 방향을 제거해 재현율이 돌아오는지 확인하는 것이다. 또한 새 데이터가 스스로 답을 암시하는 구조를 가질수록(제품 종류가 제조사를 암시하는 식) 새 사실은 빨리 배우지만 옛 사실은 회복되지 않는다는 트레이드오프도 기억할 만하다. 새 사실을 빨리 학습시키는 요인이 곧 옛 사실 회복을 막는 요인이라는 뜻이다.

저자들이 밝힌 한계도 분명하다. 최소 모델은 의도적으로 극단적이며, 정규화가 주도하는 회복은 실제 데이터에서 더 약할 가능성이 있다. 다만 붕괴 자체는 더 일반적일 수 있다고 본다. 사전학습 모델 실험에서 회복 여부의 차이를 새 사실의 주체가 답에 대해 알려주는 정보량으로 귀속시키지만, 두 종류의 새 사실은 다른 측면에서도 다르고, 검증에 사용한 모델도 단 하나뿐이다.