100개 태스크를 순차 학습하는 언어모델의 장기 기억, 메커니즘 조합으로 망각을 늦추다

Continual Learning Mechanisms Compose for Long-Horizon Memorization

HF Daily2609.06986

Zheyuan Zhang, Alvin Zhang, Daniel Khashabi2026-09-07조회 4

무엇인가

이 논문은 언어모델이 시간차를 두고 도착하는 정보를 파라미터 안에 내재화하고, 이후 많은 업데이트를 거친 뒤에도 그 정보를 유지할 수 있는지를 다룬다. 저자들은 이를 long-horizon memorization(장기 지평 기억)이라는 설정으로 정의한다. 모델은 100개의 질의-응답 태스크를 연속적인 지도 미세조정(continual SFT)으로 학습하는데, 이전 태스크의 원본 학습 예시를 보관하거나 다시 보지 못하고, 추론 시점에 태스크 식별자도 받지 못한다. domain-incremental 설정이다. 프롬프트나 검색 증강은 정보를 모델 파라미터 바깥에 두고 매번 다시 공급해야 하지만, 이 논문은 반복 업데이트만으로 파라미터 자체가 기억이 될 수 있는지를 묻는다. 문제는 새 태스크를 위한 업데이트가 이전 지식을 덮어쓰는 치명적 망각이며, 저자들이 평가한 어떤 단일 continual learning 메커니즘도 이 지평에서 강한 유지율을 보이지 못했다.

어떻게 동작하나

저자들의 가설은 망각의 서로 다른 원인을 다루는 메커니즘을 조합하면 더 효과적이라는 것이다. 조합은 두 축으로 정리된다. 하나는 앵커(anchor)로, 각 업데이트가 어떤 과거 정보를 보존해야 하는지를 규정한다. 다른 하나는 저랭크 할당 규칙으로, 연속된 업데이트가 어디에 남는지를 결정한다. 전체 목적함수는 Θ_t = argmin Θ [L_SFT^t(Θ) + R_D^t(Θ) + R_F^t(Θ) + R_W^t(Θ)] 형태로, 현재 태스크의 SFT 손실에 세 개의 보존 항을 더한다. 데이터 앵커 R_D는 이전 모델의 동결 복사본으로 생성한 의사 시퀀스를 재생한다. 태스크와 무관한 리플레이 토큰 하나로 태스크마다 300개 시퀀스를 생성하고 빈 출력은 버리며, 학습 중에는 현재 태스크 미니배치마다 리플레이 미니배치 하나를 짝지어 준다. 리플레이 가중치와 생성 온도가 조절 변수이고, 동결 모델이 제공하는 소프트 다음 토큰 타깃도 현재 태스크를 배우는 동안에만 사용된다. 함수 앵커 R_F는 현재 태스크 입력에 대해서만 이전 모델의 예측 분포와 현재 모델의 분포 차이를 벌점으로 준다(Learning without Forgetting 방식의 자기 증류). 가중치 앵커 R_W는 이전에 학습한 동작에 대한 파라미터 중요도를 추정해 1/2 (ϑ - ϑ⋆)ᵀ H (ϑ - ϑ⋆) 형태의 이차 벌점을 가한다. online EWC와 SI가 이 자리에 들어간다.

무엇과 다른가

저랭크 할당은 LoRA 행렬을 태스크 사이에 어떻게 넘길지 정한다. shared LoRA는 모든 태스크에서 같은 A, B를 계속 최적화한다. merged LoRA는 태스크마다 새 LoRA 쌍을 부여하고, 태스크 학습이 끝나면 ρB⋆A⋆를 밀집 행렬 W에 접어 넣은 뒤 다음 태스크를 위해 새 LoRA 행렬과 새 옵티마이저를 초기화한다. ReLoRA의 merge-and-reinitialize 패턴을 continual learning에 맞게 옮긴 것이다. 두 방식 모두 밀집 모델 하나와 LoRA 쌍 하나만 유지하므로 태스크 수가 늘어도 보유 상태 크기가 일정하다. 반면 O-LoRA나 sequential OSRM은 상태가 태스크 수에 비례해 커진다.

어떻게 쓰나

평가를 위해 의미적 사실성이 점점 높아지는 세 개의 100-태스크 데이터셋을 직접 구축했다. Symbol-QA는 무작위 키-값 연상 10,000개(태스크당 100개), LLM-QA는 LLM이 만든 100개의 허구 주제에 걸친 질의-응답 10,000개(태스크당 100개), Real-QA는 공개 QA 데이터셋 10곳에서 가져온 자연 질의-응답 5,000개(태스크당 50개)로, 모델이 다섯 번의 샘플링 완성 중 하나라도 정답을 맞힌 항목은 제외하도록 필터링했다. 합성 데이터셋에서는 질의가 전체 태스크에 걸쳐 정확히 하나의 정답에 대응하도록 보장한다. 지표는 시간별 정확도 행렬 M_i,j에서 계산한다. Final은 마지막 태스크까지 배운 뒤 모든 태스크에 대한 평균 정확도, Diag는 각 태스크를 배운 직후의 평균 정확도(즉시 습득), Forget은 각 태스크의 최고 관측 정확도에서 최종 정확도로의 평균 하락이다. 조합 공간 탐색에는 task-level successive halving(TSH)을 도입했다. 90개 구성(가중치 앵커 3종 × 함수 앵커 3종 × 리플레이 5종 × LoRA 할당 2종)에서 시작해 10 태스크 후 상위 45개, 20 태스크 후 23개, 50 태스크 후 10개로 줄이고, 남은 10개만 100 태스크까지 학습시킨다. 이후 세 앵커와 merged LoRA의 2^4 팩토리얼 실험으로 개별 효과와 상호작용 효과를 측정했고, 데이터셋당 21개 방법을 시드 3개로 평가했다.

전제와 한계

결과는 조합 가설을 지지한다. 100 태스크 후 naive 순차 미세조정의 평균 최종 유지율은 1.2%였고, 가장 강한 단일 메커니즘도 Symbol-QA 4.2%, LLM-QA 7.5%, Real-QA 12.5%에 그쳤다. 반면 조합 중 최고는 각각 23.2%, 41.8%, 54.8%를 기록했다. 세 앵커를 모두 merged LoRA와 결합한 방법이 평균 최종 유지율 34.9%로 naive 대비 28배 개선이며, 모든 데이터셋에서 상위 3위 안에 든 유일한 조합이다. 데이터셋별 최강 조합은 달랐다. Symbol-QA는 자기 증류+리플레이+merged LoRA, LLM-QA는 SI+자기 증류+리플레이+merged LoRA, Real-QA는 SI+리플레이+merged LoRA를 선호했다. 기억 수명도 늘어난다. 메모리 반감기(정확도가 학습 직후의 절반 아래로 떨어지는 첫 시점)는 naive가 Symbol-QA와 LLM-QA에서 1 태스크, Real-QA에서 2 태스크였고, 최강 단일 메커니즘이 4, 6, 11 태스크, 최강 조합이 19, 32, 44 태스크, 최고 방법이 19, 32, 32 태스크였다.

팩토리얼 분석에서 가장 큰 주효과는 리플레이와 merged LoRA였다. 리플레이는 최종 유지율을 9.5~19.3%포인트, merged LoRA는 5.9~20.5%포인트 끌어올렸다. 두 메커니즘의 상호작용은 세 데이터셋 모두에서 양수이면서 유의했고, 초가산적(super-additive)이었다. SI와 자기 증류를 뺀 구성에서 리플레이와 merged LoRA의 단독 이득을 더하면 Symbol-QA, LLM-QA, Real-QA에서 각각 3.9, 7.7, 13.9%포인트에 불과하지만, 둘을 함께 쓰면 naive 대비 15.6, 31.0, 46.9%포인트가 개선된다. 자기 증류는 모든 데이터셋에서 양의 주효과를 보였으나 리플레이와의 상호작용은 LLM-QA와 Real-QA에서 음수였다. 즉 리플레이가 이미 있을 때 자기 증류의 평균 이득이 줄어든다. SI는 두 자연어 데이터셋에서 양의 주효과가 있었지만 Symbol-QA에서는 탐지 가능한 주효과가 없었고, merged LoRA와의 음의 상호작용은 Symbol-QA에서만 유의했다. 저자들은 merged LoRA가 태스크마다 LoRA 인자를 교체하는 반면 SI는 이전 인자에 묶인 중요도 값과 참조를 그대로 넘기기 때문에, 기능적 역할이 바뀐 새 좌표에 중요도가 잘못 적용되는 구조적 위험이 있다고 설명한다. 태스크 수에 따라 상태가 커지는 O-LoRA와 sequential OSRM도 시험했지만, O-LoRA는 자연어 데이터셋 두 곳에서 소폭 이득, Symbol-QA에서는 하락이었고 sequential OSRM은 세 데이터셋 모두에서 유지율을 떨어뜨렸다. 상태가 커지는 할당 규칙이 일관되게 더 낫지는 않다는 뜻이다.

실무 관점에서 이 논문이 주는 신호는 명확하다. 테스트타임 트레이닝이나 지속적 파인튜닝으로 모델에 사실을 축적해야 하는 시스템이라면, 단일 기법을 고르기보다 리플레이(데이터 앵커)와 merged LoRA를 기본 골격으로 두고 자기 증류와 중요도 정규화를 데이터 특성에 맞춰 얹는 편이 낫다. 특히 merged LoRA는 태스크마다 어댑터를 새로 초기화하고 이전 업데이트를 밀집 가중치에 접어 넣기 때문에, 태스크 수가 늘어도 보유 상태가 커지지 않아 운영 비용 예측이 쉽다. 다만 이 논문의 유지율 수치는 학습에 쓴 질의를 그대로 다시 물었을 때의 정확도이므로, 실제 서비스에서 표현이 바뀐 질의에 얼마나 답하는지는 별도로 검증해야 한다. 또한 기억 성능이 좋아져도 일반 능력은 함께 무너진다. GSM8K, MATH, MGSM, MMLU-Redux에서 평가한 결과 모든 방법이 심각한 망각을 보였고, merged LoRA보다 O-LoRA가 LLM-QA와 Real-QA 학습 후 일반 능력을 훨씬 잘 보존했다. 유지율만 보고 기법을 고르면 안 된다는 뜻이다.

저자들이 명시한 한계도 분명하다. 첫째, 평가는 학습 중 본 질의로 회상만 측정한다. 모델이 연상을 유지하고 있어도 바꿔 쓴 질의에는 틀릴 수 있으므로, 새로운 질의 표현으로의 일반화는 이 결과로 입증되지 않는다. 둘째, 기억을 강화한다고 일반 능력이 보존되지 않는다. 100 태스크 학습 후 일반 능력 벤치마크 정확도는 모든 방법에서 크게 떨어지며, 새 연상을 배우면서 이런 능력을 지키는 것은 열린 문제로 남는다. 셋째, 조합은 망각의 시간 척도를 바꿔 늦출 뿐 막지는 못한다. 메모리 나이에 따른 정확도 곡선은 최고 방법에서도 계속 하락한다.