EngramEdit이 조건부 메모리만 고쳐 LLM의 사실 지식을 갱신한다
EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory
무엇인가
이 논문이 푸는 문제는 LLM의 사실 지식 갱신을 어디에 저장하고 어떻게 고칠 것인가다. 기존 locate-then-edit 계열(ROME, MEMIT 등)은 FFN 가중치 같은 Transformer 원래 파라미터를 수정한다. 반면 DeepSeek Engram으로 대표되는 조건부 메모리 구조는 입력 n-gram을 키로 학습된 임베딩을 조회해 백본에 공급하는데, Engram에 대한 ablation에서 조건부 메모리를 끄면 사실 지식 성능은 크게 떨어지지만 문맥 이해·추론 능력은 대체로 유지됐다. 즉 지식 저장과 범용 연산이 분리돼 있다는 관찰이 이 논문의 출발점이다. 저자들은 백본을 고정한 채 조건부 메모리만 갱신해 사실을 바꾸는 것을 목표로 삼는다. 문제는 메모리 조회가 사실이 아니라 n-gram으로 결정된다는 점이다. 같은 사실을 편집해도 서로 다른 n-gram 임베딩이 활성화되고, 공유 임베딩을 고치면 다른 사실의 예측이 틀어질 수 있다. 저자들은 이를 효능(편집 간 충돌), 일반화(다른 표현에서의 실패), 특이성(무관한 지식 오염) 세 가지 난점으로 정리한다.
어떻게 동작하나
제안 방법 EngramEdit은 세 단계로 구성된다. 첫째, 편집 대상 사실마다 모델이 의미가 같은 표현 K개를 생성하게 해 n-gram 커버리지를 넓힌다. 각 편집에 대해 하나의 공유 학습 가능한 섭동 δ_i를 모든 표현의 메모리 표현에 임시로 더하고, 새 사실에 대한 NLL 손실을 역전파해 δ_i만 최적화한다. 이렇게 얻은 δ_i*가 각 표현의 목표 메모리 표현 h_i*(x) = h_i(x) + δ_i*가 된다. 둘째, 각 표현의 마지막 주어 토큰 위치에서 활성화되는 n-gram 집합을 모아, 표현을 행, 배치 전체의 고유 n-gram을 열로 하는 매핑 행렬 A를 만든다. 여러 표현이 같은 n-gram을 쓰면 그 임베딩은 하나의 열로 공유된다. 셋째, 임베딩 업데이트 U를 A U ≈ B(목표 변화량)에 맞추되, 재사용이 잦은 임베딩에 더 큰 벌점을 주는 정규화 Λ = diag(λ_j), λ_j = λ_reuse·w_j + λ_ridge를 함께 최소화한다. n-gram이 짧거나 말뭉치 빈도가 높을수록 w_j가 커진다. 닫힌 해는 U* = (A^T A + Λ)^{-1} A^T B이며, 저자들은 이 해가 같은 메모리 변화를 만드는 업데이트 중 가중 비용을 최소화하고, 목표가 최적화 과정에서 조금 흔들려도 정규화가 그 영향을 억제한다는 것을 증명한다. 업데이트는 조건부 메모리에만 적용되고, 추론 시 해당 n-gram이 현재 접두사에서 활성화될 때만 계산에 들어간다.
무엇과 다른가
실험은 LongCat-Flash-Lite를 대상으로 순차 배치 편집으로 진행했다. CounterFact와 ZsRE에서 각각 2,000건 순차 편집, MQuAKE 3,000건, 일반 능력 6개 태스크에서 5,000건 편집을 적용했다. 비교 대상은 FT, FT-L, AdaLoRA, UnKE, MoEEdit, 그리고 n-gram 임베딩을 직접 미세조정하는 Memory-FT(Subject), Memory-FT(All Tokens)다. 결과적으로 CounterFact에서는 MoEEdit·MFT-S와 Efficacy가 비슷하지만 Generalization이 훨씬 높았고, ZsRE에서는 Efficacy와 Generalization 모두 앞섰다. 편집 프롬프트 성공률이 비슷해도 다른 표현으로의 회상은 같지 않다는 것이 저자들의 해석이다. MQuAKE에서는 표준 프롬프팅에서 FT와 비슷했지만 CoT 프롬프팅에서는 최강 베이스라인의 약 3배 정확도를 냈고 모든 홉 그룹에서 앞섰으며, 4홉 사례까지 이점이 유지됐다. 일반 능력은 5,000건 순차 편집 후에도 편집 전 평균 F1의 96% 이상을 유지했다. 다만 표 1의 데이터셋별 세부 수치는 제공된 본문 발췌에 숫자로 제시되지 않았다.
어떻게 쓰나
구성 요소별 기여도도 분리해 측정했다. 공동 할당을 제거한 w/o Joint는 두 데이터셋에서 Efficacy와 Generalization이 크게 떨어졌고, 생성 표현을 제거한 변형은 Generalization이 크게 낮아졌다. 재사용 기반 정규화를 빼면 Efficacy와 Specificity가 하락했고, 빈도 가중이나 길이 가중을 각각 제거해도 Utility가 줄었다. 무관한 질의에서 새로 발생한 오류의 92% 이상이 갱신된 임베딩의 활성화와 관련됐고, 사실 관련 임베딩을 전혀 활성화하지 않는 보류 패러프레이즈 약 2%가 일반화 실패의 절반을 차지했다. 메모리 사용 분석에서는 해당 사실의 업데이트만 끄면 Efficacy와 Generalization이 급락해, 모든 업데이트를 끈 것과 거의 같은 효과를 보였다. 반대로 수와 n-gram 길이를 맞춘 무작위 업데이트를 끄면 성능은 그대로였다.
전제와 한계
개발자 관점에서 이 논문은 지식 갱신을 재학습이 아니라 조건부 메모리 패치로 다루는 구체적 레시피를 준다. 사내 모델이 Engram류 n-gram 메모리나 MoE 구조를 쓴다면, 편집 파이프라인을 (1) 표현 다양화, (2) 공유 임베딩 식별, (3) 재사용 가중 정규화가 있는 공동 선형 해로 구성할 수 있다는 뜻이다. 다만 실무 적용 전에 확인할 것이 있다. 실험은 LongCat-Flash-Lite 단일 모델과 sum aggregation 가정에 기반하고, 목표 계산은 여러 표현에 걸친 반복 최적화를 요구하므로 편집 배치가 커질 때의 비용과 지연을 따로 재봐야 한다. 또한 이 기법은 사실을 바꾸는 능력 자체가 오용될 수 있어, 편집 권한 통제와 감사 절차가 전제돼야 한다고 저자들도 명시한다.
저자들이 밝힌 한계는 다음과 같다. 일반 능력 6개 태스크 중 MRPC에서 상대적으로 큰 F1 하락이 나타났는데, 두 문장이 같은 의미인지 판정하는 과제 특성상 문장마다 다른 n-gram이 활성화돼 국소 임베딩 갱신이 표현에 서로 다르게 영향을 주기 때문이라고 설명한다. 향후 과제로는 다른 조건부 메모리 아키텍처와 모델 규모로의 확장, 더 많은 사실을 더 높은 빈도로 효율적이고 안정적으로 갱신하는 방법을 제시한다. 윤리 성명에서는 벤치마크의 반사실적 편집 대상이 검증된 실제 사실이 아니며, 책임 있는 사용을 위해 사실 검증과 편집 접근 제한, 의도·비의도 효과 감사가 필요하다고 못박는다.