MemFold가 압축 메모리를 독자 행동 기준으로 학습한다
MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization
무엇인가
장기간 같은 사용자를 상대하는 어시스턴트는 그 사용자가 이전 상호작용에서 밝힌 사실, 선호, 제약 중 무엇이 아직 유효하고 무엇이 수정되었는지를 답에 반영해야 한다. 논문은 여기서 두 가지를 분리한다. 정보를 보유하는 것과 그 정보에 따라 행동하는 것은 다른 요구사항이라는 것이다. 텍스트 메모리는 읽기 쉽고 편집 가능하지만 리더의 입력이 보유한 이력에 비례해 커지고 매 턴 다시 인코딩된다. 반대로 잠재 메모리는 텍스트를 고정 개수의 연속 벡터로 바꿔 인터페이스 크기를 이력 길이와 무관하게 만든다. 문제는 기존 압축기가 대개 원문 복원이나 참조 답변 모방으로 학습된다는 점이다. 두 목적 모두 리더가 실제로 생성하지 않은 시퀀스에서 채점되므로, 텍스트가 사라진 뒤 리더가 저지르는 오류에 도달하지 못한다.
어떻게 동작하나
MemFold의 구조는 세 부분이다. 먼저 어댑터가 질의 시점에 보이는 이력 C와 질의 x로부터 질의 조건부 텍스트 메모리 M을 작성한다. 다음으로 Perceiver 스타일 압축기가 K개의 학습된 잠재 쿼리로 M을 집계해 K×d 크기의 연속 벡터 Z를 만든다. 이 Z가 리더의 메모리 인터페이스이며, 리더는 (x, Z)만 조건으로 응답을 생성한다. 초기화는 세 단계다. 원시 이력 접두사 h에서 텍스트 메모리를 복원하는 재구성 손실로 압축기를 사전학습하고, 이를 텍스트 메모리 입력 Z=C(E(M))에 적응시키고, 마지막으로 (x, Z)로부터 답을 생성하도록 리더를 초기화한다. 저자들은 이 초기화 목적들이 리더가 만들지 않은 시퀀스에서 채점된다는 한계를 명시한다.
무엇과 다른가
핵심은 그 뒤의 온폴리시 최적화다. 각 질의마다 현재 정책이 G개의 응답을 샘플링하고, 각 응답에 과제 보상을 매겨 그룹 상대 어드밴티지를 계산해 GRPO 목적을 적용한다. 동시에 동결된 텍스트 메모리 교사가 같은 롤아웃을 재채점한다. 이 교사는 초기화된 리더의 동결 복사본으로, 소프트 메모리 Z 대신 텍스트 메모리 M을 읽는다. 교사와 학생은 처음에 모든 가중치를 공유하고 메모리 입력만 다르다. 두 모델이 학생이 샘플링한 동일 토큰 시퀀스에 대해 매긴 로그확률 차이를 게이트 g=σ(β(ℓ_T−ℓ_θ))로 만들어, 학생 토큰의 우도에 가중치로 곱한다. 이 게이트는 detach되어 그래디언트가 교사 쪽으로 흐르지 않는다. 교사는 샘플링에 전혀 쓰이지 않으므로 지도 신호가 학생의 현재 분포 위에 머물고 추가적인 자기회귀 디코딩도 발생하지 않는다. 추론 시에는 교사와 증류 계산이 전부 제거된다. 저자들은 이 목적이 기대값에서 텍스트 메모리 리더를 향한 역 KL로 작동하되 토큰별 영향이 유계라고 설명한다. 교사는 정확도 오라클이 아니라 동결된 텍스트 메모리 독자이므로, 특정 토큰 하나가 업데이트를 지배하지 못하게 하려는 의도적 설계다. 최종 목적함수는 두 항의 가중 합이다.
어떻게 쓰나
실험은 PersonaMem-32K와 PersonaMem-128K에서 동적 사용자 선호 추적을 평가하고, PersonaMem-32K로 학습한 체크포인트를 PrefEval의 암시적 페르소나 부분집합에 그대로 적용해 교차 데이터셋 전이를 본다. 또한 LoCoMo로 학습해 LongMemEval에 과제 특화 학습 없이 직접 평가한다. 백본은 Qwen2.5-3B-Instruct, Qwen2.5-7B-Instruct, Qwen3-4B 세 가지다. 비교 대상은 학습 목적 기준으로 GRPO와 OPSD, 잠재 메모리·컨텍스트 압축 방법으로 AutoCompressor, MemGen, xRAG, 그리고 비압축 기준선인 Full Text다. 저자들이 보고하는 결과는 모든 벤치마크와 백본에서 MemFold가 최고 정확도를 얻었고 PrefEval의 한 셀에서는 최강 베이스라인과 동률이었다는 것이다. 두 가지 패턴을 강조한다. 첫째, 이력이 길어질수록 격차가 벌어진다. 세 백본 모두 32K보다 128K에서 최고 경쟁 방법과의 차이가 더 크고, 32K에서 경쟁적이던 여러 베이스라인이 128K에서 급락하는 반면 MemFold는 그렇지 않다. 리더가 받는 벡터 수 K는 두 설정에서 동일하고 뒤에 있는 이력만 길어지는데도 그렇다. 둘째, 정확도가 추론 비용 증가에서 오지 않는다. 평균 엔드투엔드 토큰 비용은 full-context 추론에 근접하고 세 백본 모두 총합은 오히려 더 낮다. 예외는 PrefEval인데, 이력이 너무 짧아 리더 쪽 절약이 메모리 구축 비용을 상쇄하지 못한다. 다만 원문에 제공된 본문에는 표의 구체적 정확도·토큰 수치가 제시되지 않았다.
전제와 한계
절제 연구에서 리더 초기화가 초기화 이득 중 가장 컸다. 모델이 먼저 소프트 메모리 인터페이스를 소비하는 법을 배워야 온폴리시 최적화가 효과를 낸다는 해석이다. 라이터 초기화는 소프트 표현이 만들어지는 텍스트 메모리 자체를 개선해 추가 이득을 준다. 온폴리시 목적 중에서는 GRPO가 과제 개선의 대부분을 차지하고, OPD는 GRPO와 결합될 때 텍스트 메모리 교사의 토큰 수준 지도로 보완적 이득을 더한다. 텍스트 공간 통제 실험은 비슷한 성능을 냈지만 전체 소프트 메모리 모델을 능가하지는 못했고, 저자들은 이를 이 학습 설정에서 고정 예산 압축이 주된 병목은 아니라는 신호로 읽는다.
메모리 예산 K에 대한 민감도도 보고된다. K를 64에서 512로 8배 늘려도 단조 증가하지 않는다. 두 곡선 모두 K=256에서 단일 피크를 보이고 128 이상에서는 거의 평탄하다. 가장 작은 예산만 명확히 부족하고 유용한 범위는 넓다는 뜻이다. 긴 이력에서는 곡선이 더 평탄한데, 라이터가 이미 대부분의 이력을 버리고 압축하기 때문으로 해석한다. 512에서의 하락은 예산별로 재튜닝하지 않은 이 학습 레시피의 성질로 읽는다. 비용은 예산에 거의 반응하지 않는다. 긴 벤치마크에서 1퍼센트 미만 변동이며, 64에서 512로 늘릴 때 리더 입력에 448개 벡터가 추가되지만 PersonaMem-32K에서 측정된 토큰 차이의 약 3분의 1 수준이다. 변동의 대부분은 생성 토큰에서 온다. 모든 설정이 텍스트 메모리를 만들기 위해 상호작용 이력을 한 번은 읽어야 하고, 긴 벤치마크에서는 그 한 번의 패스가 인스턴스당 비용의 거의 전부를 차지한다. 메모리 개입 실험에서는 인스턴스에 맞게 만들어진 소프트 메모리를 셔플하거나 널로 바꾸면 두 데이터셋 모두에서 정확도가 크게 떨어진다. 리더가 과제 사전확률만으로 답하지 않고 해당 인스턴스의 메모리 내용에 의존한다는 근거다. 다만 이것이 이력에 여러 버전의 선호가 있을 때 올바른 시점의 버전을 골라낸다는 것까지 보여주지는 않는다고 저자들은 밝힌다.
실무 관점에서 이 논문이 쓸모 있는 지점은 개인화 어시스턴트의 메모리 계층을 직접 학습시킬 때다. 특히 이력 길이가 계속 늘어나는 서비스에서 리더 입력을 고정 예산으로 묶고 싶지만, 압축을 텍스트 복원으로 학습시키면 다운스트림 행동이 따라오지 않는다고 느낀 경우에 해당한다. 도입 전에 확인할 것은 세 가지다. 첫째, 컴팩트 메모리는 리더 인터페이스를 이력 길이와 무관하게 만들 뿐, 텍스트 메모리를 만들기 위해 전체 이력을 한 번 읽는 비용은 남는다. 둘째, 텍스트 메모리 교사는 정확도 오라클이 아니며 과제 정확도가 최종 학생보다 낮다. 게이트가 토큰별 영향을 유계로 묶는 이유가 여기 있으므로, 교사를 더 강한 모델로 바꾸는 식의 변형은 전제가 달라진다. 셋째, K는 재조정이 필요한 하이퍼파라미터이며 저자들의 레시피에서는 256이 피크, 128 이상은 평탄, 512는 하락이었다.
저자들이 명시한 한계는 다음과 같다. 전이는 균일하지 않다. PrefEval에서 Qwen2.5-7B-Instruct를 쓸 때 MemFold는 최강 베이스라인과 동률에 그쳤고, 이 설정은 방법들 간 정확도 범위가 좁아 다른 벤치마크보다 변별력이 낮다. 또한 소스 도메인 성능 향상이 OOD 성능으로 자동 이어지지는 않는다. GRPO와 OPSD는 PrefEval에서 일관된 이득을 주지 못했고 일부 백본에서는 학습되지 않은 Full Text 기준선보다도 낮았다. 잠재 메모리 베이스라인들은 LongMemEval에서 전반적으로 부진했다. K=512에서의 정확도 하락은 예산별 재튜닝을 하지 않은 이 레시피의 성질로 읽는다는 단서도 붙는다. 마지막으로 메모리 개입 실험은 메모리가 사용된다는 것만 보여줄 뿐, 그중 어느 부분이 사용되는지, 여러 시점의 선호가 섞인 이력에서 올바른 버전을 해소하는지는 보여주지 못한다.