PrisMem이 에이전트 메모리 자가진화를 능력별 축으로 넓힌다
Capability-Driven Self-Evolution of Agent Memory
무엇인가
LLM 에이전트의 메모리를 '실행 가능한 프로그램'으로 두고, 과제 피드백으로 그 프로그램을 반복 개선하는 자기진화 연구가 있다. 기존 방식은 대체로 전체론적(holistic) 진화다. 서로 다른 능력에서 나온 실패를 뒤섞은 피드백에서 수정 방향을 뽑고, 진척 여부는 전체 평균 점수로 판단한다. 이 논문은 여기서 두 가지 문제를 지적한다. 첫째, 섞인 피드백은 최적화 방향을 흐린다. 예를 들어 검색 범위를 넓히면 다중 세션 추론은 좋아질 수 있지만 관련 없는 개인 기억이 끼어들어 과잉 개인화가 늘 수 있는데, 실제로 구현해 평가하기 전에는 어느 쪽으로 기울지 알 수 없다. 둘째, 한 능력에서 얻은 이득이 다른 능력의 퇴행에 상쇄되어 전체 점수는 그대로거나 오히려 낮아진다. 저자들의 분석에 따르면 전체 점수가 오르지 않은 수정 가운데 80.5%가 최소 한 능력에서는 향상을 만들었다. 성능이 정체된 구간에서는 이런 이득이 더 쉽게 묻힌다.
어떻게 동작하나
제안 시스템 PrisMem은 탐색 공간을 전체 점수 한 축에서 여러 능력 축으로 끌어올린다. 먼저 메모리 프로그램을 Extraction, Indexing, Planning, Retrieval, Answer 다섯 컴포넌트로 분해해 수정 경계를 잘게 만든다. 기존의 'add/retrieve' 추상화보다 어느 단계가 실패 원인인지 국소화하기 쉽다. 능력 집합은 대표적인 다섯 개로 구성하고(F, T, P, M, A로 축약), 훈련·검증 과제마다 LLM으로 주 능력 하나와 최대 두 개의 부차 능력을 오프라인 주석한다. 이 라벨은 피드백을 조직하고 진화를 이끄는 데만 쓰이며 평가 시점에 메모리 프로그램에 제공되지 않아 베이스라인과 조건이 같다. 진화는 세 단계다. 1단계 콜드 스타트는 5라운드 동안 모든 능력의 피드백을 함께 보며 균형 잡힌 기반 프로그램을 만든다. 이때 참조 근거와 (i) 추출된 메모리 단위, (ii) 근거를 질의로 삼아 검색한 내용, (iii) 실제 질문으로 검색한 내용 사이의 의미 유사도를 능력별·컴포넌트별 표로 집계해, 정보 보존·접근성·검색 효과 중 어디가 약한지 짚게 한다.
무엇과 다른가
2단계 능력 정제에서는 능력별 최고 프로그램을 '전문가(specialist)'로 추적하고, 대상 능력이 선택되면 그 전문가에서 수정을 시작한다. 전체 점수에 가려진 국소 이득을 계속 키울 수 있게 하려는 장치다. 어떤 능력을 다음에 손댈지는 의존성 인식 선택으로 정한다. 주 능력 cp 과제에서 부차 능력 cs 가 요구되는 비율을 기저율 D(cp→cs)로 두고, cs 전문가의 오류가 cs 를 요구하는 과제에 얼마나 편중되는지를 F로 측정한다. F−D가 양수면 cs 의 결함이 cp 오류와 유난히 얽혀 있다는 뜻이고, 여기에 cp 과제 평균 오류를 곱해 유입 오류 압력 I를 얻는다. 후보 능력의 긴급도 U는 자기 자신에 대한 직접 결손에 다른 능력들로부터의 최대 압력을 더한 값이다(합이 아니라 최대로 잡아 중심성 편향을 피한다). 여기에 과거 할당 횟수 n(c)로 나눠 ρ=U/(1+n)을 만들고 최대값 능력을 고른다. 진단은 점수 0.8 이하인 실패 중 5개를 뽑되, 과거 프로그램들이 잘 풀었던 회귀 증인 사례를 우선하고 자주 뽑힌 사례와 반복된 부차 능력 조합은 가중치로 깎아 진단 범위를 넓힌다.
어떻게 쓰나
3단계 추적 기반 통합은 서로 다른 방향으로 진화한 전문가들을 하나의 프로그램으로 합친다. 모든 후보가 같은 훈련 과제 집합에서 평가되므로, 기반 프로그램과 통합 대상 전문가 사이의 점수 격차가 가장 큰 과제를 '쌍별 차분 사례'로 골라 두 실행 결과를 비교한다. 이 차이가 전문가의 행동 차이와 부작용을 드러내 통합 계획의 근거가 된다. 계획 모델이 계보 구조상 기반에 가까운 전문가부터 먼 쪽으로 통합 순서를 정하고, 코딩 모델이 최대 3라운드까지 실행한다. 통합이 전체 점수를 올리지 못하거나 어떤 능력이 임계값 θ 이상 떨어지면, 실패한 구현과 같은 차분 사례의 실행 결과를 다시 코딩 모델에 돌려 재시도한다. 비용 절감도 설계에 들어갔다. 질문·정답·근거·검색 내용·예측을 담되 중복을 제거하고 생략을 표시한 압축 진단 컨텍스트로 진단 사례 토큰 비용을 평균 44% 줄였고, 부모 프로그램과 비교해 영향받지 않은 컴포넌트의 출력을 재사용한다. 검색만 고친 수정은 추출·색인을 건너뛴다.
전제와 한계
실험은 에이전트 메모리 벤치마크 BEAM과 LongMemEval에서 한다. 모든 진화 방법은 짧은 분할인 BEAM-100K와 LongMemEval-S에서 20회 반복 학습한 뒤, 내용이 다른 100만 토큰 이상 분할인 BEAM-1M과 LongMemEval-M에서 평가한다. 베이스라인은 Mem0, A-MEM, HippoRAG2, SimpleMem, LightMem 같은 정적 방법과, 전체 점수를 신호로 쓰는 자기진화 방법 M*(인구 기반 반성적 코드 탐색) 및 EvolveMem(검색·답변 구성 적응)이다. 모델은 Qwen3.8-27B와 Qwen3-Embedding-8B, 실행은 A100 GPU와 vLLM 0.20.0, Python 3.12이며 GPT-5.5 결과도 부록에 있다. 결과적으로 PrisMem은 거의 모든 능력 비교에서 최고 성능을 냈고, 전체 점수 기준으로 최강 정적 베이스라인을 8.17~11.53%p, 최강 자기진화 베이스라인을 7.83~10.54%p 앞섰다(BEAM-1M에서 10.54%p, LongMemEval-M에서 7.83%p). 반면 전체론적 진화의 이득은 제한적이어서 M*는 BEAM에서 최강 정적 베이스라인 대비 0.99%p, EvolveMem은 LongMemEval에서 0.34%p 개선에 그쳤다. GPT-5.5에서는 BEAM-1M에서 6.17~20.41%p 차이로 앞선다.
진화 비용은 같은 20라운드 예산에서 비교한다. LongMemEval은 질문마다 이력이 독립적이라 라운드당 추출 비용이 커서 전체 비용이 더 든다. EvolveMem은 검색·답변 구성만 진화해 토큰을 가장 적게 쓰고, 전체 프로그램을 진화하는 M*와 PrisMem은 추출 비용이 추가된다. 그럼에도 PrisMem은 M* 대비 진화 비용을 4~30% 줄였다. 절제 실험(BEAM, Qwen3.8-27B)에서는 능력 기반 진화를 제거하고 기존 전체론적 진화로 되돌리면 10.15%p 떨어졌고, 추적 기반 통합을 빼면 3.16%p 떨어졌다(그래도 베이스라인은 앞선다). 의존성 인식 선택 대신 고정 라운드로빈을 쓰면 2.55%p, 사례 선택을 무작위로 하면 5.26%p 하락했다. 진화 궤적 분석에서는 2단계에서 능력별 점수가 간헐적으로 오르고, 한 능력을 정제할 때 다른 능력의 전문가도 함께 갱신되며, 최종 통합 프로그램이 진화 중 도달한 능력별 최고점에 근접했다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 평가 축을 쪼개라는 것이다. 메모리 계층을 만들 때 전체 정확도 하나로 A/B를 판정하면, 한 유형의 질의를 살리고 다른 유형을 망가뜨리는 변경을 버리게 된다. 질의 유형별로 점수를 나눠 추적하고, 유형 간 의존 관계(예: 시간 추적 결함이 세션 간 종합 과제를 망치는 경우)를 따로 측정하면 개선 후보를 살릴 수 있다. 또 메모리 파이프라인을 추출·색인·계획·검색·답변처럼 단계로 나눠 두면 수정 범위를 좁힐 수 있고, 단계별 출력을 재사용해 평가 비용을 줄일 수 있다는 점도 그대로 참고할 만하다. 다만 능력 라벨을 LLM으로 미리 붙여야 하고, 진화 예산이 라운드 단위로 정해져 있다는 전제를 감안해야 한다.
한계와 전제는 논문에 별도 절로 정리되어 있지 않다. 본문에서 확인되는 전제는 다음과 같다. 능력 라벨은 LLM이 오프라인으로 붙인 것이며 평가 시 프로그램에 주어지지 않지만, 라벨 품질이 진화 방향에 영향을 줄 수 있다. 실험은 BEAM과 LongMemEval 두 벤치마크, 그리고 짧은 분할에서 학습해 긴 분할로 옮기는 단일 프로토콜에 한정된다. 통합 재시도 기준이 되는 능력 하락 임계값 θ의 구체적 수치는 제시되지 않았고, 진화 비용은 EvolveMem보다 여전히 높다(검색·답변 구성만 바꾸는 방법 대비 전체 프로그램을 진화하기 때문). 저자들은 결론에서 능력 기반 진화를 더 탐구하길 권한다고만 밝힌다.