MemPilot이 LLM 에이전트 메모리를 질의 시점에 맞춰 큐레이션한다
MemPilot: Orchestrating On-Demand Multimodal Memory Curation for LLM Agents
무엇인가
LLM 에이전트가 장기 상호작용으로 갈수록 메모리는 핵심이 되지만, 대부분의 기존 에이전트 메모리 시스템은 미래 질의를 모르는 상태에서 메모리를 미리 구축한다. 논문은 이 방식이 불필요한 전처리 비용을 만들고 나중에 중요해질 세부 정보를 버린다고 지적한다. 런타임 적응으로 옮겨간 최근 연구들도 특정 연산이나 고정된 처리 파이프라인에 특화되어 있어 성능·비용·지연 사이의 유연한 제어는 충분히 탐구되지 않았다. 저자들은 세 가지 한계를 든다. 런타임 메모리 제어가 구조적으로 경직되어 있고(수작업 연산, 예산 티어, 휴리스틱), 토큰 사용량이나 금전 비용 같은 일부 목표만 다루며 사용자 체감 지연은 명시적 최적화 대상이 아니고, 런타임 적응이 고정된 처리 백엔드를 가정한다는 것이다.
어떻게 동작하나
MemPilot의 설계 원칙은 단순하다. 질의 무관 메모리 뱅크 M은 기존 에이전트 메모리 시스템으로 구축해 효율적 접근에 쓰고, 원본 멀티모달 상호작용 이력 H는 그대로 보존해 질의별 런타임 큐레이션에 쓴다. H는 원래의 멀티모달 맥락을 유지한 채 256토큰 청크로 분할된다. 추론 시점에 오케스트레이터 정책은 상태 s_t=(q, a_<t, o_<t)를 조건으로 구조화된 행동 a_t=(z_t, φ_t)를 만든다. 행동 유형 z_t는 질의 무관 메모리에서 검색하는 Retrieve와 원본 이력에 질의별 큐레이션을 수행하는 Curate 중 하나다. 관측은 Retrieve면 의미 유사도 기반 검색 결과 R_M(φ_t), Curate면 C_H(φ_t)다. 이 과정이 최대 T_max 스텝의 궤적 τ를 만들고, 각 궤적은 답변 품질 Q(τ)와 금전 비용 C(τ), 지연 L(τ)로 특징지어진다. 목표는 선호 벡터 λ 아래에서 세 목표를 균형 있게 맞추는 정책을 학습하는 것이다.
무엇과 다른가
행동 인자는 유형별로 분해된다. Retrieve는 (r_t, k_t), Curate는 (r_t, k_t, i_t, m_t, v_t)다. r_t는 검색 질의, k_t는 증거 개수로 고정 top-k 대신 스텝마다 검색 깊이를 바꿀 수 있다. Curate에서는 i_t가 질의별 큐레이션 지시문, m_t가 처리 백엔드 선택, v_t가 원본 시각 증거 포함 여부를 정한다. 논문은 '무엇을 검색할지'(예: Lena의 드레스 후보)와 '어떻게 큐레이션할지'(예: 그녀가 고려한 두 드레스 유형을 추출)를 분리해 하나의 텍스트 필드에 뭉치는 것을 피한다. 모델 위임도 제어 축이다. 오케스트레이터는 파라미터 규모와 지원 입력 양식 같은 경량 프로필과 익명화된 모델 ID를 받고, LLM·VLM 풀에서 스텝마다 백엔드를 고른다. 오케스트레이터 자체는 텍스트 전용이라 이미지 픽셀 같은 원본 멀티모달 입력을 직접 처리하지 않는다.
어떻게 쓰나
학습은 GRPO로 한다. 선호 벡터 λ=(λ_Q, λ_C, λ_L)에서 λ_Q=1로 두고, 질의마다 G개의 궤적을 샘플링해 세 목표별 보상 r^Q=Q(τ), r^C=-C(τ), r^L=-L(τ)를 계산한다. 비용은 오케스트레이터 생성과 위임 모델 호출의 토큰 기반 비용을 합한 값이고, 지연은 네트워크·서빙 변동에 민감해 벽시계 시간 대신 프록시 추정치를 써서 학습 안정성을 확보한다. 여러 보상을 그룹 정규화 전에 합치면 개별 학습 신호가 흐려지므로, 논문은 목표별 어드밴티지 분리(objective-wise advantage decoupling)로 각 목표를 독립적으로 정규화한 뒤 λ로 가중 합산하고 배치 수준에서 다시 정규화한다. 또 궤적 수준 어드밴티지는 모든 큐레이션 단계에 같은 신호를 주기 때문에, 각 단계 t 이후를 잘라 답을 생성해 u_{i,t}=Q(ŷ_{i,t})와 그 차분 Δu_{i,t}를 구하고 해당 단계의 정책 토큰 어드밴티지에 ηΔu를 더한다(prefix-based marginal utility). 비용·지연은 이미 궤적 수준에서 반영되므로 이 미세 크레딧 할당은 품질만 본다.
전제와 한계
실험은 멀티모달 에이전트 메모리 벤치마크 5개(Mem-Gallery, WorldMemArena, H2HMem, MemEye, MemLens)에서 수행했고, MemEye와 MemLens는 분포 외 평가셋으로 썼다. 품질은 F1과 GPT-4o-mini를 심판으로 한 LLM-judge 점수(L-J)로, 비용은 오케스트레이터와 위임 모델의 토큰 기반 금전 비용으로, 지연은 초 단위 추론 지연으로 측정한다. 구현은 VeRL 기반이고 기본 오케스트레이터는 Qwen3-4B-Instruct다. RL로 강화된 답변 생성의 효과를 분리하기 위해 큐레이션된 맥락을 별도 비RL 답변 모델(Qwen3-VL-4B-Instruct, Qwen3.5-9B)에 넘기는 분리 평가도 보고한다. 원본 이력은 256토큰 청크로 나누고 Qwen3-Embedding-0.6B로 검색하며, 기본 메모리 뱅크는 LLMLingua-2로 0.4 압축률로 구축한다. 스텝당 최대 5개 증거를 검색하고 7/1/2 분할을 쓴다. 결과적으로 MemPilot-Perf는 두 답변 모델 모두에서 5개 벤치마크 전부 최고 L-J를 기록했고, MemPilot-Bal은 비용을 크게 낮춘 중간 지점, MemPilot-Cost는 더 낮은 자원 사용 지점을 제공한다. 텍스트 중심 시스템은 멀티모달 처리와 런타임 큐레이션을 피해 비용이 낮지만 품질도 낮은 편이고, MIRIX·M2A·MemVerse 같은 멀티모달 시스템은 훨씬 높은 비용을 쓰면서도 그 비용이 일관되게 더 나은 품질로 이어지지 않았다. 선호를 쓸어보는 실험에서 MemPilot은 LightMem, BudgetMem, OmniSimpleMem 같은 트레이드오프 인식 베이스라인보다 넓은 성능-비용 및 성능-지연 프런티어를 형성했다.
행동 분석에서 선호가 저비용·저지연으로 이동하면 정책은 단일 손잡이가 아니라 여러 축을 함께 조정한다. 정책 스텝 수, Curate 빈도, 이미지 접근, 정책 출력 토큰이 줄고 증거 개수도 적응적으로 바뀐다. 모델 선택도 핵심 메커니즘으로, 고비용 설정에서는 더 강한 VLM·LLM에, 저비용 설정에서는 더 저렴한 모델군에 의존한다. 절제 실험(답변 모델 Qwen3-VL-4B-Instruct)에서 LLM/VLM 위임을 제거하면 평균 Judge 점수가 37.40에서 14.58로 떨어졌고, marginal utility나 검색-지시문 분리를 제거해도 비슷하게 큰 하락이 나타났다. 목표별 어드밴티지 분리를 빼면 21.94로 내려갔다. 절제 변형들은 모두 추론 비용이 더 낮았지만 품질 손실이 커서, 단순히 런타임 연산을 줄이는 것이 좋은 트레이드오프가 아니라는 점을 보여준다. 메모리 뱅크 호환성 실험에서는 기본 LLMLingua-2 뱅크가 저비용 영역, SimpleMem이 중간, A-MEM이 더 높은 비용과 더 강한 성능 영역을 차지했고, 재학습 없이도 각 뱅크의 성능-비용 특성을 유지하며 런타임 연산을 늘릴수록 성능이 향상됐다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 메모리 설계를 '미리 압축해 두는 파이프라인' 하나로 고정하지 말라는 것이다. 질의 무관 메모리는 빠른 접근용으로 남기고, 원본 이력은 청크 단위로 보존해 두었다가 질의가 들어온 시점에 필요한 만큼만 꺼내 쓰는 구조가 비용과 품질을 동시에 관리하는 데 유리하다. 특히 검색 깊이, 큐레이션 지시문, 처리 모델, 이미지 포함 여부를 각각 독립적인 제어 축으로 두면, 서비스 요구가 바뀔 때 파이프라인을 다시 짜지 않고 선호 가중치만 조정해 운용점을 옮길 수 있다. 다만 이득은 위임 모델 풀과 프롬프트 설계에 크게 의존하므로, 도입 전에는 자체 트래픽에서 비용·지연 측정 정의를 먼저 확정하고 프런티어를 직접 그려보는 편이 안전하다.
논문이 밝힌 전제와 한계는 다음과 같다. 지연은 벽시계 측정이 아니라 프록시 추정치를 쓰며 이는 학습 안정성을 위한 선택이다. 오케스트레이터는 텍스트 전용이라 원본 이미지를 직접 보지 않고 위임 모델을 통해서만 시각 정보를 다룬다. 메모리 뱅크 구축은 MemPilot의 런타임 오케스트레이션과 직교하도록 설계되어, 상류 메모리 시스템의 품질에 따라 운용 영역이 달라진다. 평가는 5개 멀티모달 벤치마크에 한정되고, 비용은 토큰 기반 금전 비용, 지연은 추정치라는 측정 정의에 의존한다. 원문에는 별도의 한계 절이 제시되어 있지 않아 위 내용은 방법론과 실험 설정에서 확인되는 전제다.