읽기 시점에 과제별로 기억을 조립하는 LLM 에이전트 메모리, JitMem

Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents

HF Daily2609.27334

Yefan Zhou, Yang Li, Zeyu Leo Liu2026-09-23조회 19

무엇인가

LLM 에이전트가 여러 과제를 연속으로 수행할 때 과거 경험을 재사용하는 기억 시스템은 대부분 쓰기 시점(write time)에 기억을 정제한다. 과제가 끝나면 궤적을 reflection, workflow, skill, reasoning strategy 같은 고정된 산출물로 증류해 저장하고, 나중에 유사도 검색으로 꺼내 쓴다. 문제는 미래 질의를 모르는 상태에서 무엇을 기억할지 결정해야 한다는 점이다. 버려진 정보는 되돌릴 수 없고, 하나의 고정 요약이 서로 다른 여러 과제를 모두 감당해야 한다. 같은 가정 내 상호작용 궤적이 어떤 과제에는 상태 전이 패턴(예: 물체 가열·냉각)을 가르치고 다른 과제에는 물체 배치 전략을 제공할 수 있는데, 쓰기 시점에는 어느 쪽이 중요한지 알 수 없다. 학습 관점에서도 쓰기 결정의 가치는 여러 과제 뒤에 관련 질의가 들어올 때에야 드러나므로 장기 크레딧 할당 문제가 생긴다.

어떻게 동작하나

JitMem은 정제 시점을 읽기 시점으로 미룬다. 구성 요소는 네 가지다. 과거 과제의 원본 궤적을 그대로 저장하는 메모리 뱅크 M_t, 검색기 R, 학습 가능한 메모리 큐레이터 π_φ, 동결된 실행기 π_L이며 큐레이터만 학습된다. 각 과제마다 네 단계가 돈다. 먼저 검색 단계에서 ξ̂_t = R(x_t, M_t)로 메모리 뱅크에서 현재 과제와 가장 관련 있는 상위 k개 원본 궤적을 가져온다. 다음 정제 단계에서 p_t = π_φ(x_t, ξ̂_t)로 현재 과제에 맞춘 간결한 자연어 페이로드를 합성한다. 실행 단계에서는 (ξ_t, r_t) = π_L(x_t, p_t)로 동결된 실행기가 페이로드를 컨텍스트에 넣고 과제를 수행한다. 마지막으로 갱신 단계에서 M_{t+1} = Update(M_t, ξ_t, r_t)로 궤적을 뱅크에 추가하는데, 품질 게이트를 통과한 경우에만 넣는다. 중요한 점은 정제된 페이로드 p_t가 일시적이며 저장되지 않는다는 것이다. 뱅크에는 요약·반성·스킬 추상화 없이 과제 설명과 관찰-행동 시퀀스 전체가 원본으로 남는다. 검색기는 과제 설명만 대상으로 BM25를 쓰고 학습하지 않으며, 저장 게이트는 실행기 모델을 LLM-as-judge로 사용해 성공으로 판정된 궤적만 받는다.

무엇과 다른가

큐레이터 훈련에는 GRPO를 쓴다. 각 훈련 과제에 대해 큐레이터가 G개의 후보 페이로드를 생성하고, 동결된 실행기가 각 후보로 과제를 시도해 벤치마크 고유 보상 r_t를 받는다. 이득은 Â_i = r_t^(i) - mean_j r_t^(j)로 계산하고(표준편차 정규화는 생략), 손실 L_GRPO = -(1/G) Σ_i Â_i · log π_φ(p_t^(i) | x_t, ξ̂_t)를 밸류 네트워크 없이 최적화한다. 이 설계의 핵심 성질은 보상 r_t가 같은 과제 t를 위해 만들어진 페이로드 p_t의 직접 함수라는 점이다. 큐레이터의 행동과 보상 사이 시간 간격이 0이므로 크레딧 할당이 즉시적이고, 쓰기 시점 학습 방식이 필요로 하는 과제 그룹화나 지연 리턴 장치가 사라진다. 훈련용 뱅크는 베이스 실행기를 훈련셋에 한 번 돌려 정답 성공 라벨로 성공 궤적만 남겨 고정하며, 큐레이터는 Qwen3-8B(thinking 비활성)에서 초기화해 GRPO 100스텝, 학습률 1×10^-6, 배치 32, 그룹 8로 훈련한다.

어떻게 쓰나

실험은 ALFWorld(텍스트 기반 체화 제어, 테스트 140과제), WebShop(웹 상품 구매, 테스트 500 인스턴스), τ²-bench(항공·소매·통신 도메인 대화형 도구 사용)에서 수행했다. 비교 대상은 no-memory 에이전트와 쓰기 시점 메모리 베이스라인 ReasoningBank, MemP, SkillOS다. JitMem은 세 벤치마크 모두에서 no-memory와 모든 쓰기 시점 베이스라인을 앞서며, 최강 베이스라인 대비 각각 16.2, 16.3, 3.9 절대 성공률 포인트를 개선했다. 동일한 Qwen3-8B 기반으로 RL 훈련한 큐레이터끼리 비교하면 ALFWorld에서 77.4 대 SkillOS 61.2, WebShop에서 32.8 대 16.5다. Gemini-2.5-Pro 실행기에서는 ALFWorld 86.2 대 80.2, WebShop 50.5 대 41.3이었다. 훈련을 전혀 하지 않은 JitMem-gemini도 WebShop에서 61.0 SR로 SkillOS의 41.0(둘 다 Gemini-2.5-Pro를 큐레이터와 실행기로 사용)을 크게 앞선다. GPT-5.4 실행기에 Qwen3-8B 큐레이터를 붙인 JitMem-base는 ALFWorld에서 79.3으로 ReasoningBank 77.9, SkillOS-gpt 70.0을 넘는다. τ²-bench에서는 GPT-5.4 기준 75.6 대 71.7/66.4였고, 다단계 정책 검증이 필요한 통신 도메인에서 +11.0으로 이득이 가장 컸다. 효율도 개선된다. JitMem-base는 no-memory 대비 입력 토큰을 1.9K만 추가하는데 ReasoningBank는 10.7K, SkillOS-base는 13.4K를 더했고, 실행 스텝은 18.5~21.9% 줄였다. RL 훈련 후에는 base 대비 입력 토큰 10.1%, 출력 토큰 13.0%, 스텝 12.1%가 추가로 감소했으며, 쓰기 시점 방법 대비로는 입력 토큰 50.3~56.3%, 실행 스텝 28.4~31.4% 감소한다. 훈련된 큐레이터는 재훈련 없이 더 강한 실행기로 전이되며, GPT-5.4로 직접 훈련한 큐레이터와 1.4 SR 포인트 이내 차이를 보인다.

전제와 한계

절제 실험은 각 설계 선택의 기여를 분리한다. 큐레이터 입력에서 현재 과제 설명을 제거하면 무훈련 JitMem-base가 ALFWorld 최대 3.1, WebShop 4.6 하락하는데, RL 훈련 후에는 각각 최대 11.4, 10.4로 격차가 커진다. 이는 RL이 궤적을 더 잘 압축하는 법이 아니라 과제 신호를 활용하는 법을 학습한다는 뜻이다. 성공 궤적만 저장하는 대신 모든 궤적을 저장하고 정답 라벨을 주석으로 달면 1.5~2.9(ALFWorld), 2.3~3.4(WebShop) 하락한다. 원본 대신 ReasoningBank식 쓰기 시점 증류본을 저장하면 1.7~2.9, 6.8~8.2 하락하는데, 저장 시점에 확정된 질의 독립 요약은 읽기 시점에 복구할 수 없기 때문이다. 검색 결과를 빈 집합으로 강제하면 RL 훈련 이득이 사라지고 무훈련 base 이하로 떨어져(최대 14.8, 15.2 하락) 이득이 검색된 경험의 증류에서 나온다는 것이 확인된다. 스테이지드 뱅크 리프레시는 Qwen3-8B +2.8, GPT-5.4 +0.9였고 Gemini-2.5-Pro는 변화가 없었으며, 테스트 뱅크를 훈련 궤적 100개로 워밍스타트하는 것은 최대 1.3 차이로 표준편차 안에 머물렀다.

실무 관점에서 이 논문이 유용한 지점은 여러 과제를 순차 처리하면서 과거 궤적을 재사용하고 싶지만 미래 질의를 예측할 수 없는 에이전트다. 구현 시 확인할 것은 네 가지다. 검색기가 BM25로 고정되어 있어 뱅크가 커지고 다양해지면 병목이 될 수 있고, 큐레이터가 과제당 LLM 호출을 한 번 더 발생시키며, 페이로드 포맷이 벤치마크별로 수작업 설계되어 있고, 실행기를 동결하기 때문에 하나의 훈련된 큐레이터를 여러 실행기에 재사용할 수 있다는 점이다. 특히 입력 토큰과 실행 스텝을 동시에 줄이는 특성은 컨텍스트 비용과 지연이 중요한 배포 환경에서 직접적인 근거가 된다.

저자들이 밝힌 한계는 분명하다. 검색기 BM25가 단순해 메모리 뱅크가 크고 다양해지면 병목이 될 수 있고, 큐레이터가 과제마다 LLM 호출을 한 번 추가하며, 페이로드 포맷이 벤치마크별로 고정되고 손으로 설계되었다. 향후 과제로 페이로드 포맷의 공동 최적화, 더 강한 검색기 탐색, 과제당 1회 정제를 새로운 관찰이 들어올 때마다의 턴·스텝 단위 적응으로 확장하는 것을 제시한다. 또한 τ²-bench는 표준 훈련 분할이 없어 훈련 없는 변형만 평가했고, 훈련 뱅크는 베이스 실행기 궤적으로 구성되는 반면 테스트 시점 뱅크는 큐레이터가 개입한 궤적으로 자라나는 완만한 분포 이동이 존재한다고 밝힌다.

관련 논문