Jev-Mem은 메모리 제어에서 LLM 생성을 뺀 에이전트 메모리다.

Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents

HF Daily2609.23986

Dongming Jiang, Yi Li, Bingzhe Li2026-09-21조회 3

무엇인가

이 논문이 푸는 문제는 장기 상호작용 에이전트의 메모리 관리 비용이다. 코딩 어시스턴트, 개인 에이전트, 연구 에이전트처럼 오래 도는 시스템은 사용자 선호, 작업 이력, 환경 지식을 계속 축적하며 고정 컨텍스트 윈도우를 금방 넘긴다. 컨텍스트 길이를 늘려도 모델이 긴 입력의 모든 위치를 안정적으로 활용하지 못하므로, 프롬프트 밖에 경험을 보존하고 필요할 때 되찾는 메커니즘, 즉 에이전트 메모리가 필요해졌다. 문제는 메모리가 풍부해질수록 제어가 비싸진다는 점이다. 지속적으로 도는 에이전트는 무엇을 저장하고, 갱신하고, 연결하고, 검색하고, 언제 검색을 멈출지를 반복해서 결정해야 한다. 기존 시스템은 고정 휴리스틱을 쓰거나 범용 자기회귀 LLM을 쓴다. 전자는 효율적이지만 경직돼 있고, 후자는 유연하지만 매번 토큰을 생성해야 한다. 이런 결정이 메모리 구축과 검색 전반에 되풀이해 등장하기 때문에, 메모리 제어 자체가 지연과 추론 오버헤드의 주요 원인이 된다.

어떻게 동작하나

저자들의 핵심 관찰은 많은 메모리 제어 연산이 의미적이지만 생성적이지는 않다는 것이다. 메모리 타입 분류, 관계 추론, 쿼리 라우팅, 후보 점수화, 정지 판단은 자유 형식 텍스트가 아니라 라벨, 확률, 점수 같은 제한된 출력을 낸다. 그런 고빈도 결정에 자기회귀 LLM을 쓰는 것은 토큰 단위 생성과 포맷팅, 파싱을 강제하는 불필요한 비용이다. 그래서 Jev-Mem은 인간 이중과정 이론의 System One(빠르고 자동적인 처리)과 System Two(느리고 숙고적인 추론) 구분을 메모리 아키텍처에 이식한다. 구조는 세 계층이다. 고빈도 구조적 결정을 맡는 System-One 컨트롤러, 정규 관찰 노드와 의미·시간·인과·엔티티 관계를 함께 유지하는 공유 메모리 데이터 플레인, 그리고 복잡한 추론과 답 합성에만 호출되는 System-Two 추론 모델이다. 논문은 Jev(TypeSafe AI)가 자기회귀 생성 없이 타입이 있는 확률적 결정을 낸다는 점을 들어 이 분업을 실현 가능하게 만든다고 설명한다.

무엇과 다른가

쓰기 경로부터 보자. 관찰은 o_t = (x_t, τ_t, μ_t), 즉 내용·타임스탬프·출처로 정의되고, 메모리는 정규 노드 집합 V_t, 관계 뷰별 엣지 집합, 벡터 인덱스, 어휘 인덱스로 구성된다. 관계 뷰는 semantic, temporal, causal, entity 네 가지이며 모두 같은 노드를 공유한다. 컨트롤러는 먼저 episodic, semantic, procedural, preference 네 개의 중첩된 타입 점수를 예측한다. 상호배타적 분류가 아니라 노드에 주석을 다는 방식이다. 다음으로 후보 발견과 관계 판단을 분리한다. 새 관찰을 모든 기존 노드와 비교하면 컨트롤러 비용이 메모리 크기에 비례해 커지므로, 벡터 유사도·어휘 중첩·공유 엔티티·시간 근접성을 결합한 결정적 검색으로 최대 K_w개의 후보만 뽑고, System-One이 그 쌍들만 평가한다. 각 쌍에 대해 의미 관련성, 방향성 인과 영향, 동일 에피소드 소속, 필요할 때 엔티티 동일성을 추정하고, P(g|v,u) ≥ θ_rel일 때만 타입 g의 엣지를 삽입한다. 신뢰할 수 있는 구조 정보가 이미 있으면 학습 추론을 피한다. 타임스탬프 순서는 곧바로 temporal 관계가 되고, 정확히 같은 식별자를 공유하면 곧바로 entity 관계가 된다. 시간 순서가 암시적일 때만 before, after, during, contains, overlaps, same_time, unknown 중에서 고른다. 중요한 설계 선택은 관찰을 버리지 않는다는 것이다. 수집 시점에 저장/폐기를 학습으로 결정하지 않아, 처음엔 사소해 보이는 정보가 나중 쿼리에서 관련성을 드러낼 때 영구히 사라지는 일을 막는다. 선택성은 구조 구축 단계와 검색 단계에서 도입된다. 주기적 유지보수는 한정된 이웃에서 중복·모순·노후화·추가 연결을 검토하되 원본 증거는 제거하지 않고, 상위 수준 텍스트 추상화가 필요하면 승인된 병합이나 승격을 명시적으로 System Two로 올린다.

어떻게 쓰나

읽기 경로는 단일 top-k 검색이 아니라 폐루프 제어 과정이다. 쿼리 q에 대해 컨트롤러가 각 관계 뷰의 관련성 p_g(q), 멀티홉 요구 h(q), 최신성 중요도 r(q)를 예측한다. 확률이 독립적으로 평가되므로 쿼리가 하나의 검색 의도로 배정되지 않고 여러 그래프 뷰를 동시에 활성화할 수 있다. p_g(q) ≥ θ_act이면 해당 뷰가 활성화되고, 전체 그래프 확장 예산 B를 w_g(q) = p_g(q)^γ / Σ_j p_j(q)^γ 비중으로 나눠 b_g = m + LRound_g[(B − m|A(q)|)w_g(q)]로 배분한다. 활성 그래프마다 최소 예산 m을 먼저 주고 남은 예산을 비례 배분하는 식이다. 멀티홉 예측은 허용 순회 깊이 D(q) = min{D_max, max(1, ⌈D_max·h(q)⌉)}도 정한다. 그래프 순회 전에는 벡터 순위와 키워드 순위를 상호순위융합(RRF, κ = 60)으로 합쳐 고품질 진입점을 찾는다. 각 검색 라운드 후에는 근거 충분성 s_d, 추가 검색의 기대효용 u_d, 결핍된 필수 근거 m_d, 미해결 모순 c_d를 추정하고, s_d ≥ θ_suff이면서 m_d < θ_cont이고 c_d < θ_cont일 때, 또는 근거가 충분하지 않더라도 u_d < θ_cont일 때 검색을 멈춘다. 후보 점수는 임베딩 유사도 z_v, 쿼리 관련성 a_v, 관계 유용성 ℓ_v에 해당 뷰 확률 p_g(q)를 곱한 항, 정보 참신성 n_v, 근거 지지 c_v와 저장된 엣지 가중치 π_e를 λ 가중치로 합산해 계산하고, 타임스탬프가 있으면 ρ_v = 1/(1 + max(0, τ* − τ_v)/day)로 최신성을 보정한다. 상위 W개가 다음 빔을 이루고 누적 근거에 추가되며, route → retrieve → assess → expand → reassess 루프가 반복된다. 종료 후 최고 점수 K개만 System Two에 넘어가고, System Two는 그래프 라우팅·후보 확장·정지 결정에는 관여하지 않는다. 제어 오버헤드는 명시적으로 유계다. 쓰기 한 번에 배치 타이핑 요청 1회와 최대 K_w개 쌍에 대한 배치 관계 요청 1회, 쿼리 한 번에 라우팅 요청 1회와 라운드당 근거 평가 1회·배치 후보 점수화 1회이며, 확장 횟수·검사 엣지·방문 노드·깊이·컨트롤러 호출·경과 시간에 각각 한도가 걸린다.

전제와 한계

실험은 LoCoMo에서 수행됐다. 초장기 다중 세션 대화로 시간·인과·교차 세션 추론을 요구하는 벤치마크다. 베이스라인은 전체 대화 이력을 그대로 넣는 Full Context, A-MEM, Nemori, MemoryOS, MAGMA이고, 지표는 LLM-as-a-Judge 점수, 총 메모리 구축 시간, 평균 쿼리 지연이다. 결과는 전체 점수 0.777로 최강 베이스라인 0.700 대비 11.0% 상대 개선이다. 여섯 개 질문 유형 중 다섯 개에서 최고였고 temporal 추론은 0.650으로 최고 기록과 동률이었다. 검색과 근거 선택이 중요한 유형에서 개선이 두드러진다. Multi-Hop은 0.625 대 최강 베이스라인 0.569, Open-Domain은 0.610 대 0.517, Adversarial은 0.962 대 0.742다. Single-Hop도 0.797로 가장 높다. 저자들은 이 이득이 특정 추론 패턴에 특화된 것이 아니라, 여러 메모리에 걸친 근거를 결합하거나 그럴듯한 방해 정보를 걸러내야 하는 상황에서 나온다고 해석한다.

효율 수치도 함께 제시된다. 메모리 구축 시간은 158초로, 가장 빠른 경쟁 메모리 시스템의 1,044초 대비 84.9% 감소이자 6.6배 속도 향상이다. A-MEM과 MemoryOS는 구축에 3,000초 이상이 걸린다. 평균 쿼리 지연은 0.93초로 가장 빠른 메모리 기반 베이스라인 1.47초보다 36.7% 낮고, 전체 컨텍스트를 직접 처리하는 1.74초보다 46.6% 낮다. MemoryOS는 쿼리당 32.68초가 걸린다. 저자들은 이 효율이 추론 품질을 희생한 대가가 아니라고 강조한다. 같은 표에서 Jev-Mem이 최고 정확도를 동시에 달성하기 때문이다.

개발자 관점에서 이 논문의 실용적 가치는 메모리 제어 결정을 LLM 생성 루프 밖으로 빼내는 패턴에 있다. RAG나 에이전트 메모리를 직접 붙이는 팀이라면, 저장·연결·라우팅·정지 같은 고빈도 판단을 매번 LLM 호출로 처리하고 있지 않은지 먼저 점검할 만하다. 도입한다면 쓰기 경로의 배치 타이핑과 관계 판단, 읽기 경로의 라우팅·예산 배분·정지 조건을 자체 임계값(θ_rel, θ_act, θ_suff, θ_cont)과 예산(B, D_max, K_w, W, K)으로 튜닝해야 한다. 논문이 강조하는 신규성은 특정 컨트롤러 구현이 아니라 아키텍처 분리 자체이며, Jev는 그중 하나의 구체적 실현이라는 점도 기억해야 한다. 코드는 공개돼 있다. 실무 적용 전에는 백본 답변 모델을 동일하게 맞춘 비교인지, 임계값 민감도, 메모리 규모가 커질 때 후보 발견 비용이 어떻게 늘어나는지를 확인하는 것이 좋다.

한계와 전제는 저자들이 본문에서 직접 밝힌 범위 안에서 정리된다. 현재 설계는 수집 시점에 저장 여부를 학습으로 결정하지 않고 관찰을 보존하며, 선택성은 구조 구축과 검색 단계에서만 도입한다. 텍스트 추상화 생성은 기본 메커니즘이 아니라 승인된 병합·승격을 System Two로 올리는 선택적 결과다. 또한 Jev는 System-One 컨트롤러의 한 가지 구체적 실현일 뿐이고, 평가는 LoCoMo에서 얻은 수치가 본문에 제시된 전부다. 실험 설정 절은 두 개의 널리 쓰이는 벤치마크를 평가한다고 언급하지만, 제공된 본문에는 LoCoMo 외 두 번째 데이터셋의 이름과 결과 수치가 제시되지 않았고, 별도의 한계 절도 없다. 임계값 민감도나 메모리 규모 확장에 따른 비용 변화에 대한 수치 역시 원문에 제시되지 않았다.

관련 논문