장기 LLM 에이전트 기억이 대화 이력에서 도출되는지 감사한다

Memory Is a Derivation: The Distributed-Evidence Paradox in Long-Term Agents

HF Daily2609.36130

Hongjun Liu, Chen Zhao2026-09-28

무엇인가

장기 실행 LLM 에이전트는 모든 과거 상호작용을 컨텍스트에 남기지 않고, 대화를 압축해 영속 메모리로 저장하고 이후 작업의 전제로 재사용한다. 문제는 그 메모리가 정말 상호작용 이력이 지지하는 내용에서 도출된 것인가다. 근거가 여러 턴에 흩어져 있을 수 있고, 압축 과정에서 이력이 세운 적 없는 관계나 사건 상태가 끼어들 수 있다. 그래서 유효한 메모리도 인용이 불완전하면 근거가 없어 보이고, 개별적으로는 지지되는 사실들도 결합되면서 이력이 세운 적 없는 더 강한 주장이 될 수 있다. 저자들은 이 문제를 evidence scope, compositional validity, admission reliability라는 세 가지 맞물린 요구로 정리하고, 쓰기 시점에 이용 가능한 이력이 영속 메모리에 들어가는 내용을 지지하는지 묻는다. 이를 semantic derivation integrity라 부른다.

어떻게 동작하나

제안 프레임워크 DerivAudit은 세 질문을 분리한다. 첫째, 지지 근거가 작성자가 붙인 인용 바깥에 있는가. 이를 위해 같은 쓰기 이력에 대해 citation-only view와 expanded-history view를 비교한다. 확장 뷰는 인용에 더해 쓰기 이전 상호작용에서 BM25로 최대 12개 구절을 검색해 보강하되 총 16개 구절 예산을 지키고, 쓰기 이후 상호작용은 제외하며, 이전에 쓰인 메모리는 같은 이력에서 나온 주장의 독립 근거로 취급하지 않는다. 인용만으로는 부족했지만 확장 후 지지되는 경우를 provenance-repaired라 부르고, 검색 한계로 복구되지 않은 경우는 역사적으로 무효라고 단정하지 않고 unresolved로 남긴다. 둘째, 결합된 메모리가 지지되지 않는 의미를 도입하는가. 메모리를 사실 주장·관계·한정(qualification)으로 분해한 semantic obligations를 정의하고, 모든 obligation이 Supported일 때만 메모리 전체를 지지된 것으로 판정한다. 예컨대 "이직 때문에 보스턴으로 이사했다"는 이사와 이직 각각뿐 아니라 둘의 인과관계까지 지지되어야 한다. 각 obligation은 두 개의 독립 모델 평가로 4-way 라벨을 받고 불일치는 블라인드 adjudication으로 해소하며, 지지와 모순을 따로 평가해 근거 부재를 반대 증거로 취급하지 않는다. 셋째, 쓰기 시점 승인 결정이 이후 메모리 사용에 어떤 영향을 주는가. 동일한 메모리·근거·검증 모델에 표현만 바꿔 holistic factuality, atomic-claim verification, predicate-argument QA, 그리고 관계와 한정을 명시하는 compact-relation·composition-graph·obligation-level 뷰를 비교한다. 또한 70개 matched family(280 예시)로 근거가 국소적인지 분산되어 있는지를 고정 통제하고, 승인 실험은 citation-only holistic, expanded-history holistic, expanded-history obligation-aware 세 설정으로 재생한다.

무엇과 다른가

자연 데이터 감사는 LoCoMo와 HaluMem-Medium에서 가져온 편집되지 않은 메모리 쓰기 400건(각 200건)으로 구성되며, 이 중 391건이 확장 이력 참조 라벨을 확보해 승인 평가에 들어간다(313건 지지, 78건 미지지 또는 모순). 검증 모델은 Qwen3-30B-A3B, Gemma-4-31B, Llama-3.3-70B-Instruct다. Qwen에서 provenance-repaired 메모리 유지율은 citation-only 82.1%에서 확장 이력 93.8%로 11.6포인트 상승했고(p=0.007), obligation-aware 검사는 92.9%로 비슷했다(p=0.023). 전체 유효 메모리 유지율은 세 설정에서 90.4%, 90.1%, 90.7%로 거의 변하지 않았다. 같은 패턴이 다른 모델에서도 나타나 Gemma는 58.0%에서 95.5%로, Llama는 85.7%에서 98.2%로 올랐다. 반면 미지지 메모리 승인율은 Qwen에서 84.6%→80.8%→76.9%로 줄었지만 78개 부정 레코드에서 citation-only 대비 통계적으로 확정되지 않았고(p=0.24), Gemma는 66.7%에서 59.0%로 내려간 반면 Llama는 83.3%에서 88.5%로 올라 모델 간 일관성이 없었다.

어떻게 쓰나

근거 범위 실험에서 인용만으로는 LoCoMo 메모리의 42.5%, HaluMem-Medium의 51.0%가 불충분했는데, 더 넓은 이력이 그중 60.0%와 59.8%를 복구해 전체 지지 비율을 53.5%→79.5%, 47.0%→77.0%로 끌어올렸다. LoCoMo의 인용 지지 메모리 107건 중 25건, HaluMem-Medium의 94건 중 14건은 여러 구절을 함께 봐야 지지된다. 결합 타당성에서는 트레이드오프가 드러난다. Qwen에서 atomic 검증은 미지지 관계를 16.5%만 탐지했고, predicate-argument QA는 39.2%까지 탐지하지만 유효한 다중 구절 메모리 유지율이 56.4%로 떨어졌다. compact-relation 뷰는 94.9%를 유지하면서 59.5%를 탐지해 holistic의 60.8%에 근접했지만, 어느 뷰도 두 기준 모두에서 일관되게 우수하지 않았다. 근거를 분산시킨 통제 조건에서 holistic과 obligation-aware는 Qwen의 무효 사례를 각각 8.6%, 11.4%만 탐지했다. 저자들은 이를 distributed-evidence paradox라 부른다. 즉 유효한 메모리는 여러 상호작용의 근거를 결합해야 하는 경우가 많지만, 바로 그 설정이 지지되지 않는 결합을 거부하기는 더 어렵게 만든다. 목표 관계를 지지하는 충분한 근거를 모두 제거하면 결정의 88~100%가 거부로 뒤집히고, 그럴듯한 전제를 무관한 이력으로 교체하면 무효 메모리 수용률이 65~88%에서 0~10%로 떨어진다. 검증 세분화도 부작용이 있다. 메모리는 그대로 둔 채 독립적으로 참인 obligation을 2개 또는 4개 더 검사하게 하면 Qwen의 중앙 지지 점수가 7.7 log-odds 하락하고 레코드의 98.7%에서 점수가 감소했다. 승인율은 Qwen에서 99.4%→98.1%로 거의 그대로였지만 Gemma는 93.3%→2.6%, Llama는 97.4%→35.5%로 무너졌다. 저자들은 이를 accumulated verification noise라 부른다.

전제와 한계

쓰기 이후 효과도 측정됐다. 반복 추출·통합 과정에서 Gemma의 시간 드리프트와 양상 드리프트는 추출 시점 8.4%와 15.8%에서 4라운드에 69.7%와 78.1%로, Qwen은 7.0%와 12.0%에서 91.1%와 92.6%로 상승했다. 다운스트림 프로브에서 정확한 메모리 대신 왜곡된 메모리를 주면 Gemma·Qwen·Llama의 실패율이 각각 93.0, 83.8, 92.2포인트 증가했고, 유효한 메모리를 제거하면 그 정보가 필요한 질의에서 99.5, 92.8, 94.9포인트 증가했다. 자연 검색에서도 무효 메모리가 검색되면 Gemma와 Qwen 사례의 100%와 96.2%에서 잘못된 정보가 나왔고, 유효 메모리는 91.9%와 85.9%에서 정답을 지지했다. HaluMem의 실제 사례에서는 Sharon Brown이 스포츠 아카데미를 세우려 한다는 계획이 현재 진행형 주장으로, 일반적으로 지지적인 사회적 네트워크가 그 특정 노력을 지지하는 것으로 바뀌었고, 확장 후에도 지지되지 않았다.

실무적으로 이 논문은 메모리 쓰기 검증을 인용 커버리지 검사로 끝내면 안 된다는 근거를 준다. 저장 시점에 인용되지 않은 이력까지 검색해 후보 메모리를 다시 평가해야 하며, 그렇게 해야 인용 누락 때문에 버려지던 유효 기억을 상당수 살릴 수 있다. 동시에 근거를 넓히는 것만으로는 미지지 메모리 승인이 줄지 않고 두 백본에서는 오히려 악화되므로, 검증 단위를 관계·한정까지 포함하는 obligation 수준으로 올리고, 검사를 세분화할 때 유효 기억이 거부되는 accumulated verification noise를 별도 지표로 감시해야 한다. 승인 결정은 유지율과 미지지 승인율을 양쪽 모두 측정해야 하며, 저장된 메모리가 이후 재작성 라운드에서 시간·양상 정보를 잃지 않는지도 추적 대상이다.

저자들이 밝힌 한계는 다음과 같다. 참조 라벨은 주로 두 개의 독립 모델 평가에 의존하고 불일치를 블라인드 adjudication으로 해소했으며, 층화 표본에 대한 인간 검토에서 96.0% 일치를 보였다. 근거 확장은 검색에 의해 상한이 정해지므로 지지를 복구하지 못했다고 해서 역사적 무효가 입증되는 것은 아니다. 자연 데이터에는 모순 사례와 명시적 관계를 포함한 사례가 상대적으로 적고, 통제 스위트는 메모리 작성 중 의미가 바뀌는 방식의 일부만 다룬다. 결과는 검증 모델, 검증 뷰, 프롬프트, 집계 규칙에 따라 달라진다. 통합 결과는 관찰적이며 다운스트림 개입은 완전히 닫힌 루프 메모리 시스템을 포착하지 못한다. 따라서 저자들은 이 발견을 평가한 설정에 대한 증거로 취급하고 메모리 검증에 대한 보편적 주장으로 보지 않는다.