MemAdapter가 정확한 기억이 만드는 아첨 편향을 사후에 교정한다
Memadapter: Counterfactual Adaptation Against Memory-induced Sycophancy
무엇인가
장기 기억은 LLM 에이전트가 세션을 넘어 정보를 재사용하게 해 개인화와 장기 상호작용을 가능하게 하지만, 동시에 아첨(sycophancy)을 유발한다. 사용자의 과거 신념·선호·판단이 이후 추론에 반복적으로 재주입되면서, 그 내용이 부정확하거나 낡았거나 객관적 증거와 충돌해도 에이전트가 사용자 쪽으로 과도하게 정렬하는 현상이다. 기존 완화 기법들은 이 문제의 원인을 편향되거나 틀린 기억 자체로 가정하고, 기억 추출·검색·조직 단계에서 그런 기억을 걸러내거나 억제하는 방식으로 접근했다. MemAdapter를 제안한 이 논문은 그 전제를 정면으로 반박한다.
어떻게 동작하나
논문의 사전 연구는 MemSyco-Bench, PersistBench, MemTrapBench에서 검색된 기억이 사실적으로 정확하고 과제 관련성이 높은 사례만 모아 실험했다. 기억을 넣지 않았을 때 정확도 96.0%가 기억을 넣으면 77.3%로 떨어졌고, 벤치마크별로는 96.0→68.0, 100.0→84.0, 92.0→80.0으로 모두 하락했다. 더 중요한 것은 기억 없이 정답이던 예측 중 19.4%가 기억 투입 후 오답이 되었고, 그 뒤집힘은 예외 없이 검색된 기억을 따라갔다는 점이다. 즉 위험은 기억 내용의 품질에서만 오지 않는다. 저자들은 같은 기억이 문맥에 따라 정당한 영향력이 달라진다는 사례도 든다. 사용자가 심장내과 전문의라는 기억은 새 치료 지침 설명의 전문성 수준을 맞추는 데는 유용하지만, 환자별 증거가 치료 B를 지지하는 선택 과제에서 전문의라는 정체성만으로 치료 A를 밀어주면 아첨이 된다.
무엇과 다른가
MemAdapter는 기억을 검색한 뒤, 생성 전에 그 기억이 추론에서 어떤 역할을 하고 얼마나 영향을 미칠지를 조정하는 사후 적응 프레임워크다. 세 단계로 구성된다. 첫째, 반사실 유도(Counterfactual Induction)는 기억 m_i를 고정한 채 그 기억이 관여할 수 있는 과제 유형과 구체적 설정을 담은 반사실 과제 공간 H_i={(t_ij,h_ij)}를 만들고, 각 설정에서 그 기억이 무엇을 뒷받침할 수 있고 어떤 결론은 정당화할 수 없는지를 기록한 설정별 기여 v_ij를 도출해 V_i를 구성한다. 이어 기여들을 비교해 표면적 표현 차이는 버리고 실질적 차이만 남겨 조건-기여 쌍 B_i={(a_ir,v_ir)}로 정리한다. 이것이 과제 독립적인 위험 특성화다. 둘째, 문맥 인식 성찰(Context-Aware Reflection)은 현재 요청 q, 모델이 보는 문맥과 증거 c, 검색된 기억 집합 M, 조건 경계 B를 함께 보고 각 기억의 역할과 영향 강도를 재평가해 U={u_i}를 만든다. u_i는 이 기억이 뒷받침할 수 있는 것, 영향을 줄 수 있는 추론·응답 부분, 그 범위 안에서의 영향 정도, 정당화할 수 없는 결론을 자연어 지시문으로 명시한다. 셋째, 증거 기반 추론(Evidence-Based Reasoning)은 (y, L)=R_EBR(q,c,M,U)로 답변 y와 내부 지지 추적 L을 함께 생성한다. L은 응답의 주요 구간마다 역할·근거 출처·적용된 기억 영향 지시를 연결하고, 반환 전에 각 출처가 실제로 존재하며 해당 구간을 뒷받침하는지, 기억 사용이 지시 범위를 벗어나지 않았는지 검증한다. 사용자에게는 y만 반환된다.
어떻게 쓰나
실험은 MemSyco-Bench, MemTrapBench, PersistBench 세 벤치마크에서 A-MEM, Mem0, NaiveRAG, MemoryBank, LightMem 다섯 기억 시스템을 대상으로 했다. 비교 대상은 각 시스템의 직접 생성 베이스라인과 Anti-Sycophancy, Self-ReCheck, Dynamic Partition, MemGate 네 가지 기억 사용 개입 기법이며, 모두 검색 이후 단계에 같은 후보 기억을 받아 적용된다. 주 백본은 DeepSeek-V4-Flash이고, 교차 백본 실험은 GPT-5.6-sol과 Qwen3-8B로 수행했다. A-MEM에서 MemAdapter는 When to Use Memory 91.22%로 가장 강한 경쟁 기법보다 0.44%p 높았고, How to Use Memory 89.39%로 2.33%p 높았다. PersistBench에서는 다섯 시스템 모두에서 아첨 실패율을 낮췄고 교차 도메인 실패율은 다섯 중 네 시스템에서 줄었다. 다만 유익한 기억 실패율(beneficial-memory failure rate)은 일부 시스템에서 오히려 증가하는 트레이드오프가 나타났다. 절제 실험에서는 NaiveRAG에서 직접 생성 70.25%가 반사실 유도만 적용한 B에서 84.26%로, A-MEM에서는 71.71%에서 84.19%로 올랐고, 여기에 문맥 인식 성찰까지 더한 B+R은 NaiveRAG 85.16%, A-MEM 85.68%, 최종 증거 기반 추론까지 포함한 전체 구성은 각각 89.94%, 90.45%를 기록했다.
전제와 한계
실무적으로 이 논문은 기억 시스템을 새로 만들지 않고도 검색 이후 단계에 얹을 수 있는 개입을 제안한다는 점이 핵심이다. 이미 Mem0나 NaiveRAG 같은 기억 계층을 쓰고 있다면, 검색된 기억을 그대로 프롬프트에 붙이지 말고 이 기억이 이번 과제에서 무엇을 정당화할 수 있는가를 먼저 판정하는 단계를 두는 것이 도움이 될 수 있다. 특히 사용자 프로필·선호·과거 판단이 사실 판단이나 의사결정에 섞여 들어가는 개인화 에이전트, 장기 상담·의료·법률 도메인에서 검증할 가치가 있다. 도입 시에는 정확도뿐 아니라 유익한 기억 사용이 오히려 줄어드는지, 백본 모델과 기억 시스템 조합에 따라 효과 크기가 달라지는지를 함께 측정해야 한다. 내부 지지 추적 L처럼 응답 근거를 명시적으로 남기는 방식은 디버깅과 감사 로그 설계에도 참고할 만하다.
저자들이 밝힌 전제와 한계는 분명하다. MemAdapter는 상류의 기억 구성·검색 과정을 수정하지 않는 사후 개입이며, 그 효과는 벤치마크·기억 시스템·백본 조합에 따라 달라진다. PersistBench의 유익한 기억 실패율은 일부 기억 시스템에서 증가했고, Qwen3-8B에서는 개인화 기억 정확도가 모든 시스템에서 개선된 반면 GPT-5.6-sol에서는 시스템별로 혼합된 변화를 보였다. 또한 반사실 유도, 문맥 인식 성찰, 증거 기반 추론은 모두 추가 추론 단계를 요구하는 구조이므로 지연과 비용 부담이 따라온다. 윤리 선언에서는 인간 피험자나 민감 자료를 다루지 않았고 사용 데이터셋이 공개 자원 기반이라고 밝히고 있다.