검색된 기억을 그대로 믿지 않게 만드는 0-파라미터 메모리 결정 계층

An Interpretable Memory Decision Controller for LLM Agents Based on Three-Signal Complementarity: Decoupling Confidence and Consistency

arXiv2609.22043v1

Yiming Zhang2026-09-18조회 5

무엇인가

LLM 에이전트의 메모리 시스템은 대부분 더 잘 검색하는 쪽에 집중해 왔고, 검색된 기억을 실제로 믿어도 되는지 판단하는 단계는 비어 있다. 이 논문은 그 공백이 실제 피해를 만든다는 것을 수치로 보인다. TruthfulQA에서 메모리 저장소에 정답과 흔한 오답이 함께 들어 있을 때, 표준 RAG의 환각률은 53.0%로 메모리를 아예 주입하지 않은 베이스라인(B1)의 23.0%보다 오히려 높았다(t=11.82, p=0.007). 검색기가 어떤 기억이 가장 관련 있는지만 답하고 그 기억을 신뢰할 수 있는지는 답하지 않기 때문에, 관련성만 높고 방향이 틀린 기억이 그대로 생성 문맥에 주입된다. 저자들은 이 실패 모드를 retrieval as adoption, 즉 검색을 곧 채택으로 취급하는 것이라고 부른다.

어떻게 동작하나

제안 방법은 Memory Decision Layer(MDL)로, 검색 계층과 생성 계층 사이에 들어가는 학습 파라미터 0개의 컨트롤러다. 입력은 질의 q, 후보 기억 m, 신뢰성 R, 과제 위험 A이고 출력은 네 단계 행동 a다. 먼저 세 신호를 뽑는다. 관련성 M은 질의 임베딩과 후보 기억 임베딩 사이 코사인 유사도의 최댓값(sentence-transformer all-MiniLM-L6-v2 사용)이다. 신뢰성 R은 clip(s_rel_bar 곱하기 (1-φ)^2, 0, 1)로, 관련 기억들 사이의 평균 쌍별 임베딩 유사도 s_rel_bar(코사인 0.3 초과인 것만 대상, 관련 기억이 두 개 미만이면 R=0.5)에 입장 충돌률 φ의 제곱 여집합을 곱한 값이다. φ는 부정, 예/아니오 극성, 반의어 쌍을 다루는 어휘 기반 충돌 검출기가 표시한 관련 기억 쌍의 비율이다. 과제 위험 A는 TruthfulQA에서는 범주-위험 등급 매핑으로, HaluEval에서는 건강·법률·금융·과학 키워드 매칭으로 {0.20, 0.50, 0.85} 중 하나가 부여되며, 최상위 위험 계층은 A ≥ 0.70을 받는다. 여기에 위험 반전 인코딩 s_A^inv = 1 - A를 적용해 위험이 높을수록 활성도가 낮아지게 만든다.

무엇과 다른가

각 스칼라 s ∈ [0,1]은 D=16차원 값 벡터 v(s) = s·1_D + Σ exp(-(s-c_i)^2/2σ^2) e_i (σ=0.20)로 인코딩된다. QR 분해로 만든 완전 직교 사영자 Π_k = P_k P_k^T(차원 배분 d1=5, d2=5, d3=6)를 이용해 부분공간 가중치 행렬 W_k = s_k Π_k + ε_c Σ_{j≠k} Π_j를 구성하고, 작업기억(관련성) 경로에는 2차 위험 변조 g_A = 0.5 + 0.5⟨v_a⟩를 걸어 위험이 높을 때 관련성 기반 확신을 감쇠시킨다. 융합 결과는 v_meta = tanh(g_A W_wm v_wm + W_r v_r + W_a v_a + b) ∈ R^16이다. 여기서 확신도 C는 v_meta의 노름을 캘리브레이션 분할에서 얻은 n_min, n_max로 정규화한 값이고, 방향 일관성 α는 v_wm과 v_meta 사이의 코사인이다. 게이팅 C_final = C·(0.3+0.7α)를 거쳐 동적 임계값 θ=(θ0, θ1, θ2)에 따라 Active, Supp, Silent, Opt-Out 네 행동 중 하나로 매핑된다. 임계값은 데이터셋당 80문항의 홀드아웃 캘리브레이션 분할에서 오라클 행동과의 일치도를 최대화하도록 그리드 서치로 정하고, 정규화 상수 n_min, n_max도 같은 분할에서 가져온다. 이론 파트에서는 직교 사영자의 에너지 보존(Lemma 1), α가 [-1,1]에 갇히는 것(Corollary 1), tanh의 선형 구간 안에서 신호가 강해질수록 C가 단조 증가하지만 포화 구간에서는 단조성이 깨진다는 것(Theorem 1)을 증명한다.

어떻게 쓰나

실험 결과는 다음과 같다. gemma-4 모델에서 표준 RAG(B2)는 충돌 기억 상황에서 53.0%(중위험 52.6%)의 환각률을 보였고, MDL(B3)은 이를 23.3%로 낮췄다(29.7%p 감소, p=0.014). 중위험에서는 27.6%로 RAG의 절반 수준이다. 고위험 질의(A=0.85, 의료·법률·금융)에서 RAG의 환각률은 63.0%였지만 MDL은 위험 반전 메커니즘으로 기권을 유발해 0.0%를 기록했고, 전체 위험 가중 환각률은 17.0%로 모든 시스템 중 가장 낮았다. 더 강한 추론 모델인 deepseek-v4-flash에서는 표준 RAG 자체가 전체 4.3%까지 버티지만, MDL은 중·고위험 제어에서 위험 가중 환각률 3.5%로 B2의 5.8%, B1의 14.2%보다 낮았다. gemini-3-flash-preview와 deepseek-v4-flash 모두 고위험에서 0.0%를 기록해 위험 인지가 기반 LLM의 추론 능력과 무관함을 보였다. HaluEval에서는 고위험 환각률 1.3%(B2 2.7%, B1 4.0%)였다. 사후 교정 베이스라인과의 비교도 있다. CRAG 변형은 이 벤치마크에서 400/400 메모리 저장소를 모두 Ambiguous로 판정해 교정 경로가 한 번도 발동하지 않았고, 전체 환각률 5.0%, 고위험 5.9%로 사실상 신중한 RAG로 퇴화했다. Self-RAG식 반성은 전체 0.5%로 가장 낮았지만 잦은 자기 비판 기반 거부와 재생성(400건 중 34건)을 대가로 치렀다.

전제와 한계

신호 상보성과 절제 실험도 구체적이다. 단일 신호(M만, R만, A만)는 결정 정확도 0.581로 다수 클래스 베이스라인으로 퇴화했다. R+A 조합이 62.7%로 가장 높았고 M+R+A 전체 조합은 61.2%였으며, 전체 조합은 모든 단일 신호 구성을 유의하게 앞섰다(p<0.001, Cohen's d_z ≈ 0.10). 흥미롭게도 R+A가 전체 조합보다 전역 정확도에서 근소하지만 유의하게 높았는데(62.7% vs 61.2%, p=0.001, d_z=0.05), 저자들은 M의 가치가 전역 정확도가 아니라 저관련성 구간의 안전 기권에 있다고 설명한다. 실제로 M<0.4인 45개 레코드에서 M을 추가하면 기권율이 20.0%에서 40.0%로 올라가고, 45건 중 9건이 채택에서 기권으로 뒤집힌다. 정보이론 분해에서는 I(M)=0.002비트, I(R)=0.012비트에 불과하지만 세 신호가 결합하면 0.057비트로 오르고 비선형 시너지 +0.007비트가 나타난다. 구성 요소 절제에서는 값 인코딩 제거가 정확도를 17.8%p 떨어뜨려(0.434) 가장 치명적이었고, 위험 반전 제거 -5.5%p, α 게이팅 -1.6%p, 위험 변조 -1.7%p였다. 직교 부분공간을 항등 사영으로 바꾸면 오히려 정확도가 2.8%p 올랐는데, 저자들은 이를 그대로 보고하며 직교 부분공간의 이득이 전역 정확도가 아니라 에너지 보존과 해석 가능한 귀속 구조에 있다고 위치시킨다. 지도학습 베이스라인과 비교하면 XGBoost 64.6%, LR 63.3%가 1~3%p 앞서지만, MDL은 학습 비용 0, 과적합 0, 독립적으로 감사 가능한 C와 α 스칼라를 제공한다. 지연 시간은 결정 1회당 평균 40.1μs(중앙값 41.9μs, 99백분위 74.5μs)이고, 어휘 충돌 검출까지 포함하면 약 0.14ms다. 같은 환경에서 질의 임베딩 1회가 약 6.8ms, LLM 자기평가 호출 1회가 2.0~4.7초이므로 사실상 무시할 수 있는 오버헤드다.

개발자 관점에서 이 논문의 실용적 의미는 명확하다. 검색과 생성 사이에 얇은 판단 계층을 끼워 넣고, 그 계층이 기권 여부를 명시적으로 결정하게 만들면, 메모리 저장소에 충돌하는 문서가 섞여 있어도 환각 증폭을 막을 수 있다는 것이다. 특히 임베딩 검색보다 약 50배 빠르고 LLM 자기평가보다 4~5자릿수 빠르므로, 고동시성 에이전트 파이프라인에 부담 없이 붙일 수 있다는 주장은 실무적으로 매력적이다. 다만 도입 전에 확인해야 할 전제가 있다. 신호 추출이 어휘 기반 충돌 검출(부정·극성·반의어)과 키워드 기반 위험 등급 매핑에 의존하므로, 도메인별 키워드 사전과 위험 등급표를 직접 만들어야 하고 임계값 θ와 n_min, n_max는 데이터셋당 80문항 규모의 캘리브레이션 분할이 필요하다. 또한 저자들이 말하는 confidence-consistency decoupling은 통계적 독립이 아니라 독립적으로 귀속·감사 가능하다는 뜻이다. 실제 벤치마크에서 C와 α의 상관계수는 r=0.902로 높지만, α는 정답 결정(평균 0.950)과 오답 결정(평균 0.946)을 여전히 구분한다(t=3.70, p<0.001). 감사 인터페이스를 설계할 때 이 구분을 오해하면 안 된다.

저자가 밝힌 한계는 두 가지다. 첫째, 고위험·고관련성 구간(A ≥ 0.70, M ≥ 0.70)에서 극단적으로 높은 관련성이 확신 C를 부풀려 위험 억제를 일부 상쇄한다. 이 구간의 의료 도메인 117개 레코드에서 결정 정확도는 55.6%로 떨어진다. 둘째, Active 행동에서도 8.0%의 잔여 환각이 남아, 검색 후 제어만으로는 메모리 저장소 자체의 세밀한 정제를 완전히 대체할 수 없다. 사례 연구에서도 gemini-3-flash-preview가 중위험 문항에서 기권한 반면, 같은 질문에 gemma-4-E4B-it이 Active 판정을 받고 환각 답변을 낸 사례가 이 잔여 실패로 보고된다. 향후 과제로는 휴리스틱 신호 추출을 종단간 미분 가능한 구조로 바꾸는 것, 조각 단위 필터링 도입, 12B 이상 대형 모델과 적대적 멀티턴 대화에서의 일반화 경계 검증이 제시된다.

관련 논문