BaRe-Mem이 검증 이력으로 협력자 신뢰도를 추정해 상담 여부를 결정한다

BaRe-Mem: Bayesian Reliability Memory for Robust and Adaptive Agent Consultation

HF Daily2609.35551

Peilin Feng, Zhengyang Huang, Soujanya Poria2026-09-28조회 2

무엇인가

여러 LLM을 에이전트 네트워크로 묶어 쓰는 시스템에서 상담은 이득이 될 수도, 손해가 될 수도 있다. 협력자의 능력은 도메인마다 다르고, 유창하고 자신감 있게 제시된 오답은 중앙 모델이 이미 맞힌 답을 버리게 만든다. 여러 협력자가 같은 그럴듯한 오답에 동의하면 다수결도 이를 걸러내지 못한다. 기존의 텍스트 메모리나 잠재 상태 메모리는 과거를 보존할 뿐, 현재 질문에 대해 어떤 외부 정보를 얼마나 신뢰할지에 대한 문맥적 추정으로 바꾸지 않는다는 것이 이 논문의 문제의식이다. 게다가 단일 에이전트 성능이 충분히 높아지면 협업 이득은 줄거나 마이너스가 될 수 있으므로, 신뢰도는 '얼마나 반영할지'뿐 아니라 '아예 상담할지'까지 결정해야 한다.

어떻게 동작하나

BaRe-Mem의 입력은 질문 q_t에 대한 후보 표현이다. 중앙 모델 M은 K개의 협력자 응답과 자기 자율 답변 a_{t,0}을 합쳐 K+1개 후보를 인코딩하고, 각 후보 k에 대해 질문 전반에 공유되는 신념 ψ_q(t)와 후보별 내용 신념 ψ_c(t,k)를 뽑는다. 후보 벡터는 x_{t,k} = [e_k ⊗ ψ_q(t); ψ_c(t,k); 1]로 구성되며, 신뢰도 점수 wᵀx_{t,k}는 출처 신뢰도 항(w_kᵀψ_q), 답변 내용 신뢰도 항(w_cᵀψ_c), 편향 항으로 분해된다. 즉 '이 협력자가 이런 질문에서 믿을 만한가'와 '이 답변 자체가 믿을 만한가'를 분리해 학습한다.

무엇과 다른가

메모리는 검증된 정오답을 베이지안 선형 회귀로 모델링한다. y_{t,k}∈{0,1}을 s_{t,k}=2y_{t,k}−1로 바꾸고 s|x,w ~ N(wᵀx, 1), w ~ N(0, λ⁻¹I)를 가정한 뒤, 사후분포를 Λ=λI+Σxxᵀ, b=Σsx, m=Λ⁻¹b로 유지한다. 새 후보가 검증될 때마다 칼만 게인 g를 이용한 랭크-1 업데이트로 사후를 정확히 갱신하므로, 전체를 다시 계산하지 않고 온라인으로 확장된다. 신뢰도 추정치는 p_{t,k}=Φ(μ_{t,k}/√(1+v_{t,k}))로, μ는 예측된 부호 있는 정답도, v는 그 불확실성이다. 검증 증거가 없으면 모든 협력자에게 p=1/2가 배정되고, 정답이 확인되면 올라가고 오답이 확인되면 내려간다.

어떻게 쓰나

추정된 신뢰도는 두 곳에 쓰인다. 첫째, 협력자 응답 토큰의 어텐션 로짓에 β_{t,k}=γ·log(p_{t,k}/max_{k'}p_{t,k'})를 더한다. 소프트맥스 전에 (p/max p)^γ ∈ (0,1]만큼 재조정하는 셈이라 가장 신뢰도 높은 협력자는 그대로 두고 나머지를 점진적으로 눌러준다. 학습 파라미터나 추가 학습이 필요 없고, 협력자 간 상대 신뢰도만 사용한다. 둘째, 상담할지 자율 추론할지를 정한다. 상담 능력을 A(T)=T·ρ+(1−T)(κ−δ)로 두는데, T는 협력자 중 최고 신뢰도, κ는 중앙 모델의 자율 능력(p_{t,0}), ρ는 신뢰할 만한 증거가 있을 때의 상담 성공률, δ는 신뢰할 수 없는 증거로 인한 성능 저하다. κ와 T는 메모리에서 바로 얻고, ρ와 δ는 과거 검증 결과로 같은 온라인 베이지안 회귀를 돌려 추정한다. A(T_t) ≥ κ_t이면 상담, 아니면 자율 추론을 택한다. δ̂>0, ρ̂>κ_t인 영역에서는 임계값 T* = δ̂/(ρ̂+δ̂−κ_t)가 유도되는데, 자율 능력이 강한 모델일수록 더 높은 신뢰도의 외부 증거를 요구한다.

전제와 한계

실험은 9개 벤치마크와 6개 중앙 모델, 6명의 협력자로 구성된다. 능력이 뒷받침되는 군은 GSM8K, APPS, SQuAD이고, 능력이 도전적인 군은 PIQA, MMLU, OpenBookQA, SciQ, BBH, SuperGLUE다. 협력자 응답의 일정 비율을 유창하지만 최종 답이 틀린 것으로 치환해 오도 정보 비율을 0%에서 100%까지 올렸다. 능력 도전 군에서 Question+Peers와 Debate(2라운드)는 오도 비율이 50%를 넘으면 두 중앙 모델 모두 상담 없음(No consultation) 기준선 아래로 떨어졌고, 다수결 변형들은 더 빠르게 무너졌다. 신뢰도 어텐션만 남기고 자율 옵션을 제거한 Advisors+memory는 능력 도전 군에서 결국 기준선 아래로 내려가는데, 이는 상대 가중치만으로는 '협력자 풀 전체를 상담할 가치가 있는가'를 판단할 수 없다는 한계를 보여준다. BaRe-Mem은 모든 오도 비율 구간에서 자율 추론 기준선 위를 유지했다.

상담 선택 비율도 이를 뒷받침한다. 능력 지원 군에서는 오도 비율이 0%에서 100%로 가도 상담 비율이 Qwen3-14B 기준 87%→85%, Phi-4 기준 85%→83%로 거의 변하지 않았다. 반대로 능력 도전 군에서는 Qwen3-14B가 90%→21%, Phi-4가 85%→18%로 급감했다. 즉 외부 정보가 쓸모 있을 때는 계속 상담하고, 아니면 스스로 푸는 쪽으로 전환한다. 보정 분석에서는 예측된 상담 이득 Δ̂로 질문을 16개 균등 그룹으로 나눴을 때 실제 이득이 예측 이득과 함께 증가했고, 곡선이 Δ̂=0 근처에서 0을 통과해 예측 경계와 실제 경계가 정렬됐다. 검증 피드백을 일부만 남긴 실험에서는 1% 미만(약 170개 샘플)에서도 피드백 없는 설정 대비 뚜렷한 향상이 나타나고 이후 빠르게 포화됐다. 에이전트 팀 라우팅으로 확장한 MuSiQue(2,417개 태스크, 6,404개 서브태스크)에서는 랜덤 라우팅과 과거 성공 횟수 기반 라우팅보다 높은 태스크 완료율을 기록했고, 동일한 완료율 상한에 더 적은 작업자 호출로 도달해 유능한 작업자를 더 일찍 찾아냈다.

실무 관점에서 이 논문이 주는 것은 '협력자를 몇 명 붙일까'가 아니라 '이 질문에서 협력자를 붙일까'를 판단하는 온라인 추정기다. 검증 신호(정답 확인, 테스트 통과, 사람 리뷰)가 조금이라도 흐르는 파이프라인이라면, 그 신호를 협력자별 신뢰도와 자기 능력 추정으로 바꿔 어텐션 가중치와 라우팅 결정에 재사용할 수 있다. 학습 파라미터가 추가되지 않고 칼만 업데이트만으로 유지되므로 추론 스택에 얹기 쉽다는 점도 실무적으로 중요하다. 다만 도입 전에 확인할 것은 검증 피드백이 실제로 얼마나 자주 들어오는지, 그리고 신뢰도가 낮다고 판단했을 때 자율 추론으로 되돌아가는 경로가 시스템에 있는지다.

저자들이 밝힌 전제와 한계도 분명하다. 상대적 협력자 가중치는 누구를 더 믿을지는 정하지만 협력자 집단 전체를 상담할 가치가 있는지는 판단하지 못하며, BaRe-Mem의 자율 추론 옵션이 이 빈틈을 메운다는 것이 논문의 주장이다. 검증된 결과는 비용이 크거나 간헐적으로만 얻어질 수 있다는 현실적 제약을 전제로 희소 피드백 실험을 따로 두었다. 또한 오도 비율 100% 조건에서도 일부 협력자는 제한된 샘플링 때문에 정답을 낼 수 있다고 명시했고, 단일 에이전트 능력이 충분히 높아지면 협업 이득이 줄거나 마이너스가 될 수 있다는 점을 방법 설계의 동기로 삼았다.