멀티에이전트 토론이 투표를 이기는 조건은 제안 공급과 검증 읽기다
When Debate Helps: Proposal Supply and Verification-Aware Readout in Multi-Agent Reasoning
무엇인가
멀티에이전트 토론은 여러 언어모델 에이전트가 답을 제안하고 비판하고 수정한 뒤 최종 결정을 내리는 방식인데, 실제로는 단순 다수결 투표나 자기일관성을 잘 못 이긴다. 기존 이론은 대칭적이고 진실과 무관한 상호작용을 마팅게일 널로 정식화해, 제안을 섞기만 하는 토론은 정답 쪽으로 양의 기대 드리프트를 만들지 않는다는 경계 사례를 보였다. 이 논문은 그 널을 출발점으로 삼아 토론이 투표를 이기려면 두 가지 서로 다른 메커니즘이 필요하다고 주장한다. 하나는 제안 공급으로, 에이전트 사회가 정답을 후보로 표면화해야 한다. 다른 하나는 읽기로, 투표가 놓친 정답을 최종 생성 단계에서 골라내야 한다.
어떻게 동작하나
정식화의 핵심은 회복 가능한 헤드룸이다. 라운드 0의 독립 제안을 기준으로 V(x,S)는 다수결이 정답인지, P(x,S)는 제안 다중집합에 정답이 있는지를 나타낸다. 회복 가능한 헤드룸 H(S)=Pr(P=1, V=0)는 정답이 제안에는 있는데 다수결이 틀린 경우의 비율이다. 명제 1은 투표 대비 이득을 G = H·R + Pr(P=0,V=0)·I − Pr(V=1)·L로 정확히 분해한다. R은 투표가 놓친 표면화 정답의 회복률, I는 초기 제안 단계 이후 새로 생긴 정답률, L은 투표가 맞힌 사례를 망가뜨린 비율이다. 즉 읽기가 투표를 이기려면 회복분과 신규 정답이 손해를 넘어서야 한다.
무엇과 다른가
읽기 모델인 LVD(Latent Verification Debate)는 제안 개수만 세는 베이스라인을 디리클레-범주-다항 회계층으로 두고, 여기에 답별 검증 의사카운트를 더한다. 제안 전용 사후는 α_prop(k) = κ·q0(k|x) + C_t(k)이고, LVD는 α_LVD(k) = κ·q0(k|x) + C_t(k) + W(k)로 정규화해 예측한다. W는 LLM 내부의 관측 가능한 은닉 상태가 아니라 이론적 추상이며, 잠재 검증 변수를 주변화한 매개변수화 W(k) = τ·q^v(k|x,F_t)로 표현된다. 명제 2는 LVD가 정답 y*의 사후 질량을 제안 개수 베이스라인보다 높이려면 W(y*)/W+ 가 α*(t)/A_t, 즉 제안만으로 이미 부여된 정답 확률보다 커야 한다고 말한다. 명제 3은 헤드룸 사례에서 정답 소수파를 잘못된 다수파 위로 올리는 조건을 W(y*) − W(y_v) > α_prop(y_v) − α_prop(y*)로 제시한다. 왼쪽이 검증 증거의 우위, 오른쪽이 제안층에서의 열세다.
어떻게 쓰나
공급 쪽 설계는 신경 덩어리(neural thicket)다. 사전학습 가중치 θ0에 가우시안 노이즈를 더한 θ_m = θ0 + σ_m·ε(s_m)로 근방 전문가 풀을 만들고, 기존 베이스라인처럼 학습셋 정확도 같은 스칼라 점수 상위 K개를 뽑는 대신 문항 수준 커버리지를 최대화하는 부분집합을 고른다. 목적함수는 C(S) = (1/|U|)·Σ_u max_{e∈S} ψ(e,u)이고 최대 커버리지 문제라서 그리디로 근사한다. AC-Greedy는 라벨이 있을 때 ψ = 1{a_e(u)=y*(u)}로 정답 커버리지를, SC-Greedy는 라벨 없이 답 클러스터 지지도 p̂_u(c)로 커버리지를 계산한다. 읽기는 고정된 토론 지시문과 vote-then-judge 파이널라이저로 구성된다.
전제와 한계
실험은 Qwen3-4B-Instruct와 OLMo-3-7B-Instruct 두 백본에서 AMC12, MATH500, GPQA, MMLU-Redux를 대상으로 하며, 각 토론은 K=4 에이전트, T=5 라운드를 쓴다. 베이스라인은 Self-Consistency, Vanilla Debate, Neural Thicket Vote, Neural Thicket Debate다. 표 1에서 라벨 없는 블록은 SC-Greedy 토론이, 라벨 있는 블록은 AC-Greedy 토론이 평균 최고였고 MMLU-Redux에서 개선이 가장 뚜렷했다. 확률적 강건성 실험은 temperature 0.7, top-p 0.95, 매칭된 생성 시드 5개로 다시 돌린 결과로, Vanilla Debate 대비 Qwen3-4B에서 SC-Greedy +1.14점(95% CI [0.60, 1.67]), AC-Greedy +1.46점([0.01, 2.91]), OLMo3-7B에서 +0.96점([0.02, 1.90])과 +2.01점([1.32, 2.69])을 보고한다. AMC12에서 에이전트를 선택해 재선택 없이 MMLU-Redux로 옮긴 도메인 전이도 양성이었지만, 어떤 구성이 최고인지는 백본마다 달랐다.
메커니즘 분석은 두 갈래다. 라운드 수준 통제에서는 같은 vote-then-judge 파이널라이저를 매 라운드 상태에 그대로 적용했을 때 R0 정확도가 76.09%에서 76.45%로 거의 오르지 않는 반면 R2는 78.34%, R3는 78.52%로 R0 읽기 대비 1.89점, 2.07점 높았다. 즉시 파이널라이저 효과만으로는 설명되지 않고 상호작용 자체가 기여한다는 뜻이다. 반대로 OLMo MATH500에서는 네 사회 모두 3.33~6.33점의 헤드룸을 남기면서 최종 이득은 음수여서 변환 병목이 드러났다. 고정 제안 개입 실험은 백본-데이터셋 조합마다 정답과 오답이 모두 들어 있는 저장 트레이스 50개를 뽑아 질문, 대상 에이전트, 초기 응답, 프롬프트, 후보 집합을 고정하고 동료 증거만 바꾼다. m(x)=log p(y_g|x) − log p(y_w|x)의 이동을 d∈{1,2,3} 정답 지지 메시지의 용량-반응 곡선에 보간해 등가 지지 단위를 추정했고, 원래 정답 동료 응답의 중앙값 효과는 GPQA에서 통제 메시지 약 2개, MMLU-Redux에서 3개 이상에 해당했다. 정답을 지우고 추론문만 남긴 조건의 격차도 네 조합 모두 양수였고, d=3에서 정확도가 평균 .325에서 .655로 올랐다. 제안 집합이 변하지 않으므로 이는 공급이 아니라 진실 민감 읽기의 효과다.
개발자 관점에서 이 논문이 주는 실무 지침은 토론을 붙일 때 에이전트 수를 늘리는 것보다 두 지점을 따로 측정하라는 것이다. 첫째, 라운드 0 제안 집합에 정답이 포함된 비율과 다수결이 그것을 놓친 비율(헤드룸)을 로깅하라. 헤드룸이 0에 가까우면 읽기를 아무리 개선해도 얻을 게 없다. 둘째, 읽기 단계에 답별 검증 증거(판정자, 재순위, 비판)를 명시적으로 넣고 그것이 정답 소수파를 다수파 위로 올리는지 확인하라. 에이전트 선별은 개별 정확도 상위 K개보다 상호 보완적 커버리지가 낫고, 라벨이 없으면 답 클러스터 지지도로 근사할 수 있다. 비용도 함께 봐야 한다. 기본 설정이 K=4 에이전트에 T=5 라운드다.
저자들은 토론이 일반적으로 투표보다 낫다는 주장이 아니라고 명시한다. 상호작용은 유용한 대안을 버리거나 투표가 맞힌 사례를 망가뜨릴 수 있고, 실용적 가치는 제안 헤드룸, 경쟁 증거를 평가하는 백본의 능력, 추론 비용에 달려 있다. 헤드룸 변환은 과제와 백본에 의존적이며 도메인 전이도 백본마다 균일하지 않다. 또한 LVD의 W는 관측된 은닉 상태가 아니라 이론적 추상이고, 등가 지지 단위 추정치도 문자 그대로의 내부 카운터가 아닌 운영적 측정치로 취급해야 한다고 밝힌다.