LLM 토론의 붕괴와 교정을 구분해 개입 정책을 다시 채점한다

Measuring Collapse and Correction in Homogeneous-Panel LLM Debate

HF Daily2609.35279

Xin Li, Mengbing Liu, Chau Yuen2026-09-28조회 2

무엇인가

다중 에이전트 LLM 토론은 흔히 '최종 답이 좋아졌는가'로 평가된다. 하지만 이 논문의 출발점은 움직임이 곧 개선이 아니라는 것이다. 같은 토론이 처음에 틀린 다수 의견을 구제할 수도 있고, 외부 적대자나 새 증거 없이도 처음에 맞은 다수 의견을 틀린 합의로 붕괴시킬 수도 있다. 저자들은 Sonnet 4.5와 Llama-3.1-8B의 토론 뒤집힘률이 0.705 대 0.726으로 거의 같은데도 조건부 붕괴율은 2.15% 대 8.46%로 약 4배 차이가 난다는 점을 든다. 빠진 변수는 움직임의 크기가 아니라 방향이다.

어떻게 동작하나

제안하는 것은 새 토론 스캐폴드가 아니라 감사 가능한 평가 프로토콜이다. 핵심은 초기 다수 정답 여부와 최종 다수 정답 여부로 만든 2×2 전이 원장으로, 각 실행을 preserved, collapse(초기 정답 → 최종 오답), correction(초기 오답 → 최종 정답), unrepaired로 분류한다. onset은 정답 다수가 처음으로 오답 다수로 뒤집힌 라운드다. 실험 설정은 동일 모델 3개 에이전트, closed-book, 객관식 문제이며 Round 0에서 독립 응답하고 Round 1~3에서 서로의 답을 보며 갱신한다. 라벨링은 LLM 심판이나 사람 코더 없이 규칙 기반으로 하고, 파서는 'Final Answer: X' 같은 명시적 표기를 우선하며 동점은 알파벳 순으로 깬다(이 동점 규칙은 열린 트레이스 부분집합에서 298/3,240, 9.20% 발동). 별도로 4×2 프로브를 8개 투여한다. 논증 강도 4단계(약·중·강·매우 강)와 사회적 압력 2단계(단독 반론 vs 두 에이전트에게 귀속된 동일 단서)의 조합이다. 여기서 α_tot(전체 답변 변경률), α_adv(초기 정답인데 바뀐 비율), α_cor(초기 오답인데 정답으로 바뀐 비율), S/A 비율(사회적 민감도 대 논증 민감도)을 계산한다. 개입 평가는 부호 있는 리플레이로 한다. 동결(freeze) 게이트가 발동하면 최종 다수 대신 초기 다수를 반환하므로, 초기 다수가 정답이었으면 붕괴를 막지만 토론이 회복했을 교정은 버린다. 효용은 U_w(g) = w_coll × prevented_collapses(g) − w_corr × lost_corrections(g)로 정의하고, 기본은 동일 가중치다.

무엇과 다른가

MMLU-Pro 6,925개 토론에서 붕괴 253건이 관측됐다(오픈소스 모델 행 251건 + 폐쇄 API 행 2건). 분석 코호트는 14개 모델 행, 7개 패밀리 클러스터다. 프로브 측정의 반복 가능성은 split-half 신뢰도 0.873, test–retest 0.760, 에이전트 간 ICC 0.630~0.633으로 보고된다. 사전 토론 스크린의 패밀리 수준 상관은 ρ=+0.8929, exact 양측 p=0.0123으로 크지만, 저자들은 이를 확증으로 취급하지 않는다. 초기 다수 정확도가 근접한 무료 비교군이고(패밀리 수준 ρ=+0.821), 초기 정확도로 조정한 패밀리 편상관은 ρ=+0.767, p=0.0877로 확증적이지 않기 때문이다. 모델 행 Spearman은 ρ=+0.8295, 최악 leave-one-family-out은 +0.741, 봉인된 N=9 빈티지 교차확인은 ρ=+0.78이었고, 정작 원시 토론 뒤집힘률은 ρ=+0.33(p=0.391)으로 약했다.

어떻게 쓰나

붕괴는 대부분 초반에 시작된다. onset 분포는 Round 1이 149건(58.9%), Round 2가 47건(18.6%), Round 3이 57건(22.5%)이다. Round 3이 Round 2보다 많은 것은 모순이 아니라, Round 2까지 정답 또는 분열 다수를 유지하다 Round 3에서 오답으로 고정되는 경우가 있다는 뜻이다. 예측력도 Round 1 특징을 넣으면 pooled out-of-fold AUC가 0.669에서 0.768로 오르고(Δ=+0.099, 95% CI [+0.080,+0.118]), Round 2/3 특징까지 넣으면 0.846이 된다(Δ=+0.077, CI [+0.064,+0.092]). 그런데 진단이 곧 안전한 제어는 아니다. leave-one-model-out 프로브 게이트 동결은 251건 중 29건의 붕괴를 막는 대신 804건 중 108건의 교정을 버려 동일 가중치에서 순효용이 −79였다. Round 1 리플레이 게이트도 56건 방지 대 69건 손실이었다. 붕괴 가중치를 r=2로 올려도 프로브 게이트 동결은 −0.77%p로 여전히 음수이고, Round 1 다수변경 규칙만 +3.43%p로 양수가 된다. Round 1 다수변경 규칙이 손익분기 되는 조건은 사용자가 붕괴를 잃은 교정의 최소 1.23배로 미리 지정할 때다.

전제와 한계

채널 분리와 후속 실험도 보고된다. 반논증 시스템 프롬프트와 반사회 시스템 프롬프트는 테스트한 16/16 모델에서 측정 가능하게 다른 뒤집힘 분포를 만들었고(전체 평균 Cohen's d=0.53, 12/16이 Holm–Bonferroni 보정 통과), Qwen3-4B(d=0.092)와 Qwen3-8B(d=0.057)는 분리도가 거의 0이었다. 사적 수정(private revision)은 동일한 Round 0 답에서 분기해 비교했을 때, 동점을 오답으로 세면 동료 토론보다 1.44~4.81점 낮았고 동점을 기대값으로 인정하면 차이가 −1.62~+0.38점으로 좁혀졌다. reasoning 모드 11개 행에서는 붕괴와 교정이 모두 남아 있었고 사적 수정이 11개 모두에서 음의 점수 차이를 보였다.

개발자 관점의 실무적 결론은 분명하다. 토론이나 다중 에이전트 스캐폴드를 붙일 때 최종 정확도 하나만 보고 컨트롤러를 고르면, 붕괴를 막는 정책이 교정을 더 많이 지워 순손실이 되는 경우를 놓친다. 프로브 α_tot는 비싼 트레이스 로깅을 어느 모델–스캐폴드 행에 배분할지 정하는 트리아지 신호로 쓰고, 토론이 시작된 뒤에는 Round 0 불일치와 Round 1 궤적 특징을 런타임 진단으로 쓰라는 것이 저자들의 권고다. 어떤 행동 정책이든(동결, 기권, 가중 투표, 토폴로지 제어, 조기 종료) 분모, 행 수준 행동, 가중치, held-out 부호 있는 리플레이를 함께 보고해야 하며, 가중치는 정책 선택 전에 선언해야 한다.

한계도 저자들이 명시한다. 주 분석은 사전등록한 18개 모델 행이 아니라 실현된 14개 행, 7개 패밀리로 작고 불균등하며, 정확한 패밀리 검정이 주이고 모델 행 결과는 민감도다. 범위는 동일 모델·closed-book·객관식 토론으로 좁고, MMLU-Pro가 주이며 ARC, TruthfulQA, GPQA, OpenRouter/Gemini 행은 벤치마크 전이를 입증하지 않는다. 이종 모델 패널, 심판–토론자 시스템, 도구 사용, 검색, 자유 형식 생성, rubric/심판 채점, 장문 맥락에서 증거를 모으는 에이전트 워크플로는 다루지 않는다. Round 1 궤적은 위험을 국소화할 뿐 인과 매개를 주장하지 않고, 스크린은 능력 독립적 속성이나 문항별 오라클이 아니라 프로토콜에 묶인 트리아지 측정이다. 아티팩트는 API 호출 없는 재빌드 스크립트와 스키마, 코더, 감사, 비용 카드를 공개하지만 일부 Round 1 및 DisagreementGate 행렬은 게이트되어 있고 제공자 재실행 시 결과가 흔들릴 수 있다.