LLM 멀티에이전트 성능은 팀 크기가 아니라 과제 구조가 결정한다
Multi-agent Scaling Across Disjunctive and Compensatory Tasks
무엇인가
이 논문은 LLM 멀티에이전트 시스템에서 팀 크기 N을 키우면 성능이 좋아진다는 암묵적 가정을 검증한다. 저자들은 사회심리학의 Steiner 그룹 과제 분류법을 멀티에이전트 LLM 분석 틀으로 끌어온다. 핵심은 과제를 결합 규칙에 따라 나누는 것이다. 분리형(disjunctive) 과제는 Y = max_i{y_i} 또는 다수결·검증기 선택으로 결과가 정해지며, 수학 추론·객관식 지식·코드 생성이 여기 속한다. 보상형(compensatory) 과제는 Y = Aggr(x_1,…,x_n)처럼 연속 추정값의 통계적 집계로 결과가 정해지며, 예측·추정·페르미 문제가 해당한다. 같은 벤치마크라도 어떤 집계 규칙을 쓰느냐에 따라 과제 유형이 달라진다는 점을 먼저 못박는다.
어떻게 동작하나
이론적 뼈대는 조건부 독립 모델이다. 항목 k가 주어졌을 때 같은 모델에서 독립적으로 샘플링한 에이전트들은 항목별 분포 P_k를 따르는 i.i.d. 표본으로 취급된다. 이때 큰 팀의 극한이 갈린다. 분리형 과제에서 다수결 투표는 그 항목에 대한 모델의 최빈 답(modal answer)으로 수렴하고, 보상형 과제에서 기하평균 집계는 모델의 항목별 편향 b_k로 수렴한다. 정답이 최빈값인 항목의 비율을 π라 하면 투표로 얻을 수 있는 이득은 |π − p̄| ≤ 2p̄(1−p̄)(1−ρ)로 유계이며, ρ는 항목 난이도 이질성에서 오는 상관계수다. 보상형 쪽은 MSE(N) = b² + σ²/N_eff(N) → b² + σ²ρ로, 편향항 b²이 지배하면 팀을 키워도 소용이 없다는 것을 수식으로 보인다. 유효 팀 용량은 Kish 설계효과로 N_eff(N) = N/(1+(N−1)ρ), 극한은 1/ρ이다.
무엇과 다른가
실험 규모는 13개 오픈웨이트 모델(3B~20B), 팀 크기 N ∈ {1,2,3,5,7,10,15,20,25,30}, 통신 라운드 1~3, 총 약 6.8×10^7개의 에이전트별 생성이다. 온도는 0.4, 프롬프트는 근거보다 최종 답을 먼저 요구하는 answer-first 형식이다. 분리형 벤치마크는 GSM8K, GSM-Hard, MATH-500, MMLU-Hard, ARC-Challenge, 보상형은 RealFP 페르미 문제다. 결과는 뚜렷하게 갈린다. 분리형에서 최소 한 에이전트가 정답일 확률(pass@N)은 팀 크기에 따라 5~20포인트 오른다. GSM8K는 단일 34.3%에서 pass@30 54.4%, MATH-500은 29.7%→47.1%, MMLU-Hard는 52.4%→67.7%, ARC-Challenge는 83.1%→88.4%다. 그러나 이 잠재력을 다수결 투표가 거의 실현하지 못한다. N=2에서 N=30으로 가는 동안 정확도 변화는 GSM8K +0.3, GSM-Hard +1.0, MATH-500 +1.3, MMLU-Hard +0.8, ARC +0.8포인트에 그친다. 정답 여부의 급내상관(ICC)은 0.53~0.97(평균 0.78)이고, 조건부 독립 모델로 예측한 대규모 팀 극한은 단일 에이전트보다 0.4~1.2포인트 높은 데 머문다. 650개 모델–과제–팀크기 조합에서 예측과 관측의 평균 차이는 0.48포인트, 피어슨 r=0.999였다.
어떻게 쓰나
다중 라운드 수정은 분리형 과제에서 큰 이득을 준다. GSM8K는 N=5에서 라운드1 34.1%가 라운드3 61.9%로 거의 두 배가 되고, GSM-Hard는 18.7%→32.9%, MATH-500은 31.3%→39.7%가 된다. 그런데 이 이득은 팀 크기와 거의 무관하다. GSM8K에서 동료 1명일 때 +26.5포인트, 29명일 때 +26.6포인트로 짝지은 차이가 −0.1포인트(95% CI [−0.6, 0.3])에 불과하다. 저자들은 상당 부분이 답을 확정하기 전에 추론할 기회를 얻은 효과라고 본다. 실제로 단일 에이전트에 5배 토큰 예산을 주면 GSM8K에서 12.4포인트 오른다. 또한 숙의 팀은 중간 크기에서 정확도가 정점을 찍고 N=30으로 갈수록 0.4~1.1포인트 떨어진다. ρ가 0.64~0.93이라 N_eff(5)는 1.06~1.40, N_eff(30)은 1.07~1.53으로, 팀을 6배 키워도 유효 용량은 거의 늘지 않는다.
전제와 한계
보상형 과제는 더 답답하다. 페르미 추정에서 한 자릿수 이내 정확도는 단일 31.6%에서 N=7 33.1%, N=30 33.4%로 거의 평평하고, 클리핑한 로그오차는 1.84에서 N=5 1.73, N=30 1.71로 줄 뿐이다. 수정 라운드도 팀 크기별로 −0.6~+0.7포인트 차이에 그친다. 반면 최소 한 에이전트가 한 자릿수 이내인 비율은 N=30에서 57.3%까지 오르지만, 평균 집계는 그 추정값을 골라낼 방법이 없다. 원인은 항목 수준 편향이다. 부호 있는 로그오차의 ICC가 0.70~0.95, N_eff(5)가 1.04~1.32로 다섯 에이전트가 겨우 한 명분 남짓의 분산 감소만 준다. 항목별 편향이 평균제곱 로그오차의 β=0.87을 차지해, 무한히 큰 동종 팀도 약 13%밖에 제거하지 못한다. 그래서 평균 집계의 오차 감소는 약 6%에 그친다. 모델 간 항목 편향 상관은 평균 r=0.63이고, 전체 항목의 31.5%에서 모든 모델이 같은 방향으로 틀린다. 라벨이 깨끗한 385개 항목만 봐도 r=0.41, 같은 방향 오류 19.1%, β=0.82로 패턴은 유지된다.
이질적 팀은 부분적 돌파구다. 8개 강한 모델 중 5개를 고르는 56개 조합을 절반 항목에서 고르고 나머지 절반에서 평가했을 때, 가장 자주 뽑힌 조합(gpt-oss-20b, r1-distill-qwen-14b, qwen3-8b, phi4-14b, smollm3-3b)은 ρ=0.37, N_eff(5)=2.01로 83.2%를 기록해 구성원 평균보다 +22.1포인트 높았다. 그러나 10개 분할 전부에서 최강 단일 모델(gpt-oss-20b, 86.8%)에는 3.4~4.3포인트 못 미친다. 서로 다른 개발자의 7B~8B 5개 모델 조합도 ρ=0.54, N_eff=1.58로 평균 구성원보다 +7.8포인트지만 최강 구성원(qwen2.5-7b)보다 2.5포인트 낮다. 반대로 페르미 추정에서는 이 7B~8B 이질 풀이 평균 구성원 대비 오차를 25.8%(95% CI [23.1, 28.7]) 줄이고, 1.45로 최고 단일 구성원(1.80)보다도 정확했다. 즉 이질성은 보상형에서만 최강자를 넘어선다.
개발자 관점의 실무적 결론은 명확하다. 분리형 과제에서 pass@N과 다수결 정확도의 격차(4.8~20.1포인트)는 검증기·보상모델·구조화된 숙의가 회수해야 할 프로세스 손실이며, 투표 상한을 올리려면 답변 전 추론이나 모델 패밀리 결합이 필요하고 그 상한은 위 부등식이 제한한다. 보상형 과제에서는 샘플을 더 뽑는 대신 편향이 정렬되지 않은 모델을 섞어 추정값 자체를 바꿔야 한다. 또 하나 실무적으로 중요한 관찰은, 온도를 0.2에서 1.0으로 올려도 qwen2.5-7b의 다수결 정확도는 그대로라는 점이다. 추가 샘플이 오답 쪽으로 퍼질 뿐이다.
저자들이 밝힌 한계는 다음과 같다. 첫째, answer-first 프롬프트가 절대 정확도를 낮추고 숙의 이득의 모양을 바꾸므로 투표 상한의 크기는 이 regime에 국한된다(메커니즘은 그렇지 않다). 둘째, 동료 없는 수정 조건이 없다. 셋째, 페르미 결과는 라벨 노이즈가 큰 단일 벤치마크(RealFP 529개 중 144개, 27.2%가 참조값과 3자릿수 이상 어긋남)에 의존하며 두 가지 프롬프트 계열로 생성됐다. 넷째, 모든 모델이 20B 이하 오픈웨이트이고, 가산형·결합형·재량형 과제는 향후 연구로 남겨뒀다.