AI 에이전트 팀은 토큰만 더 태우고 품질은 거의 못 올린다
여러 에이전트를 동시에 투입해 성능을 끌어올리는 전략이 기대만큼 값을 못 한다는 측정 결과가 나왔다. 평가 전문 기업 Vals AI가 GPT-6 Sol과 Claude Opus 5.5를 대상으로 단일 에이전트와 에이전트 팀을 같은 조건에서 맞붙였는데, 팀 쪽이 훨씬 많은 토큰을 쓰면서도 결과물 품질은 거의 나아지지 않았다.
실험은 코딩 과제 벤치마크인 Vibe Code Bench에서 진행됐고, 추론 강도를 중간과 최대로 나눠 각각 비교했다. 비용 차이는 모델과 설정에 따라 1.8배에서 5.1배까지 벌어졌다. 그런데 네 번의 비교 중 통계적으로 유의미한 개선이 확인된 경우는 단 한 건뿐이었다. GPT-6 Sol을 중간 추론 강도로 돌렸을 때 팀 구성이 7.3점 앞선 것이 전부다. 추론 강도를 최대로 올리면 Sol과 Opus 5.5 모두 팀 구성에서 실질적인 이득이 사라졌다.
Anthropic이 Opus 5.5로 자체 수행한 두 개 테스트에서도 비슷한 곡선이 나왔다. 에이전트 수를 늘릴수록 품질 개선 폭은 줄어들었다. 팀 규모가 크면 특정 성능 수준에 더 빨리 도달하기는 했지만, 10개에서 100개로 늘려도 24시간이 지난 뒤 점수 상승은 미미했다. 별도의 ProgramBench 테스트에서는 속도 향상이 토큰 사용량 증가를 동반했다.
모델별 편차도 관찰됐다. Fable 5.1은 Lean 정리 증명 과제에서 에이전트가 10개를 넘어설 때 품질 향상이 상대적으로 두드러졌지만, 전체 테스트에서는 여전히 Opus 5.5보다 낮은 점수에 머물렀다. 지식베이스 과제에서는 30개에서 100개로 확장할 때 오히려 점수가 소폭 떨어졌다.
멀티 에이전트가 실제로 사는 것은 품질이 아니라 속도라는 진단도 나온다. OpenAI 연구원 Noam Brown은 Dwarkesh 팟캐스트에서 에이전트 4개를 쓰면 작업을 두 배 빠르게 끝내지만 비용도 두 배가 된다고 설명했다. 16개로 늘려도 같은 패턴이 유지되면서 효율은 조금씩 더 나빠졌다. 효과는 과제 성격에 크게 좌우된다. 웹 리서치나 수학처럼 병렬화가 잘 되는 작업과 달리 소설 집필 같은 작업은 병렬화되지 않으며, 소설에 에이전트 1만 개를 투입하는 것은 사람 1만 명을 투입하는 것과 다를 바 없다는 것이다. 다만 비용 부담 때문에 초대규모 에이전트 확장은 아직 거의 탐구되지 않은 영역이다.
OpenAI 개발자 Eric Provencher도 같은 이유로 에이전트 스웜 사용에 경고를 내놨다. 에이전트 사이의 조정이 무너지면서 돈만 낭비할 가능성이 크다는 것이며, 이를 두고 조정 비용(coordination tax)이라고 표현했다.
개발자 입장에서 이 결과가 주는 신호는 명확하다. 에이전트 수를 늘리는 것을 성능 향상 수단으로 기본값처럼 두던 설계는 재검토가 필요하다. 특히 모델을 이미 최대 추론 예산으로 돌리고 있다면 팀 구성을 추가하는 것은 비용만 키우는 선택이 되기 쉽다. 반대로 지연 시간을 줄이는 것이 목표라면 병렬 에이전트는 여전히 유효한 카드다. 검색, 수학, 코드 탐색처럼 작업을 잘게 쪼갤 수 있는 영역과 그렇지 않은 영역을 구분해 적용하는 것이 핵심이다.
해석에는 전제가 따른다. 이번 수치는 특정 벤치마크와 모델 조합에서 나온 것이고, 통계적 유의성을 확보한 비교는 네 번 중 한 번에 그쳤다. 에이전트 수를 아주 크게 늘리는 영역은 비용 문제로 데이터 자체가 부족하다. 과제 특성에 따라 결과가 달라질 수 있다는 점도 감안해야 한다.