여러 LLM 에이전트 협업을 선호도 학습으로 최적화하는 MAPL

Improving LLM Collaboration via Multi-Agent Preference Learning

arXiv2609.32827v1

Shuo Liu2026-09-26조회 2

무엇인가

LLM 에이전트를 여러 개 붙여 복잡한 작업을 나눠 맡기는 멀티에이전트 시스템(MAS)은 이미 널리 쓰이지만, 대부분의 범용 LLM은 협업을 명시적으로 학습한 적이 없어 역할 분담과 조율에서 자주 어긋난다. 기존 연구는 다중 에이전트 강화학습(MARL)으로 이 문제를 풀려 했으나, 보상 함수를 사람이 직접 설계해야 하고 도메인별 지표가 없거나 팀 전체 목표를 제대로 반영하지 못하는 경우가 많다. 이 논문은 보상 설계 대신 비교 기반 선호 피드백으로 LLM 협업을 최적화하는 문제를 다룬다.

어떻게 동작하나

저자들은 협업 구조를 두 가지로 나눠 각각을 의사결정 과정으로 정식화한다. 분산 협업은 각 에이전트가 자기 로컬 관측 이력만 보고 행동하는 선호 기반 분산 부분관측 MDP(Pb-Dec-POMDP)로, 중앙집중 협업은 모든 에이전트가 공동 관측·행동 이력을 공유하는 선호 기반 다중에이전트 POMDP(Pb-MPOMDP)로 모델링한다. 두 설정 모두 에피소드마다 두 개의 궤적을 샘플링해 주석자(사람 또는 AI)가 잠재 보상 R*에 따라 승자와 패자를 라벨링하고, 에이전트는 그 선호만으로 누적 잠재 보상을 최대화하는 공동 정책을 찾는다.

무엇과 다른가

제안 프레임워크 MAPL은 이 선호 데이터를 반복적으로 갱신하며 정책을 개선한다. 먼저 현재 정책으로 궤적을 모아 초기 선호 데이터셋을 만들고, 승자 궤적의 리턴 기준 상위 k개 쌍만 리플레이 버퍼에 넣는다. 이후 매 반복에서 현재 에이전트 정책이 만든 궤적과 비교자(comparator) 정책(이전 체크포인트나 다른 모델 변형)이 만든 궤적을 짝지어 새 선호 데이터를 만들고, 다시 상위 k개를 버퍼에 추가한다. 비교자와 에이전트가 각각 분산/중앙집중 중 무엇을 쓰는지에 따라 Dec-Dec, Cen-Cen, Dec-Cen 세 가지 학습 패러다임이 나온다.

어떻게 쓰나

MAPL의 구체적 구현은 두 가지다. MARLHF는 2단계 방식으로, 먼저 공동 이력 기반 보상 모델을 선호 쌍에 대한 Bradley-Terry 손실로 학습해 잠재 보상을 근사하고, 그 보상을 고정한 채 정책을 최적화한다. 이때 LLM MAS의 행동 공간이 워낙 커서 가치 기반 방법과 크리틱 학습이 비실용적이므로, 같은 작업에 대해 G개 궤적을 샘플링해 그룹 평균을 베이스라인으로 쓰는 그룹 상대적 몬테카를로 어드밴티지(논문 식 5)로 정책을 업데이트한다. MADPO는 보상 모델을 명시적으로 학습하지 않고, 승자·패자 궤적의 정책 로그비 차이를 직접 최대화하는 DPO를 다중 에이전트 공동 이력으로 확장한 한 단계 방식이다.

전제와 한계

실험은 문서 요약(TLDR), 협업 코드 생성(CoopHE), 함수 호출(BFCL), 여행 계획(Travel) 네 도메인에서 진행됐다. TLDR은 Qwen3-1.7B 두 개, CoopHE는 Qwen2.5-Coder-3B 두 개, BFCL과 Travel은 Qwen3-4B-Instruct-2507 두 개를 쓴다. 보상은 도메인별 결정적 오라클 함수로 선호를 생성했다. 최적 설정의 MAPL은 CoopHE 통과율 65.8%, Travel 통과율 76.4%를 기록해 가장 강한 단일 에이전트 베이스라인과 테스트 시점 협업 프레임워크(parallel, sequential, discussion)를 네 도메인 모두에서 앞섰다. 오라클 보상을 쓰는 MARL(MAGRPO)이 TLDR 점수와 CoopHE·Travel 통과율에서 가장 높았지만, MAPL은 TLDR 점수와 Travel 통과율에서 1% 미만 차이로 따라붙었다. 분산 협업에서는 MARLHF가 CoopHE 호출률(40.2% 대 37.9%)과 Travel 성공률(13.1% 대 12.5%)에서 MAGRPO를 오히려 앞섰는데, 저자들은 비슷한 품질의 샘플이 더 촘촘히 모인 선호 데이터셋이 상대적 품질을 구분하는 국소적 학습 신호를 제공했기 때문이라고 해석한다.

절제 실험도 수치로 제시된다. 리플레이 버퍼를 오프라인(선수집 80쌍 중 상위 16개)으로 쓰는 대신 4회 반복에 걸쳐 온라인으로 모으면 BFCL에서 MARLHF가 7.5%에서 14.8%로, MADPO가 3.1%에서 15.3%로 좋아졌고, 이전 반복 샘플을 λ로 감쇠시키는 버퍼가 대부분 도메인에서 최고였다. 비교자 모델을 키우는 것은 일관되게 도움이 되지 않았다. TLDR에서 비교자를 같은 크기에서 4배로 키우면 MARLHF는 86.3%에서 66.5%로, MADPO는 92.9%에서 71.8%로 떨어졌고, 다른 계열의 DeepSeek-V4-Pro를 쓰면 각각 70.1%, 74.6%였다. MARL 알고리즘 비교에서는 MAGRPO가 중앙집중 크리틱(CoLLM-CC)과 분산 크리틱(CoLLM-DC)을 네 도메인 모두에서 앞섰으며, TLDR 점수 최소 59.6%, CoopHE 통과율·BFCL 정답률·Travel 통과율 최소 14.5%·15.5%·33.0% 개선을 보였다.

실무 관점에서 이 논문이 주는 신호는 명확하다. 보상 함수를 손으로 설계하기 어려운 협업 태스크라면, 정답 라벨 대신 두 협업 결과를 비교한 선호만으로 정책을 밀어올릴 수 있다는 것이 네 도메인에서 확인됐다. 다만 비교자는 무조건 강한 모델을 쓰는 게 아니라 에이전트와 같은 계열·비슷한 크기로 맞추는 편이 낫고, 학습 데이터는 오프라인 선수집보다 현재 정책이 만들어내는 궤적을 반복적으로 섞는 온라인 수집이 유리하다. 또한 중앙집중 협업(Cen-Cen)이 대체로 가장 좋지만, 모델 용량이 작으면 오히려 분산(Dec-Dec)보다 나쁠 수 있다는 점, 그리고 분산 에이전트에 중앙집중 비교자를 붙이는 Dec-Cen은 정보·실현 가능성 격차 때문에 대부분 도메인에서 성능이 떨어진다는 점을 배포 전에 확인해야 한다.

저자들이 밝힌 한계는 다음과 같다. MARLHF는 대부분 태스크에서 MADPO보다 우수하지만 데이터 커버리지, 에이전트·비교자 모델 선택, 기반 MARL 알고리즘에 민감하다. 선호 데이터가 적거나 비교자 정책이 에이전트와 크게 다르거나 액터-크리틱 계열을 쓰면 분산이 커진다. 보상 추정이 부정확하거나 분산이 높으면 가치 추정과 정책 업데이트가 불안정해지고, 암묵적 보상 모델이 정책과 함께 갱신될 때는 학습이 비정상(non-stationary)해진다. 또 기존 대규모 선호 데이터셋은 다중 에이전트 협업용으로 재활용하기 어려워, 실험에서는 도메인별 결정적 오라클 보상으로 선호를 합성했다는 전제가 깔려 있다.