MAGIC는 단일 에이전트와 그룹을 섞어 다중 에이전트 협업 그래프를 RL로 만든다.
MAGIC: Mixed-Granularity Agent Graphs via Incremental Construction with Dense-Reward Reinforcement Learning
무엇인가
이 논문은 LLM 기반 다중 에이전트 시스템에서 협업 토폴로지가 성능과 실행 비용을 동시에 좌우한다는 문제를 다룬다. 기존 토폴로지 생성기는 조직 전체를 원자적 에이전트로만 만들거나 미리 정의된 그룹으로만 연결해, 하나의 질의 안에서도 하위 작업별로 필요한 협업 규모가 다른 점을 반영하지 못한다. 예를 들어 API 업데이트 작업에서 상류 변경 조사와 호환성 테스트는 SearchGroup과 TestingGroup이 유리할 수 있지만, 한두 줄 패치 구현은 ProgrammerAgent 하나로 충분할 수 있다. 저자들은 이런 고정 입자도 불일치를 지적하며, 각 기능 역할마다 단일 에이전트 또는 재사용 그룹을 국소적으로 선택하는 혼합 입자도 조직 공간을 제안한다. 목표는 질의 Q와 고정 역할 라이브러리 R가 주어졌을 때, 실행 점수 S(Execute(Q,G), y*)의 기대값을 최대화하는 구성 정책 pθ(G|Q,R)을 찾는 것이며, G는 합법 그래프 G_legal에 속하고 최상위 단위 수 N은 N_max 이하여야 한다. 정답이나 테스트는 실행 후 채점에만 사용된다.
어떻게 동작하나
방법을 설계하기 전에 저자들은 세 가지 경험적 관찰을 제시한다. D1에서는 decomposer-solver-verifier 직렬 골격의 원자/그룹 할당 8가지를 MMLU-Pro 테스트와 TAT-QA dev의 각 200개 질의에서 열거했다. MMLU-Pro는 GAA를, TAT-QA는 AAG를 선호했고, 혼합 할당은 고정 입자도 양 끝점보다 각각 4.5점과 2.5점 높은 정확도를 보이면서 GGG보다 토큰을 적게 썼다. D2에서는 이중 입자도 역할이 m개인 고정 역할-엣지 골격에서 구성 수가 2^m이고, B번의 완전 그래프 실행 예산으로 검증 가능한 비율이 min(1, B/2^m) 이하로 제한됨을 보였다. D3에서는 MMLU-Pro, GSM8K, HumanEval의 동일한 720개 궤적에서 중간 ADD 행동의 비영(非零) 어드밴티지 비율이 밀집 보상으로 증가했고, MMLU-Pro에서는 32.81%에서 83.13%로 올랐다. 이 관찰들이 국소 입자도 선택과 중간 구성 피드백의 필요성을 뒷받침한다.
무엇과 다른가
MAGIC의 조직 공간에서 각 역할 r은 원자 에이전트 또는 그룹이라는 실현을 하나 이상 허용한다. 그래프 G=(U,E)에서 U는 (i, r_i, z_i) 형태의 최상위 단위들이고, E는 단위 간 방향성 의존성이다. 원자 단위는 역할 실행기 하나를 쓰고, 그룹은 고정된 내부 에이전트 그래프와 하나의 역할 수준 결과를 내는 집계기를 쓴다. 두 실현은 같은 입출력 계약을 노출하므로 연결된 단위들이 입자도와 무관하게 역할 수준 출력을 교환할 수 있다. 실행 시 그룹은 내부 DAG로 펼쳐지고, 펼쳐진 원자 에이전트 그래프가 의존성 순서로 실행된다. 고정 외부 요약기가 공개 과제, 출력 요구사항, 펼쳐진 그래프의 모든 싱크 결과로 최종 답을 만든다. 빈 그래프 G0나 즉시 정지의 경우에는 질문, 선택지, 답 요구사항만 담은 최소 직접 답변 프롬프트를 기본 LLM에 준다.
어떻게 쓰나
구성 정책은 공개 질의와 부분 그래프를 관찰한다. 고정 텍스트 인코더가 질의와 역할 실현을 임베딩하고, 노드 특징은 실현 의미, 입자도, 구성 위치, 차수 임베딩을 결합한다. Edge-aware GRU가 구성 순서대로 단위를 인코딩하며, 각 단위 특징과 실제 선행자들의 평균 표현, 질의 임베딩을 합친다. 재귀 상태는 구성 이력을, 선행자 집계는 그래프 의존성을 담는다. 과제 조건부 어텐션이 노드 상태를 풀링하고, 투영이 풀링 표현, 질의, 구성 진행도를 결정 문맥 c_t로 결합한다. 세 개의 조건부 헤드가 비정지 행동 a_t=(r_t,z_t,b_t)를 매개변수화한다. 역할과 정지는 하나의 마스킹된 범주 분포를 공유하고, 두 번째 범주 분포가 선택된 역할의 실현을 고른다. 독립 베르누이 결정이 허용 가능한 선행자 부분집합을 선택한다. 정지 행동은 역할 수준 확률만 쓰고 나머지 헤드를 건너뛴다. 합법성 마스크가 라이브러리, 방향, 구조 제약을 강제한다. 각 추가 후 그래프 인코딩이 갱신되고, 최대 단위 지평에서는 정지만 합법이 된다. 추론 시에는 드롭아웃을 끄고 그래프를 샘플링해 실행하며, 프로브 점수, 정답, 보상은 훈련 전용이다. 훈련 중 텍스트 인코더와 실행 LLM은 고정되고, 그래프 인코더, 특징 투영, 풀링, 행동 헤드만 갱신된다.
전제와 한계
훈련은 잠재 기반 밀집 보상 강화학습으로 이루어진다. 각 질의의 궤적 그룹에 대해 다른 훈련 질의에서 고른 고정 프로브 집합 P를 모든 궤적과 구성 단계에 공유한다. 단위를 추가해 G_t가 G_{t+1}로 바뀔 때 쌍별 효용 이득은 ΔU_t = (Σ_{p∈P}[S(G_{t+1},p)-S(G_t,p)])/(|P|+κ)로 정의된다. 구조 오버헤드는 C(G)=w_n[N_exp(G)-b_n]_+ + w_e[E_exp(G)-b_e]_+이고, 역할 반복은 D(G)=Σ_r[m_r(G)-1]_+이다. 각 추가는 d_t=αΔU_t-βΔC_t-γ_RΔD_t를 기여하고, Φ_0=0에서 Φ_{t+1}=Φ_t+d_t로 누적해 그래프 잠재 Φ_t를 만든다. 보상은 r'_t = r_t^task + ηΦ_{t+1} - Φ_t이며, 구성 중 기본 보상은 0이고 종료 시 과제 점수가 들어간다. 초기와 종료 잠재는 0으로 두고, 명시적 정지는 S(G,q)-Φ_P(G)를 받는다. 저자들은 할인 η를 보상 형성과 리턴 계산에 동일하게 쓰고 Φ_0=Φ_T=0으로 두면 Σ η^t r'_t = Σ η^t r_t^task가 성립함을 명제 1로 제시한다. 즉 보상 형성은 기대 과제 리턴과 최적 정책 집합을 보존하면서 중간 신호를 재분배한다. 정책 최적화에서는 질의마다 현재 정책에서 K개 궤적을 샘플링하고, 같은 위치에 행동이 있는 궤적들 사이에서 리턴을 정규화해 어드밴티지 A_{k,t}=(G_{k,t}-μ_t)/(σ_t+ε)를 만든다. 손실은 -sg(A)logπθ(a|s)의 평균에 KL 정규화와 엔트로피 항을 더한 형태이며, 가치 네트워크나 미리 수집한 성공 궤적 코퍼스 없이 현재 정책 궤적만으로 구성 정책을 직접 훈련한다. 훈련은 공유 프로브에 대한 부분 그래프 평가와 조건 질의에 대한 최종 그래프 채점을 쓰지만, 추론은 완성된 조직만 실행한다.
실험은 네 가지 과제군, 여덟 개 벤치마크에서 진행됐다. 지식·상식 추론은 MMLU-Pro와 StrategyQA, 수학 추론은 AQuA와 GSM8K, 코드 생성은 HumanEval과 LiveCodeBench-v6, 표·금융 추론은 TAT-QA와 TabFact다. 비교 대상은 직접·단일 에이전트 방법인 DeepSeek V4 Flash와 Qwen Flash, 기존 MAS인 AutoGen과 LLM-Debate, 적응형·학습 조직인 DyLAN, GPTSwarm, G-Designer, Sparse-Comm, GraphSearch, Graph-R1, R-GFM, BIGMAS, MasRouter, GoAgent, VeriMAP, ARG-Designer, EIB-Learner까지 총 17개다. MAGIC은 DeepSeek V4 Flash를 실행기로 쓰고, 벤치마크마다 100개 훈련 예제로 별도 구성 정책을 한 번씩 훈련해 최종 체크포인트를 평가했다. HumanEval은 LiveCodeBench와 같은 100개 예제를 쓴다. 결과적으로 MAGIC은 여덟 벤치마크 모두에서 1위를 했고, 가장 큰 개선은 MMLU-Pro와 LCB-v6에서 나타났다. MMLU-Pro 정확도는 73.60%에서 83.20%로, LCB-v6 pass@1은 26.86%에서 36.57%로 올랐다. 코드 생성에서는 Qwen Flash가 모든 MAS 베이스라인을 앞섰지만 MAGIC은 두 코드 벤치마크 모두에서 더 높았고, MMLU-Pro와 TAT-QA에서는 각각 DyLAN과 GraphSearch를 넘어섰다.
구성 요소 절제 실험은 Qwen Flash 설정에서 MMLU-Pro와 TAT-QA로 진행됐다. All-Atomic은 토큰을 가장 적게 썼지만 Full보다 MMLU-Pro 정확도 8.00점, TAT-QA F1 5.93점이 낮았다. All-Group은 토큰을 상당히 더 쓰면서도 Full에 못 미쳤다. 혼합 입자도는 두 고정 끝점보다 성능이 좋고, 그룹만 쓰는 비용도 피했다. Final-reward only와 비교하면 밀집 피드백은 MMLU-Pro 정확도 7.00점, TAT-QA F1 0.52점을 더 얻으면서 토큰을 각각 15.28%와 15.70% 줄였다. Search-then-SFT와 Dense-reward RL을 같은 Qwen Flash API 예산에서 비교한 결과, RL은 각 데이터셋의 다섯 개 비영 예산 단계 중 네 단계에서 SFT를 앞섰다. CNY 10에서 RL은 MMLU-Pro 78.00% 정확도, TAT-QA 74.95% F1을 기록해 SFT보다 각각 8.00점과 2.35점 높았다. 효율 연구에서는 MAGIC이 네 데이터셋 모두에서 성능-토큰 파레토 최전선에 있었고, MMLU-Pro, HumanEval, TabFact에서는 가장 적은 토큰을 썼다. GSM8K에서는 Chain이 토큰을 더 적게 쓰지만 정확도가 7.12점 낮았다.
개발자 관점에서 MAGIC은 모든 하위 작업에 동일한 협업 단위를 강제하지 않고, 역할별로 단일 에이전트와 재사용 그룹을 섞는 설계가 성능과 추론 비용을 함께 개선할 수 있음을 보여준다. 실무에 적용하려면 먼저 고정 역할 라이브러리와 각 역할의 허용 실현, 그룹의 외부 인터페이스와 내부 토폴로지, 최상위 단위 수 N_max, 비순환성 같은 합법성 제약을 정리해야 한다. 훈련에는 다른 훈련 질의에서 뽑은 고정 프로브 집합과 부분 그래프 평가가 필요하고, 실행 LLM과 텍스트 인코더는 고정한 채 그래프 인코더와 행동 헤드만 갱신한다는 점도 확인해야 한다. 또한 벤치마크별로 별도 정책을 100개 예제와 한 번의 훈련 실행으로 만든 설정이므로, 실제 도메인에서는 데이터 규모와 재훈련 안정성을 별도로 검증해야 한다. 훈련 비용과 추론 비용이 다르게 발생한다는 점, 프로브 평가와 정책 업데이트가 훈련 전용이라는 점도 배포 계획에 반영해야 한다. 원문에는 별도 한계 절이 없지만, 방법과 실험 설정에서 고정 역할 라이브러리, 고정 그룹 내부 토폴로지, 고정 실행 LLM, N_max와 합법성 제약, 훈련 질의에서 온 프로브 집합, 실행 후에만 쓰이는 정답이라는 전제가 드러난다.