라우터와 에이전트를 한 학습 루프에서 함께 진화시키는 MoA 프레임워크, CERA-MoA
CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents
무엇인가
Mixture-of-Agents(MoA)는 여러 에이전트를 조합해 단일 모델의 한계를 넘으려는 패러다임이지만, 기존 연구는 두 갈래로 갈라져 있다. 하나는 고정된 능력의 에이전트들 사이에서 오케스트레이션(다중 에이전트 토론, 동적 에이전트 선택)을 최적화하는 방향이고, 다른 하나는 미리 정해진 워크플로 구조 안에서 에이전트를 파인튜닝하는 방향이다. 이 논문이 지적하는 문제는 두 방향 모두 라우팅 전략과 에이전트의 지속 학습 역학을 분리시킨다는 점이다. 그 결과 포스트트레이닝 중에 개별 에이전트의 능력이 계속 변해도 기존 라우팅은 그 변화에 맞춰 적응하지 못하고, 수동으로 분할된 데이터셋에 의존하기 때문에 능력 기반 샘플 배분이 없어 에이전트들이 도메인 전문가가 아니라 동질적인 제너럴리스트로 남는다.
어떻게 동작하나
CERA-MoA는 이 단절을 폐루프 공동 진화로 잇는다. 프레임워크는 파라미터화된 라우터 D_ψ, N개의 지속 학습 에이전트 정책 {A_θi}, 투표 기반 집계기 S로 구성된다. 학습 단계에서 라우터는 들어온 쿼리에 대해 상대적 에이전트 능력을 나타내는 친숙도 점수를 계산하고, 그 점수를 바탕으로 쿼리를 특정 에이전트 부분집합에 배분한다. 선택된 에이전트는 각자 완성을 생성하고 과제별 보상으로 강화학습을 통해 정책을 갱신하며, 동시에 라우터는 참여 에이전트들의 상대적 성능 이득을 평가해 자신의 친숙도 추정기를 갱신한다. 이 반복 피드백 루프에서 에이전트는 자신에게 맞는 문제를 계속 받아 도메인 전문가로 분화되고, 라우터는 그 실시간 전문성을 따라간다. 추론 단계에서는 학습된 친숙도 점수를 기준으로 최소한의 유능한 에이전트 부분집합에만 쿼리를 보내고, 결정적 정답이 있는 과제는 친숙도 가중 다수결로, 개방형 과제는 가장 친숙도가 높은 에이전트의 완성을 그대로 출력한다.
무엇과 다른가
핵심 구성 요소는 예측적 친숙도 추정기다. 외부 검증기나 전체 롤아웃 생성의 오버헤드 없이, 텍스트 생성 이전에 에이전트-쿼리 적합도를 추정하기 위해 각 에이전트마다 학습 가능한 predictor head g_i와 무작위로 초기화한 뒤 영구 동결되는 target head g_bar_i를 둔다. 라우터의 백본은 동결되어 있고, 쿼리 q의 의미 표현 h(q)는 전체 깊이 L인 모델의 floor(L/2)층과 floor(3L/4)층 은닉 상태를 이어 붙여 만든다(중간층 은닉 상태가 다음 토큰 예측에 묶인 최종층 표현과 상보적인 의미 정보를 담는다는 근거에서다). 두 head의 투영을 정규화한 뒤 유클리드 거리 d_i(q)를 구하고, f_i(q) = exp(-λ d_i(q))로 친숙도를 얻는다. 거리가 작을수록 친숙도가 높다. 절대 보상을 회귀하는 대신, 고정된 앵커 주변에서 상대적 이득이 양수면 예측기를 앵커 쪽으로 당기고 음수면 마진만큼 밀어내는 push-and-pull 신호로 보상 감독을 변환한다는 것이 이 설계의 요점이다. 동결된 target head는 의미 프로토타입이나 능력 레이블을 담지 않고, 단지 안정적인 기준점 역할만 한다.
어떻게 쓰나
라우팅은 고정 top-k를 쓰지 않는다. 학습 중 라우팅 점수는 친숙도에 탐색 보너스와 역사적 엔트로피를 더한 s_i(q) = f_i(q) + c_ucb * sqrt(log T / (n_i + 1)) + w_ent * H_bar_i로 계산한다. 여기서 T는 라우팅된 쿼리 수, n_i는 에이전트 i에 배분된 학습 샘플 수, H_bar_i는 해당 에이전트의 역사적 평균 생성 엔트로피다. 다만 에이전트 선택의 우선순위를 정하는 것은 이 점수지만, 부분집합 활성화의 컷오프는 엄격히 친숙도 점수로만 평가한다. 누적 친숙도가 임계값 τ 이상이 되는 최소한의 상위 랭크 부분집합을 활성화하고, 전체 합이 τ에 못 미치면 쿼리를 전체 에이전트에 배분한다. 추론 시에는 탐색 항을 0으로 꺼서 가장 유능한 전문가에게만 라우팅해 효율을 지킨다.
전제와 한계
공동 최적화는 에이전트 정책 최적화와 라우터 갱신을 하나의 강화학습 프로토콜로 묶는다. 선택된 에이전트는 배분된 쿼리를 LIFO 버퍼에 저장하고, 배치를 구성하면 쿼리당 G개의 완성을 샘플링해 DAPO에 GSPO의 시퀀스 수준 중요도 샘플링을 결합해 정책을 갱신한다. 정규화된 어드밴티지, 클리핑된 대리 목적함수, 참조 정책 대비 토큰별 KL 페널티를 사용하고, 손실은 배치 내 활성 완성 토큰 수로 정규화한다. 라우터는 참여 에이전트 전체 평균 대비 각 에이전트의 상대 이득 A_i,q = r_i,q - (1/|S_q|) Σ_j r_j,q로 갱신하며, 단독으로 활성화된 에이전트는 A_i,q = r_i,q로 두어 친숙도가 꾸준히 오르게 한다. 라우터 손실은 A_i,q ≥ 0이면 A_i,q * d_i(q)를, A_i,q < 0이면 |A_i,q| * max(0, m - d_i(q))를 최소화하는 형태로, 고성능 에이전트의 투영 거리를 줄여 지수 친숙도를 직접 높이고 그 반대의 경우는 밀어낸다. 이 프레임워크는 에이전트와 라우터의 파라미터화 방식에 무관하며, 하나의 베이스 백본을 공유하고 독립 LoRA 어댑터를 붙이는 구성과 이종 베이스 모델을 함께 배치하는 구성을 모두 지원한다.
실험은 네 개 도메인에서 이뤄졌다. 수학 추론(GSM8k, Hendrycks MATH, DAPO-MATH-17k), 코드 생성(MBPP, Eurus-2-Code, TACO), 지시 따르기(MAGPIE-IF, RLVR-IFEval), 일반 추론(BIG-bench Hard)이며, 학습셋으로 에이전트와 라우터를 모두 학습하고 독립적으로 분할된 테스트셋에서 성능을 보고한다. 분포 외 일반화는 IFEval, HumanEval, AGIEval, ARC-c, LogicBench, OlympiadBench에서 추가 파인튜닝 없이 평가한다. 비교 대상은 오케스트레이션 최적화 계열(ICL-Router, LinUCB, RouteMoA)과 고정 워크플로 파인튜닝 계열(GSPO, MAPoRL, AT-GRPO)이다. 구현은 4B 베이스 모델에 독립 LoRA를 붙인 N=4 에이전트로 총 파라미터가 약 4.4B에 불과하고, 이종 모델 설정은 Qwen3-4B, Llama-3.2-3B-Instruct, Phi-4-mini-Instruct를 직접 호출하는 N=3 앙상블이다. 저자들이 보고한 바에 따르면 CERA-MoA는 세 베이스 모델 모두에서 분포 내·분포 외 평균 성능이 가장 높았고, 이종 앙상블에서도 모든 베이스라인을 앞섰으며 특히 DAPO-MATH, LogicBench, OlympiadBench 같은 어려운 추론 데이터셋에서 큰 향상을 보였다. 다만 본문 텍스트에는 정확도 수치가 인용되어 있지 않고 표에 제시되어 있다.
절제 실험에서 친숙도 추정기는 직접 보상 회귀와 보상 기반 다중 클래스 분류를 모두 뚜렷하게 앞선다. 보상 추정치는 학습 중 진동하는 반면 친숙도 점수는 매끄럽게 수렴하는데, 에이전트 정책이 변하면 같은 프롬프트에 대한 성능도 계속 바뀌기 때문에 보상 자체가 불안정하기 때문이다. 라우팅 절제에서는 고정 Top-2가 정확도는 강하지만 토큰 비용이 크고, 고정 Top-1은 비용은 줄지만 단일 에이전트가 복잡한 쿼리를 혼자 풀지 못해 성능이 눈에 띄게 떨어진다. 누적 임계값 방식은 복잡한 문제에만 여러 에이전트를 활성화해, 고정 Top-2 대비 평균 생성 토큰을 약 45% 줄이면서 비슷한 성능을 유지한다. 전문화 분석에서는 역할 지정이나 사람의 개입 없이 4개 Qwen3-4B 에이전트가 스스로 분화했다. 긴 사고 사슬 추론 덕분에 Agent 2가 주 해결자로 대부분의 쿼리를 배분받았고, Agent 1은 간결한 수학·논리, Agent 3은 코딩, Agent 4는 일반 추론을 맡았다. 중간 은닉 상태의 t-SNE 시각화에서 같은 에이전트로 라우팅된 쿼리들이 촘촘한 의미 군집을 이룬다.
개발자 관점에서 이 논문이 유용한 지점은 라우팅과 파인튜닝을 별도 파이프라인으로 운영할 때 생기는 드리프트를 정면으로 다룬다는 것이다. 에이전트를 계속 학습시키면서 라우터를 고정해 두면, 학습이 진행될수록 라우팅 결정이 실제 능력 분포와 어긋난다. CERA-MoA는 라우터를 학습 루프 안에 넣고, 전체 롤아웃 대신 중간층 은닉 상태 두 개를 이어 붙인 표현만으로 적합도를 추정해 평가 비용을 줄인다. 실무에 적용하려면 백본을 동결한 채 predictor head만 학습시키는 구조, 학습 시에만 켜지는 UCB·엔트로피 탐색 항, 추론 시 탐색 항을 끄는 스위치, 그리고 누적 임계값 τ가 성능-비용 트레이드오프를 어떻게 움직이는지를 먼저 확인해야 한다. 또한 공유 백본 + LoRA 구성과 이종 모델 앙상블 구성이 모두 지원된다는 점은 이미 여러 모델을 서빙 중인 팀에 현실적인 선택지다.
저자들이 밝힌 한계와 전제도 분명하다. 현재 라우팅은 단일 턴 의미 라우팅에 머물러 있어 반복적 문제 해결을 요구하는 다중 턴 상호작용이나 다중 에이전트 토론으로 확장하는 것이 향후 과제로 남아 있다. 또한 친숙도 가중 투표를 적응형 메타싱커 같은 고급 답변 집계 기법으로 업그레이드하면 집단 추론 성능을 더 높일 수 있다고 본다. 방법론적으로는 라우터 백본이 동결되어 있고 중간 은닉 상태를 고정 의미 특징으로 취급한다는 전제, 그리고 학습 중 라우팅 점수에 탐색 항이 섞이지만 활성화 컷오프는 친숙도로만 판단한다는 이원 구조도 함께 고려해 읽어야 한다.