MoE 에이전트 RL에서 전문가 선택을 턴 구조에 맞춰 묶는다
Structuring MoE Expert Selection for Agentic Reinforcement Learning
무엇인가
장기 호라이즌 LLM 에이전트를 희소 MoE(mixture-of-experts) 모델로 구현하는 일이 흔해졌지만, 에이전트 행동과 MoE 라우팅 구조를 함께 설계하는 문제는 거의 다뤄지지 않았다. 이 논문은 상용 MoE 모델의 라우터가 이미 에이전트 궤적 구조와 맞물린 특화를 보인다는 관찰에서 출발한다. 한 턴 안에서 의미적으로 비슷한 조작(예: READ, UPDATE)을 수행하는 턴끼리는 전문가 라우팅이 더 많이 겹치고, 다른 조작을 하는 턴끼리는 덜 겹친다. 도구 이름 같은 다른 기준으로 묶으면 이런 특화가 잘 드러나지 않는다. 그런데 PPO나 GRPO 같은 표준 RL 알고리즘은 이 특화를 전혀 고려하지 않아 학습 중 라우팅이 통제 불능 상태가 되고, 그 결과 과제 성능과 추론 효율이 함께 제한된다는 것이 저자들의 진단이다.
어떻게 동작하나
제안하는 것은 계층적 라우팅 제어 프레임워크다. 첫째, 턴 수준 제어는 한 턴의 thinking 필드와 tool-use 필드 각각에 대해 토큰별 라우터 확률을 평균한 턴 수준 전문가 분포와 그 턴의 조작 레이블 사이의 상호정보량(MI)을 최대화한다. 같은 조작을 하는 턴은 비슷한 전문가를 쓰고, 다른 조작은 서로 다른 전문가를 쓰도록 유도하는 것이다. MI 항은 수치 안정성을 위해 엡실론 10^-12와 클리핑 상한 20을 쓰고, 배치 전체 궤적에 대해 계산하며 턴이 최소 8개는 있어야 신호를 적용한다. 저자들은 이 목적이 전문가 사용을 균등하게 만드는 기존 로드 밸런싱 손실과 달리 조작 의존적 사용을 추가로 보상한다고 설명한다.
무엇과 다른가
둘째, 토큰 수준 제어는 인접 토큰의 전문가 집합 격차를 재서 이미 비슷한 경우에만 이전 토큰의 전문가 집합을 유지하도록 현재 토큰의 라우터 확률을 밀어준다. 격차가 임계값보다 크면 아무 벌점도 주지 않는데, 이는 의미 전환이 일어나는 지점에서 라우팅이 바뀌는 것을 막지 않기 위해서다. 필드나 턴 경계를 넘는 토큰 쌍은 제외하고, 이전 토큰의 확률과 게이트는 그래디언트에서 분리한다. 셋째, 이 보조 손실들이 RL 학습을 불안정하게 만들 수 있어 정책 엔트로피가 목표 구간을 벗어나면 라우팅 제어 그래디언트를 끊는 엔트로피 게이트를 둔다. 게이트가 닫히면 표준 RL 업데이트만 계속되고, 엔트로피가 구간으로 돌아오면 제어가 재개된다. 전체 목적식은 RL 목적에 게이트를 곱한 턴/토큰 제어 항을 더한 형태이며, 기존 top-k 라우터를 그대로 쓰고 아키텍처를 바꾸지 않아도 된다. PPO, GRPO, LOOP, GiGPO와 조합할 수 있다.
어떻게 쓰나
실험은 AppWorld 90개 과제와 AutomationBench 공개 학습 480개 과제(6개 도메인)에서 했다. AppWorld에는 Qwen3-30B-A3B-2507, 더 어려운 AutomationBench에는 Qwen3.5-35B-A3B를 쓰고 8장의 NVIDIA B200에서 학습과 롤아웃을 함께 돌렸다. 결과는 AppWorld에서 최대 12.9점, AutomationBench에서 LOOP 기준 11.34점 향상이다. 다만 PPO는 AppWorld에서 개선이 일관되지 않았는데, 저자들은 프롬프트당 궤적 수가 그룹 기반 RL보다 훨씬 적어 상호정보량 계산이 불안정해진 탓으로 본다.
전제와 한계
라우팅이 실제로 바뀌었는지도 측정한다. 토큰 수준 제어는 필드 내 평균 Jaccard 유사도를 7.7% 올렸고, 턴 수준 제어는 후반부에서 턴 수준 전문가 분포와 조작 레이블 사이 MI를 23.5% 높였다. 추론 효율에서는 학습 100~200 스텝 구간에서 처리량이 GPU당 초당 224토큰에서 316토큰으로 41.1% 늘고, 롤아웃 시간은 224초에서 174초로 22.3% 줄었다. 토큰 수준 제어만 쓴 경우 롤아웃 시간이 133초로 가장 짧았다.
개발자 관점에서 이 논문이 주는 실무적 신호는 명확하다. MoE 기반 에이전트를 RL로 파인튜닝한다면 라우터를 그냥 두는 것이 최선이 아닐 수 있고, 턴 단위의 도구 호출 유형 같은 값싼 메타데이터를 라우팅 정규화 신호로 재활용할 수 있다. 다만 도입 전에 확인할 것은 세 가지다. 학습 로그에서 정책 엔트로피를 모니터링해 게이트 임계값을 자기 모델에 맞게 잡아야 하고, 배치에 충분한 턴이 쌓이는지(최소 8턴) 봐야 하며, MI 항의 가중치가 매우 작은 값(턴 2×10^-6, 토큰 2×10^-7)이라는 점을 감안해 스케일을 다시 튜닝해야 한다.
저자들이 밝힌 전제와 한계도 분명하다. 턴 수준 MI는 배치 전체의 턴 통계에 의존하기 때문에 궤적이 적은 설정, 특히 PPO처럼 프롬프트당 궤적이 적은 알고리즘에서는 신호가 불안정해진다. 엔트로피 게이트가 없으면 정책 엔트로피가 튀면서 약 100스텝 부근에 평가가 0으로 붕괴했고, 상한을 0.4로 두면 붕괴가 140스텝으로 미뤄졌을 뿐이며 0.2로 낮춰야 안정적으로 유지됐다. 즉 제안 방법은 게이트 임계값에 민감하고, 조작 레이블을 도구 호출에서 추출하는 규칙에 의존한다. 또한 실험은 두 벤치마크와 두 MoE 모델에 한정되어 있다.