FlexRouter가 모델 상관관계까지 고려해 LLM 라우팅 중복을 줄인다

FlexRouter: Learning Complementary Model Sets for Flexible LLM Routing

HF Daily2609.38585

Wang Wei, Harry Yang, Tiankai Yang2026-09-29

무엇인가

LLM을 여러 개 풀로 두고 입력 쿼리에 맞는 모델을 고르는 라우팅 문제를 다룬다. 기존 방식은 각 후보 모델에 점수를 매겨 top-k를 독립적으로 뽑는데, 이 논문은 이 설계가 모델 간 상관관계를 무시한다고 지적한다. 비슷한 데이터와 구조로 학습된 모델들은 강점뿐 아니라 실패 모드도 비슷해서, 점수 상위 모델들을 함께 뽑으면 거의 같은 답을 내놓다가 같이 틀린다는 것이다. 실제 서빙에서는 여러 후보 응답을 생성한 뒤 검증기·리랭커·사용자가 최종 답을 고르는데, 이때 중요한 것은 선택된 모델들이 모두 정답일 확률이 아니라 그중 최소 하나가 정답일 확률이다. 논문은 이 목표를 '정답 커버리지(answer coverage)'로 정의하고, 커버리지를 최대화하는 부분집합 선택 문제로 라우팅을 재정식화한다.

어떻게 동작하나

방법의 핵심은 Determinantal Point Process(DPP)로 라우팅 정책을 매개변수화하는 것이다. 쿼리 x를 인코더로 임베딩한 v_x와 각 모델의 학습 가능한 임베딩 u_i로 모델별 정답 확률 q_i(x)=σ(v_x^T u_i)를 계산하고, 모델 임베딩 간 코사인 유사도로 상관 행렬 K를 만든다. 최종 커널은 L_x = diag(q(x))·K·diag(q(x))로 조립되는데, 대각 성분 q_i(x)^2는 개별 모델의 품질을, 비대각 성분은 상관 높은 모델을 함께 뽑을 때의 페널티를 나타낸다. 결과적으로 어떤 부분집합의 행렬식(determinant)은 그 집합의 품질과 다양성을 동시에 반영하며, 서로 닮은 모델을 같이 넣으면 값이 떨어진다.

무엇과 다른가

학습에서는 정답 부분집합이 하나로 정해지지 않는다는 점이 문제가 된다. 정답 모델 집합 C_x와 하나라도 포함하면 성공이므로 지도학습처럼 고정 타깃을 둘 수 없다. 그래서 저자들은 실패 집합 F_x에 대한 주변화로 성공 확률을 유도한다. 샘플링된 부분집합이 전부 실패 집합에 속할 확률은 P(Y ⊆ F_x) = det(I + (L_x)_{F_x}) / det(I + L_x)이고, 성공 확률은 1에서 이를 뺀 값이다. 이를 음의 로그로 취한 L_hit = -log(1 - 위 비율)이 커버리지 손실이 되며, 여기에 모델별 정답 예측 q_i(x)를 직접 지도하는 BCE 손실을 가중치 λ=1.0으로 더해 전체 목적함수를 만든다.

어떻게 쓰나

추론은 DPP의 MAP 문제를 푸는 과정인데 정확 해는 NP-hard라서 그리디 전략을 쓴다. 매 단계에서 아직 선택되지 않은 모델 중 행렬식 부피를 가장 크게 늘리는 모델을 고르고, 그 이득 g_i(S)는 슈어 보수(Schur complement)를 이용해 효율적으로 계산한다. 예산을 k로 고정하는 대신, 첫 이득 대비 일정 비율 τ보다 이득이 작아지면 선택을 멈춘다. DPP의 로그-행렬식 목적은 단조가 아니어서 상관 높은 모델을 추가하면 오히려 점수가 떨어질 수 있고, 이 성질이 자연스러운 조기 종료 근거가 된다. 최대 부분집합 크기는 k=10으로 둔다.

전제와 한계

실험은 대규모 라우팅 벤치마크인 RouterEval에서 수행한다. 후보 풀이 3811개인 medium-pool 설정에서는 BBH·MATH·GPQA로 학습하고 IFEval·MuSR로 도메인 외 일반화를 봤으며, 후보가 5000개인 large-pool 설정에서는 MMLU·HellaSwag·GSM8K·ARC로 학습하고 TruthfulQA·WinoGrande로 평가했다. 비교 대상은 독립 스코어링 top-k, EmbedLLM, BaRP, 그리고 단일 강모델 참조 점수(Ref.)다. 결과는 medium-pool 평균 Success@10 0.8632, large-pool 평균 0.9914로 두 설정 모두 최고 평균을 기록했고, 특히 GPQA와 도메인 외 과제에서 격차가 컸다. large-pool에서는 6개 과제 중 5개에서 최고점을 냈으며, MATH만 EmbedLLM이 앞섰는데 저자들은 MATH에 소수의 강한 전문 모델이 있어 독립 선택으로도 충분했다고 해석한다. 중복도 지표인 ILD@10에서도 두 설정 모두 가장 다양한 부분집합을 만들었고, medium-pool에서는 모든 과제에서 우위였다. BaRP는 MMLU에서 다양성이 높게 나오지만 과제별로 거의 같은 모델 집합을 골라 쿼리 적응이 아니라 고정 선택에 가깝다고 지적한다.

구현은 RoBERTa-base 인코더로 쿼리를 128차원 공유 공간에 투영하고 Adam으로 최대 100 에폭 학습하며, NVIDIA A100 80GB에서 실험했다. 커널 설계 절제에서는 코사인 유사도와 학습 가능한 대역폭을 가진 가우시안 RBF를 비교했는데, RBF가 일부 도메인 내 성공률에서 근소하게 앞서는 구간이 있었지만 코사인은 도메인 외 성능과 다양성에서 일관되게 더 나아 기본값으로 채택했다. 정지 임계값 τ를 키우면 평균 부분집합 크기가 줄고 커버리지가 완만히 떨어지는데, τ≈0.2 부근이 비용 대비 커버리지가 좋은 운용점으로 제시된다. 부분집합 크기가 쿼리마다 달라진다는 점이 고정 예산 방식과의 핵심 차이다.

개발자 관점에서 이 논문이 주는 실무적 시사점은 두 가지다. 첫째, 여러 모델을 호출해 후보를 만들고 그중 하나를 고르는 구조라면 모델별 정답 확률만으로 순위를 매기는 대신 모델 간 유사도를 함께 봐야 하며, DPP 커널은 그 결합을 학습 가능한 형태로 제공한다. 둘째, 난이도에 따라 호출 모델 수를 늘리고 줄이는 적응적 종료가 가능하므로 고정 k 예산을 강제하지 않아도 된다. 다만 이 논문이 최적화하는 것은 최종 정답 정확도가 아니라 후보 풀 안에 정답이 하나라도 들어 있을 확률이므로, 실제 서비스 정확도로 연결하려면 검증기나 리랭커 같은 하류 선택기를 함께 붙여 평가해야 한다.

저자들이 명시한 한계도 분명하다. FlexRouter는 라우팅 단계의 후보 풀 구성까지만 다루고 최종 답 선택은 하지 않으므로, Success@k는 배포 정확도가 아니라 라우팅 커버리지 지표로 읽어야 한다. 하류 검증·리랭킹·집계·사용자 선택이 항상 유일한 정답을 건져낸다는 보장도 없다. 다양성 분석은 고정된 모델 임베딩 수준에서 측정한 것이라 쿼리별 출력 문장의 의미적 다양성을 뜻하지는 않으며, RouterEval이 정답 라벨만 제공하고 전체 생성 응답을 주지 않아 응답 수준 분석은 향후 과제로 남긴다. 비용도 호출 모델 수를 대리 지표로 썼을 뿐 모델별 지연시간, 토큰 단가, 출력 길이, 배칭, 하드웨어 제약은 반영하지 않았고, 어려운 쿼리에서 적응적 라우팅이 오히려 비용을 늘릴 수 있다는 점도 윤리 진술에서 인정한다.