SaveRouter는 라우터 학습 비용까지 계산해 배포 손익분기점을 앞당긴다

Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing

HF Daily2609.37402

Guannan Lai, Gelin Bian, Hao-Xuan Ma2026-09-29조회 6

무엇인가

LLM 라우팅은 질의마다 적합한 모델을 골라 응답 품질을 유지하면서 서빙 비용을 줄이는 기법이다. 문제는 라우터를 학습시키는 과정이다. N개의 학습 질의와 M개의 후보 모델이 있으면 질의-모델 품질 행렬을 채우기 위해 최대 N×M번의 모델 실행이 필요하고, 이 비용은 배포 전에 먼저 지출된다. 기존 연구는 대부분 배포 이후의 서빙 효율만 보고, 그 절감액이 사전 지출을 회수할 만큼 충분한지는 따지지 않았다. 이 논문은 사전 감독 비용 C0(Ω)를 명시적으로 회계에 넣고, 누적 순이익 S(T;π,Ω)=T·ΔC(π)−C0(Ω)가 0이 되는 배포 질의 수를 SA-BEP=C0/ΔC로, 일정 배포 구간 H에서 비용을 분할 상환한 비율을 SA-CR(H)=(C0+H·c_r)/(H·C_b)로 정의해 라우팅을 평가하자고 제안한다.

어떻게 동작하나

저자들은 조밀 감독이 경제적으로 과잉 공급된다고 본다. 두 가지 중복이 있다. 관련 질의들이 비슷한 모델 성능 패턴을 보이는 구조적 중복, 그리고 라우팅이 행렬 복원 문제가 아니라 결정 문제라는 점에서 오는 결정 중복이다. 라우터가 실제로 필요한 것은 모든 y_m(x)의 정확한 추정이 아니라 argmax_m [y_m(x) − λ c_m(x)]를 고르는 것이다. 선택된 모델을 바꾸지 않는 추가 관측은 라우팅 결정에 가치가 거의 없다. 실제로 EmbedLLM은 30%, kNN은 60%의 감독만으로 완전 감독 정확도의 99%에 도달한다.

무엇과 다른가

SaveRouter는 질의당 K≪M개의 모델만 평가하는 희소 감독 설정을 푼다. 먼저 적응적 희소 피드백 획득 단계에서 학습 질의를 그룹으로 묶는다. 학습 데이터에 예측 가능한 태스크 라벨이 있으면 그것으로 그룹을 정의하고 분류기를 학습해 새 질의를 배정하며, 없으면 동결된 질의 표현을 클러스터링한다. 그룹화는 질의 입력만 쓰고 모델 품질 피드백은 쓰지 않는다. 각 그룹-모델 쌍 (g,m)에 대해 관측 횟수 n_gm과 품질 누적 S_gm을 유지하는데, 관측이 적은 쌍의 경험 평균은 불안정하므로 모델 전역 추정 μ̄_m으로 축소(shrinkage)한 μ̃_gm을 쓴다. 획득은 K번의 패스로 진행되고 패스마다 질의당 새 관측 하나를 얻어 총 N×K개의 서로 다른 쌍을 모은다. 매 패스 시작에 그룹·모델 수준 획득 통계를 초기화하고 질의를 무작위로 섞되 관측 마스크는 유지하며, 현재 패스에서 이미 드러난 피드백만으로 a_gm = μ̃_gm + β_ucb·sqrt(log(Σ_j n_gj + 1)/max(n_gm,1))를 계산해 가장 높은 그룹-모델 쌍을 고른다. 그룹 안에 관측이 전혀 없는 후보 모델이 있으면 먼저 그중 하나를 균등하게 선택해 최소한의 커버리지를 보장한다.

어떻게 쓰나

획득된 관측은 희소하고 불균일하므로 SaveRouter는 능력을 계층적으로 추정한다. 먼저 관측된 쌍에 2원 가산 모형 y_im = b + u_{g_i} + v_m + ε_im을 릿지 정규화로 적합시켜, 전체 난이도 b, 그룹 간 체계적 차이 u_g, 모델 간 전역 차이 v_m을 얻고 이를 0과 1로 클리핑한 구조적 사전분포 π_gm을 만든다. 이 사전분포와 그룹-모델 국소 증거를 μ̂_gm = (S^Ω_gm + τπ_gm)/(n^Ω_gm + τ)로 결합하는데, 관측이 많으면 관측 평균이, 적으면 공유 구조가 지배한다. 완전히 관측되지 않은 쌍은 자연히 사전분포로 수렴한다. 다음으로 그룹 수준 추정이 놓치는 그룹 내 변이를 잡기 위해 질의 수준 잔차 보정을 한다. 관측 쌍 (i,m)마다 자기 자신을 국소 통계에서 제거한 μ̂^(−i)를 구해 잔차 e_im = y_im − μ̂^(−i)를 만들고, 모델별로 가벼운 예측기 h_m을 잔차에 적합시킨다. 최종 품질 추정은 ŷ_m(x) = μ̂_{g(x),m} + γ·h_m(ψ_res(x))이며, 계층 성분은 희소 감독에서도 안정적으로 공유 가능한 패턴을, 잔차 예측기는 인스턴스별 편차만 담당하도록 역할을 나눈다. 배포 시에는 π_λ(x) = argmax_m [ŷ_m(x) − λ·ĉ_{g(x),m}/C_max]로 품질과 비용을 함께 고려해 모델을 고르며, 품질·비용 추정 모두 Ω 안의 피드백만 사용한다.

전제와 한계

실험은 LLMRouterBench, Mixinstruct, MMR-Bench, RouterBench 네 개 벤치마크에서 시드 42의 도메인 내 20/80 학습·테스트 분할로 수행했다. 질의 그룹화에는 텍스트 벤치마크에서 동결된 all-MiniLM-L6-v2 표현을, MMR-Bench에서는 CLIP ViT-B/16 텍스트·이미지 결합 표현을 쓴다. 비교 대상은 EmbedLLM, kNN, OmniRouter, RMSoftmax, TRouter, UniRoute, InferenceDynamics, WISERouter, BaRP, SemiRouter이며 모두 ORBIT 툴킷의 같은 데이터 분할에서 평가했다. SaveRouter는 네 벤치마크 모두에서 최고 Peak Score와 최저 Cost Ratio를 기록했고, 전체 학습 피드백의 약 33~41%만 사용했다. 손익분기 배포량은 LLMRouterBench에서 5.3K 질의로, 가장 빠른 기존 베이스라인의 11.5K보다 짧다. RouterBench에서는 42.6K 대 EmbedLLM의 326.4K로 격차가 더 벌어진다. Mixinstruct는 라우팅 품질이 이미 포화되어 대부분의 Peak Score가 0.75 근처인데도, 가장 빠른 기존 라우터의 SA-BEP 11.63M을 1.23M으로 줄였다. 희소 피드백 전용 방법과 비교해도 우세하다. WISERouter와 SemiRouter는 여러 벤치마크에서 목표 동작점에 도달하지 못하거나 양의 순이익을 내지 못해 지표가 ∞가 되었고, BaRP는 네 벤치마크에서 SA-BEP가 114.0K, 44.66M, 640.8K, 3.25M로 SaveRouter의 5.3K, 1.23M, 18.2K, 42.6K보다 훨씬 크다.

LLMRouterBench에서 K=4로 고정한 절제 실험도 있다. 질의 수준 잔차 보정을 빼면 Peak Score가 1.63%포인트 떨어지고 Cost Ratio가 0.2320에서 0.3484로 나빠진다. 태스크 인식 그룹을 임베딩 기반 클러스터로 바꿔도 품질과 비용 효율이 모두 나빠지고, 모든 질의를 단일 그룹으로 합치면 Peak Score가 0.6338에서 0.5985로 가장 크게 하락한다. 획득 정책만 바꾼 실험에서는 무작위 K, 능력만 사용, 불확실성만 사용이 모두 제안된 UCB 정책보다 품질이나 서빙 효율에서 뒤진다. 흥미로운 점은 무작위 K가 손익분기에는 더 빨리 도달한다는 것이다(3.8K 대 5.3K 질의). 그럼에도 SaveRouter가 더 높은 Peak Score와 더 낮은 SA-CR@1M을 보여, 가장 이른 회수 시점과 장기 효율이 반드시 일치하지는 않는다는 것을 보여준다. 감독량 실험에서는 질의당 K=2(16.7% 감독)만으로도 완전 감독 정확도에 근접하며, K를 늘려도 이득은 완만하다.

실무 관점에서 이 논문이 바꾸는 것은 라우터 도입 판단의 기준이다. 라우터를 붙일지 결정할 때 배포 후 질의당 절감액만 보면 안 되고, 학습용 질의-모델 품질 수집에 들어간 비용과 예상 배포 물량을 함께 놓고 SA-BEP를 계산해야 한다. 후보 모델 풀이 크거나 학습 질의가 많을수록 사전 비용은 N×M으로 커지므로, 소규모 트래픽에서는 아무리 좋은 라우터도 회수되지 않을 수 있다. 또 하나 실무적으로 중요한 시사점은 감독을 무작정 늘리는 것이 최적이 아니라는 점이다. 저자들은 서빙 비용을 최소화하는 감독 수준과 가장 이른 회수를 만드는 감독 수준이 다를 수 있다고 명시한다. 라우터를 운영 중 재학습한다면 어떤 질의-모델 쌍을 관측할지 자체를 설계 변수로 다뤄야 한다.

저자들이 밝힌 전제와 한계는 다음과 같다. SA-BEP와 SA-CR은 벤치마크 내부 지표이며, 모든 비용 항을 같은 양수로 스케일해도 값이 변하지 않기 때문에 벤치마크 간 절대 금액으로 비교해서는 안 된다. 비용 회계도 모델 실행 비용, 즉 감독 획득 비용과 서빙 비용만 다루며 시스템 전체 비용은 아니다. 또한 K에 대한 성능이 단조롭지 않은데, 저자들은 이를 추가 감독이 본질적으로 해롭다는 증거로 해석하지 않고 감독 예산이 바뀌면 능력 추정기에 들어가는 관측이 달라져 학습된 라우팅 프런티어가 달라질 수 있다고 설명한다. WISERouter, BaRP, SemiRouter는 논문에서 재구현해 같은 평가 파이프라인에 맞춘 것이므로 원 구현과 차이가 있을 수 있다.