LLM 라우팅을 재학습 없이 새 환경으로 옮기는 RouteFM
Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing
무엇인가
LLM 라우팅은 질의마다 능력·비용·지연이 제각각인 후보 모델 풀에서 가장 적합한 모델을 골라, 단일 대형 모델로 전부 처리하는 방식보다 나은 품질-효율 절충을 얻는 문제다. 기존 라우터는 대부분 특정 질의 워크로드와 특정 후보 풀에 맞춰 학습되는데, 논문은 이를 local fitting이라 부른다. 문제는 라우팅 환경이 본질적으로 동적이라는 점이다. 새 도메인과 모달리티가 등장하고, 새 모델이 들어오고 기존 모델이 교체되면 도메인·후보 풀·모달리티가 바뀔 때마다 행동 관측을 다시 모으고 라우터를 다시 최적화해야 한다. 이 반복적인 fit-and-refit이 유지 비용을 키우고, 학습된 라우터 자체를 재사용하기 어렵게 만든다. 저자들은 라우팅을 고정된 모델 정체성에 묶인 정책이 아니라, 이질적 환경에서 공유되는 재사용 가능한 능력으로 보고 파운데이션 모델 관점에서 접근하자고 제안한다.
어떻게 동작하나
RouteFM의 핵심은 후보 모델을 이름이나 지속적 임베딩이 아니라 현재 환경에서 관측된 행동으로 표현한다는 것이다. 후보 m의 행동 컨텍스트는 (질의 임베딩, 관측 품질, 정규화된 상대 비용) 튜플의 집합으로 주어지며, 질의 임베딩은 동결된 4096차원 벡터, 품질과 비용은 [0,1] 값이다. 비용은 라우팅 코퍼스마다 신호가 달라서 에피소드 내부에서 정규화해 상대 지표로만 쓴다. 같은 품질 점수라도 어떤 질의에서 관측됐는지에 따라 의미가 달라지므로, RouteFM은 질의 의미·관측 품질·상대 비용을 함께 인코딩해 관측 하나당 하나의 행동 토큰을 만든다. 이 토큰 시퀀스를, 모든 후보가 공유하는 24개의 학습 가능한 잠재 능력 토큰이 교차 어텐션으로 읽어들이고 다시 자기 어텐션으로 정보를 교환하는 블록을 쌓아, 가변 길이 관측을 고정 크기 능력 프로파일로 압축한다(은닉 차원 256). 이 프로파일은 사전 정의된 스킬 범주로 지도되지 않고 라우팅 지도 신호만으로 종단간 학습되며, 후보마다 요약본인 능력 프로파일과 세밀한 증거를 보존한 원본 관측 시퀀스를 함께 유지한다.
무엇과 다른가
라우팅은 궁극적으로 비교 문제이므로, RouteFM은 목표 질의 표현을 두 갈래 어텐션으로 각 후보에 조건화한다. 프로파일 분기는 목표가 후보의 전반적 능력과 얼마나 정합하는지를, 컨텍스트 분기는 압축 과정에서 사라질 수 있는 개별 관측의 세밀한 증거를 끌어온다. 두 결과는 학습된 스칼라 α를 통해 z = 프로파일 + α(컨텍스트 − 목표)로 융합된다. 이어서 후보 차원 위에 Transformer 인코더를 적용해 후보들을 독립적으로 평가하지 않고 한 풀 안에서 함께 비교하는데, 후보 슬롯에 위치 인코딩을 넣지 않아 후보 순서에 대해 치환 등변성을 갖는다. 무효·패딩 후보는 마스킹된다. 최종적으로 각 후보 표현에서 목표별 품질과 상대 비용을 각각 예측하고, 배포 시에는 ŷ − λĉ를 최대화하는 후보를 고른다. λ를 바꾸면 재학습 없이 품질-비용 선호를 바꿀 수 있다.
어떻게 쓰나
사전학습은 고정된 후보 풀 위에서가 아니라 에피소드 단위로 이뤄진다. 각 에피소드는 하나의 태스크에서 만들어지고, 익명 후보 집합과 그 행동 컨텍스트, 그리고 컨텍스트와 겹치지 않는 목표 질의 집합을 담는다. 에피소드마다 태스크, 후보 구성, 후보 순서, 컨텍스트 크기를 바꾸고 후보 슬롯을 무작위로 섞어, 고정 위치를 특정 모델과 연관짓지 못하게 하고 행동 증거로부터 능력을 추론하도록 강제한다. 손실은 품질과 비용 각각에 대해 점별 회귀와 쌍별 랭킹을 결합하고, 여기에 라우팅 인지 regret 항을 더한다. 예측 품질로 소프트 라우팅 분포를 만들고, 풀 내 최고 품질과 그 기대 품질의 차이를 최소화하는 것이다. 세 항의 가중치는 사전학습 커리큘럼 동안 regret 기여도를 점진적으로 키운다.
전제와 한계
사전학습 데이터는 LLMRouterBench, RouterBench, RouterEval, MixInstruct 네 소스로, 전처리 후 212,470개 질의-태스크 인스턴스와 173만 건의 유효한 질의-모델 관측을 담는다. 질의는 동결된 Qwen3-VL 4096차원 임베딩으로 표현하고, 모델 이름·제공자·파라미터 수 같은 정체성 특징은 RouteFM에 전혀 노출하지 않는다. 에피소드는 익명 후보 6~24개, 목표 질의 16~32개, 후보당 관측 예산 K ∈ {8,16,32,64,128,256,512,1024}로 구성하고, AdamW로 10,000 스텝, 유효 배치 16으로 학습한다. 평가는 사전학습에 포함된 태스크의 RouterEval 홀드아웃 질의(후보 4개, K ∈ {8,16,32,64})와, 사전학습에서 제외된 멀티모달 벤치마크 MMR-Bench에서 이뤄진다. 베이스라인은 Weighted kNN, MLP, Embedding-Ridge, EmbedLLM, RM-Softmax, TRouter, InferenceDynamics, UniRoute, ICL-Router, Context-Mean이며, 지표는 선택된 모델의 평균 실현 품질이다.
결과는 두 가지다. 인도메인 RouterEval에서 RouteFM은 모든 관측 예산에서 최고 품질을 냈고, K=8에서 최강 베이스라인을 0.84 품질점 앞섰으며 증거가 많아질수록 격차는 줄었다. 사전학습에서 제외된 MMR-Bench에서는 모든 예산에서 최고를 기록했고, K=8에서 최강 비-RouteFM 베이스라인을 2.23 품질점 앞섰다. 관측이 풍부한 대규모 관측 구간에서는 격차가 0.07점까지 줄어든다. 즉 이점은 저컨텍스트 구간에 집중되며, 동결된 라우터가 파라미터 갱신 없이 소량의 행동 컨텍스트만으로 새 환경에 적응한다는 뜻이다. 절제 실험에서는 후보 풀 Transformer를 제거했을 때 K=8에서 1.33점이 떨어져 가장 큰 손실이었고, 목표-컨텍스트 어텐션 제거도 특히 관측이 적을 때 성능을 떨어뜨렸으며, Qwen3-VL 질의 표현을 BGE로 바꾸면 전 구간에서 성능이 하락했다. 별도 프로토콜에서는 타깃 도메인 라벨 20%를 주고 처음부터 학습한 모델이 K=8에서 동결된 RouteFM보다 1.08점 낮았고, 사전학습된 RouteFM을 타깃 도메인에 미세조정해도 일부 예산에서 미미한 이득, 다른 예산에서는 약간 낮은 성능에 그쳤다. 배포 변화 적응에서는 새 모델을 풀에 추가했을 때 그 모델의 예시 8개만 보고 재학습된 모든 베이스라인을 앞섰고, 16개 관측에서는 확장된 풀 라우팅이 기존 풀 라우팅보다 좋았다. 컨텍스트 예산 효율에서는 Weighted kNN의 전체 컨텍스트 성능을 관측량 1%로, MLP는 3%로, EmbedLLM은 26%로 따라잡았다.
개발자 관점에서 이 논문이 바꾸는 것은 라우터 유지보수의 단위다. 후보 모델이 바뀔 때마다 라벨을 모아 재학습하는 대신, 후보별 행동 관측 몇 건을 컨텍스트로 넣어주는 것만으로 새 모델과 새 도메인에 대응하는 구조를 설계할 수 있다. 도입을 검토한다면 세 가지를 확인해야 한다. 첫째, 후보 모델의 정체성을 쓰지 않고 행동 로그만으로 표현하므로 사내 모델명·벤더 정보를 노출하지 않는 구성이 가능한지, 둘째, 비용 신호가 에피소드 내 상대값으로만 정규화되므로 실제 청구 단가와 지연 목표를 λ 하나로 얼마나 반영할 수 있는지, 셋째, 이점이 저컨텍스트 구간에 집중되므로 관측이 이미 풍부한 환경에서는 기존 라우터 대비 이득이 0.07점 수준으로 사라진다는 점이다. 또한 논문이 보고한 절대 지연에서는 단순 비모수 방법이 여전히 더 빠르므로, 지연이 최우선 제약인 서비스라면 별도 검증이 필요하다.
원문에 별도의 한계 절은 없지만, 본문에서 드러나는 전제와 한계는 분명하다. 성능 이점은 관측이 적을 때 집중되고 증거가 풍부해지면 경쟁 방법과 거의 같아지므로, 풍부한 라벨이 이미 있는 환경에서는 파운데이션 모델 접근의 실익이 작다. 비용은 에피소드 내부 정규화를 거친 상대 지표로만 쓰여 절대 비용 최적화를 보장하지 않는다. 평가는 RouterEval과 MMR-Bench 두 축에 한정되며, 후보 풀 규모도 인도메인에서는 4개로 작다. 또한 동결된 라우터가 평가 라벨로 파라미터를 갱신하지 않는다는 점은 장점이지만, 그만큼 배포 시점의 컨텍스트 구성 품질이 성능을 좌우한다는 뜻이기도 하다.