SeLMRoute는 질의가 요구하는 능력을 확률적 의미 증거로 먼저 뽑는다
SeLMRoute: Probabilistic Semantic Evidence for Large Language Model Routing
무엇인가
대규모 언어모델은 수학 추론, 코드, 사실 지식, 지시 따르기 같은 능력에서 서로 다르고 추론 비용도 다르다. 그래서 서빙 시스템은 요청이 들어올 때마다 어느 모델에 보낼지 정하는 라우팅 문제를 안게 된다. 기존 라우터들은 질의 임베딩, 모델 표현, 선호 데이터, 유사 예시 클러스터에서 결정을 직접 학습한다. 저자들은 이 표현이 질의가 실제로 무엇을 요구하는지 말해주지 않는다고 지적한다. 임베딩은 유사성을 담을 뿐이고 유사성은 과제 요구와 다르다. 파이썬 딕셔너리 컴프리헨션 문법을 묻는 질의와 비동기 함수 여러 개가 얽힌 레이스 컨디션을 진단하라는 질의는 둘 다 코드로 임베딩되지만 요구하는 능력은 전혀 다르다. LLMRouterBench가 여러 선도 라우터를 같은 틀에서 평가했을 때 성능이 좁은 구간에 몰리고 인스턴스 수준 오라클과는 여전히 큰 격차가 남는다는 관찰도 이 문제를 부각한다.
어떻게 동작하나
SeLMRoute는 라우팅 함수를 세 단계로 쪼갠다. 질의 x를 의미 증거 s(x)로 바꾸고, 그 상태를 후보 모델별 예상 성능으로 매핑한 뒤, 마지막에 배포 목표를 적용해 모델을 고른다. 첫 단계의 의미 추출기는 후보 모델 풀과 무관하게 동작한다. 사람이 읽을 수 있는 16개 질문을 던지는데, 8개는 예/아니오 이진 판단이고 8개는 4단계 점수 판단이다. 추론 유형, 외부 지식 필요성, 과제 구조, 모호성, 정확성 요구, 제약 밀도 같은 차원을 덮는다. 17번째 선택형 질문은 대략적인 과제 계열을 진단용으로만 뽑고 주 표현에서는 뺀다. 핵심은 각 판단을 최빈값으로 굳히지 않고 확률분포로 남긴다는 점이다. 이렇게 모은 확률 질량이 8 + 8×4 = 40차원의 의미 상태를 이루고, 엔트로피·신뢰도·기대 점수·분포 폭 같은 파생량까지 붙인 전체 표현은 88차원이 된다. 예를 들어 4단계 점수 판단이 [0.05, 0.20, 0.55, 0.20]이면 하드 라벨은 3단계 하나만 남기지만 확률 질량은 2단계와 4단계도 여전히 그럴듯하다는 정보를 보존한다. [0.00, 0.01, 0.98, 0.01]과 구별할 수 있게 되는 것이다. 이 의미 상태에는 후보 모델 이름이나 모델별 적합도 점수가 들어가지 않는다. 두 번째 단계에서는 CatBoost 기반의 가벼운 지도 학습기가 이 상태를 각 후보의 예상 점수로 바꾼다. 성능 추정이 끝난 뒤에야 배포 목표가 적용되므로, 같은 의미 상태를 성능 지향 결정에도 비용 인식 결정에도 재사용할 수 있다. 가격이나 품질 선호가 바뀌어도 의미 증거를 다시 뽑을 필요가 없고, 후보 풀이 바뀌어도 기존 의미 벡터는 그대로 쓸 수 있다. 다만 새로 추가된 모델은 성능 매핑을 위한 별도 캘리브레이션이 필요하다.
무엇과 다른가
성능 지향 평가는 LLMRouterBench의 15개 데이터셋, 20개 후보 모델, 11,481개 질의에서 이뤄졌다. SeLMRoute는 평균 정확도 72.08±0.45%를 기록했고, 중복 질의가 학습·평가 양쪽에 걸치지 않게 막은 grouped 5-fold out-of-fold 평가에서는 72.64%로 최고 고정 단일 모델의 69.23%를 앞섰다. 표현 비교에서는 확률 질량이 전체 88차원 의미 표현, 하드 의미 판단, GTE-Qwen2 밀집 임베딩, 도메인 라벨, TF-IDF보다 평균 성능이 높았다. 논문은 LLMRouterBench에 보고된 다른 라우터 수치도 외부 참조로 인용하는데 EmbedLLM 71.24%, GraphRouter 70.29%, Model-SAT 71.88%, Avengers 71.94%다. 다만 분할 프로토콜이 달라 직접 비교로 취급하지 않는다. 의미 추출기를 바꿔도 구조가 유지되는지도 확인했다. 오픈웨이트 Laya 백엔드는 같은 grouped OOF 프로토콜에서 70.53%로 최고 고정 모델보다는 높았지만 JEV 기반보다는 낮았고, 저자들은 이를 의미 추출기 품질이 인터페이스가 같아도 결과를 좌우한다는 근거로 든다. JEV에게 익명화된 후보 프로필을 주고 모델을 직접 고르게 한 실험은 성능이 더 낮았는데, 이는 의미 증거 추출과 하류 성능 학습을 분리하는 설계를 뒷받침한다.
어떻게 쓰나
비용 인식 설정은 13개 플래그십 모델, 10개 데이터셋, 12,446개 질의, 161,520개 후보 관측으로 구성됐고 GPT-5를 기준 모델로 삼았다. 검증 파티션에서만 라우팅 파라미터를 고른 뒤 손대지 않은 테스트 파티션에서 평가하는 엄격한 프로토콜에서 SeLMRoute는 5개 grouped split 모두에서 양의 PerfGain을 냈고 평균 +2.66±1.85%(범위 +0.52~+4.58%)를 기록했다. 반면 금전적 절감은 일관되게 나오지 않았다. 검증 단계에서 GPT-5 이상의 정확도를 유지하면서 가장 저렴한 운영점을 고르는 strict CostSave 조건을 만족한 split은 다섯 개 중 어느 것도 없었다. seed 3407과 2만 검증 조건을 통과했는데 각각 -0.10%, -1.58%로 오히려 GPT-5보다 조금 비쌌다. seed 0과 1은 테스트에서 더 높은 정확도를 더 낮은 비용으로 달성했지만, 검증 단계 조건을 만족하지 못해 strict CostSave로 인정되지 않았다. 저자들은 이 구분이 테스트 결과를 보고 사후에 싼 운영점을 고르는 것을 막기 위한 것이라고 설명한다.
전제와 한계
의미 추출 자체의 비용과 지연도 측정했다. JEV는 백만 입력 토큰당 0.042달러였고 16개 probe 전체 추출에 질의당 평균 1,606.7 입력 토큰이 들었다. 11,481개 질의에 18,446,536 토큰, 총 0.775달러로 질의당 약 6.75×10⁻⁵달러, 1,000질의당 0.0675달러 수준이다. 12개 probe로 줄인 Lite-12는 질의당 1,062.7 토큰, 총 0.512달러로 1,000질의당 약 0.0446달러, 약 33.9% 절감이다. 지연은 JEV가 원격 API 호출을 포함해 평균 약 350ms, p95 481ms였고, 로컬에서 도는 Laya는 평균 103ms, p95 206ms였다. 하류 CatBoost 학습기는 배치 크기 1에서 1.23ms, 32에서 0.043ms, 256에서 0.011ms로 훨씬 가볍다. probe를 12개로 줄이면 입력 토큰이 34%, p95 지연이 18% 줄고 grouped OOF 정확도는 0.145%포인트만 떨어지지만, 전체 구성에 대한 통계적 비열등성은 입증되지 않았다.
의미 엔트로피로 어려운 질의를 걸러내는 선택적 라우팅도 시도했다. 엔트로피가 보정된 임계값을 넘는 질의는 거부하고 나머지만 라우팅하는 방식으로, held-out 도메인 5개 평가에서 96.82±0.92% 커버리지로 평균 정확도 65.38±0.60%를 냈다. 전부 라우팅하면 같은 프로토콜에서 65.32±0.60%로 사실상 차이가 없다. 저자들은 엔트로피가 의미 추출기가 질의를 어떻게 규정하는지에 대한 불확실성을 재는 것이지, 성능 학습기가 그 의미 공간 영역에서 후보 모델 행동에 대해 얼마나 증거를 가졌는지와는 다른 문제라고 해석한다. 의미 서술은 자신 있게 하면서도 그 영역의 후보 성능은 학습 데이터로 잘 뒷받침되지 않는 질의가 있을 수 있다는 뜻이다.
실무 관점에서 이 논문의 값어치는 라우팅 결정을 감사 가능하게 만든다는 데 있다. 밀집 임베딩은 왜 코드 특화 모델을 골랐는지 설명하지 못하지만, SeLMRoute는 코드 추론 확률이 높고 정확성 요구가 크고 제약 밀도가 높으며 최신 정보 의존도가 낮다는 증거를 그대로 노출한다. 후보 풀이나 요금제가 바뀌어도 질의 의미 상태를 다시 계산할 필요가 없다는 점도 여러 모델을 묶어 서빙하는 팀에 실질적이다. 반대로 기대를 낮춰야 할 지점도 분명하다. 의미 추출이 전체 추가 지연의 대부분을 차지하므로 응답 시간이 짧아야 하는 서비스에는 그대로 쓰기 어렵고, 품질 예측이 좋아져도 금전 절감으로 이어진다는 보장이 이 실험에서는 나오지 않았다. 새 모델을 풀에 넣을 때는 그 모델에 대한 성능 캘리브레이션을 따로 해야 한다.
저자들이 밝힌 한계는 네 갈래다. 완전히 처음 보는 도메인으로의 일반화가 여전히 어렵고, 의미 추출이 측정 가능한 지연을 더하며, 품질 예측 개선이 금전 절감으로 자동 번역되지 않고, 새 후보 모델이 들어오면 기존 의미 상태는 재사용할 수 있어도 성능 학습기에는 그 모델에 대한 사전 증거가 없어 별도 캘리브레이션이 필요하다. 향후 계획으로는 라우팅용 의사결정 모델을 타입 지정 의미 분석 과제에 직접 파인튜닝하는 것, 확률분포 보정, 의미 불확실성과 라우팅 불확실성의 결합 처리, 적응적 probe 선택, 새 모델을 위한 능동 캘리브레이션, 후보 능력과 가격이 변할 때의 온라인 적응, 품질·후보 추론 비용·의미 추출 비용·지연을 함께 고려하는 목표 함수를 꼽는다.