openJiuwen이 자가 진화 모델 라우터 X-Router를 공개했다
화웨이 2012랩과 화웨이 클라우드 등이 대학·기업 개발자들과 함께 만든 오픈소스 AI 에이전트 플랫폼 openJiuwen이 모델 라우팅 엔진 X-Router를 공개했다. 에이전트와 모델 풀 사이에 한 계층을 두고, 요청마다 어떤 모델에 어떤 전략으로 보낼지를 실시간으로 결정하는 구조다. 팀은 Ascend 계열 하드웨어에 친화적이라고 밝혔고, 일부 벤치마크에서는 모델 호출 비용이 절반 이상 줄었다고 주장했다.
핵심은 라우팅 규칙을 정적인 표로 박아두지 않는 데 있다. 구조는 세 층으로 나뉜다. 첫 층은 모델별 능력 프로파일링으로, 과거 실행 데이터를 오프라인으로 분석해 모델마다 어떤 유형·난이도의 작업에 얼마나 강한지, 지연과 전력 특성은 어떤지, 비용 규모는 어느 정도인지를 세밀하게 기록한다. 모델 버전이 바뀌거나 성능이 달라지면 1분 이내에 프로파일을 갱신한다. 두 번째 층은 결정을 내리는 라우팅 알고리즘이고, 세 번째 층은 그 결정을 실행 결과로부터 학습시키는 자기 진화 모듈이다.
라우팅의 입력은 문제 난이도 하나가 아니다. 에이전트 작업은 여러 턴에 걸친 상태 기반이라 최근 대화 창과 도구 호출 진행 상황을 함께 넣어 판단하는데, 도구 출력이 창을 가득 채워 사용자의 원래 요청이 밀려나는 경우를 막기 위해 마지막 사용자 요청은 별도로 보존한다. 여기에 시스템 상태가 더해진다. 이 요청의 컨텍스트가 어느 모델의 KV 캐시와 더 친한지, 지금 어느 모델이 덜 바쁜지, 방금 타임아웃이나 속도 제한에 걸린 모델은 없는지를 반영해 후보에서 제외한다. 이 모든 제약을 놓고 품질·비용·지연·도구 호환성 사이의 다목적 최적화를 수행해 '가장 강해 보이는' 모델이 아니라 '이번 요청에 가장 나은' 모델을 고른다.
구현상 눈에 띄는 설계는 결정과 실행의 분리, 그리고 상태 분리다. 라우팅 알고리즘은 순수 함수로 두어 같은 요청과 같은 상태 스냅샷에는 같은 결정을 내리게 하고, 요청 간 기억은 전부 외부 상태 계층에 둔다. 실행 결과는 성공 여부·지연·비용·품질 점수 형태로 되돌아와 상태 계층에 쌓이고, 다음 결정의 입력이 된다. 상태가 날아가도 요청이 실패하지는 않고 '콜드 라우팅'으로 품질만 떨어진다. 알고리즘 교체와 상태 계층 교체가 서로를 붙잡지 않는다는 뜻이다. 학습은 Contextual Bandit과 경량 강화학습으로 실제 피드백에서 경험을 뽑아내는 경로와, 프로파일 갱신·알고리즘 교체·정책 업그레이드를 독립 모듈로 처리하는 경로 두 갈래로 진행된다. 표본이 부족하거나 우위가 뚜렷하지 않으면 기존 판정을 유지하는 것이 기본값이다.
기본 제공되는 알고리즘 모듈 x-router는 작업 복잡도를 다섯 단계로 나눈다. 단순한 질의는 경량 모델로, 데이터 처리 스크립트 작성은 범용 또는 고성능 모델로, 다문서 리서치는 리서치형 모델로, 수학 증명과 심층 추론은 추론 모델로 보내는 식이다. 분류기는 Qwen3-0.6B를 프로세스 안에서 직접 돌려 별도 서비스를 띄우지 않는다. 엣지·클라우드 등급 분리, 로컬 모델의 능력 경계 판단, 실패 시 강등은 하되 승격은 하지 않는 정책, Contextual Bandit을 통한 경험 보정이 함께 들어간다. 같은 계층에 Rust로 작성된 경량 전방 라우팅 알고리즘도 있는데, 고차원 특징 공간에서 품질과 작업 궤적을 예측해 함께 최적화하는 방식이며 정적 컴파일되어 런타임 의존성이 없고 호스트 프로세스에 바로 embed할 수 있다. 엔진 본체는 Rust, Python 쪽은 PyO3 확장이다.
평가는 WorkSwarm에 x-router를 붙여 PinchBench 전체 147개 과제로 진행했다. 로그 분석, 데이터 분석, 코딩, 리서치 등 11개 범주를 아우른다. 모든 요청을 클라우드 강모델 Kimi-K2-Thinking에 넘긴 기준선은 71.36% 점수에 11.11달러가 들었다. 자기 진화를 끈 x-router 정적 라우팅은 66.3%, 8.25달러로 점수가 5.1% 내려가는 대신 비용이 25.7% 줄었다. 여기에 Bandit 자기 진화를 켜면 비용이 6.16달러로 한 번 더 25.3% 줄면서 점수는 4.4% 올라 70.70%가 됐다. 기준선과 비교하면 점수 차이는 0.66%포인트에 불과하고 비용은 약 44.6% 낮다.
Terminal-Bench/LLMRouterBench에서는 Opus4.8, Qwen3.5-122B, Qwen3.5-35B 세 단계 모델 풀을 두고 단일 턴·다중 턴 라우팅을 시험했다. 비용 우선 설정에서는 비용이 51.4% 줄고 성공률이 Opus의 95.2%에 도달했으며, 품질 우선 설정에서는 비용 15.7% 절감에 성공률 98.6%를 기록했다고 팀은 전했다. 얼마를 아끼고 얼마만큼 품질을 양보할지는 사용자가 설정으로 고른다는 것이 이 구조의 요지다.
배경에는 모델 생태계의 분화가 있다. 강한 추론에 특화된 모델, 단말용 경량 모델, 멀티모달 모델, 코드나 특정 도메인 전문 모델이 각각 갈라지면서 모든 축에서 이기는 모델이 사라졌다. 에이전트는 챗봇과 달리 오래, 여러 턴, 여러 도구를 쓰며 일하기 때문에 토큰 소비가 선형이 아니라 배수로 불어난다. 데모에서는 잘 돌아가는 기능도 비용을 눌러두지 못하면 실서비스에서 굴러가지 않는다는 것이 팀의 문제 설정이다. 배포 형태는 설정만 바꿔 단일 프로세스·메모리 상태·외부 의존성 없는 엣지형, 상태 계층을 외부에 둔 클라우드형, 모델 목록이 제한된 기업 사설형, 엣지와 클라우드를 섞은 혼합형으로 나눌 수 있다.
다만 공개된 수치는 모두 openJiuwen 팀이 자체적으로 구성한 벤치마크 결과이며 제3자 재현은 아직 확인되지 않았다. 제목에서 강조한 '토큰 50% 이상 절감'은 Terminal-Bench의 비용 우선 설정에서 나온 51.4%를 가리키는 것으로 보이고, PinchBench 기준 비용 절감은 44.6%다. 정적 라우팅만 켰을 때는 점수가 5%포인트 넘게 떨어졌다는 점도 함께 봐야 한다. 자기 진화가 그 하락을 되돌린다는 것이 팀의 주장이지만, 학습이 충분히 쌓이기 전 구간의 성능은 별도로 검증할 필요가 있다.