에이전트 라우팅에 70B 모델은 과하다는 Laya와 Jev 비공식 비교가 나왔다

V2EX19일 전조회 3

에이전트 워크플로에서 "다음에 어떤 도구를 호출할지"를 정하는 라우팅 단계에 70B급 자율회귀 모델을 붙이는 관행에 의문을 제기하는 비교 자료가 나왔다. Convai Innovations가 Apache-2.0으로 공개한 결정 모델 Laya(421M, ModernBERT-large 기반)와 TypeSafe가 호스팅하는 상용 엔진 Jev를 나란히 놓은 비공식 평가다. 작성 측은 TypeSafe, Convai Innovations 어느 쪽과도 소속·후원 관계가 없다고 밝혔다.

공개된 숫자는 Laya 쪽 우위로 정리된다. 응답 지연은 32.8ms로, Jev의 236~276ms 대비 약 7.8배 빠르다고 제시됐다. 온도 보정 후 ECE(기대 캘리브레이션 오차)는 0.081 대 0.246으로 Laya가 더 낮다. 태스크별 정확도는 typed-decisions 2000회 기준 0.766 대 0.727(+3.9%), AG News 4분류 0.950 대 0.910(+4.0%), DAIR Emotion 6분류 0.595 대 0.480(+11.5%)로 보고됐다. guardrail·jailbreak 계열 held-out 작업에서는 0.708~0.762 구간이 나왔다. 비용은 Jev가 폐쇄형 API로 100만 토큰당 약 0.042달러, Laya는 자체 호스팅 소프트웨어 기준 0으로 표기됐다.

배경에는 2026년 9월 초 TypeSafe의 Jev(jev-1.13.0) 출시가 있다. Jev는 가변 길이 텍스트를 생성하는 대신 확정된 choice와 confidence를 바로 내놓는 비자율회귀 결정 프리미티브를 내세웠다. 이에 대해 Convai Innovations 창업자 Nandha Kishor M이 관련 기술 회고를 공개했고, 같은 시기에 Laya가 Hugging Face(convaiinnovations/laya)에 올라왔다. 도구 다섯 개 중 하나를 고르는 일에 GPT-4·Claude급 모델을 동원하면 수백 밀리초에서 수 초가 들고 토큰을 소모하며 JSON·스키마 파싱에서 어긋나기 쉽다는 문제의식이 깔려 있다.

속도의 근거로 제시된 것은 인코더 구조다. FlashAttention-2, RoPE, unpadding, 확장된 컨텍스트를 활용해 토큰을 병렬 처리하고, 자율회귀 라우팅의 O(N) 디코딩 루프를 건너뛴다. 텍스트 디코딩 없이 한 번의 순전파로 클래스 로그 확률을 뽑는 방식이다. 학습에서는 top-1 정확도만 밀어붙이면 과신하는 확률이 나오는 문제를 피하기 위해 Brier, log-loss 같은 proper scoring을 강조했다고 한다. 다국어 트래픽에서 매번 가중치를 동적으로 로드하면 콜드 스타트 비용이 약 7.4초까지 커지므로, 사전 로드가 전제된다는 점도 언급됐다.

실무에서 갈리는 지점은 정확도 자체보다 임계값 설계다. 예컨대 code_search를 0.98 확신으로 예측하면 자동 채택이 합리적이지만, 0.52라면 사실상 추측이므로 fail-closed handoff(사람 검토 또는 재질의)로 넘기는 편이 낫다. 보정되지 않은 모델은 "95% 확신"이라고 말하면서도 실제로 자주 틀리는 표본에서 오류율이 40%에 가까울 수 있어, 온도 조정이나 도메인 내 재적합이 임계값의 의미를 좌우한다. "auth 토큰 파싱 위치를 찾고 테스트를 mock으로 바꿔라" 같은 문장은 code_search와 test_runner가 동시에 필요한 다중 의도인데, 제약 없는 라우터는 자신감 있는 라벨 하나를 내놓고 하류 상태를 오염시킬 수 있다는 지적이다.

다만 이 비교는 통제된 대조 실험이 아니라는 단서가 붙는다. Convai가 공개한 여러 축의 표는 제3자가 이미 공개한 TypeSafe Jev 수치(AbdelStark, nlbzard 등의 평가 자료)와 나란히 놓은 것으로, 방향성 참고는 되지만 동일 네트워크·동일 런타임 조건의 바이트 단위 비교는 아니라는 것이다. 더 신뢰할 수 있는 형태로는 같은 프롬프트 묶음, 동일한 네트워크·런타임 가정, 버전을 고정한 모델을 쓰는 방식을 제시했다. JevLab은 Laya 베이스라인을 공개 Lab에 추가하는 방안을 검토 중이며, 정식 측정 보고서가 나오기 전까지는 공개 사이트를 비공식 임계값 실험실 겸 프리뷰로 봐야 한다고 밝혔다.

관련 글