에이전트 라우팅에 70B 모델은 과하다는 Laya와 Jev 비공식 비교가 나왔다
에이전트 워크플로에서 "다음에 어떤 도구를 호출할지"를 정하는 라우팅 단계에 70B급 자율회귀 모델을 붙이는 관행에 의문을 제기하는 비교 자료가 나왔다. Convai Innovations가 Apache-2.0으로 공개한 결정 모델 Laya(421M, ModernBERT-large 기반)와 TypeSafe가 호스팅하는 상용 엔진 Jev를 나란히 놓은 비공식 평가다. 작성 측은 TypeSafe, Convai Innovations 어느 쪽과도 소속·후원 관계가 없다고 밝혔다.
공개된 숫자는 Laya 쪽 우위로 정리된다. 응답 지연은 32.8ms로, Jev의 236~276ms 대비 약 7.8배 빠르다고 제시됐다. 온도 보정 후 ECE(기대 캘리브레이션 오차)는 0.081 대 0.246으로 Laya가 더 낮다. 태스크별 정확도는 typed-decisions 2000회 기준 0.766 대 0.727(+3.9%), AG News 4분류 0.950 대 0.910(+4.0%), DAIR Emotion 6분류 0.595 대 0.480(+11.5%)로 보고됐다. guardrail·jailbreak 계열 held-out 작업에서는 0.708~0.762 구간이 나왔다. 비용은 Jev가 폐쇄형 API로 100만 토큰당 약 0.042달러, Laya는 자체 호스팅 소프트웨어 기준 0으로 표기됐다.
배경에는 2026년 9월 초 TypeSafe의 Jev(jev-1.13.0) 출시가 있다. Jev는 가변 길이 텍스트를 생성하는 대신 확정된 choice와 confidence를 바로 내놓는 비자율회귀 결정 프리미티브를 내세웠다. 이에 대해 Convai Innovations 창업자 Nandha Kishor M이 관련 기술 회고를 공개했고, 같은 시기에 Laya가 Hugging Face(convaiinnovations/laya)에 올라왔다. 도구 다섯 개 중 하나를 고르는 일에 GPT-4·Claude급 모델을 동원하면 수백 밀리초에서 수 초가 들고 토큰을 소모하며 JSON·스키마 파싱에서 어긋나기 쉽다는 문제의식이 깔려 있다.
속도의 근거로 제시된 것은 인코더 구조다. FlashAttention-2, RoPE, unpadding, 확장된 컨텍스트를 활용해 토큰을 병렬 처리하고, 자율회귀 라우팅의 O(N) 디코딩 루프를 건너뛴다. 텍스트 디코딩 없이 한 번의 순전파로 클래스 로그 확률을 뽑는 방식이다. 학습에서는 top-1 정확도만 밀어붙이면 과신하는 확률이 나오는 문제를 피하기 위해 Brier, log-loss 같은 proper scoring을 강조했다고 한다. 다국어 트래픽에서 매번 가중치를 동적으로 로드하면 콜드 스타트 비용이 약 7.4초까지 커지므로, 사전 로드가 전제된다는 점도 언급됐다.
실무에서 갈리는 지점은 정확도 자체보다 임계값 설계다. 예컨대 code_search를 0.98 확신으로 예측하면 자동 채택이 합리적이지만, 0.52라면 사실상 추측이므로 fail-closed handoff(사람 검토 또는 재질의)로 넘기는 편이 낫다. 보정되지 않은 모델은 "95% 확신"이라고 말하면서도 실제로 자주 틀리는 표본에서 오류율이 40%에 가까울 수 있어, 온도 조정이나 도메인 내 재적합이 임계값의 의미를 좌우한다. "auth 토큰 파싱 위치를 찾고 테스트를 mock으로 바꿔라" 같은 문장은 code_search와 test_runner가 동시에 필요한 다중 의도인데, 제약 없는 라우터는 자신감 있는 라벨 하나를 내놓고 하류 상태를 오염시킬 수 있다는 지적이다.
다만 이 비교는 통제된 대조 실험이 아니라는 단서가 붙는다. Convai가 공개한 여러 축의 표는 제3자가 이미 공개한 TypeSafe Jev 수치(AbdelStark, nlbzard 등의 평가 자료)와 나란히 놓은 것으로, 방향성 참고는 되지만 동일 네트워크·동일 런타임 조건의 바이트 단위 비교는 아니라는 것이다. 더 신뢰할 수 있는 형태로는 같은 프롬프트 묶음, 동일한 네트워크·런타임 가정, 버전을 고정한 모델을 쓰는 방식을 제시했다. JevLab은 Laya 베이스라인을 공개 Lab에 추가하는 방안을 검토 중이며, 정식 측정 보고서가 나오기 전까지는 공개 사이트를 비공식 임계값 실험실 겸 프리뷰로 봐야 한다고 밝혔다.
관련 글
- LLM 로그확률로 이미지까지 분류하는 Jev 스타일 래퍼 공개LLM이 내놓는 토큰 로그확률을 읽어 분류기처럼 활용하는 Jev 스타일 요청 형식이 공개됐다. 여기에 이미지 첨부 필드를 더해 웹캠 프레임을 실시간으로 판정하는 파이썬 예제까지 함께 올라왔으며, RTX 3090에서 초당 1프레임 수준의 처리량을 기록했다.
- AI가 포켓몬 레드를 플레이하며 결정과 확률을 보여주는 Show HN 프로젝트다Show HN에 AI가 포켓몬 레드를 플레이하는 'Jev Plays Pokémon Red'가 공개됐다. 화면 오른쪽 패널에서 매 결정과 각 선택의 확률을 실시간으로 보여주며, AI가 공략 가이드에 의존해 진행한다는 전제도 드러난다.
- Ollaya는 결정 모델을 로컬에서 돌려 RTX 4090에서 8ms로 응답한다.Ollaya는 결정 모델을 자체 하드웨어에서 돌리는 오픈소스 런타임으로, RTX 4090에서 5개 질문을 약 10ms에 처리한다. TypeSafe SDK 0.7.1과 호환되는 API를 제공하고 확률 캘리브레이션도 개선했다.
- 텍스트 생성 없이 확률만 뽑는 결정 모델, 오픈소스로 33ms에 응답하다오픈소스 연구자가 텍스트를 생성하지 않고 확률만 즉시 내놓는 비자기회귀 결정 모델 'RL Agent'를 공개했다. 421M 파라미터 양방향 인코더 기반으로 GPU에서 33~38ms에 응답하며, 유사 개념을 상용화한 TypeSafe AI의 Jev보다 약 4배 빠르다고 주장한다.
- Jev Ultrafast, 화면 요소를 번호로 인덱싱해 브라우저 작업을 7초대로 단축browser-use가 공개한 Jev Ultrafast는 매 관찰마다 화면 요소를 번호로 인덱싱하고 동작·대상 두 개의 결정 헤드만으로 브라우저를 조작하는 에이전트다. Google Flights 검색을 7.07초에 끝내며 중앙값 작업 시간을 25% 줄였다.