Ollaya는 결정 모델을 로컬에서 돌려 RTX 4090에서 8ms로 응답한다.
Ollaya는 결정 모델(decision model)을 개발자 자신의 하드웨어에서 실행하는 오픈소스 런타임이다. 텍스트나 JSON을 넣고 타입이 지정된 질문을 던지면, 밀리초 단위로 확률값이 붙은 답이 돌아온다. 일반적인 LLM처럼 토큰을 하나씩 생성하지 않고 단일 포워드 패스로 결론을 내는 것이 이 계열 모델의 특징이다.
실제 동작은 명령 한 줄로 확인할 수 있다. `ollaya run laya --preset triage`에 중복 청구와 환불 요청을 담은 문장을 넘기면, 감정 축에서 1.59/3(3점 만점)이라는 점수와 "clearly annoyed" 0.36이라는 확률이 함께 나온다. 이 요청은 laya:en으로 라우팅됐고 RTX 4090에서 8.9ms에 끝났다. 질문 5개를 묶어 HTTP API로 왕복시키는 경우에도 엔드투엔드 약 10ms 수준이다.
성능 비교도 공개됐다. Ollaya가 제시한 수치에서 laya:multilingual의 중앙값은 8.1ms, TypeSafe의 호스티드 Jev API는 236~276ms다. 다만 조건이 다르다. Ollaya 쪽은 RTX 4090에서 laya를 fp16으로 돌린 값이고, Jev는 외부 벤치마크(AbdelStark/jev-benchmarks, nibzard/decision-model-benchmark)의 호스티드 API 지연으로 네트워크 시간이 포함되며 fp32 기준이다. 같은 조건의 대조가 아니므로 자릿수 차이 정도로 읽어야 한다.
API 호환성은 TypeSafe 스키마를 따른다. `/v1/systemone`과 `/v1/models`를 제공하며, 공식 TypeSafe Python SDK 0.7.1이 수정 없이 로컬 서버를 상대한다. `TYPESAFE_BASE_URL`을 `http://localhost:11435`로, `TYPESAFE_API_KEY`를 아무 값으로, `TYPESAFE_DEFAULT_MODEL`을 `laya`로 지정하면 기존 코드를 그대로 쓸 수 있다는 구성이다.
모델 라인업은 여러 저자의 것을 묶었다. Convai Innovations의 Laya는 영어 모델과 100개 이상 언어 모델, 타입 지정 결정에 파인튜닝된 모델, 그리고 이를 자동 선택하는 라우터로 구성되며 파라미터는 322m·421m 규모다. Mapika의 decider는 Qwen3.5 기반으로 옵션 글자에 대한 로짓을 한 번의 포워드 패스에서 읽어내며 0.75b·1.9b 버전이 있고, Ollaya가 제공하는 오픈 결정 모델 중 정확도가 가장 높다고 설명된다. Moritz Laurer의 nli는 각 선택지를 가설로 바꿔 함의 여부를 채점하는 방식으로 인코더 계열 최고 정확도를 기록했고(396m·435m), Knowledgator의 gliclass는 선택지 전체를 한 번에 채점해 선택지 수가 늘어도 비용이 거의 늘지 않는다(439m). llama.cpp를 통한 GGUF 기반 결정 모델 'von'도 예고돼 있다.
배경에는 민감 데이터 문제가 있다. 티켓, 이메일, 사용자 메시지는 조직이 가진 데이터 중에서도 특히 민감한데, 이를 외부 API로 보내지 않고 이미 데이터가 있는 곳에서 채점하자는 접근이다. 런타임은 ONNX Runtime 위에서 CPU 또는 NVIDIA GPU로 돌고, 서버는 기본적으로 127.0.0.1에만 바인딩된다. 가중치는 각 저자의 Hugging Face 저장소에서 커밋을 고정해 받아 sha256으로 검증하며, Ollaya가 직접 재호스팅하지는 않는다. 런타임 라이선스는 Apache-2.0이다.
개발자 입장에서 달라지는 지점은 세 가지다. 첫째, 확률에 임계값을 걸어 분기 로직을 만들 수 있다. Laya의 캘리브레이션 오차(ECE)는 온도 피팅 후 0.081로, Jev의 0.246보다 낮다고 제시됐다. 둘째, 호출량 미터링이나 API 청구 없이 하드웨어가 감당하는 만큼 돌릴 수 있다. 셋째, 배포 형태가 넓다. macOS·Windows·Linux용 데스크톱 앱과 CLI, 서버용 Docker 이미지(GHCR)를 제공하며, Linux x86-64와 WSL 2, Docker에서는 NVIDIA CUDA 13 GPU를 쓸 수 있다. Linux ARM64와 macOS는 CPU 전용이다.
전제 조건도 분명하다. NVIDIA GPU를 쓰려면 드라이버 R580 이상이 필요하고, 설치 프로그램은 GPU를 발견했을 때만 CUDA 라이브러리를 내려받는다. Apple·AMD·Intel GPU 환경에서는 모델이 CPU에서 실행된다. 앞서 언급한 지연 비교 역시 정밀도와 네트워크 포함 여부가 다른 값이므로, 실제 도입 판단은 자신의 워크로드로 직접 측정하는 편이 안전하다.
관련 글
- 에이전트 라우팅에 70B 모델은 과하다는 Laya와 Jev 비공식 비교가 나왔다Convai Innovations가 공개한 421M 결정 모델 Laya와 TypeSafe의 상용 엔진 Jev를 비교한 비공식 평가가 나왔다. 속도와 캘리브레이션 수치가 공개됐지만, 통제된 대조 실험이 아니라는 전제가 붙는다.
- Qwen3.5 기반 초소형 의사결정 모델 'Kev'가 공개됐다.Qwen3.5를 베이스로 한 초소형 의사결정 모델 Kev가 공개됐다. 0.8B·4B·9B 세 크기로 제공되며 예/아니오·객관식·평점 질문을 한 요청에 처리하고 확률과 신뢰도를 함께 돌려준다. 학습 코드와 평가 데이터, 로컬 서빙까지 포함된다.