22ms에 결정 내리는 제로샷 분류 모델 'Jeff' 오픈소스 공개

开源中国12일 전조회 12

'Jeff'라는 이름의 오픈소스 프로젝트가 공개됐다. Qwen3.5와 Gemma 4를 파인튜닝한 모델로, 텍스트를 생성하는 대신 주어진 선택지 각각에 대해 보정된 확률을 한 번의 순전파로 돌려주는 제로샷 분류기다.

사용 방식은 단순하다. 시나리오를 설명하고 선택지 목록을 주면 모델은 문장을 만들어내지 않는다. 출력을 파싱할 필요도 없다. 각 선택지에 대한 확률값을 그대로 반환한다. 공개된 내용에 따르면 RTX PRO 6000에서 결정 한 번에 약 22ms가 걸린다. Apple M4 Max의 MLX 환경에서도 동작한다는 언급이 있지만, 원문이 그 지점에서 끊겨 구체적인 수치는 확인되지 않는다.

제목에서는 0.8B 규모 파인튜닝 모델이 벤치마크에서 'Jev'에 근접했다고 내세운다. 다만 어떤 벤치마크를 썼는지, 격차가 얼마인지는 제시되지 않았다. 확인되지 않은 주장으로 다루는 게 안전하다.

배경에는 LLM을 분류기로 쓰는 방식의 비용 문제가 있다. 생성 모델에 판단을 맡기면 출력 텍스트를 다시 해석해야 하고, 그만큼 지연과 토큰 비용이 붙는다. 분류 전용으로 작은 모델을 파인튜닝하면 이 과정을 통째로 걷어낼 수 있다는 접근이다.

실무에서는 요청 경로 안에서 판단이 필요한 자리가 후보다. 의도 분류, 모델·도구 라우팅, 가드레일 판정처럼 선택지가 정해져 있고 확률값 하나면 충분한 작업에 쓸 수 있다. 확률이 보정되어 있다면 임계값 기반 로직을 얹기도 쉽다. 22ms 수준이면 사용자 요청 처리 흐름에 넣어도 체감 지연이 크지 않다.

다만 학습 데이터, 평가 방법, 라이선스, 실제 서비스 환경에서의 정확도는 공개된 내용에서 확인되지 않는다. 벤치마크 근접 주장 역시 수치 없이 제시됐다. 도입을 검토한다면 자체 데이터로 별도 평가를 거치는 편이 낫다.