Cloudflare가 결정 모델 Clef와 RL 파인튜닝 플랫폼을 공개했다
Cloudflare가 자체 학습시킨 결정 모델(decision model) 두 종류인 Clef와 Clef-flash를 Workers AI에서 제공하기 시작했다. 결정 모델은 LLM처럼 문장을 생성하는 대신, 주어진 입력에 대해 확률이 붙은 정형 출력을 돌려주는 데 특화된 모델이다. 예컨대 고객 지원 문의를 넣고 "긴급한가", "어느 팀이 처리해야 하는가"를 물으면, 각 선택지에 대한 확률값을 타입이 지정된 형태로 반환한다. 이 값을 코드에서 그대로 읽어 티켓 라우팅, 에스컬레이션, 사람 담당자 이관 같은 분기를 자동으로 태울 수 있다.
두 모델은 Hugging Face에 Apache 2.0 라이선스로 공개돼 로컬에서 직접 돌려볼 수 있고, Workers AI 호스팅 버전도 함께 제공된다. 기존 Jev 계열 결정 모델과 API가 호환되므로 엔드포인트만 바꾸는 방식으로 교체가 가능하다. 큰 쪽인 Clef는 정밀도를 우선한 모델이고, Clef-flash는 지연이 중요한 경로를 겨냥한 경량 버전이다. 호출 예시는 Workers AI의 `@cf/cloudflare/clef` 엔드포인트로 전달하는 형태다.
성능 면에서는 Jev Decision Index 기준으로 Clef가 현재 선두를 기록 중이라고 Cloudflare는 밝혔다. Typesafe의 자체 평가 스위트에서도 4개 영역 중 3개에서 Jev를 앞섰고, 특히 Clef-flash가 속도 대비 좋은 점수를 냈다. 회사가 수행한 43개 평가 벤치마크에서는 Laya를 제외한 결정 모델들을 지연 시간에서 앞질렀는데, Laya는 매우 빠른 대신 품질을 상당히 포기하는 트레이드오프가 있다고 설명했다.
구조적 차이도 있다. Clef는 비전 인코더를 갖춰 이미지 입력을 분류할 수 있는 반면, Jev는 현재 텍스트 분류만 지원한다. 컨텍스트 창은 64k로 Jev의 32k보다 넓어 한 번에 넣을 수 있는 입력 상태가 많다.
실사용 사례도 공개됐다. Cloudflare의 위협 인텔리전스 팀은 Browser Run으로 도메인을 가져와 Clef에 넘기는 방식으로 사이트 분류를 시험했다. 어떤 도메인을 패션 사이트일 확률 95%, 이커머스 85%, 피싱 1% 미만 식으로 판정하는 데 걸린 시간은 페이지 가져오기·렌더링·분류를 합쳐 2.2초였다. 같은 워크플로에서 가장 빠른 범용 LLM인 gpt-oss-120b는 4.7초가 걸렸고 분류 결과도 두 개만 돌려줬다. 지연이 절반으로 줄고 결과가 더 촘촘해지면 악성·정상 도메인 판별 속도가 그만큼 올라간다는 것이 Cloudflare의 설명이다.
배경에는 최근 등장한 결정 모델 흐름이 있다. 분류기는 오래전부터 있었지만, 재학습 없이도 새로운 분류 범주를 어느 정도 소화하면서 값싸고 빠르고 일관된 정형 출력을 내는 모델이 에이전트 워크플로의 판단 지점에 끼어들기 시작했다. 반면 LLM은 비결정적이지만 개방형 추론과 텍스트·도구 호출 생성에 강하다. Cloudflare는 이 둘을 대체 관계가 아니라 조합 대상으로 본다. 결정 모델을 에이전트의 핫 패스에 두고, 실제 행동은 Workers AI의 LLM으로 실행하는 구성이다.
내부 구현을 보면 Clef는 Qwen을 백본으로 삼아 결정 모델 용도에 맞게 후학습시킨 모델이다. 추론 시에는 Qwen으로 프리필(prefill) 패스만 수행한 뒤, 스키마상 유효한 선택지들을 병렬로 채점한다. 결정 단계가 자기회귀적이지 않아 토큰을 하나씩 생성하는 중간 텍스트가 없고, 그만큼 자기회귀 LLM보다 빠르다는 것이 회사 측 설명이다. 중간 텍스트 대신 백본 내부 표현에서 스키마 선택을 직접 끌어내는 방식이며, 이를 위해 각 유효 선택지가 프롬프트의 관련 컨텍스트를 추출하고 필드 파라미터끼리 교차 어텐션하는 2단계 어텐션 라우팅을 쓴다.
개발자 입장에서 달라지는 지점은 판단을 어디에 두느냐다. 티켓 분류, 콘텐츠 카테고리 판정, 위험도 등급 산정처럼 선택지가 정해져 있고 지연이 중요한 작업은 LLM 호출로 처리하는 대신 확률 출력을 받아 코드로 분기하는 편이 빠르고 예측 가능하다. API 호환이 유지되므로 기존 Jev 기반 코드를 크게 손대지 않고 교체할 수 있다는 점도 실무에서는 부담이 적다.
주의할 전제도 있다. Cloudflare는 요청과 응답을 읽거나 저장하거나 학습에 쓰지 않는다는 것을 기업용 보증으로 내걸었지만, 파인튜닝 제품을 쓰는 경우에는 이 예외가 적용된다. 파인튜닝은 우선 전담 엔지니어(FDE) 팀이 함께 붙는 형태로 제공되고, 이후 고객이 직접 학습시켜 Cloudflare에 재배포하는 셀프서브 플랫폼으로 확장될 예정이다.