마이크로소프트가 Decision-1로 분류·라우팅 전용 모델 경쟁에 뛰어든다
마이크로소프트가 자체 결정 전용 모델인 Decision-1을 내놨다. 범용 대화 모델이 아니라, 분류와 평가, 라우팅처럼 짧고 정형화된 판단을 빠르게 내리는 데 특화된 소형 모델이다. 마이크로소프트는 이 모델이 복잡한 환경에서 에이전트를 안내하고 제어하는 역할까지 맡을 잠재력이 있다고 설명한다.
기반은 Qwen3.5-9B다. 약 15만 개 질문을 아우르는 36개 벤치마크에서 자사가 테스트한 모델 가운데 가장 정확했다는 것이 마이크로소프트의 주장이다. 속도 면에서는 비교 대상 중 두 번째로 빠른 H2O-Lightning-4B보다 2.5배 빠르다고 밝혔다. 공개된 비교표에서 Decision-1은 정확도 83.5%, 지연 시간 85ms로 Jev 1.13.0을 앞선다.
배포는 마이크로소프트 Foundry와 OpenRouter를 통해 이뤄진다. 가격 구조가 눈에 띄는데, 입력 토큰 100만 개당 0.042달러이고 출력 토큰은 무료다. 판단 결과를 짧게 뱉는 용도이니 출력 쪽을 사실상 공짜로 열어둔 셈이다.
이 제품이 등장한 배경에는 최근 몇 달 사이 형성된 '결정 모델' 흐름이 있다. 지난 9월 중순 스타트업 Jev가 이 개념을 처음 밀어붙였고, 이후 OpenAI와 Cloudflare가 비슷한 방향의 모델을 내놓으면서 빠르게 확산됐다. 다만 흐름이 커진 만큼 기술이 빠르게 흡수되고 대체되는 속도도 빨랐다. 공개된 소형 언어 모델을 조금만 손보면 비슷한 성능을 낼 수 있다는 사실이 곧바로 드러났기 때문이다. Jev 입장에서는 개념을 열어준 대가를 톡톡히 치른 몇 주였던 셈이다.
개발자 관점에서 이 소식의 핵심은 모델 자체의 성능이 아니라 배치 지점이다. 에이전트를 여러 단계로 엮으면 각 단계마다 거대 모델을 호출하는 비용이 빠르게 불어난다. 그중 상당수는 '이 요청을 어느 도구로 보낼까', '이 답변이 규칙을 지켰는가' 같은 단순한 판단이다. 이런 자리를 9B급 소형 모델로 대체하면 지연과 비용을 동시에 줄일 수 있다. 85ms라는 수치는 사람이 체감하기 어려운 수준이라, 라우팅 계층에 여러 번 끼워 넣어도 전체 응답 시간에 부담이 적다.
주의할 점도 분명하다. 우선 비교의 범위다. 마이크로소프트가 제시한 순위는 자사가 구성한 벤치마크 묶음에 근거한 것이고, 같은 Qwen 계열을 기반으로 한 Cloudflare의 오픈소스 Clef 모델들은 이 비교에 아예 포함되지 않았다. 즉 '가장 정확하다'는 표현은 비교 대상이 한정된 조건부 주장이다. 또 에이전트를 복잡한 환경에서 제어할 수 있다는 부분은 마이크로소프트 스스로 '잠재력'이라는 표현을 썼을 뿐, 실제 검증 결과가 제시된 것은 아니다.
결정 모델이라는 범주 자체가 아직 표준화되지 않았다는 점도 감안해야 한다. 어떤 작업을 '결정'으로 규정할지, 정확도를 어떤 지표로 재야 할지에 대한 합의가 없는 상태에서 각 사가 자기 기준의 순위표를 내놓고 있다. 도입을 검토한다면 벤치마크 숫자보다 실제 워크로드에서의 라우팅 정확도와 실패 시 폴백 경로를 먼저 확인하는 편이 낫다.