스노우플로우, Cortex AI 게이트웨이에 동적 모델 라우팅 도입
스노우플로우가 자사 AI 게이트웨이인 Cortex AI 게이트웨이에 동적 모델 라우팅 기능을 공개했다. 핵심은 하나의 모델을 정해 고정하는 대신, 작업 단위로 비용과 속도, 품질을 저울질해 가장 적합한 모델을 자동으로 골라 붙이는 것이다. 스노우플로우 CEO인 시리다르 라마스와미가 직접 발표 글을 통해 이 기능과 배경을 설명했다.
플랫폼은 Anthropic, Google, Mistral AI, OpenAI 등의 모델을 중립적으로 묶어 제공하며, 원문 기준으로 SpaceXAI라는 표기의 모델도 함께 언급됐다. 여기에 GLM-5.3과 DeepSeek-V4-Flash 0731을 추가해 모델 선택지를 더 넓히겠다고 밝혔다. 사용 방식은 이렇다. 고객이 승인할 모델의 범위와 비용·성능·지연 중 무엇을 우선할지 같은 판단 기준을 정하면, 게이트웨이가 그 정책과 실제 운영에서 나온 비용·성능 데이터를 함께 반영해 사례별로 후보를 평가하고 최적 모델을 자동 선택한다.
라우팅 자체도 고정된 규칙이 아니라 학습 대상이다. 어떤 모델이 작업을 끝내면 별도의 독립 모델이 그 출력 품질을 검증하고, 그 결과가 다음 라우팅 결정을 개선하는 피드백 루프로 이어진다는 설명이다. 이 기능은 개발자용 인터페이스인 CoCo와 비즈니스 사용자용인 CoWork에 기본 통합돼, 새 모델이 등장해도 기존 에이전트와 워크플로를 다시 만들 필요가 없다는 것이 회사 측 주장이다.
배경에는 기업들의 시선 변화가 있다. AI 도입 초기에는 직원 사용률이나 토큰 소비량 같은 과정 지표가 주목받았지만, 이제는 매출 증대나 비용 절감, 업무 효율처럼 정량적으로 확인 가능한 성과를 요구한다는 것이다. 동시에 오픈소스 모델의 성능이 올라오면서, 로직이 단순하고 요구사항이 분명한 작업에서는 값비싼 최상위 모델 대신 오픈소스 모델로 충분한 결과를 얻는 경우가 늘었다. 모델마다 비용·품질·지연의 좌표가 다르고 그 좌표가 계속 움직이기 때문에, 단일 모델을 표준으로 굳히는 접근은 시간이 지나면 최적이 아니게 된다는 논리다.
개발자 입장에서 달라지는 지점은 모델 선택이 애플리케이션 코드에서 인프라 계층으로 밀려난다는 것이다. 라우팅 계층이 모델 교체를 흡수하면, 더 싸거나 더 빠른 모델이 나올 때마다 에이전트와 워크플로를 수정하는 대신 정책만 조정하면 된다. 비용 최적화도 요청 단위가 아니라 라우팅 규칙 단위로 다룰 수 있게 된다.
다만 성능 수치는 회사 측이 제시한 초기 벤치마크라는 점을 감안해야 한다. 동일한 품질 기준에서 단일 모델 의존 방식보다 비용 효율이 낫다는 결과는 스노우플로우가 밝힌 것이며 외부에서 독립 검증된 값은 아니다. 라우팅 품질이 출력을 검증하는 별도 모델의 신뢰도에 의존한다는 구조적 전제도 있다. 언급된 모델 버전명은 발표 시점 기준이다.
관련 글
- Kimi K3, 벤치마크와 실사용 체감 사이… 699위안 구독자들 "쿼터가 사라졌다"중국 개발자 커뮤니티 V2EX에서 Kimi K3의 벤치마크 점수와 실제 사용 체감이 어긋난다는 지적이 나왔다. 699위안 구독자들은 조용히 사라진 쿼터와 사용량 한계를 근거로 GLM·GPT를 섞는 병행 전략을 공유했다.
- GLM, 자체 추론 인프라를 직접 구축하다GLM이 자체 추론 인프라를 구축했다는 소식이 해커뉴스에 올라왔다. 모델 제공자가 서빙 스택을 직접 만드는 선택이 API 비용과 지연, 그리고 개발자의 모델 활용 방식에 어떤 영향을 주는지 정리한다.
- 결정 전용 모델 'Jev' 활용 사례 20여 개 모은 사이트 공개중국 개발자 커뮤니티 V2EX에 결정 특화 모델 Jev를 활용한 프로젝트 20여 개를 모은 사이트가 공개됐다. 생성형 모델과 달리 분류·라우팅·점수화 같은 판단 작업을 전담하는 Jev의 실제 쓰임새를 사례로 보여준다.
- 값싼 모델로 품질 확보 노린 오픈소스 하네스 'CyberNewma' 공개V2EX에 공개된 오픈소스 프로젝트 CyberNewma는 값싼 모델에서 준수한 엔지니어링 품질을 얻는 것을 목표로 하는 코딩 에이전트용 하네스다. 작성자는 ds와 GLM flash 모델로 자체 테스트했지만 벤치마크는 아직 없다고 밝혔다.