Kimi K3, 벤치마크와 실사용 체감 사이… 699위안 구독자들 "쿼터가 사라졌다"
중국 개발자 커뮤니티 V2EX에 월 699위안 구독자라고 밝힌 한 사용자가 Kimi K3의 실제 사용 경험을 공유했다. 그는 공식 사이트에서 'kimi code' 관련 배수 쿼터가 별도 공지 없이 사라졌다고 적었다. 벤치마크 점수가 특정 모델(원문 표기 'fable')에 견줄 만하다는 홍보와 달리, 체감 성능은 DeepSeek 4.1 flash와 큰 차이를 느끼지 못하겠다는 것이 그의 주장이다.
댓글에서는 K3를 두고 실무에 쓸 수 있고 중국 모델 가운데 최상위권이라는 평가가 나왔다. 다만 연산 자원이 한정돼 있어 월 699위안 요금제에 코딩 에이전트의 team agent·workflow 기능을 함께 쓰면 실제로 쓸 수 있는 양이 매우 적다는 지적이 이어졌다. 한 댓글 작성자는 GPT 20x 요금제와 '5.6 sol xhigh|max' 조합에 맞먹는 체감을 얻으려면 699위안 계정이 최소 4개 필요하다고 계산했다.
다른 사용자는 699위안 계정 3개로도 부족했고, 699위안 2개에 GLM pro 하나를 더한 뒤에야 충분해졌다고 밝혔다. 모델별 특성도 갈린다. Kimi는 캐시 비용이 저렴한 대신 입력·출력 허용량이 매우 적어 정해진 방안을 실행하는 용도에 맞고, 계획을 세우는 단계는 GLM이 낫다는 것이다. GPT나 Anthropic 모델을 쓸 수 있는 환경이라면 가격과 성능 모두 국산 모델이 견주기 어렵다는 의견도 있었다.
배경에는 Kimi가 프런트엔드 코드를 한 번에 만들어내는 결과물로 주목받으며 사용자를 모은 이력이 있다. 그러나 최근 K3의 품질이 떨어졌다는 이른바 '지능 저하' 불만이 나오고 있고, 엄격한 논리 처리가 필요한 작업에서는 GLM-5.3보다 낫지 않다는 평가가 이 스레드에 올라왔다.
개발자 입장에서 이 논의가 보여주는 것은 구독형 AI 코딩 도구의 선택 기준이 벤치마크 수치에서 월 요금 대비 실제 처리 가능한 토큰으로 옮겨가고 있다는 점이다. 계획은 한 모델, 실행은 다른 모델에 맡기는 식으로 여러 모델을 역할별로 나눠 쓰는 라우팅이 비용 관리 수단으로 자리 잡는 모습도 확인된다.
다만 이 글은 V2EX 개인 사용자들의 체감과 추정이며, 쿼터 변경이나 성능 저하에 대해 회사가 공식 입장을 낸 내용은 없다. 벤치마크 점수와 실사용 체감의 차이도 개별 워크로드에 따라 달라질 수 있어 특정 모델의 우열로 일반화하기는 어렵다.
관련 글
- 값싼 모델로 품질 확보 노린 오픈소스 하네스 'CyberNewma' 공개V2EX에 공개된 오픈소스 프로젝트 CyberNewma는 값싼 모델에서 준수한 엔지니어링 품질을 얻는 것을 목표로 하는 코딩 에이전트용 하네스다. 작성자는 ds와 GLM flash 모델로 자체 테스트했지만 벤치마크는 아직 없다고 밝혔다.
- 스노우플로우, Cortex AI 게이트웨이에 동적 모델 라우팅 도입스노우플로우가 Cortex AI 게이트웨이에 동적 모델 라우팅을 도입했다. 작업마다 비용·속도·품질을 비교해 최적 모델을 자동 선택하고, 독립 모델 검증으로 라우팅 품질을 계속 개선한다는 구상이다.
- 에이전트 라우팅에 70B 모델은 과하다는 Laya와 Jev 비공식 비교가 나왔다Convai Innovations가 공개한 421M 결정 모델 Laya와 TypeSafe의 상용 엔진 Jev를 비교한 비공식 평가가 나왔다. 속도와 캘리브레이션 수치가 공개됐지만, 통제된 대조 실험이 아니라는 전제가 붙는다.
- GLM, 자체 추론 인프라를 직접 구축하다GLM이 자체 추론 인프라를 구축했다는 소식이 해커뉴스에 올라왔다. 모델 제공자가 서빙 스택을 직접 만드는 선택이 API 비용과 지연, 그리고 개발자의 모델 활용 방식에 어떤 영향을 주는지 정리한다.
- a16z가 투자한 Vals, '문항 비공개' 산업별 평가로 AI 벤치마크 판을 뒤집으려 한다AI 벤치마킹 스타트업 Vals가 앤드리슨 호로위츠가 이끄는 시리즈 A에서 4천만 달러를 유치했다. 시험 문항을 공개하지 않고 법률·금융·코딩 등 산업별 실무 과제로 모델을 평가해 기존 벤치마크의 한계를 겨냥한다.