Kimi K3, 벤치마크와 실사용 체감 사이… 699위안 구독자들 "쿼터가 사라졌다"

V2EX19일 전조회 4

중국 개발자 커뮤니티 V2EX에 월 699위안 구독자라고 밝힌 한 사용자가 Kimi K3의 실제 사용 경험을 공유했다. 그는 공식 사이트에서 'kimi code' 관련 배수 쿼터가 별도 공지 없이 사라졌다고 적었다. 벤치마크 점수가 특정 모델(원문 표기 'fable')에 견줄 만하다는 홍보와 달리, 체감 성능은 DeepSeek 4.1 flash와 큰 차이를 느끼지 못하겠다는 것이 그의 주장이다.

댓글에서는 K3를 두고 실무에 쓸 수 있고 중국 모델 가운데 최상위권이라는 평가가 나왔다. 다만 연산 자원이 한정돼 있어 월 699위안 요금제에 코딩 에이전트의 team agent·workflow 기능을 함께 쓰면 실제로 쓸 수 있는 양이 매우 적다는 지적이 이어졌다. 한 댓글 작성자는 GPT 20x 요금제와 '5.6 sol xhigh|max' 조합에 맞먹는 체감을 얻으려면 699위안 계정이 최소 4개 필요하다고 계산했다.

다른 사용자는 699위안 계정 3개로도 부족했고, 699위안 2개에 GLM pro 하나를 더한 뒤에야 충분해졌다고 밝혔다. 모델별 특성도 갈린다. Kimi는 캐시 비용이 저렴한 대신 입력·출력 허용량이 매우 적어 정해진 방안을 실행하는 용도에 맞고, 계획을 세우는 단계는 GLM이 낫다는 것이다. GPT나 Anthropic 모델을 쓸 수 있는 환경이라면 가격과 성능 모두 국산 모델이 견주기 어렵다는 의견도 있었다.

배경에는 Kimi가 프런트엔드 코드를 한 번에 만들어내는 결과물로 주목받으며 사용자를 모은 이력이 있다. 그러나 최근 K3의 품질이 떨어졌다는 이른바 '지능 저하' 불만이 나오고 있고, 엄격한 논리 처리가 필요한 작업에서는 GLM-5.3보다 낫지 않다는 평가가 이 스레드에 올라왔다.

개발자 입장에서 이 논의가 보여주는 것은 구독형 AI 코딩 도구의 선택 기준이 벤치마크 수치에서 월 요금 대비 실제 처리 가능한 토큰으로 옮겨가고 있다는 점이다. 계획은 한 모델, 실행은 다른 모델에 맡기는 식으로 여러 모델을 역할별로 나눠 쓰는 라우팅이 비용 관리 수단으로 자리 잡는 모습도 확인된다.

다만 이 글은 V2EX 개인 사용자들의 체감과 추정이며, 쿼터 변경이나 성능 저하에 대해 회사가 공식 입장을 낸 내용은 없다. 벤치마크 점수와 실사용 체감의 차이도 개별 워크로드에 따라 달라질 수 있어 특정 모델의 우열로 일반화하기는 어렵다.

관련 글