Qwen 3.8 27B 양자화 'ShapeLearn' 정식판 공개…13.1GB로 BF16 품질 99.6% 확보

Hacker News22일 전조회 5

ByteShape가 Qwen 3.8 27B를 위한 GGUF 양자화 모델군 'ShapeLearn' 정식판을 내놨다. 지난 8월 18일 최소한의 최적화 예산으로 급하게 풀었던 ShapeLearn-Lite의 후속이자 완성판으로, 이번에는 5개 모델 전부가 6종 GPU 비교 그래프에서 품질-속도 프런티어 위에 올라갔다. 여기서 프런티어란 '다른 어떤 모델도 이보다 동시에 더 빠르고 더 정확하지는 않다'는 뜻이다.

라인업은 bpw와 품질이 반비례하도록 설계됐다. GPU-1(IQ2_XXS, 2.56bpw)은 BF16 대비 93.04% 품질에 RTX PRO 6000 기준 초당 116.11토큰, GPU-2(IQ3_XXS, 2.88bpw)는 96.56%에 108.01토큰, GPU-3(IQ3_XS, 3.01bpw)는 97.26%에 105.44토큰, GPU-4(IQ3_S, 3.23bpw)는 98.72%에 101.11토큰이다. 최상위 GPU-5(IQ4_XS, 3.84bpw)는 99.63% 품질에 90.42토큰을 기록했다. ByteShape는 GPU-5를 기본 권장으로 밀면서, VRAM이 빠듯하면 11.0GB짜리 GPU-4도 충분히 경쟁력이 있다고 설명한다. GPU-5가 13.1GB를 차지하는 것과 비교하면 2GB 이상을 아끼면서 속도는 더 빠르고, 품질 손실은 1%p가 채 안 된다.

추론 가속은 두 갈래다. 모든 GGUF에 MTP 드래프트 헤드가 내장돼 있어 별도 파일 없이 `--spec-type draft-mtp --spec-draft-n-max 3` 같은 옵션만 붙이면 되고, 이미지 입력도 그대로 쓸 수 있다. 반면 DFlash2는 1.1GB짜리 외부 드래프트 모델을 따로 받아 `--spec-type draft-dflash --spec-draft-n-max 7`로 연결하는 방식으로, 보통 더 빠르지만 메모리를 더 먹고 llama.cpp에서는 이미지 입력을 지원하지 않는다. DFlash2를 쓰려면 llama.cpp b10658 이상이 필요하다. 텍스트만 다루면서 메모리에 여유가 있다면 DFlash2, VRAM이나 멀티모달이 중요하면 MTP가 낫다는 것이 정리다. 테스트한 모든 모델과 GPU에서 두 방식 모두 처리량을 끌어올렸다.

배경에는 Lite 버전의 성적표가 있다. Lite는 최적화 예산과 검증 횟수가 훨씬 적었는데도 KLD 순위가 시사한 것보다 잘 버텼고, Lite 대 Unsloth Dynamic v3 비교에서 6개 중 3개가 프런티어에 남았다. 정식판은 그보다 나은 결과를 냈다. Qwen 3.8 27B가 dense 모델이라 메모리 전송이 병목이 되기 때문에, MoE와 달리 bpw를 낮추는 것이 토큰 처리량 증가로 거의 직결된다는 점도 이번 결과의 배경이다.

경쟁 양자화와의 비교도 함께 공개됐다. Unsloth Dynamic v3(UD-Q2_K_XL 95.72%·106.95토큰, UD-IQ3_XXS 93.59%·100.51토큰), ISTA-DASLab의 GSQ-RCO 계열(IQ3_S가 99.43%·94.77토큰으로 프런티어에 이름을 올렸다), AtomicChat의 AD-IQ2_XXS(83.85%·116.28토큰) 등이 같은 그래프에 놓였다. Bartowski의 최신 모델은 테스트 이후에 나와 제외됐다.

GPU별 권장안은 일관된다. RTX PRO 6000에서 GPU-5는 90.4토큰, RTX 5090에서는 93.7토큰으로 기본 선택이다. RTX 4090도 GPU-5가 59.2토큰으로 같은 패턴을 유지한다. RTX 3090에서는 GPU-4가 49.5토큰, GPU-5가 45.8토큰으로, 더 큰 모델로 가는 대가가 처리량 약 7.5%인 반면 품질은 98.72%에서 99.63%로 오른다. 16GB 카드인 RTX 4080은 GPU-4 52.4토큰·GPU-5 45.7토큰, RTX 5060 Ti는 33.1토큰·29.1토큰이었다. 24GB 카드 두 종은 5개 모델을 모두 담을 수 있지만 처리량 차이 때문에 그래프를 분리해 그렸고, 순서는 동일하다.

실무적으로 달라지는 지점은 선택 기준이다. 모델 가중치만이 아니라 컨텍스트 공간까지 고려해야 하므로, 16GB 이하에서는 GPU-4로 한 단계 내려 앉히는 것이 합리적이다. 24GB 이상이면 GPU-5를 기본값으로 두고, 이미지 입력이 필요하면 MTP를, 텍스트 처리량 극대화가 목표면 DFlash2를 고르면 된다. 각 모델의 권장 샘플링 설정과 실행 명령은 모델 카드와 런 툴에 정리돼 있다.

주의할 전제도 분명하다. DFlash2는 메모리 요구량이 더 크고 llama.cpp 환경에서 이미지 입력을 받지 못하며, 최신 빌드(b10658 이상)를 요구한다. 벤치마크는 ByteShape가 측정한 특정 GPU 조합과 시점을 기준으로 하며, Bartowski처럼 테스트 이후에 공개된 경쟁 모델은 그래프에서 빠져 있다.

관련 글