Qwen 3.8 27B 양자화 'ShapeLearn' 정식판 공개…13.1GB로 BF16 품질 99.6% 확보
ByteShape가 Qwen 3.8 27B를 위한 GGUF 양자화 모델군 'ShapeLearn' 정식판을 내놨다. 지난 8월 18일 최소한의 최적화 예산으로 급하게 풀었던 ShapeLearn-Lite의 후속이자 완성판으로, 이번에는 5개 모델 전부가 6종 GPU 비교 그래프에서 품질-속도 프런티어 위에 올라갔다. 여기서 프런티어란 '다른 어떤 모델도 이보다 동시에 더 빠르고 더 정확하지는 않다'는 뜻이다.
라인업은 bpw와 품질이 반비례하도록 설계됐다. GPU-1(IQ2_XXS, 2.56bpw)은 BF16 대비 93.04% 품질에 RTX PRO 6000 기준 초당 116.11토큰, GPU-2(IQ3_XXS, 2.88bpw)는 96.56%에 108.01토큰, GPU-3(IQ3_XS, 3.01bpw)는 97.26%에 105.44토큰, GPU-4(IQ3_S, 3.23bpw)는 98.72%에 101.11토큰이다. 최상위 GPU-5(IQ4_XS, 3.84bpw)는 99.63% 품질에 90.42토큰을 기록했다. ByteShape는 GPU-5를 기본 권장으로 밀면서, VRAM이 빠듯하면 11.0GB짜리 GPU-4도 충분히 경쟁력이 있다고 설명한다. GPU-5가 13.1GB를 차지하는 것과 비교하면 2GB 이상을 아끼면서 속도는 더 빠르고, 품질 손실은 1%p가 채 안 된다.
추론 가속은 두 갈래다. 모든 GGUF에 MTP 드래프트 헤드가 내장돼 있어 별도 파일 없이 `--spec-type draft-mtp --spec-draft-n-max 3` 같은 옵션만 붙이면 되고, 이미지 입력도 그대로 쓸 수 있다. 반면 DFlash2는 1.1GB짜리 외부 드래프트 모델을 따로 받아 `--spec-type draft-dflash --spec-draft-n-max 7`로 연결하는 방식으로, 보통 더 빠르지만 메모리를 더 먹고 llama.cpp에서는 이미지 입력을 지원하지 않는다. DFlash2를 쓰려면 llama.cpp b10658 이상이 필요하다. 텍스트만 다루면서 메모리에 여유가 있다면 DFlash2, VRAM이나 멀티모달이 중요하면 MTP가 낫다는 것이 정리다. 테스트한 모든 모델과 GPU에서 두 방식 모두 처리량을 끌어올렸다.
배경에는 Lite 버전의 성적표가 있다. Lite는 최적화 예산과 검증 횟수가 훨씬 적었는데도 KLD 순위가 시사한 것보다 잘 버텼고, Lite 대 Unsloth Dynamic v3 비교에서 6개 중 3개가 프런티어에 남았다. 정식판은 그보다 나은 결과를 냈다. Qwen 3.8 27B가 dense 모델이라 메모리 전송이 병목이 되기 때문에, MoE와 달리 bpw를 낮추는 것이 토큰 처리량 증가로 거의 직결된다는 점도 이번 결과의 배경이다.
경쟁 양자화와의 비교도 함께 공개됐다. Unsloth Dynamic v3(UD-Q2_K_XL 95.72%·106.95토큰, UD-IQ3_XXS 93.59%·100.51토큰), ISTA-DASLab의 GSQ-RCO 계열(IQ3_S가 99.43%·94.77토큰으로 프런티어에 이름을 올렸다), AtomicChat의 AD-IQ2_XXS(83.85%·116.28토큰) 등이 같은 그래프에 놓였다. Bartowski의 최신 모델은 테스트 이후에 나와 제외됐다.
GPU별 권장안은 일관된다. RTX PRO 6000에서 GPU-5는 90.4토큰, RTX 5090에서는 93.7토큰으로 기본 선택이다. RTX 4090도 GPU-5가 59.2토큰으로 같은 패턴을 유지한다. RTX 3090에서는 GPU-4가 49.5토큰, GPU-5가 45.8토큰으로, 더 큰 모델로 가는 대가가 처리량 약 7.5%인 반면 품질은 98.72%에서 99.63%로 오른다. 16GB 카드인 RTX 4080은 GPU-4 52.4토큰·GPU-5 45.7토큰, RTX 5060 Ti는 33.1토큰·29.1토큰이었다. 24GB 카드 두 종은 5개 모델을 모두 담을 수 있지만 처리량 차이 때문에 그래프를 분리해 그렸고, 순서는 동일하다.
실무적으로 달라지는 지점은 선택 기준이다. 모델 가중치만이 아니라 컨텍스트 공간까지 고려해야 하므로, 16GB 이하에서는 GPU-4로 한 단계 내려 앉히는 것이 합리적이다. 24GB 이상이면 GPU-5를 기본값으로 두고, 이미지 입력이 필요하면 MTP를, 텍스트 처리량 극대화가 목표면 DFlash2를 고르면 된다. 각 모델의 권장 샘플링 설정과 실행 명령은 모델 카드와 런 툴에 정리돼 있다.
주의할 전제도 분명하다. DFlash2는 메모리 요구량이 더 크고 llama.cpp 환경에서 이미지 입력을 받지 못하며, 최신 빌드(b10658 이상)를 요구한다. 벤치마크는 ByteShape가 측정한 특정 GPU 조합과 시점을 기준으로 하며, Bartowski처럼 테스트 이후에 공개된 경쟁 모델은 그래프에서 빠져 있다.
관련 글
- 삼진 LLM 저장 효율 다시 계산…제로 분포 활용한 BITCOS, 1.58비트 벽 넘어삼진 LLM 가중치를 5개씩 바이트에 묶는 기존 5-trit 포맷 대신, 제로 밀도에 적응하는 BITCOS 레이아웃이 제안됐다. 29개 모델 측정에서 제로가 최대 51.5%를 차지했고, 최대 1.485비트/가중치와 1.28배 빠른 커널을 달성했다.
- 알리바바, Qwen 3.8 Omni Flash 공개…Qwen Studio에 멀티모달 기능 총집합알리바바가 Qwen 3.8 Omni Flash를 공개하며 Qwen Studio에서 챗봇, 이미지·영상 이해, 이미지 생성, 문서 처리, 웹 검색 연동, 도구 활용, 아티팩트까지 한 환경에 묶었다. 모델 크기와 라이선스, API 제공 여부는 원문에서 확인되지 않아 별도 검증이 필요하다.
- 8~29MB 초소형 온디바이스 모델 'Needle 3' 공개…레이어 깊이별 성능 사다리로 도구 호출·구조화 추출 노린다캑터스가 8~29MB 크기의 온디바이스 파운데이션 모델 Needle 3를 공개했다. 하나의 가중치에서 2~20레이어 서브네트워크를 골라 쓰는 구조로, 4레이어를 튜닝하면 DeepSeek V4 Flash에 맞먹는다고 주장한다.
- Pinterest, 수백억 벡터 검색에 양자화 도입…HNSW 메모리 부담 낮춘다Pinterest가 수백억 임베딩을 다루는 검색 플랫폼 마나스에서 HNSW의 메모리 부담을 줄이기 위해 스칼라·곱 양자화를 도입했다. 오프라인 벤치마크 수치와 SSD 기반 SPANN 전환, ColBERT 다중 벡터 검색 실험까지 정리했다.
- 센스타임, 이기종 칩으로 추론 자원 재배치…일일 토큰 0.46조→4.5조센스타임 대장치가 이기종 칩을 묶어 대규모 추론을 처리하는 '토큰 팩토리' 아키텍처를 공개했다. Prefill·Decode 자원을 부하에 따라 동적으로 재배치하고, 일일 토큰 처리량을 8개월 만에 0.46조에서 4.5조로 늘렸다고 밝혔다.