삼진 LLM 저장 효율 다시 계산…제로 분포 활용한 BITCOS, 1.58비트 벽 넘어
삼진(ternary) 대규모 언어모델의 가중치 저장 효율을 다시 계산한 연구가 나왔다. 가중치를 {-1, 0, +1} 세 값으로만 표현하는 삼진 LLM은 이론적으로 가중치당 log₂3 ≈ 1.585비트면 충분하지만, 실제 배포 포맷은 그보다 많은 비트를 쓴다. Evangelos Georganas, Alexander Heinecke, Pradeep Dubey는 arXiv에 공개한 논문 'Breaking the 1.58-bit Barrier for Ternary LLMs'에서 이 간극을 실제 모델의 심볼 분포로 메우는 BITCOS 레이아웃을 제안했다.
문제의 출발점은 '다섯 개씩 묶기'다. 현재 널리 쓰이는 삼진 가중치 포맷은 삼진값 5개를 1바이트에 담는 5-trit 패킹으로, 가중치당 1.6비트에 해당한다. 여기에 실무에서 쓰이는 그룹 크기가 2의 거듭제곱으로 맞춰지면서 1.625비트까지 올라간다. 이 계산은 -1, 0, +1 세 심볼이 똑같은 확률로 나타난다는 가정 위에 서 있다.
연구진은 이 가정이 틀렸다는 것을 실측으로 보였다. 삼진 LLM 29종의 가중치를 조사한 결과, 0이 차지하는 비중은 최대 51.5%에 달했다. 절반 가까운 가중치가 0이라면, 세 심볼을 등확률로 취급하는 고정 비트폭은 상당한 낭비다.
BITCOS는 이 관찰을 레이아웃에 그대로 반영한다. 구조는 단순하다. 어떤 위치에 가중치가 존재하는지를 나타내는 조밀한 프레즌스 비트맵(presence bitmap)과, 실제 부호만 압축해 이어 붙인 부호 벡터(sign vector)로 나눈다. 모델의 제로 밀도를 z라고 할 때 가중치당 비용은 2 - z비트가 된다. 제로가 많을수록 저장 공간이 줄어드는 구조다.
실험 결과는 29개 모델 중 26개에서 5-trit 패킹보다 압축률이 좋았다. 제로가 가장 많은 모델에서는 가중치당 1.485비트까지 내려간다. 이론적 하한인 1.585비트보다 낮은 수치로, 제목이 말하는 '1.58비트 장벽'을 실제 분포 정보로 넘어선 셈이다.
저장만 줄이고 언패킹이 느려지면 의미가 없다. 연구진은 AVX-512, AVX2, 그리고 인텔 Xe2 GPU를 위한 최적화된 언패킹 시퀀스를 함께 제시했다. 실제 삼진 모델이 보이는 제로 밀도에서 프로덕션 수준의 삼진 행렬-벡터 곱셈 커널과 비교했을 때 최대 1.28배의 이득을 얻었다.
끝단(end-to-end) 추론 성능도 보고됐다. 클라이언트·서버 CPU, 통합형·외장형 Xe2 GPU 등 5개 플랫폼에서 디코드 처리량이 CPU에서 최대 1.18배, GPU에서 최대 1.27배 향상됐다.
삼진 양자화는 가중치를 2비트 미만으로 떨어뜨리려는 시도의 한 갈래다. '1.58비트'라는 이름 자체가 log₂3에서 나온 이론적 하한을 가리키며, 그동안 논의는 주로 모델을 어떻게 삼진으로 학습·변환하느냐에 집중됐다. 이 논문은 이미 만들어진 삼진 모델을 어떤 비트 레이아웃으로 저장하고 얼마나 빠르게 풀어내느냐는 하위 계층 문제를 다룬다는 점에서 결이 다르다.
저비트 LLM을 서빙하는 입장에서 이 논문이 건드리는 지점은 메모리 대역폭이다. 디코드 단계는 가중치를 읽어들이는 속도에 묶이는 경우가 많아, 가중치당 비트폭을 줄이면 지연과 처리량이 함께 움직인다. 다만 BITCOS는 별도 언패킹 단계를 전제로 하므로 기존 추론 스택에 그대로 얹히기보다는 커널 수준 구현이 따라와야 한다. 도입을 검토한다면 자신이 쓰는 모델의 실제 제로 밀도가 얼마인지, 그리고 AVX-512·AVX2·Xe2 중 어느 백엔드에 최적화가 제공되는지를 먼저 확인하는 편이 좋다.
논문이 밝힌 범위도 분명하다. 압축 이득은 측정한 29개 모델의 제로 분포에 근거하며, 제로가 적은 모델에서는 5-trit 패킹보다 불리했던 사례도 3개 있었다. 언패킹 시퀀스 역시 명시된 CPU·GPU 명령어 집합에 맞춰 최적화된 것이라 다른 하드웨어에서는 별도 작업이 필요하다. 현재 arXiv 프리프린트 v1로 공개된 상태다.
관련 글
- PrismML, 퀄컴 스냅드래곤 스마트글래스에 1비트 초소형 LLM 얹었다PrismML이 퀄컴 스냅드래곤 AR1 Gen 1 플랫폼에서 로컬로 도는 1비트 초소형 언어모델을 선보였다. 20억 파라미터 비전·언어 모델로 스마트글래스에서 실시간 시각 질의를 처리하는 온디바이스 AI 사례다.
- Qwen 3.8 27B 양자화 'ShapeLearn' 정식판 공개…13.1GB로 BF16 품질 99.6% 확보ByteShape가 Qwen 3.8 27B용 GGUF 양자화 'ShapeLearn' 정식판을 공개했다. 13.1GB GPU-5 모델이 BF16 대비 99.63% 품질을 기록하며 6종 GPU 벤치마크의 품질-속도 프런티어를 차지했다.
- Pinterest, 수백억 벡터 검색에 양자화 도입…HNSW 메모리 부담 낮춘다Pinterest가 수백억 임베딩을 다루는 검색 플랫폼 마나스에서 HNSW의 메모리 부담을 줄이기 위해 스칼라·곱 양자화를 도입했다. 오프라인 벤치마크 수치와 SSD 기반 SPANN 전환, ColBERT 다중 벡터 검색 실험까지 정리했다.