G²PTQ가 블록 단위 전역 감독으로 LLM 사후 양자화 오차를 줄인다
G^2PTQ: Improving LLM Post-Training Quantization with Generalized Gradient Compensation
무엇인가
대규모 언어모델(LLM)을 재학습 없이 저비트로 압축하는 사후 양자화(PTQ)에서 GPTQ 계열 기법은 사실상 표준이 됐다. 하지만 논문은 이 계열이 서로 보완적인 두 가지 한계를 안고 있다고 지적한다. GPTQ와 QuIP처럼 선형 계층별 MSE를 최소화하는 방법은 개별 계층 출력만 맞출 뿐 모델 전체 성능에 대한 감독이 없다. 반대로 OAC, GuidedQuant, YAQA처럼 종단 간 NLL이나 KL 발산을 목표로 삼는 방법은 전역 감독을 얻는 대신 헤시안을 양자화 시작 시점에 한 번 계산해 고정하고, 1차 그래디언트 항을 아예 버린다. 가중치가 순차적으로 양자화되면서 그 추정치는 점점 실제 모델과 어긋나 낡아간다. FOEM처럼 1차 항을 되살린 연구도 있지만, 1차 테일러 근사에 의존해 계층별 MSE에서는 정확하고 블록 단위 MSE나 KL 발산에서는 불필요한 오차를 만든다.
어떻게 동작하나
G²PTQ는 이 두 한계를 동시에 겨냥한다. 목표 함수를 선형 계층별 MSE가 아니라 트랜스포머 블록 단위로 정의한다. 각 블록에 대해 양자화된 블록의 출력과 전체 정밀도 블록의 출력 사이의 차이를 줄이는데, 중간 블록은 블록 단위 MSE를, 마지막 블록은 예측 분포를 직접 겨냥하는 KL 발산을 쓴다. 핵심은 양자화를 진행하기 전에 각 블록마다 그래디언트와 헤시안 추정치를 새로 계산한다는 점이다. 전체 모델 역전파가 아니라 해당 블록 하나만 통과하는 역전파 한 번이면 되기 때문에, 전역 목표를 쓰는 기존 방법들보다 훨씬 저렴하면서도 보상 신호가 낡지 않는다. 가중치 갱신식은 GPTQ의 2차 항과 FOEM이 도입한 1차 항을 합친 형태이며, 1차 항은 테일러 근사 없이 역전파로 정확히 계산한다.
무엇과 다른가
정확한 1차 보상 항은 그래디언트와 헤시안의 수치 스케일에 민감해 가중치 갱신이 폭주하기 쉽다. 논문은 이를 막기 위해 신뢰영역(trust-region) 스케일링을 도입한다. 갱신으로 인한 손실 변화가 정해진 예산을 넘지 않도록 1차 항에 0과 1 사이의 계수 β를 곱하는데, β는 GPTQ 갱신이 유발한 손실 변화량과 그래디언트·헤시안으로 계산되는 상수 c, 그리고 강도를 조절하는 하이퍼파라미터 α로 결정된다. 헤시안은 블록 단위 MSE와 KL 발산 각각에 대해 그래디언트 벡터의 외적, 즉 피셔 정보 행렬 형태로 근사할 수 있음을 두 개의 정리로 보인다. LLM 헤시안이 블록 대각 구조를 보인다는 기존 관찰에 따라 출력 채널별로 별도 헤시안을 두되, 채널을 g개 그룹으로 묶어 그룹마다 하나의 헤시안을 공유한다. 구현에서는 역행렬과 그래디언트를 매 단계마다 새로 곱하는 대신 F 행렬을 재귀적으로 갱신해 복잡도를 O(max{d_col³, d_row·d_col²})로 낮춘다. 이는 원래 GPTQ와 같은 수준이며, GPTQ의 지연 배치(lazy-batch) 갱신도 F와 가중치 양쪽에 맞게 확장한다.
어떻게 쓰나
실험은 0.6B에서 125B까지 13개 밀집 모델과 2개 MoE 모델을 대상으로 했다. 지표는 퍼플렉시티, KL 발산, 그리고 7개 상식 QA 벤치마크 정확도다. 비교 대상은 RTN, GPTQ, GuidedQuant, GPTAQ이며 회전·클리핑·활성값 재정렬 같은 기법은 모든 방법에 동일하게 적용했다. 가중치 전용 양자화에서 G²PTQ 변형들은 평가한 모든 지표에서 최고 성능을 냈다. W2A16 설정에서 세 모델 평균 기준 G²PTQ*는 GPTAQ 대비 KL 발산을 1.83에서 0.90으로 절반으로 줄였고, QA 정확도는 6.45%p 올랐다. 4비트 가중치·활성값 동시 양자화에서는 LLaMA3-70B에서 GPTAQ보다 QA 정확도가 4.56%p 높았다. MoE에서는 Qwen3-30B-A3B와 125B Qwen3.8-Flash-Next를 4비트로 양자화했는데, 125B 모델에서 QA 정확도 하락이 0.33%에 그쳤다.
전제와 한계
절제 실험은 Qwen3-0.6B, 3비트 조건에서 이뤄졌다. 계층별 GPTQ 기준선의 평균 QA 정확도 33.09%가 블록 단위 정렬을 적용하면 37.40%로 오른다. 정보를 동적으로 갱신하면 헤시안 추정이 정밀해져 추가 향상이 있고, 이 갱신은 그래디언트 보상의 전제 조건이기도 하다. 갱신하지 않으면 전체 정밀도 가중치가 그래디언트가 0인 극소점에 머물기 때문이다. 정보 갱신과 정확한 그래디언트 보상을 함께 적용하면 QA 정확도가 1.75%p 더 오르고, 마지막 블록에 KL 발산을 적용하면 추가 이득이 있다. 신뢰영역 스케일링을 빼면 정확한 그래디언트 항이 발산해 하위 작업 정확도가 붕괴한다. 보정 비용은 8B 모델 기준 단일 가속기에서 2.24시간, 12.54GB 메모리다.
실무 관점에서 이 방법은 GPTQ 파이프라인에 블록 단위 역전파와 헤시안 갱신 단계를 추가하는 형태라, 기존 GPTQ 커널과 지연 배치 전략을 그대로 재사용할 수 있다는 점이 눈에 띈다. 2비트나 3비트처럼 손실이 큰 저비트 영역, 또는 4비트 가중치·활성값 동시 양자화처럼 활성값 이상치가 오차를 지배하는 상황에서 이득이 크다고 보고된다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, GPTQ는 헤시안 추정에 순전파 한 번만 쓰지만 G²PTQ는 블록별 역전파가 필요해 보정 시간과 메모리가 늘어난다. 둘째, 신뢰영역 강도 α를 그리드 서치로 모델마다 튜닝해야 한다. 셋째, 헤시안을 블록 대각으로 근사하고 출력 채널을 그룹으로 묶어 공유하는 근사가 들어가 있으므로, 자신의 모델·비트폭에서 이 근사가 유효한지 확인해야 한다.
저자들이 명시한 전제와 한계도 이 지점에 모인다. G²PTQ는 전체 모델 역전파 없이 블록 단위 역전파만 수행하지만, GPTQ보다 많은 메모리와 연산을 쓴다는 점을 논문 스스로 인정한다. 또한 헤시안 근사는 블록 대각 구조 가정과 채널 그룹 공유에 의존하며, 정확한 1차 보상 항의 안정성은 신뢰영역 스케일링과 α 튜닝에 달려 있다. 논문은 보정 집합 크기, 출력 채널 그룹 수, 정확한 그래디언트 보상에 대한 추가 절제 실험과 100B 모델의 보정 자원, 일괄 자동 튜닝 전략, 헤시안 기반 가중치 클리핑 논의를 부록으로 미뤄 두었다.