OPTQ 양자화의 일반화 오차와 정규화 λ 선택법
Generalization behavior of OPTQ and the role of regularization
무엇인가
OPTQ(일명 GPTQ)는 이미 학습된 신경망의 가중치를 순차적으로 반올림하면서, 주어진 캘리브레이션 데이터에 대한 제곱 양자화 오차 ‖Xw − Xq‖²를 최소로 유지하는 학습 후 양자화(PTQ) 알고리즘이다. 이 논문이 겨냥하는 문제는 캘리브레이션 오차와 일반화 오차가 서로 다른 양이라는 점이다. 캘리브레이션 세트가 작으면 OPTQ는 샘플링된 활성값의 경험적 기하 구조에 들어 있는 우연한 상관관계를 이용해 캘리브레이션 오차를 낮출 수 있지만, 그 방향이 실제 데이터 분포에서는 분산을 갖기 때문에 보지 못한 데이터에서의 오차는 커진다. 기존 이론(Zhang et al. 2025)은 캘리브레이션 데이터 위에서의 전체·좌표별 오차만 다뤘고, 캘리브레이션 밖으로의 일반화는 거의 알려져 있지 않았다.
어떻게 동작하나
논문의 정규화는 캘리브레이션 행렬 X를 X̃ = (X; √λ I)로 확장하는 방식으로 들어간다. 이 확장은 X의 열 랭크가 부족해도 OPTQ의 업데이트 방향을 항상 잘 정의되게 만들고, 동시에 경험적 목적함수가 모든 방향을 "보게" 만든다. 첫 번째 결과인 정리 3.1은 특정 양자화 알고리즘에 묶이지 않은 비교 부등식이다. ‖x‖₂ ≤ R인 i.i.d. 샘플 m개로 만든 X와 Σ = E[xxᵀ]에 대해 λ > 2R²log(N/ε)이면, 확률 1−ε로 모든 r ∈ ℝ^N에 대해 E_x[|xᵀr|²] ≤ (1 − √(2R²log(N/ε)/λ))⁻¹ · (1/m)(‖Xr‖² + λ‖r‖²)가 성립한다. 데이터에 의존해 만들어진 r = r(X)에도 균일하게 적용된다는 점이 핵심이다.
무엇과 다른가
이를 OPTQ에 적용한 것이 따름정리 3.2다. r = q − w로 두면 E_x[|xᵀw − xᵀq|²] ≤ (Cδ²/m)(1 − √(2R²log(N/ε)/λ))⁻¹ Σᵢ ‖P_{>i}^⊥ X̃ᵢ‖²이며, 결정론적 OPTQ는 C = 1/4, 확률적 OPTQ는 C = 1이다. 여기서 P_{>i}^⊥ X̃ᵢ는 i번째 열을 나머지 열들의 직교 여공간에 사영한 것으로, 캘리브레이션 데이터의 기하 구조가 일반화 오차에 어떻게 반영되는지를 보여준다. 정규화 항 λ‖r‖²가 없으면 캘리브레이션 샘플에 잘 표현되지 않은 방향의 모집단 분산을 경험적 제곱형이 통제하지 못한다는 것이 저자들의 설명이다.
어떻게 쓰나
두 번째 축은 확률적 반올림을 쓰는 stochastic OPTQ에 대한 것이다. 정리 3.3은 임의의 양의 준정부호 행렬 A에 대해 E_α[(X̃r)ᵀA X̃r] ≤ (δ²/4)(maxᵢ‖P_{>i}^⊥X̃ᵢ‖²)·tr A를 증명하고, 확률 1−ε 버전도 제시한다. 이를 따름정리 3.4에 적용하면 E_z[|zᵀw − zᵀq|²] ≤ (δ²/4)(maxᵢ‖P_{>i}^⊥X̃ᵢ‖²/λ)·E_z[‖z‖²]가 되는데, 이 부등식은 테스트 분포가 캘리브레이션 데이터를 만든 분포와 달라도 성립하는 분포 무관 결과다. 비교 대상으로 메모리리스 스칼라 양자화(MSQ, 흔히 RTN)는 일반적으로 δ²E_z[‖z‖²] 이상의 오차를 낸다. 즉 λ를 충분히 크게 잡으면 데이터 의존 알고리즘인 stochastic OPTQ가 데이터 독립 알고리즘보다 최악의 경우에도 상수 배 이상 나쁘지 않다. 따름정리 3.5는 ‖w − q‖_∞ 바운드를 주며, Zhang et al.의 정리 4.6을 √π만큼 개선한다. 이는 클리핑이 일어나지 않도록 알파벳의 비트 수 b를 정하는 데 쓰인다.
전제와 한계
λ 선택은 이 바운드들을 최소화하는 문제로 정리된다. 논문의 제안(Remark 4.1)은 λ = β · ‖X‖_F²/(m^{1/3} min{m,N}^{2/3})이고, 실험적으로 β = 1을 쓴다. 유도 과정에서 바운드의 로그를 미분해 f′(λ)의 부호를 분석한 결과, 최적 λ*는 4.5R²log(N/ε) ≤ λ* ≤ max{18R²log(N/ε), (√(2R²log(N/ε))·‖X‖_F²/N)^{2/3}} 범위에 들어간다. 즉 λ는 캘리브레이션 행렬의 프로베니우스 노름, 샘플 수 m, 차원 N에 의존해 스케일링되어야 한다.
실험은 세 가지 분포에서 수행된다. 64×64 Sylvester Hadamard 행렬의 행을 균일하게 뽑는 uniform Hadamard, 같은 행렬에서 i번째 행을 확률 ∝ 1/i로 뽑는 non-uniform Hadamard, 그리고 64×16 표준정규 행렬 W에 표준정규 v를 곱하고 ReLU를 적용해 만든 ReLU 신경망 모델이다. 비교한 λ는 총 7가지로, 제안식 (35)에 서로 다른 β를 넣은 5가지와 기존 문헌 추천인 λ₁ = 0.01‖X‖_F²/N(Frantar et al. 2023), λ₂ = 10⁻³·‖X‖_op(Zhang et al. 2026, Qronos)이다. 테스트 오차는 E = Σᵢ E[|zᵀv^(i)|²]로 측정하고 z를 1000개 샘플링하며, 30회 독립 시행의 평균과 표준편차를 그림 1~3에 제시한다. 결과의 경향은 명확하다. 기존 추천 λ들은 저랭크 구조가 있고 샘플이 충분한 영역에서는 잘 동작하지만 샘플이 적은 영역에서 큰 오차를 낸다. 반면 제안식을 β = 1로 쓰면 샘플이 적을 때 그림 1과 2의 오차를 크게 줄이면서, 샘플이 많을 때 그림 2와 3에서도 작은 오차를 유지한다. 다만 본문에는 구체적인 수치표가 없고 그림으로만 결과가 제시되어 있어, 개선폭을 숫자로 확인하려면 원문 그림을 봐야 한다.
개발자 관점에서 이 논문이 유용한 지점은 캘리브레이션 데이터가 부족한 상황이다. LLM 4비트 PTQ에서 캘리브레이션 샘플을 수백 개 수준으로 줄이면 기존 λ 추천은 과적합에 취약해지는데, λ를 ‖X‖_F²와 m, N에 맞춰 키우는 것만으로 저샘플 영역의 일반화 오차를 줄일 수 있다는 것이 이 논문의 실무적 주장이다. 또한 확률적 반올림을 쓰면 테스트 분포가 캘리브레이션 분포와 달라도 성립하는 바운드를 얻는다는 점, 그리고 ℓ∞ 바운드로 클리핑 없는 비트폭을 정할 수 있다는 점도 참고할 만하다. 다만 λ 스케일이 데이터 행렬의 노름에 직접 의존하므로, 입력 정규화나 스케일링 방식을 바꾸면 λ 값도 다시 맞춰야 한다.
저자들이 밝힌 전제와 한계는 다음과 같다. 분석은 반올림으로 인한 오차만 다루고 클리핑 오차는 배제한다. 알파벳을 δℤ로 두고 b가 충분히 커서 클리핑이 없다고 가정한다. 정리 3.1은 ‖x‖₂ ≤ R이 거의 확실히 성립하는 유계 지원 분포를 전제로 한다. λ 선택 유도에서 R² ≈ K²‖X‖_F²/m으로 바꿔 넣는 단계는 행 노름에 대한 명시적 집중 가정이 없으면 휴리스틱이며, 이 논증만으로는 최적 스케일 상수를 정밀하게 결정할 수 없어 β를 실험적으로 정했다고 저자들은 명시한다. 따름정리 3.4의 두 번째 부분에서 확률은 αᵢ의 무작위성에만 관한 것이고, 정리 3.3의 바운드는 캘리브레이션 행렬 X를 고정한 상태에서 성립한다.