VisionMX가 비전 모델의 MX 4비트 사후 양자화 손실을 되돌린다

VisionMX: Unlocking Microscaling Post-Training Quantization for Vision Models

arXiv2610.03218v1

Elad Dror Cohen2026-10-02

무엇인가

마이크로스케일링(MX) 포맷은 저정밀 요소값과 블록 단위 공유 스케일을 결합한, 하드웨어가 지원하기 시작한 데이터 포맷이다. OCP가 표준화한 MXFP4-UE8M0, 더 촘촘한 스케일을 쓰는 MXFP4-UE5M3, NVIDIA의 NVFP4가 여기 속한다. 그런데 기존 MX 연구는 대부분 언어모델에 집중돼 있고, 비전 모델에서 사후 양자화(PTQ)가 어디서 얼마나 무너지는지는 체계적으로 다뤄지지 않았다. 이 논문은 그 공백을 메우기 위해 아키텍처, 요소 포맷, 블록 스케일 포맷, 가중치·활성값 양자화 각각의 영향을 실측하고, 직접 변환(round-to-nearest)에서 발생하는 오차를 세 갈래로 정리한다. 첫째 블록 스케일 표현 자체의 한계, 둘째 일부 작은 합성곱 가중치 텐서가 비균일 요소 그리드에 잘 정렬되지 않는 문제, 셋째 ReLU 같은 비선형 뒤의 음이 아닌 활성값이 부호 있는 그리드의 음수 코드를 낭비하는 문제다.

어떻게 동작하나

제안 방법 VisionMX는 이 두 번째와 세 번째 문제에 각각 대응하는 두 구성 요소로 이뤄진다. RangeRound는 기존 학습 기반 반올림이 값을 인접한 두 양자화 레벨 사이에서만 고르도록 제한하던 관행을 완화한다. 각 가중치를 정규화한 뒤 중심 폭 δ/2 안에 들어오는 그리드 점들과 가장 가까운 상·하위 그리드 점을 후보 집합으로 삼고, AdaRound식 로짓 행렬을 rectified sigmoid로 통과시켜 후보 집합의 양 끝점 사이를 보간한다. 이때 정규화 항은 인접 셀 중간점에서 최대, 모든 표현 가능한 그리드 점에서 0이 되는 다중 우물(multi-well) 페널티로 바뀐다. 값이 0 근처면 촘촘한 여러 레벨 사이를 이동할 수 있고, 클리핑 경계 근처면 위·아래 어느 쪽으로도 반올림해 재구성 오차를 줄일 수 있다. Activation Affine Correction(AAC)은 선형 연산에 들어가는 활성값을 채널별 스케일 α와 시프트 γ로 변환한 뒤 MX 양자화하고, 역변환을 뒤따르는 선형 연산에 접어 넣는다. 시프트가 분포를 부호 있는 그리드의 음수 영역으로 밀어 유휴 코드를 활용하게 만들고, 스케일이 표현 범위를 조정한다. 두 요소를 레이어 단위 재구성에 얹은 VisionMX-LW와 BRECQ식 블록 재구성에 얹은 VisionMX-BW 두 변형이 제시된다.

무엇과 다른가

이론적 근거도 함께 제시된다. 태스크 손실을 헤시안 기반 2차 근사로 전개했을 때, INT4에서는 반올림 상·하 후보 집합 안에 전역 최적해가 존재하지만(등식), 비균일 FP4 E2M1에서는 전체 코드북의 최솟값이 상·하 후보 집합의 최솟값보다 작거나 같다는 부등식만 성립한다. 즉 인접 두 레벨만 보는 것으로는 FP4에서 최적을 놓칠 수 있다는 것이고, 논문은 1.40과 4.90 두 가중치 예시에서 최근접 반올림 결과의 손실 0.365를 더 넓은 후보 집합의 0.315까지 낮출 수 있음을 보인다. Proposition 5.1은 후보 창 폭 δ가 최대 그리드 간격의 두 배 이상이면 2차 근사 최솟값이 보존됨을 보이며, E2M1 FP4에서는 δ=4로 충분하다고 밝힌다.

어떻게 쓰나

실험은 ImageNet-1K 분류, COCO 객체 검출(Faster R-CNN, RetinaNet, FCOS), COCO 의미론적 분할, 저조도 이미지 개선에서 이뤄졌다. 베이스라인은 직접 변환(RTN), AdaRound, QDrop이며 QDrop은 MX 블록 단위로 마스크를 샘플링하도록 적응시켰다. 캘리브레이션 세트는 ImageNet 2,048장, COCO 256장, 저조도 256장이고, 5개 시드 평균에 H100 한 장에서 10k~20k 반복 최적화를 돌린다. 민감도 분석에서는 DeiT-B, Swin-T, ViT-S/16, ConvNeXt-Tiny가 가중치만·활성값만 양자화 모두에서 상대 손실 5% 이내로 버틴 반면, MobileNetV2는 가중치만 양자화에서 참조 정확도의 97.40%를, 활성값만 양자화에서 52.30%를 잃었고 EfficientViT-L2는 두 경우 모두 정확도가 거의 전멸했다. MXFP8 RTN은 대부분의 모델에서 부동소수점 참조에 근접한 성능을 유지한다.

전제와 한계

결과적으로 VisionMX는 CNN과 하이브리드 모델 전반에서 정확도를 끌어올리며, 일부에서는 이득이 10%p에 이른다. 블록 스케일 포맷의 효과도 뚜렷해서 UE5M3가 UE8M0보다 모든 모델에서 일관되게 좋았고 이득은 약 3%p에 달한 반면, UE5M3에서 NVFP4로 바꿨을 때의 추가 이득은 대부분 작았다. 검출과 분할에서 직접 변환은 큰 성능 저하를 보였고, VisionMX-BW는 RTN 대비 검출 AP를 5.64~9.59, 분할 mIoU를 3.04~48.51 끌어올리며 평가된 대부분의 모델-포맷 조합에서 기존 PTQ 베이스라인을 앞섰다. 절제 실험(MXFP4 요소 + UE8M0 스케일, 블록 단위)에서 MobileNetV2는 RangeRound와 바이어스만 켰을 때 57.42%였던 top-1이 AAC를 더하자 65.53%로 8.11%p 올랐고, CaiT-XXS24에서는 같은 조건이 73.30%에서 73.56%로 0.26%p 개선됐다. 세 요소를 모두 켠 구성이 두 모델 모두에서 가장 높았다.

개발자 관점에서 이 논문의 실용적 신호는 두 가지다. 하나는 MX 4비트를 비전 모델에 그대로 적용하면 아키텍처에 따라 결과가 극단적으로 갈린다는 점이다. 트랜스포머 계열은 비교적 안전하지만 MobileNetV2나 EfficientViT-L2 같은 소형 합성곱·하이브리드 모델은 직접 변환만으로는 사실상 사용할 수 없다. 다른 하나는 블록 스케일 포맷 선택이 공짜가 아니라는 점이다. UE8M0(2의 거듭제곱 스케일)보다 UE5M3처럼 세밀한 스케일을 쓰는 것만으로 수 퍼센트포인트가 오가므로, 하드웨어가 허용한다면 스케일 포맷을 먼저 확인해야 한다. 또한 AAC의 이득이 큰 모델과 거의 없는 모델로 나뉘므로, 자신의 모델에서 어떤 구성 요소가 실제로 기여하는지 절제 실험을 해보는 편이 좋다.

저자들이 명시한 전제와 한계도 분명하다. 반올림 상·하 최적성 정리와 후보 창 충분성 명제는 모두 태스크 손실의 2차 근사와 헤시안의 양의 정부호성 및 대각 우세 조건 아래에서 성립하며, 정확한 태스크 손실로 확장하려면 테일러 나머지 항을 통제해야 한다고 논문 스스로 밝힌다. 아키텍처 민감도 분석 역시 평가에 포함된 모델들에 대한 실측 결과이며, ConvNeXt-Tiny가 버틴 것처럼 합성곱 아키텍처 전체가 민감한 것은 아니라는 점도 저자들이 인정한다.