레이어별 활성값 기하를 보존하는 무학습 트랜스포머 압축, GeoPair
GeoPair: Geometry-Preserving Cross-Layer Factorization for Training-Free Transformer Compression
무엇인가
이 논문은 사후 학습(post-training) 압축, 그중에서도 가중치 행렬 분해를 다룬다. 트랜스포머는 깊은 스택 전반에 걸쳐 레이어 간 중복이 자연스럽게 생기는데, 기존 압축 파이프라인은 각 레이어를 따로 최적화하거나 인접 레이어를 묶는 식의 휴리스틱 그룹핑에 의존해 왔다. 저자들은 이 두 가지 접근이 레이어별 활성값 분포, 즉 활성값 기하를 무시한다고 지적한다. 특히 최근의 Basis Sharing 계열 방법은 레이어별 공분산을 전역 화이트닝 변환으로 평균 내고 공유를 인접 레이어로 제한하는데, 논문은 이것이 (1) 레이어 고유의 활성값 기하를 왜곡하고 (2) 인접하지 않은 정렬 가능한 쌍을 놓친다고 본다. GeoPair는 이 휴리스틱을 최적화 문제로 대체하자는 제안이다.
어떻게 동작하나
출발점은 압축을 캘리브레이션 집합에 대한 활성값 재구성 문제로 보는 것이다. 가중치 W에 대해 활성값 X가 있을 때 목적식은 ||X(W-Ŵ)||² + η||W-Ŵ||²이고, 이는 Tikhonov 정규화된 그램 행렬 G_η = XᵀX + ηI의 촐레스키 분해 G_η = LᵀL로 만든 화이트닝 공간에서 ||L(W-Ŵ)||²를 최소화하는 것과 수학적으로 동일하다. 즉 레이어마다 다른 L이 곧 그 레이어의 활성값 기하를 담는 좌표계가 된다. GeoPair는 이 L을 하나로 합치지 않고 각 레이어의 것을 그대로 유지한 채 공유 구조를 찾는다.
무엇과 다른가
핵심 구성은 두 레이어의 가중치 W1, W2가 하나의 공유 사전 D와 레이어별 계수 C1, C2로 표현되는 결합 분해다. 목적식은 ||L1W1 - L1DC1||² + ||L2W2 - L2DC2||²이며, D와 C에 대해 이중 볼록이므로 교대 최소화로 푼다. 계수 갱신은 가중 최소제곱의 닫힌 형태 해로 끝나고, 사전 갱신은 두 항을 가진 일반화 실베스터 방정식으로 정리된다. 저자들은 두 행렬 펜슬의 동시 대각화를 이용해 이 방정식을 독립적인 스칼라 방정식으로 분리하고, 반복 최적화나 스텝 크기 튜닝 없이 결정적인 닫힌 형태 해를 얻는다. 이 교대 스킴은 목적 함수의 단조 감소와 블록 정상점 수렴이 보장된다고 주장한다.
어떻게 쓰나
압축률을 더 끌어올리기 위해 계수 갱신에 ℓ0 제약(열마다 비영 원소 개수 k_i 이하)을 걸고, 이를 Hard Thresholding Pursuit로 푼다. 그라디언트 스텝, 각 열에서 크기 상위 k_i개를 남기는 지지집합 선택, 선택된 지지집합 위에서 켤레 기울기(CG) 솔버로 다시 푸는 제한 투영의 세 단계다. k_i를 사전 크기 r과 같게 두면 이 절차는 자연스럽게 기존 닫힌 형태 촐레스키 갱신으로 퇴화한다. 레이어 짝짓기는 별도의 전역 최적화다. 두 가중치의 화이트닝 공간에서 정규화된 프로베니우스 부분행렬 거리를 정의하고(출력 차원이 다르면 짧은 쪽을 긴 쪽 위로 슬라이딩), 이를 1D 상호상관으로 O(d·d_j)에 계산한다. 그 위에 완전 그래프를 만들어 최대 가중 매칭 문제를 Edmonds의 Blossom 알고리즘으로 정확히 푼다. 주목할 점은 같은 서브모듈 종류로 제한하지 않아, 입력 차원 d만 같으면 어텐션과 피드포워드 가중치도 짝이 될 수 있다는 것이다.
전제와 한계
실험은 7개 벤치마크에서 이뤄졌다. Llama-3 1B와 8B에서의 구성요소 절제에서 전역 화이트닝을 실베스터 기반 정식화로 바꾸는 것만으로 정확도가 크게 회복되고, 최적 그룹핑을 더하면 제로샷 성능이 추가로 오르며, HTP 희소화까지 포함한 전체 구성이 비압축 기준 정확도의 90% 이상을 회복한다고 보고한다. 희소화 파이프라인에서 그룹핑을 빼면 성능이 떨어져, 짝짓기가 계수 복구에 필수적이라는 근거로 제시된다. 밀집 저랭크와 희소 사전학습 계열을 아우르는 구조적 분해 방법들과의 비교에서 GeoPair가 가장 높은 정확도를 냈고, 행렬 분해 외의 압축·가지치기 기법들과의 비교에서도 사후 파인튜닝 없이 최고 평균 정확도를 기록했다고 한다. 다만 본문에 인용된 범위에서는 표의 구체적인 수치가 제시되지 않고, 1B부터 32B까지 압축률 0.2/0.3/0.4에서 Basis Sharing과 비교한 결과와 절제 실험 결과가 정성적으로 서술된다.
교차 과제 일반화 검증으로 영상 생성 모델 Wan2.2 5B를 20%와 40% 압축했고, 사후 보정 없이도 고품질 생성을 유지했다고 한다. Rapidata/awesome-text2video-prompts의 프롬프트 50개에 대해 16프레임 샘플링으로 X-CLIP 점수를 측정한 결과, 20% 압축에서 0.2164로 기준 0.2165 대비 1×10⁻⁴만 하락했고 40% 압축에서도 0.2111로 상대 2.5% 하락에 그쳤다. 절제 실험에서는 KS 비율(사전 원자 수 대비 계수 행렬 열당 비영 원소 수)이 2.5일 때 가장 좋았고, 이 값을 모든 희소화 실험의 기본값으로 쓴다고 밝힌다.
실무 관점에서 이 논문의 값어치는 레이어를 하나씩 SVD로 자르는 방식의 한계를 정면으로 다룬다는 데 있다. 캘리브레이션 데이터만 있으면 파인튜닝 없이 적용할 수 있고, 레이어 쌍을 데이터 기반으로 고르기 때문에 모델 구조별 수동 규칙을 줄일 수 있다는 것이 저자들의 주장이다. 도입을 검토한다면 확인할 것은 세 가지다. 첫째, 캘리브레이션 활성값의 품질과 η, ε 같은 정규화 상수에 결과가 얼마나 민감한지(논문은 부록 D에서 캘리브레이션 민감도와 수렴을 다룬다고만 언급한다). 둘째, 어텐션과 FFN을 넘나드는 짝짓기가 실제 서빙 파이프라인의 가중치 레이아웃과 커널에 맞는지. 셋째, KS 비율 2.5 같은 하이퍼파라미터가 자신의 모델·압축률에서도 유효한지다.
저자들이 명시한 가장 큰 한계는 짝짓기가 두 레이어 단위라는 점이다. 세 개 이상의 레이어가 사전을 공유하는 m-way 확장은 닫힌 형태 실베스터 해가 두 행렬 펜슬의 동시 대각화에 의존하기 때문에 해석적으로 일반화되지 않는다. 다중 그룹으로 확장하려면 반복적 수치 근사나 고차 텐서 분해가 필요하고, 이는 추가 계산 비용과 수치적 불안정성을 낳는다. 저자들은 이를 향후 핵심 과제로 남긴다.
관련 논문
- prefill과 decode에 서로 다른 양자화를 배정하는 disaggregated quantization프리필과 디코드가 각각 다른 양자화 이득을 본다는 점에 착안해, 연산 포맷과 가중치, 저장 위치를 두 단계에 맞게 특화하는 DQ를 제안한다. Qwen 3와 Gemma 3에서는 디코드의 활성값 양자화를 제거해 디코드 중심 작업 정확도를 높이면서 추론 비용은 늘리지 않았다.
- 값 토큰 재배열과 E4M3 직접 인코딩으로 비디오 DiT 어텐션을 가속하는 VC-Attention디퓨전 트랜스포머 영상 생성의 최대 병목인 어텐션을 저비트로 처리하는 VC-Attention이 제안됐다. 값(value) 이상치를 스무딩하고 소프트맥스를 캐스팅해 정확도 손실을 줄이는 접근이다.
- KV 캐시 축출을 배포 위험 계약으로 재정의한 위험 제어 프레임워크KV 캐시 축출을 평균 품질-메모리 절충이 아니라 배포 위험 제어 문제로 재정식화하고, 목표 위험과 신뢰도 계약을 만족하는 보존 정책을 보정 데이터로 인증한다. 인증 실패 시 전체 KV로 폴백하며, Llama·LongBench 등에서 같은 계약이 허용하는 축출 수준이 달라짐을 보인다.
- 어텐션 값 투영을 레이어별 토큰 메모리로 대체하는 Memory Attention언어 모델의 어텐션 값 생성을 토큰 인덱스 메모리와 컨텍스트 키의 결합으로 대체하는 Memory Attention을 소개한다. 추론 시 정규화를 메모리 테이블에 접어 조회와 덧셈으로 줄이고, CPU 오프로딩과 프리페칭으로 GPU 파라미터 저장을 낮출 수 있다.