레이어별 활성값 기하를 보존하는 무학습 트랜스포머 압축, GeoPair

GeoPair: Geometry-Preserving Cross-Layer Factorization for Training-Free Transformer Compression

HF Daily2609.25963

Baher Mohammad, Ammar Ali, Stamatios Lefkimmiatis2026-09-22조회 9

무엇인가

이 논문은 사후 학습(post-training) 압축, 그중에서도 가중치 행렬 분해를 다룬다. 트랜스포머는 깊은 스택 전반에 걸쳐 레이어 간 중복이 자연스럽게 생기는데, 기존 압축 파이프라인은 각 레이어를 따로 최적화하거나 인접 레이어를 묶는 식의 휴리스틱 그룹핑에 의존해 왔다. 저자들은 이 두 가지 접근이 레이어별 활성값 분포, 즉 활성값 기하를 무시한다고 지적한다. 특히 최근의 Basis Sharing 계열 방법은 레이어별 공분산을 전역 화이트닝 변환으로 평균 내고 공유를 인접 레이어로 제한하는데, 논문은 이것이 (1) 레이어 고유의 활성값 기하를 왜곡하고 (2) 인접하지 않은 정렬 가능한 쌍을 놓친다고 본다. GeoPair는 이 휴리스틱을 최적화 문제로 대체하자는 제안이다.

어떻게 동작하나

출발점은 압축을 캘리브레이션 집합에 대한 활성값 재구성 문제로 보는 것이다. 가중치 W에 대해 활성값 X가 있을 때 목적식은 ||X(W-Ŵ)||² + η||W-Ŵ||²이고, 이는 Tikhonov 정규화된 그램 행렬 G_η = XᵀX + ηI의 촐레스키 분해 G_η = LᵀL로 만든 화이트닝 공간에서 ||L(W-Ŵ)||²를 최소화하는 것과 수학적으로 동일하다. 즉 레이어마다 다른 L이 곧 그 레이어의 활성값 기하를 담는 좌표계가 된다. GeoPair는 이 L을 하나로 합치지 않고 각 레이어의 것을 그대로 유지한 채 공유 구조를 찾는다.

무엇과 다른가

핵심 구성은 두 레이어의 가중치 W1, W2가 하나의 공유 사전 D와 레이어별 계수 C1, C2로 표현되는 결합 분해다. 목적식은 ||L1W1 - L1DC1||² + ||L2W2 - L2DC2||²이며, D와 C에 대해 이중 볼록이므로 교대 최소화로 푼다. 계수 갱신은 가중 최소제곱의 닫힌 형태 해로 끝나고, 사전 갱신은 두 항을 가진 일반화 실베스터 방정식으로 정리된다. 저자들은 두 행렬 펜슬의 동시 대각화를 이용해 이 방정식을 독립적인 스칼라 방정식으로 분리하고, 반복 최적화나 스텝 크기 튜닝 없이 결정적인 닫힌 형태 해를 얻는다. 이 교대 스킴은 목적 함수의 단조 감소와 블록 정상점 수렴이 보장된다고 주장한다.

어떻게 쓰나

압축률을 더 끌어올리기 위해 계수 갱신에 ℓ0 제약(열마다 비영 원소 개수 k_i 이하)을 걸고, 이를 Hard Thresholding Pursuit로 푼다. 그라디언트 스텝, 각 열에서 크기 상위 k_i개를 남기는 지지집합 선택, 선택된 지지집합 위에서 켤레 기울기(CG) 솔버로 다시 푸는 제한 투영의 세 단계다. k_i를 사전 크기 r과 같게 두면 이 절차는 자연스럽게 기존 닫힌 형태 촐레스키 갱신으로 퇴화한다. 레이어 짝짓기는 별도의 전역 최적화다. 두 가중치의 화이트닝 공간에서 정규화된 프로베니우스 부분행렬 거리를 정의하고(출력 차원이 다르면 짧은 쪽을 긴 쪽 위로 슬라이딩), 이를 1D 상호상관으로 O(d·d_j)에 계산한다. 그 위에 완전 그래프를 만들어 최대 가중 매칭 문제를 Edmonds의 Blossom 알고리즘으로 정확히 푼다. 주목할 점은 같은 서브모듈 종류로 제한하지 않아, 입력 차원 d만 같으면 어텐션과 피드포워드 가중치도 짝이 될 수 있다는 것이다.

전제와 한계

실험은 7개 벤치마크에서 이뤄졌다. Llama-3 1B와 8B에서의 구성요소 절제에서 전역 화이트닝을 실베스터 기반 정식화로 바꾸는 것만으로 정확도가 크게 회복되고, 최적 그룹핑을 더하면 제로샷 성능이 추가로 오르며, HTP 희소화까지 포함한 전체 구성이 비압축 기준 정확도의 90% 이상을 회복한다고 보고한다. 희소화 파이프라인에서 그룹핑을 빼면 성능이 떨어져, 짝짓기가 계수 복구에 필수적이라는 근거로 제시된다. 밀집 저랭크와 희소 사전학습 계열을 아우르는 구조적 분해 방법들과의 비교에서 GeoPair가 가장 높은 정확도를 냈고, 행렬 분해 외의 압축·가지치기 기법들과의 비교에서도 사후 파인튜닝 없이 최고 평균 정확도를 기록했다고 한다. 다만 본문에 인용된 범위에서는 표의 구체적인 수치가 제시되지 않고, 1B부터 32B까지 압축률 0.2/0.3/0.4에서 Basis Sharing과 비교한 결과와 절제 실험 결과가 정성적으로 서술된다.

교차 과제 일반화 검증으로 영상 생성 모델 Wan2.2 5B를 20%와 40% 압축했고, 사후 보정 없이도 고품질 생성을 유지했다고 한다. Rapidata/awesome-text2video-prompts의 프롬프트 50개에 대해 16프레임 샘플링으로 X-CLIP 점수를 측정한 결과, 20% 압축에서 0.2164로 기준 0.2165 대비 1×10⁻⁴만 하락했고 40% 압축에서도 0.2111로 상대 2.5% 하락에 그쳤다. 절제 실험에서는 KS 비율(사전 원자 수 대비 계수 행렬 열당 비영 원소 수)이 2.5일 때 가장 좋았고, 이 값을 모든 희소화 실험의 기본값으로 쓴다고 밝힌다.

실무 관점에서 이 논문의 값어치는 레이어를 하나씩 SVD로 자르는 방식의 한계를 정면으로 다룬다는 데 있다. 캘리브레이션 데이터만 있으면 파인튜닝 없이 적용할 수 있고, 레이어 쌍을 데이터 기반으로 고르기 때문에 모델 구조별 수동 규칙을 줄일 수 있다는 것이 저자들의 주장이다. 도입을 검토한다면 확인할 것은 세 가지다. 첫째, 캘리브레이션 활성값의 품질과 η, ε 같은 정규화 상수에 결과가 얼마나 민감한지(논문은 부록 D에서 캘리브레이션 민감도와 수렴을 다룬다고만 언급한다). 둘째, 어텐션과 FFN을 넘나드는 짝짓기가 실제 서빙 파이프라인의 가중치 레이아웃과 커널에 맞는지. 셋째, KS 비율 2.5 같은 하이퍼파라미터가 자신의 모델·압축률에서도 유효한지다.

저자들이 명시한 가장 큰 한계는 짝짓기가 두 레이어 단위라는 점이다. 세 개 이상의 레이어가 사전을 공유하는 m-way 확장은 닫힌 형태 실베스터 해가 두 행렬 펜슬의 동시 대각화에 의존하기 때문에 해석적으로 일반화되지 않는다. 다중 그룹으로 확장하려면 반복적 수치 근사나 고차 텐서 분해가 필요하고, 이는 추가 계산 비용과 수치적 불안정성을 낳는다. 저자들은 이를 향후 핵심 과제로 남긴다.

관련 논문