파라미터 수 대신 특이값 스펙트럼으로 Transformer 구조를 채점하는 NSC
Neural Spectral Capacity: Measuring and Designing Architectures from Network Specification Alone
무엇인가
Transformer 설계와 압축은 결국 "고정된 파라미터·연산 예산 아래에서 용량을 어느 구성요소에 얼마나 배분할 것인가"라는 하나의 질문으로 환원된다. 사전학습 단계에서는 깊이-너비 트레이드오프, FFN 비율, GQA/MQA 같은 어텐션 헤드 공유, MoE의 레이어별 전문가 배분이 이 질문이고, 사후 압축 단계에서는 배포 예산 아래 어떤 구성요소를 남길지가 같은 질문을 뒤집어 놓은 것이다. 실무자에게 주어진 표준 스칼라는 #Params와 #FLOPs뿐인데, 이 둘은 크기와 연산량은 알려주지만 구조에 대해서는 아무 말도 하지 않는다. 파라미터 예산이 같은 두 아키텍처가 깊이-너비 배분이나 헤드 배분, FFN 비율을 다르게 가져가면 같은 점수를 받지만 학습·배포 시 동작은 달라진다. 논문은 "명세만으로 계산 가능하면서 구조를 반영하는 스칼라가 있는가"를 묻는다.
어떻게 동작하나
제안하는 NSC(Neural Spectral Capacity)는 각 가중치 행렬의 특이값 스펙트럼에 근거한다. 가중치 행렬 W를 선형 가우시안 채널 y=Wx+z로 보고, x~N(0,I), z~N(0,I)일 때 상호정보량이 I(x;y)=½ln det(I+WᵀW)=½Σ ln(1+σ_i²)로 닫힌 형태를 갖는다는 점을 출발점으로 삼는다. 상수 ½을 떼고 ψ(W)=ln det(I+WᵀW)=Σ ln(1+σ_i²)를 한 행렬의 스펙트럼 용량으로 정의한다. 특이값이 0이면 기여도 0이라 랭크 결손 행렬에서도 정의된다. 저자들은 ψ가 파라미터 수의 재표현이 아님을 강조한다. 같은 4096×11008 크기의 LLaMA-7B FFN 행렬도 풀랭크면 ψ≈3174, 랭크-1 절단이면 ψ≈2.5로 1270배 차이가 난다.
무엇과 다른가
핵심은 이 값을 모델을 만들지 않고 계산하는 것이다. 표준 랜덤 초기화에서 W의 원소가 i.i.d. 평균 0, 분산 s²이면 Marchenko-Pastur 정리에 따라 정규화된 제곱 특이값 분포가 결정적 법칙으로 수렴하고, 그 법칙에 ln(1+Ms²λ)를 적분한 값이 닫힌 형태로 나온다(정리 1). 즉 ψ_MP(m,n,s)=N·I(γ, Ms²)로, 행렬의 차원과 초기화 분산만의 함수가 된다. 저자들은 이 극한값을 근사가 아니라 정의로 삼는다. min(m,n)=128에서 SVD 기반 값 대비 상대오차가 0.4% 미만, 1024에서 약 10⁻⁴ 수준이다. 네트워크 점수는 행렬→레이어→네트워크 순으로 합산한다. 멀티헤드 어텐션은 헤드별 Q/K/V 투영을 따로 세고(헤드 수 차이를 구분하기 위해), 컨볼루션은 im2col 형태로 재배열하며, 임베딩·바이어스·정규화·비선형성은 제외한다. 레이어 용량은 그 레이어 행렬들의 합이고, 이는 블록대각 행렬의 로그-디터미넌트와 같다. 네트워크 NSC는 레이어 용량의 합이다.
어떻게 쓰나
레이어별 가산성 덕분에 자원 제약 하 NSC 최대화가 bounded/multiple-choice knapsack으로 환원되고, 동적계획법으로 정확히 풀린다. NSC-DP는 네트워크 수준 결정 g(깊이, 스테이지 레이아웃, 임베딩 크기 등)를 열거하고, g가 고정되면 레이어별 문제를 DP로 푼다. 저자들이 내세우는 네 가지 성질은 전역 최적성(단, 프록시 목적함수에 대한 전역 최적이며 아키텍처 설계 문제 자체의 최적은 아니다), 다중 예산 탐색(DP 테이블 하나로 이산화된 예산 격자 전체의 파레토 프런트를 O(B) 조회로 얻음), 효율성(ψ_MP 한 번이 약 10μs의 1D 수치 적분이고 캐시 재사용 가능, 10³² 규모 탐색 공간을 CPU 한 코어에서 수 초에 탐색), 일반성(점수가 레이어별 독립 기여의 합으로 분해되고 제약이 레이어별 비용의 합이면 적용 가능)이다.
전제와 한계
랭킹 실험은 FlexiBERT 500개 BERT, LiteTransformerSearch의 GPT-2 200개, AutoFormer-Tiny ViT 1001개, NATS-Bench-SSS CNN, MobileNetV3(OFA) 다섯 계열에서 #Params, #FLOPs, 그리고 W-PCA·ZeroLM·SNIP·GradNorm 같은 학습 없는 프록시와 비교했다. FlexiBERT에서 NSC는 Kendall τ=0.695로 #Params 0.485, #FLOPs 0.552를 앞선다. 특히 파라미터 수 차이가 10% 미만인 쌍만 남긴 10%-PW 조건에서 #Params가 τ=0.082로 무너지는 동안 NSC는 0.505를 유지한다. 이 패턴은 AutoFormer-Tiny(0.503 대 0.322), NATS-Bench-SSS(0.372 대 0.116), MobileNetV3(0.535 대 0.414)에서도 반복된다. 학습 없는 프록시와 비교해도 FlexiBERT에서 W-PCA를 +0.060, ZeroLM을 +0.168 앞서고, AutoFormer-Tiny에서는 W-PCA 대비 +0.110이며, GPT-2에서는 W-PCA와 0.03 이내로 경쟁하면서 계산 시간은 몇 자릿수 낮다. 아키텍처당 비용은 마이크로초 수준이다.
설계와 압축 실험도 같은 방향을 보인다. Transformer-XL(WikiText-103, 비임베딩 파라미터 38.4M±5%)에서 NSC-DP가 찾은 구조는 테스트 PPL 23.087로 Transformer-XL Base 23.279, Synaptic Diversity 23.135보다 낮았고, 탐색은 CPU에서 2.0초로 학습 없는 프록시 기반 탐색(883~965초)보다 400배 이상 빨랐다. AutoFormer-Tiny에서는 하루 규모의 AutoFormer 오라클과 정확도 0.03 포인트 이내로 맞추면서 탐색 비용을 여섯 자릿수 줄였고 Acc@1에서 휴리스틱 대안들을 앞섰다. LLaMA-7B 구조적 프루닝(LoNAS SuperNet, 5.7B 예산, 블록별 LoRA 랭크 {32,28}과 FFN 중간 차원 {11008,9632,8256,6880,5504})에서는 8개 상식 추론 과제 평균 Avg8에서 W-PCA를 +1.64pp 앞서며 모든 개별 과제에서 베이스라인을 이겼다. 프루닝은 CPU 스레드에서 0.46초로 GradNorm(22분)보다 약 2800배, W-PCA(45분)보다 약 5900배 빨랐고, 캘리브레이션 데이터가 전혀 필요 없었다. 같은 DP 역방향 패스가 모든 도달 가능 예산의 최적점을 담고 있어 1.29~1.41 TFLOPs 구간의 7개 운영점을 추가 탐색 없이 읽어낼 수 있다.
개발자 관점에서 유용한 지점은 두 가지다. 첫째, 파라미터·FLOPs 예산이 이미 고정된 상황에서 깊이/헤드/FFN 비율 같은 구조 선택지를 비교할 때 #Params와 #FLOPs는 후보들을 구분하지 못하지만 NSC는 구분한다. 둘째, 후보를 실제로 인스턴스화하지 않으므로 GPU 없이 CPU 한 코어에서 수 초 만에 예산별 최적 배분을 뽑을 수 있다. 다만 NSC가 예측하는 것은 "그 명세로 학습했을 때의 품질 순위"이지 절대 성능이 아니며, 순위 보존은 검증된 범위(벤치마크별 Spearman ρ 0.78~0.97) 안에서의 이야기라는 점을 확인해야 한다. 도입 전에는 자신의 검색 공간이 NSC-DP의 두 전제(점수의 레이어별 가산 분해, 제약의 레이어별 비용 합)를 만족하는지부터 따져야 한다.
저자들이 명시한 전제와 한계도 분명하다. 레이어 간 합산은 경험적으로 동기를 부여한 모델링 선택이며, 레이어가 순차 실행된다는 사실을 감안할 때 순전파 전체의 상호정보량을 주장하는 것이 아니다. 합산 규칙이 평균적으로 가장 좋았고 병목(min) 규칙은 FlexiBERT 500개 아키텍처에 22개의 서로 다른 점수만 부여하며 AutoFormer-Tiny에서 역상관으로 무너졌다는 점을 근거로 든다. 모든 후보에 동일한 초기화 프로토콜을 고정해야 점수 차이가 아키텍처를 반영하며, 어떤 고정 스킴을 쓰든 순위는 대체로 보존된다고 부록에서 밝힌다. ψ는 학습이 덮어쓸 랜덤 초기화 가중치에서 계산되므로, 학습이 진행돼도 순위가 보존됨을 보이지만(10개 아키텍처에서 ρ(ψ0,ψT)=1.00, 대규모 실험에서 Spearman 0.78~0.97) 이는 경험적 관찰이다. MP 극한은 점근 결과이므로 작은 차원에서는 오차가 커진다. NSC-DP의 전역 최적성은 프록시 목적함수에 대한 것이지 실제 아키텍처 설계 문제의 최적성이 아니다. 임베딩·바이어스·정규화·비선형성은 점수에서 제외된다.