출력 Fisher-Rao 기하학으로 언어모델의 공유 구조·학습·최소 교란 제어를 통합한 연구
The information geometry of large language models is shared, learned, and controllable
무엇인가
언어모델은 서로 다른 아키텍처와 토크나이저로 학습되는데도 비슷한 예측 행동을 보인다. 그런데 그들이 공유하는 구조가 무엇인지, 그리고 하나의 행동을 바꾸면서 다른 행동을 건드리지 않으려면 무엇을 기준으로 삼아야 하는지는 불분명했다. 이 논문은 다음 토큰 확률분포 위의 Fisher-Rao 기하학이 그 질문들을 연결한다고 주장한다. 핵심 논거는 표현 공간에는 특권적 좌표가 없지만 행동 공간에는 있다는 것이다. 은닉 활성값은 역가역 선형변환 GL(d)만큼의 게이지 자유도를 가지므로, 유클리드 거리와 내적에 기반한 활성값 거리, 특징 중요도, 조향, 미세조정 정규화는 재매개변수화에 불변하지 않다. 반면 Chentsov 정리에 따르면 통계적 정보를 보존하는 변환에 불변한 계량은 Fisher-Rao 계량이 스케일을 제외하고 유일하다.
어떻게 동작하나
구체적인 방법은 다음과 같다. 개입 층의 활성값 h에 대해 최종 은닉 상태 h_L(h)와 언임베딩으로 정의되는 출력 법칙 p_h = softmax(W_U h_L(h) + b_U)를 두고, 출력 Fisher H_h = Cov_{p_h}(w)를 계산한 뒤 야코비안 J_h = ∂h_L/∂h로 당겨온 풀백 계량 G_h = J_h^T H_h J_h를 쓴다. 이 계량이 국소 출력 변화를 측정한다는 것은 KL(p_h || p_{h+δh}) = (1/2) δh^T G_h δh + O(||δh||^3)로 제시된다. 목적 함수 기울기 q에 대한 감쇠 자연그래디언트 δh ∝ (G + αR)^{-1} q는 좌표 공변적이어서, 시드된 재매개변수화 계열로 옮겨도 원래 방향을 10^{-12} 이하로 재현하는 반면 R을 항등행렬로 되돌리면 방향이 오더 1만큼 바뀐다. 저자들은 행동만으로 기하학을 식별할 수 있다는 것도 보인다. 언어가 정하는 read-out 부분공간 T와 후보 S의 chordal 거리 d(S,T)에 대해, 잉여 매개변수를 최적화해 없앤 뒤의 예측 위험 K(S)가 K(S) ≥ c d^2(S,T)라는 전역 이차 마진을 따른다는 것이다. 여기서 c는 참조 법칙과 문맥 가중치가 정하는, 단위 제곱 부분공간 이동당 예측 비용의 인증된 하한이다.
무엇과 다른가
모델 간 공유는 공통 문맥 배터리에서 각 모델이 다음 토큰 분포 사이의 Fisher-Rao 거리 행렬을 만들고, 행렬 상삼각의 Spearman 상관으로 비교하는 방식으로 측정된다. 토크나이저나 아키텍처, 활성값 정렬이 필요 없다. 트랜스포머, 상태공간, 순환 모델을 아우르는 10개 모델, 7개 학습 파이프라인, 4개 토크나이저, 70M~7B 파라미터에서 자연 텍스트 평균 순위 일치도는 0.88이었고, 중간층 활성값 기하학은 0.62, 마지막 층은 0.61이었다. 부트스트랩 구간이 이 격차에서 0을 배제한다. 같은 토크나이저 쌍에서 데이터 의존 인증서는 하한 0.61~0.67을 주는데 관측치는 0.76~0.83이었다. 즉 문맥별 불일치(중앙 root-probability 거리 0.30~0.71)는 크지만 그 불일치 방향이 관계 구조와 거의 직교한다(코히어런스 약 0.03). 토크나이저 독립 검사로 각 다음 토큰 법칙을 남은 텍스트 첫 바이트 분포로 사상했을 때 교차 토크나이저 일치도는 0.91이었다. 인간 데이터와의 비교도 있다. 512개 문장 문맥에서 모델 표본으로 추정한 의미 분포와 인간 완성의 평균 제곱 거리는 70M에서 약 0.34, 2.8B에서 0.30으로 규모가 커질수록 줄었고, 신뢰도 보정된 관계 기하학 정렬은 0.82~0.85였다. 별도 384 문맥 배터리에서 Pythia 크기와 체크포인트로 적합한 위험-정렬 관계가 재적합 없이 OLMo와 외부 5개 모델을 상관 0.76, RMSE 0.029로 예측했다. 1,726개의 인간 다음 단어 예측 데이터에서도 7개 계열 중 6개에서 모델 유래 주도 방향이 인간 방향 구조를 무작위 부분공간 통제보다 잘 복원했다.
어떻게 쓰나
기하학은 언어 통계를 물려받는다. 출력 Fisher 고유값은 국소 출력 효과 순으로 방향을 정렬하고, 감쇠가 유효 차원을 정의한다. 중심화·정규직교화한 read-out 행 u_a와 u_bar = Σ p_a u_a로 프로파일 q_a = p_a ||u_a - u_bar||^2를 만들면, 적합 파라미터 없이 유효 차원 N_eff(α) = Σ_k q_(k)/(q_(k)+α)를 예측한다. 측정 고유값을 넣으면 N_eff(α) = Σ λ_k/(λ_k+α)가 항등식으로 성립한다. 고유값은 랭크 2~80 구간에서 λ_i ~ i^{-β}, β≈1로 떨어지고, 이 지수는 모델 자신의 가중 토큰 프로파일 지수를 따라간다(중앙 편차 0.04, r=0.91). BLOOM, GPT-Neo, Mamba, Qwen2, RWKV 등 5개 외부 계열 9개 모델의 64문맥 배터리에서, 고유 스펙트럼을 보기 전에 고정한 프로파일 예측이 랭크 8~32에서 계열 중앙 오차 0.0617~0.0884 decades, 배수 편차 1.15~1.23배, 스펙트럼 지수 오차 0.0623~0.0856을 냈고, N_eff 곡선은 RMSE 0.0270~0.0521로 예측했다. 같은 트레이스의 평탄 스펙트럼 대비 4.89~9.22배, 랭크를 섞은 프로파일 대비 13.55~25.63배 낮은 오차다. 7개 계열 14개 모델, 192개 새 문맥의 비교에서는 확률만 쓴 프로파일이 유효 차원을 더 잘 맞추고, read-out 방향까지 포함한 가중 프로파일이 스펙트럼 지수를 더 잘 맞췄다. 즉 확률 집중도는 해상되는 모드 수를, read-out 구조는 그 강도가 어떻게 감쇠하는지를 설명한다.
전제와 한계
말뭉치 n-gram 통계는 습득 시점을 예측한다. 학습 전에 측정한 unigram·bigram·trigram 마진이 재적합 없이 새 사실의 전체 궤적을 예측했고, 세 모델 크기에서 궤적 R² 0.775~0.792, 습득 상태 일치 0.792~0.854, 연속 시점 오차 0.77~0.96 log2 학습 스텝이었다. 인과 실험도 있다. 동일한 사실을 얕은 증거 구성과 깊은 증거 구성에 무작위 배정하고 초기 가중치와 배치 스트림을 짝지으면, 지정된 깊이 미만에서는 두 답을 구분하는 통계가 없다. 10~20 백분위에서 깊은 증거의 습득 시점 분위는 얕은 증거의 약 4.3배였고, 이는 log2 학습 스텝 기준 2.10의 거의 균일한 이동이다. GPT-2, GPT-NeoX, Llama 스타일 디코더와 두 개의 통제 언어를 완전 교차한 무작위 연구에서도 깊은 구성이 모든 셀에서 지속적 습득을 0.81~1.51 log2 스텝, 즉 1.75~2.86배 더 많은 스텝만큼 지연시켰다. 6개 95% 구간 모두 0을 배제한 반면 12개 고정 처리·라벨 무작위화 통제 구간은 모두 0을 포함했다. 누적 습득 사실 수를 학습 스텝이 아니라 held-out 손실로 정렬하면 70M에서 160M 비교에서 300개 중 중앙 절대 오차 2.1개로, 스텝 정렬보다 약 3배 낮았다.
기하학은 최소 교란 개입과 그 상대 비용을 규정한다. A = G + αR이 양정치일 때 목적 기울기 q와 목표 변화 q^T δ = b에 대해 유일한 최소 교란 스텝은 δ* = b A^{-1}q/(q^T A^{-1}q)이고 최소 정규화 비용은 b²/(2 q^T A^{-1}q)다. 다른 어떤 실행 가능한 스텝도 이 최적점으로부터의 A-거리 제곱의 절반만큼 초과 비용을 낸다. 유한 감쇠에서 실현될 출력 교란을 예측하려면 Π_G(u) = (u^T G u)/(q^T u)^2를 두고 R_pred(q) = Π_G(q)/Π_G(A^{-1}q)를 쓴다. 6개 아키텍처 계열 11개 모델, 3개 조향 목적, 3개 상대 층 깊이에서 개입 전에 계산한 이 비율이 1,188개 셀의 3,515개 측정(98.6% 커버리지)을 추적했고, 측정 대 예측 비율 중앙값 0.967(95% 구간 0.957~0.975), log-log 기울기 0.982(0.966~0.997)였다. 유한 경로에서는 216개 프롬프트, 18개 모델-목적 셀에서 Fisher 경로가 유클리드 경로보다 국소 KL을 약 11~127배 적게 누적했다. 재사용 제어도 된다. 목적당 4개 기증자 프롬프트로 추정한 업데이트를 목표 기울기 없이 8개 미지 프롬프트에 그대로 적용했고, 참조 프롬프트의 행동을 유클리드 제어보다 잘 보존했다. 같은 보정이 조향, 지식 편집(GPT-2의 CounterFact 30개 홀드아웃 편집, GPT-2-XL의 100개·300개 편집), 특징 귀속(SAE 특징을 0으로 제거할 때 1/2 Δh^T G Δh로 비용 예측), 사전학습(top-k SAE 디코더 업데이트를 코드 기하 자연그래디언트로 전처리하고 Woodbury 해로 행렬을 만들지 않음), LoRA(Pythia-70M rank-4, 8개 외부 시드, 16개 보존 프롬프트)에 적용됐다.
실무적으로 이 논문이 주는 메시지는 활성값 공간의 유클리드 기하학을 기본값으로 쓰지 말라는 것이다. 조향 벡터를 만들거나, SAE 특징을 제거하거나, LoRA 정규화를 설계할 때 활성값의 유클리드 노름 대신 출력 Fisher 계량 G = J^T H J를 풀백해 쓰면 같은 목표 변화에 대해 다른 토큰 분포의 교란을 줄일 수 있고, 그 이득을 개입 전에 R_pred로 예측할 수 있다. 또한 기증자 프롬프트 몇 개로 참조 계량을 평균해 두면 목표 프롬프트마다 다시 풀지 않고도 전이되는 업데이트를 얻는다. 다만 계량은 개입 층과 목적 함수에 의존하므로, 어느 층에서 무엇을 목적 q로 삼았는지 기록해야 재현이 된다. 자연그래디언트 스텝이 유클리드 스텝과 같아지는 조건은 개입 층에서 G ∝ R이거나 목적 q의 지지가 하나의 일반화 고유공간에 들어가는 경우이며, H만 조건을 걸면 J가 스케일 등거리사상이 아닌 한 불충분하다는 점도 기억할 만하다.
저자가 밝힌 전제와 한계도 분명하다. 식별 정리는 유한 지지집합과 역차트 조건을 전제하고, 이차 마진의 상수 c는 참조 법칙과 문맥 가중치에 의존한다. 활성값 기하학의 게이지 자유도는 완전한 GL(d)다. 계산은 대부분 float32로 수행됐고 float64 예외가 프로토콜별로 명시되어 있으며, GPU 상주 풀백 풀이는 2.8B 파라미터까지 적합하지만 6.9B에서는 그래프 없는 스펙트럼과 CPU 기반 풀백 보정·오프로드 분석으로 증거가 제한된다. 모델 간 공유에서 잔차 고유벡터 공유는 원시 중첩의 약 9%에 불과하고 선행 모드에 집중된다. 인간 로그 점수 보정은 7개 계열 중 6개에서 개선됐지만 Qwen2는 -0.0030 nats로 악화됐다. LoRA 실험의 과제 전이와 능력 보존 종점은 더 넓은 결론을 지지하지 못해 국소 보존 결과로 제한해 보고했다. 코드와 파생 데이터는 공개 저장소가 아니라 요청 시 제공으로 되어 있어 완전한 재현에는 저자 협조가 필요하다.