트랜스포머 잔차 표현은 깊어지며 자기 끝점에 특화된다
The Geometry of Inference in Transformer Residual Streams
무엇인가
트랜스포머 언어 모델은 잔차 업데이트를 거듭하며 다음 토큰 예측을 만든다. 기존 연구는 중간 상태에서 최종 토큰 예측 정보를 디코딩할 수 있다는 것(Belrose et al., 2023; Ali et al., 2025), 그리고 최종 표현에 출력과 관련된 기하학적 구조가 있다는 것(Park et al., 2025)을 보였다. 하지만 중간 상태가 자기 문맥이 도달할 최종 표현을 다른 가능한 최종 표현들로부터 얼마나 선택적으로 구분하는지, 그 구분이 깊이에 따라 어떻게 변하는지는 열려 있었다. 이 논문은 중간 잔차 상태가 가능한 최종 상태들 사이의 부분적 구분을 표현하고, 잔차 업데이트가 상대적 기하를 바꾸며 그 구분을 정교화한다는 '기하학적 추론 가설'을 세운다.
어떻게 동작하나
방법의 핵심은 고정된 끝점 은행(endpoint bank)이다. 각 문맥의 마지막 입력 위치에서 최종 블록 이후, 최종 정규화 이전의 잔차 상태를 그 문맥의 '자기 끝점'으로 두고, 다른 문맥들의 최종 잔차 상태를 대안 끝점으로 모은다. 어떤 대안 끝점이 현재 중간 상태에 자기 끝점보다 더 가까우면 그 대안을 경쟁자로 정의하고, 경쟁자 비율(경쟁자 수/대안 수)을 기하학적 특화도로 삼는다. 거리는 유클리드 거리(자기 끝점의 노름으로 나눠 정규화)와 코사인 거리 두 가지를 쓴다. 자기 끝점이 평균적 대안보다 가까운지를 보는 평균 선호 마진도 함께 계산한다. Gemma-2B·Gemma-7B, Qwen2.5-1.5B·Qwen2.5-7B, Mistral-7B, Llama-3-8B 여섯 모델에서 FineWeb sample-10BT의 겹치지 않는 256토큰 문맥 1,024개씩을 사용했고, 각 질의마다 대안은 1,023개다.
무엇과 다른가
결과적으로 여섯 모델 모두, 두 거리 지표 모두에서 측정 가능한 가장 이른 블록 이후 상태부터 자기 끝점에 대한 평균 선호가 양수로 나타났다. 그러나 평균적 선호가 감지된 뒤에도 개별 경쟁자는 많이 남는다. 유클리드 거리에서는 다섯 모델이 깊이의 상당 구간에서 수백 개의 경쟁자를 유지한다. 코사인 경쟁은 유클리드 경쟁보다 더 이른 깊이에서 줄어들고, Mistral-7B와 Llama-3-8B의 중간 레이어처럼 유클리드 거리가 거의 평평한 구간에서도 방향 정렬은 좋아질 수 있다. 더 중요한 것은 경쟁 집합의 구성이 바뀐다는 점이다. 코사인 경쟁 집합은 평균 크기가 줄어드는 깊이 구간에서도 새로 들어오는 끝점(entry)과 빠져나가는 끝점(exit)이 모두 관측되며, Qwen2.5-1.5B에서 회전이 특히 지속적이다. 유클리드 집합은 경로 대부분에서 중첩(nested)에 가깝고 주로 끝부분에서 변한다. 문맥 통제 실험에서 질의와 같은 문서의 끝점을 제외해도 코사인 선호와 경쟁자 비율 곡선은 거의 그대로였고, 같은 입력 토큰으로 끝나는 문맥만 남겨도 첫 측정 레이어부터 선호가 유지됐다(다만 마진은 작아지고 경쟁자는 더 남는다). 각 상태에서 입력 토큰 임베딩 방향 성분을 제거해도 여섯 모델 모두 1층 코사인 선호가 유지됐다.
어떻게 쓰나
이론 부분은 관측된 현상을 세 가지로 분해한다. 먼저 각 비교를 부호 있는 마진으로 쓰면, 잔차 업데이트가 끝점 차이 방향에 양으로 투영될 때 해당 마진이 커진다. 하나의 업데이트가 어떤 끝점에 대한 선호는 강화하고 다른 끝점에 대해서는 약화할 수 있으므로 경쟁자가 동시에 빠지고 들어올 수 있다. 자기 끝점을 향한 직선 경로를 가정하면 두 거리 지표 모두에서 경쟁 집합이 중첩되어야 함을 증명하는데, 관측된 entry들은 이 직선 수렴 기준선에서 벗어난다는 것을 뜻한다. 다음으로 유클리드 거리는 방향과 크기를 섞기 때문에, 노름비 r/R = 2c인 경로에서는 정렬 c가 커져도 정규화 거리가 1로 일정하게 유지될 수 있음을 보인다. 마지막으로 공유 축 고차원 모델에서 끝점을 y_j = R(ρm + √(1-ρ²)v_j), 중간 상태를 x = r(bm + √(1-b²)w)로 분해하면 기대 경쟁자 수는 M·F̄_D(a)가 된다. a가 양수면 자기 끝점이 평균적으로 유리하지만, 0 < a ≪ D^(-1/2)이면 경쟁자 비율은 여전히 1/2에 가깝다. 즉 아주 작은 정렬 변화가 고차원에서 경쟁 질량을 급격히 떨어뜨릴 수 있고, 감소율은 -d/dt log E[N<(t)] = f_D(a(t))/F̄_D(a(t)) · a'(t)로 주어진다.
전제와 한계
끝점 분포 자체가 경쟁을 예측하는지도 실험했다. 균일 구면, 구면 캡, 단일 von Mises–Fisher, vMF 혼합, projected-normal 다섯 분포족을 최종 끝점만으로 적합하고(문서를 약 60/20/20으로 나눠 학습·검증·테스트), 각 분포에서 대안 256개를 샘플링해 고정된 중간 상태와 자기 끝점을 따라 경쟁자 비율을 예측했다. 적합도 진단에서 최고 점수는 균일 구면 대비 4.6~7.5배 개선됐다. 예측 정확도는 로그 스케일 평균 절대 차이(ε=10^-3, 최종 레이어 제외)로 측정했는데, projected-normal이 여섯 모델 중 다섯에서 가장 낮은 오차를 냈고 Gemma-7B에서는 vMF 혼합이 근소하게 앞섰다(다른 모델에서는 vMF 혼합이 2위). 두 모델 모두 캡과 단일 vMF를 모든 아키텍처에서 앞섰고, 균일 구면은 다섯 모델에서 오차가 가장 컸다. 즉 방향 구조를 포착하는 것만으로도 실제 잔차 궤적 위의 경쟁 질량을 더 잘 예측한다.
출력 조직과의 연결도 보고된다. 여섯 모델 전부에서 질의 문맥 아래 확률이 낮은 순위의 출력 토큰에 대응하는 끝점일수록 코사인 거리 기준으로 더 멀리 위치했다. 같은 최상위 예측 토큰을 공유하는 끝점들은 평균적으로 더 조밀했고, 끝점 거리가 클수록 출력 분포 간의 괴리도 컸다. 다만 저자들은 기하학이 모델 출력 변동의 일부만 설명한다고 명시하며, 경쟁자 비율을 보정된 토큰 확률로 취급하지 않는다고 못박는다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 중간 레이어를 '얼마나 일찍 믿을 수 있는가'라는 질문에 거리 하나로 답하면 안 된다는 것이다. 자기 끝점까지의 유클리드 거리는 평평한데 방향 정렬과 경쟁자 수는 계속 개선될 수 있고, 경쟁자 수가 줄어드는 구간에서도 집합 구성은 계속 바뀐다. 따라서 조기 종료, 레이어 스킵, 중간 레이어 로짓 렌즈 같은 기법을 설계할 때는 거리·경쟁자 수·생존 끝점의 집중도를 서로 다른 지표로 함께 봐야 한다. 또한 끝점 분포의 방향 구조를 반영한 기준선이 균일 구면보다 예측이 낫다는 결과는, 모델별로 끝점 통계를 한 번 적어 두고 재사용하는 진단 도구가 유효할 수 있음을 시사한다.
한계도 분명하다. 적합된 끝점 분포는 관측된 궤적 위의 경쟁을 예측할 뿐, 잔차 업데이트가 언제 어떤 이유로 발생하는지는 설명하지 않는다. 경쟁 집합은 은행 구성과 거리 지표에 의존하며, 자기 끝점에 도달하면 정의상 크기가 0이 된다. 관측된 회전(turnover)은 모델 내부에 명시적인 탐색 과정이 있다는 증거가 아니며, 기하학적 선호의 변화가 실제 토큰 예측을 바꾸는지는 경쟁 마진이 교차하는 지점 근처에서 개입 실험을 해봐야 확인할 수 있다고 저자들은 남겨 둔다.