트랜스포머 업데이트를 평행·수직 성분으로 분해해 편집 취약성, 압축 진단, 사전학습 개입을 하나의 기하학으로 설명한 연구

Disentangling Representation Evolution in Transformers through Directional Decomposition

HF Daily2609.15975

Shwai He, Haichao Zhang, Shen Yan2026-09-14조회 4

무엇인가

트랜스포머 레이어는 잔차 스트림 위에 학습된 덧셈 업데이트를 쌓아 표현을 진화시킨다. 이 논문은 그 업데이트를 기하학적으로 두 역할로 나눈다. 들어오는 표현의 방향을 유지한 채 크기만 조절하는 평행 성분과, 표현을 새로운 의미 부분공간으로 회전시키는 수직 성분이다. 문제 제기는 여기서 나온다. 평행 업데이트는 결국 스칼라 재스케일링일 뿐이고, 잔차 연결이 파라미터 비용 0으로 이미 그 기능을 제공한다. 그런데도 파라미터가 많은 어텐션과 MLP 서브레이어가 굳이 용량을 할당해 평행 성분을 만들어낸다. 저자들은 이 역설을 "행동적으로 필수인가, 기능적으로 중복인가"라는 질문으로 정식화한다.

어떻게 동작하나

방법의 핵심은 직교 분해다. 기준 벡터 z와 업데이트 Δ가 같은 표현 공간에 있을 때, Δ는 Δ∥ = (Δ·z / ‖z‖²) z = αz 와 Δ⟂ = Δ − Δ∥ 로 유일하게 분해된다. 평행 성분은 z 방향을 따라 크기를 α배 스케일하고, 수직 성분은 z에 직교하는 (d−1)차원 부분공간에서 방향 전환의 자유도를 담당한다. 이 분해를 두 공간에 적용한다. 잔차 공간에서는 서브레이어 업데이트를 들어오는 hidden state 기준으로, 어텐션 value 공간에서는 출력 투영 이전의 집계 o_t = Σ_{s≤t} A_ts v_s 를 해당 토큰 자신의 value v_t 기준으로 분해한다. 여기서 중요한 장치가 exclude-self 스케일링이다. o_t를 자기 메시지 d_t = A_tt v_t 와 비자기 집계 c_t = Σ_{s<t} A_ts v_s 로 분리한 뒤, c_t의 평행·수직 성분만 s(∥), s(⟂)로 스케일하고 d_t는 그대로 복원한다. 일반형은 ỹ_t = s(∥)y_{t,∥} + s(⟂)y_{t,⟂} 이고, 무개입은 둘 다 1, 평행 제거는 s(∥)=0, s(⟂)=1이다. 자기 어텐션 대각 성분을 마스킹하거나 재정규화하지 않는다는 점이 이 조작의 특징이다.

무엇과 다른가

첫 번째 실험 묶음은 추론 시점의 방향 민감도다. 가중치는 고정한 채 세 사이트(value 공간 exclude-self, 잔차 어텐션, 잔차 MLP)에서 s(∥)와 s(⟂)를 각각 스윕한다. 결과는 뚜렷한 방향 비대칭이다. 수직 스케일링은 극도로 취약해서 항등에서 조금만 벗어나도 퍼플렉서티가 급등하고, 완전 제거 시 value 공간과 잔차 어텐션에서 수만 점, 잔차 MLP에서 수백만 점 규모로 폭발한다. 반대로 평행 스케일링은 넓은 안정 구간을 보인다. 그 안에서도 사이트 위계가 있다. value 공간 조작은 s(∥)∈[0,1] 구간에서 거의 평평해 PPL이 1점 미만(스케일 3까지 최대 1.3점)만 움직이고, 잔차 어텐션은 중간, 잔차 MLP가 가장 취약하다. 즉 견고함은 "평행함" 자체의 속성이 아니라 어느 표현 공간에서 무엇을 보존하느냐에 달려 있다.

어떻게 쓰나

두 번째는 다운스트림 과제 견고성이다. Qwen3-1.7B dense와 Qwen3-30B-A3B MoE에서 7개 표준 제로샷 벤치마크를 비교한다. 전체 집계에 평행 제거를 그대로 적용하면 두 모델 모두 평균 8~10점이 떨어진다. 자기 메시지 A_tt v_t 가 함께 억제되기 때문이다. 반면 self를 보존하고 비자기 집계만 스케일하는 exclude-self는 1.7B에서 베이스라인 대비 1.5점 뒤처지는 데 그치고, 30B-A3B MoE에서는 0.1점 이내로 사실상 동일하며 일부 과제에서는 소폭 향상된다. 잔차 공간 어텐션 제거는 꾸준히 하락하고, 대각 성분을 강제로 0으로 만드는 조작은 심각하게 무너진다. 문맥 길이 확장성도 같은 결론을 뒷받침한다. Llama-3.2-3B의 RULER 4k→12k에서 self를 고정하고 평행 성분 절반(s(∥)=0.5)만 남기면 4k에서 0.2점, 12k에서 2.4점 이내로 베이스라인을 따라가고, 완전 제거 시 전체 집계 편집은 26~40점 붕괴하는 반면 exclude-self는 4k에서 75% 이상 정확도를 유지한다. 흥미로운 반증도 있다. Qwen3-0.6B에서 post-W_O 어텐션 출력을 감사하면 비자기 토큰의 평행 문맥 제거가 잔차 공간 제거보다 훨씬 큰 섭동(49.10% 대 25.15% of unedited branch norm)을 만든다. 출력을 거의 두 배 더 바꾸면서도 성능이 유지된다는 것은, 안정성이 등방성 섭동 크기 최소화가 아니라 자기 정체성 라우팅과 잔차 전파 궤적 보존에서 나온다는 뜻이다.

전제와 한계

세 번째는 압축 진단이다. 압축은 파라미터를 바꿔 e = Δ_comp − Δ_base 라는 오차를 만든다. 이를 Δ_base 방향 기준으로 e∥와 e⟂로 분해하면, Qwen3-4B에서 4-bit AWQ와 50% Wanda(unstructured, 4:8, 2:4) 네 체제의 수직 오차 곡선이 다운스트림 충실도 순서와 정확히 일치하게 분리된다(4-bit AWQ 최저, 그다음 unstructured, 4:8, 2:4). 평행 오차 곡선은 서로 뒤섞여 일관된 순위를 주지 못한다. MLP 브랜치와 전체 블록 업데이트에서도 수직 왜곡이 총 압축 오차를 지배한다(r > 0.97). 등방성 L2 거리가 압축 열화를 예측하지 못하는 이유가 여기서 설명된다.

네 번째는 학습 시점 개입이다. OpenWebText로 GPT 스타일 모델을 296M에서 2.7B까지 처음부터 사전학습하면서, 최적화와 평가 양쪽 모두에서 평행 어텐션 업데이트를 제거한다. 검증 손실 궤적은 초기 학습 단계부터 아래로 내려가고 그 이점이 최종 체크포인트까지 유지된다. 1.4B와 2.7B 모델의 6개 제로샷 벤치마크에서 두 변형 모두 베이스라인을 넘고, value 공간 평행 제거가 가장 큰 이득을 낸다(1.4B에서 +0.7점, 2.7B에서 +1.5점). 저자들은 이를 평행 억제가 어텐션 용량을 직교적 문맥 조향으로 돌리는 효과적인 귀납 편향이라고 해석한다.

개발자 관점에서 이 논문이 주는 실무적 신호는 세 가지다. 첫째, 어텐션 value 공간에서 self 메시지를 건드리지 않고 문맥 집계의 평행 성분만 줄이는 편집은 매우 안전한 반면, 같은 크기의 조작을 잔차 스트림이나 MLP에 가하면 훨씬 위험하다. 추론 시점 최적화나 캐시 압축, 게이팅 실험을 설계할 때 어느 지점을 건드리는지가 성패를 가른다. 둘째, 양자화·프루닝 파이프라인을 평가할 때 전역 L2 오차 대신 기준 업데이트 방향에 대한 수직 오차 비율을 지표로 삼는 편이 다운스트림 성능 순위를 더 잘 맞춘다. 셋째, 어텐션의 평행 성분을 학습 중 억제하는 것은 별도 아키텍처 변경 없이 시도할 수 있는 개입이지만, 저자들 스스로 이 편집들을 주로 분석 도구로 쓰며 실용 기법으로 만들려면 추가 검증이 필요하다고 못박는다.

한계도 분명하다. 실험은 디코더 전용 언어 모델에 한정되어 있고, 여러 스케일과 과제, 추론 시점 개입, 압축 설정, 처음부터 학습하는 구성만 다룬다. 같은 기하학적 그림이 평가된 설정들에서 일관되게 나타나지만 다른 아키텍처와 학습 체제에서도 유지되는지는 아직 확립되지 않았다. 또한 레이어 수준 기하학을 다운스트림 행동에 더 직접적으로 연결하는 일, 그리고 제안된 편집을 실제 학습·추론 기법으로 전환하는 일은 향후 과제로 남겨져 있다.

관련 논문