국소 혼합층이 전역 NoPE 어텐션에 상대 위치를 심는다

How Local Mixing Encodes Relative Position in Global NoPE Attention

arXiv2609.38109v1

Cutter Dawes2026-09-29조회 4

무엇인가

셀프 어텐션은 본질적으로 위치 불변 연산이라 언어 모델은 회전 위치 인코딩(RoPE) 같은 명시적 위치 인코딩을 당연히 필요로 한다고 여겨져 왔다. 그런데 최근 대규모 모델들은 슬라이딩 윈도우 어텐션(SWA)이나 게이트 선형 어텐션 같은 국소 혼합층을 전역 어텐션과 번갈아 쌓으면서, 정작 전역 어텐션에는 위치 인코딩을 넣지 않는 방식(NoPE)으로 성공하고 있다. 이 논문이 풀려는 문제는 바로 이 지점이다. 기존 연구는 하이브리드 NoPE 모델이 절대 위치를 표현하지 않는다는 것만 보였고, 전역 NoPE만 쓴 모델에서 인과 마스크 때문에 생기는 최근성 편향은 약 30토큰 수준의 아주 짧은 시퀀스에서만 확인됐을 뿐이다. 상대 위치를 표현하는지, 그리고 그 효과가 긴 시퀀스에서도 유지되는지는 열린 질문이었다.

어떻게 동작하나

논문의 중심 주장은 하이브리드 구조가 전역 NoPE 층에서 상대 위치를 암묵적으로 인코딩한다는 것이며, 이를 세 단계로 나눠 설명한다. 첫째, SWA나 게이트 선형층이 잔차 스트림에 최근성 편향을 만든다. 둘째, 이 편향이 잔차 덧셈·정규화·MLP 같은 중간 변환을 통과하며 보존된다. 셋째, 전역 NoPE 어텐션의 쿼리·키 투영이 이 편향을 선택해 어텐션 로짓으로 끌어올린다. 결과적으로 명시적 상대 위치 인코딩과 유사한 효과가 NoPE 층 안에서 만들어진다는 것이다.

무엇과 다른가

1단계 이론은 SWA가 기대값에서 이동평균 컨볼루션에 근사한다는 관찰에서 출발한다. 어텐션 가중치가 거의 균일하고 투영된 값들이 서로 무상관이라고 가정하면 SWA 출력은 윈도우 크기 w에 대해 y_i ≈ (1/w)Σ o_{i-r}로 근사되고, 두 출력의 코사인 유사도는 c_SWA(d) ≈ [1 - d/w]_+로 거리에 따라 선형으로 줄어든다. 반면 전역 NoPE 어텐션은 y_i ≈ (1/(i+1))Σ o_t로 전체 선행 시퀀스를 평균하므로 c_global(d) ≈ √((i-d+1)/(i+1)) ∝ 1 - O(d/i)가 되어 시퀀스 길이가 늘수록 위치 신호가 희석된다. 즉 SWA의 국소성 스케일은 윈도우 크기로 고정되어 길이에 독립적이지만, 전역 어텐션의 스케일은 길이에 종속된다. 학습 후 어텐션 프로파일이 균일하지 않은 일반적인 경우에도 출력의 지연 교차모멘트는 G_Y(d) ≈ A(g_a * G_X)(d) A^T로 표현되는데, 평균 어텐션 자기상관 g_a(k)가 윈도우 안에서만 양수이므로 최근성 편향의 구조적 효과는 그대로 남는다.

어떻게 쓰나

2단계는 이 편향이 중간 모듈을 지나며 살아남는지를 다룬다. 잔차 스트림에 더해진 출력의 유사도 구조는 기존 구조와의 상호작용으로 결정되고, RMSNorm은 단위 정규화된 교차모멘트 구조를 정확히 보존하며 LayerNorm도 실무적으로 유사하게 동작한다. 다만 정규화의 채널별 게인은 위치 독립적 평균 성분의 에너지를 상대적으로 줄여 코사인 유사도의 바닥(floor)을 낮추고 거리 간 격차(gap)를 키우는 방향으로 작용한다. MLP는 랜덤 초기화에서 가우시안 에르미트 전개 k_f(p) = Σ a_n² p^n / Σ a_n²로 커널이 기술되며, 계수가 a_n²로 들어가므로 p ≥ 0 구간에서 비감소 함수가 된다. 즉 넓은 MLP는 초기화 시점에 최근성 편향 프로파일의 순서를 보존한다. 다만 이는 초기화 논증일 뿐이고, 학습된 MLP는 들어온 유사도 구조를 억제하거나 증폭하거나 방향을 바꿀 수 있어 실험으로 확인한다.

전제와 한계

3단계는 이 편향이 실제로 어텐션 로짓에 읽히는 조건을 규명한다. 정규화 후 전역 NoPE의 쿼리·키 투영 입력을 x라 하면 기대 로짓 프로파일은 ℓ(d) = ⟨G_X(d), M⟩_F이고 여기서 M = W_Q^T W_K / √D_H다. 로짓의 최근성 격차가 양수가 되려면 M이 G_X(1) - G_X(L)과 양의 정렬을 이뤄야 한다. 중요한 점은 독립적인 영평균 초기화에서 E[M] = 0이라는 사실이다. 따라서 최근성 편향은 초기화 시점에 자동으로 로짓에 전파되지 않고, 학습이 W_Q와 W_K를 정렬시켜야 비로소 로짓에 나타난다.

실험은 120M과 350M 두 규모의 하이브리드 모델에서 수행했다. SWA 윈도우 크기를 64, 128, 256, 512, 1024, 2048, 4096으로 바꾸고 각 규모마다 전역 NoPE 베이스라인(즉 SWA 없음)과 비교했으며, 별도 언급이 없으면 SWA 층은 RoPE를 쓰고 전역 NoPE와 1:1로 교차 배치했다. 학습 데이터는 Prolong, 주기적 평가는 TextbookChapters를 사용했고, 최근성 격차는 f(1) - f(L)로 정의하되 먼 거리 기준 지연 L은 4096으로 두었다. 결과적으로 최근성 편향은 초기화 시점부터 존재했고 학습이 진행되면서 오히려 강해졌으며, 깊이가 깊어질수록 뚜렷해졌다. 윈도우가 작을수록 더 좁고 가파른 편향이 생겼고, NoPE-in-SWA 구성에서는 이 효과가 더 두드러졌다. 모듈별로는 정규화가 코사인 바닥을 낮추고 격차를 키웠으며, SWA가 격차를 가장 크게 끌어올렸고, 잔차 덧셈과 MLP는 격차를 줄이고 바닥을 높였고, 전역 NoPE 어텐션도 격차를 키우되 SWA보다는 훨씬 약했다. 로짓 쪽에서는 학습과 함께 최근성 편향 프로파일이 나타나 빠르게 강해진 뒤 안정화됐고, RoPE-in-SWA에서는 윈도우 크기에 따른 변화가 작았지만 NoPE-in-SWA에서는 큰 윈도우에서 로짓 격차가 크게 양수와 음수로 요동쳤다. 또한 작은 윈도우가 큰 윈도우보다 낮은 손실을 보였고, 큰 NoPE-in-SWA 윈도우는 손실 붕괴를 일으켰다. 다만 윈도우 크기별 실험은 연산량을 맞추지 않았으므로 작은 윈도우의 이점은 표시된 것보다 더 클 수 있다고 저자들은 밝힌다.

개발자 관점에서 이 논문은 위치 인코딩을 '넣을까 말까'의 문제가 아니라 '어디서 만들어질까'의 문제로 바꾼다. 긴 문맥 모델을 설계할 때 전역 어텐션에 RoPE를 넣지 않아도, 국소층의 윈도우 크기만으로 상대 위치 신호의 강도와 해상도를 조절할 수 있다는 뜻이다. 특히 윈도우 크기가 너무 크면 잔차 스트림의 최근성 편향이 약해져 전역 로짓이 위치 신호를 회수하지 못하고 성능이 무너질 수 있으므로, 하이브리드 구조를 쓸 때는 윈도우 크기를 학습 손실과 함께 반드시 스윕해야 한다. 또한 이 방식은 학습 때 본 길이를 넘어서도 위치 인코딩이 급격히 변하지 않아 길이 외삽에 유리할 가능성이 있다는 점이 실무적 함의다.

저자들이 명시한 한계도 분명하다. 이론 분석은 SWA라는 한 종류의 국소층이 갖는 구조적 효과를 분리해낸 것으로, 내용 의존적 어텐션과 MLP가 실제로 수행하는 다양한 연산을 완전히 설명하지는 못한다. 최근성 편향이 모델의 모든 모듈을 통과하며 어떻게 정량적으로 전파되는지, 깊이와 시퀀스 길이에 따라 어떻게 감쇠하는지에 대한 완전한 정량적 설명은 아직 없다. 나아가 이러한 특성과 길이 일반화 성능 사이의 정량적 관계도 확립하지 못했으며, 이는 향후 과제로 남겨둔다.