문단 경계는 공백이 아니며 계층 구조의 서명은 압축의 깊이다.

Paragraph Boundaries Are Not White Space:Compression Depth as the Signature of Hierarchical Structure

HF Daily2609.23551

Shuyang Xiang2026-09-20조회 4

무엇인가

이 논문이 푸는 문제는 위치 인코딩의 좌표계 자체다. 표준 위치 인코딩은 위치를 읽기 순서라는 1차원 좌표로 표현하고, 토큰 i와 j의 관계를 i, j 또는 그 차이 i-j에서 유도한다. 그런데 텍스트는 document ⊃ paragraph ⊃ sentence ⊃ token처럼 중첩되어 있다. 같은 읽기 순서 간격을 가진 두 토큰이 같은 문장 안에 있을 수도, 한 문단의 다른 문장에 있을 수도, 서로 다른 문단에 있을 수도 있는데 읽기 순서만으로는 이 셋을 구분할 수 없다. 저자들은 n개 토큰 열이 2^(n-1)개의 문단 분할을 허용한다는 조합론적 사실을 들어, 읽기 순서가 선형 열에는 정확하지만 계층 구조에는 충분통계량이 아니라고 주장한다. 이 논문의 질문은 언어모델이 문단을 이해하는가가 아니라, 계층적 위치가 토큰 사이의 유효 상호작용 거리를 바꾸는가, 그리고 얼마나 바꾸는가다.

어떻게 동작하나

방법의 핵심은 계층적 회전 위치 인코딩(hRoPE)이다. 문단 인덱스 p1, 문단 내 문장 인덱스 p2, 문장 내 토큰 인덱스 p3를 별도 좌표로 두고, 각 계층에 독립적인 회전 채널 그룹을 배정한다. R_hier(p1,p2,p3) = R1(p1) ⊕ R2(p2) ⊕ R3(p3) 형태로, 각 R_k는 자기 채널 부분공간에서만 회전한다. p1이 p2나 p3와 하나의 스칼라로 합쳐지지 않기 때문에, 토큰 열과 하위 좌표를 전부 고정한 채 문단 좌표만 따로 조작할 수 있다. 각 그룹의 주파수 베이스는 코퍼스 분포에서만 보정하며(99백분위 범위 M_g와 채널 쌍 수 D_g로 base_g = (S·M_g/2π)^(D_g/(D_g-1))), 학습 파라미터는 추가되지 않는다. 저자들은 파라미터 수·깊이·학습 스텝·시드를 맞춘 네 가지 변형을 학습시킨다. flat(표준 RoPE), sent_axial(p2, p3만), hrope_axial(3그룹 전체), rand_axial(hrope_axial과 동일하지만 p1이 경계 밀도에 맞춰 재표집된 무작위 라벨). 여기에 period_axial이라는 거울 대조군을 더하는데, 이는 p1을 문단 길이 창(각각 132/102/64 토큰)으로 나눈 기계적 격자로 두어, 진짜 문단 구조가 아니라 토큰 거리의 준결정적 함수인 순서가 어텐션을 압축하는지 확인하는 용도다.

무엇과 다른가

측정 절차는 반사실 개입이다. fake-merge는 실제 두 문단에 같은 p1을 부여하고, fake-split은 인위적 경계를 삽입한다. 두 경우 모두 토큰과 읽기 순서는 그대로이고 p1만 바뀐다. 어텐션은 레이어와 헤드에 걸쳐 평균한 뒤, 로그를 취해 토큰 거리에 대한 선형 추세 log A = β0 + β1·d(i,j)를 적합하고 그 추세를 뺀 잔차 D_eff를 계산한다. 이것이 거리로 설명되지 않는 어텐션 성분이다. 이 잔차를 문단 내 기준점과 실제 문단 경계 기준점 사이로 정규화한 β를 정의하고, 개입 효과 Δ를 조작 전후의 β 차이로 측정한다. fake-split에는 실제 경계와 같은 크기의 반응을 냈는지 비교하는 β_C를 별도로 보고한다. 모든 신뢰구간은 문서 단위 부트스트랩 재표집으로 계산한다. 데이터는 WikiText-2, OpenWebText, 파이썬 소스 코드 세 코퍼스이며, 8레이어·8헤드·d_model=512·컨텍스트 1024 모델을 5000스텝, 코퍼스당 3시드로 학습한다.

어떻게 쓰나

1층 결과는 인과 효과의 존재를 확인한다. 단일 예시에서 fake-split이 경계를 넘는 어텐션을 떨어뜨려 Δ = -3.105를 기록했다. 코퍼스 수준에서는 두 개입이 반대 방향으로 작동한다. 문단을 합치면 어텐션이 압축되고(Δ_B < 0), 쪼개면 팽창한다(Δ_C > 0). 합친 조건의 반응은 문단 내 기준선을 넘어서는데, WikiText-2가 -0.300, OpenWebText가 -0.302, Code가 -2.769다. 정규화된 fake-split 반응 β_C는 1.06에서 1.52 사이이고, Code는 95% 구간 [1.31, 1.80]으로 β_C = 1을 배제해 인위적 경계가 평균적 실제 경계보다 유의하게 강했다. OpenWebText는 [1.02, 1.12]로 아슬아슬하게, WikiText-2는 [0.99, 1.14]로 1을 포함한다. 백분위 순위 C_pct는 58~62%로, 조작이 이상할 정도로 크지 않고 자연스러운 문단 구조와 정량적으로 일치한다. p1 채널이 없는 flat과 sent_axial은 Δ가 0에 가깝고, 추가 자유도만 가진 rand_axial은 hrope_axial보다 모든 코퍼스에서 눈에 띄게 약하게 반응한다. 나아가 추론 시점에 p1을 real, period, rand, const0으로 치환하면 real < period < rand < const0 순서가 모든 시드와 코퍼스에서 성립한다. 문단 축을 상수로 붕괴시킨 const0이 real보다 0.30~0.34 nats 나쁘다. 저자들은 이를 근거로 학습된 가중치가 채널의 점유 여부가 아니라 내용을 구분한다고 주장한다(다만 n=3이라 방향적 증거이며, 최소 단측 부호검정 p값은 0.125다).

전제와 한계

2층의 중심 주장은 압축 자체가 진단적이지 않다는 것이다. 어텐션 압축은 모든 코퍼스에서 나타나지만, 밀도를 맞춘 무작위 라벨 채널도 압축된다. 다만 그 깊이가 더 얕다. 진짜 구조와 무작위 대조군을 가르는 것은 압축의 위치가 아니라 깊이다. 실제 구조 대 무작위 대조군의 깊이 격차는 세 코퍼스 중 둘에서 0을 배제했고, 세 번째는 시드 수로는 분해되지 않았다. 깊이의 코퍼스 간 순서는 Code > WikiText-2 > OpenWebText로 기술적으로 나타나며, Code의 깊이 -0.772는 WikiText-2의 -0.481보다 약 1.6배 크다. 한편 가장 깊은 압축이 어디서 일어나는지를 가리키는 위치 Δp1*는 WikiText-2에서 구조적으로 식별 불가능하고 Code에서는 적합에 민감하며, OpenWebText만 안정적이다. 부수적으로 문단 간 어텐션 기여도 상위 5% 토큰을 마스킹하는 탐색적 프로브를 돌렸는데, 같은 수의 무작위 토큰을 마스킹해도 깊이는 거의 움직이지 않는 반면 같은 부피의 문단 간 쌍을 마스킹하면 크게 움직인다. 즉 반응의 대부분은 어떤 토큰이 실어 나르는지가 아니라 제거된 어텐션 질량의 부피를 반영한다.

3층에서는 코퍼스만의 통계량 여덟 개를 세 가지 구성개념(어휘 지속성, 문단 길이, 임베딩 기반 일관성)에 걸쳐 깊이의 코퍼스 간 순서와 비교한다. 결론은 어느 것도 순서를 완전히 재현하지 못한다는 것이다. 어휘 지속성에서는 λ_struct, L_int, δ_zero가 순서를 맞추지 못하고, λ_local은 순서는 맞지만 어떤 쌍에서도 자기 코퍼스 내 부트스트랩 불확실성 아래 분리되지 않는다. 문단 길이도 Code와 WikiText-2를 뒤바꾼다. 임베딩 일관성이 가장 근접하는데, 집계 일관성 점수는 Code를 나머지 둘과 분리하지만 WikiText-2와 OpenWebText는 분리하지 못하고, 일관성 반감기는 방향은 재현하되 구간이 넓어 어떤 쌍도 분리하지 못한다. λ_struct의 코퍼스 간 순서(Code > OpenWebText > WikiText)는 어휘 크기 V ∈ {50,100,150,200,300,500}에서 모두 안정적이지만, 그 순서 자체가 깊이 순서와 맞지 않으므로 문제를 구제하지 못한다. 저자들은 세 코퍼스뿐이라 어떤 코퍼스 간 순서도 통계적 의미에서 일화적이며, Code > WikiText-2 > OpenWebText 순서를 확립된 규칙으로 취급하려면 더 많은 코퍼스가 필요하다고 명시한다.

개발자 관점에서 이 논문이 주는 실무적 신호는 두 가지다. 첫째, 문단 경계를 단순한 공백이나 구분자로 흘려보내는 토큰화·위치 인코딩 설계는 계층 정보를 잃는다. p1을 별도 채널로 분리하면 토큰을 하나도 바꾸지 않고도 어텐션 패턴이 달라지고, 검증 손실도 개선된다. hrope_axial은 모든 매칭 시드·코퍼스에서 rand_axial보다 검증 손실이 낮고 flat 대비 비용은 작으며 Code에서는 시드 노이즈와 구분되지 않는다. 둘째, 계층 좌표를 넣었다는 사실만으로 그것이 의미를 갖는다고 가정하면 안 된다. 밀도를 맞춘 무작위 라벨도 압축을 만들어내므로, 계층 구조를 도입했다면 진짜 라벨과 무작위 라벨을 대조하는 통제 실험을 함께 설계해야 한다. 이 논문이 제시하는 진단 지표는 압축의 위치가 아니라 깊이다.

한계는 저자들이 상당히 구체적으로 밝힌다. 코퍼스가 세 개뿐이라 코퍼스 간 순서는 기술적이며, 문서 단위 부트스트랩은 코퍼스 내 표집 불확실성만 정량화한다. 깊이를 결정하는 코퍼스 속성은 찾지 못했고, 실제 대 무작위 격차가 두 코퍼스에서는 분해되지만 세 번째에서는 분해되지 않는 이유도 열린 문제로 남긴다. 위치 Δp1*는 WikiText-2에서 식별 불가능하므로 깊이를 주 지표로 삼는다. period_axial은 p1이 토큰 거리의 준결정적 함수여서 통제 대조 설계로 분석할 수 없다. 모든 실험은 8레이어·d_model=512·5000스텝 규모로, 다중 코퍼스·다중 시드 개입 프로토콜을 감당할 수 있게 고른 것이지 프로덕션 규모가 아니며, 다운스트림 태스크 지표는 보고하지 않는다. 저자들은 관측된 현상이 인간의 읽기를 모사한다고 주장하지 않고, 리만 계측이나 물리적 퍼텐셜을 확립했다고도 주장하지 않는다. 1차 개입만으로는 2차 계측 텐서를 식별할 수 없으므로, 정당화되는 최강의 진술은 어텐션이 좌표 의존적인 구조화된 반응장을 보인다는 것뿐이다.