Gated DeltaNet의 감쇠 스펙트럼을 재배치해 문맥 창을 늘리는 SpectralShift
SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization
무엇인가
이 논문은 선형 어텐션 계열, 그중에서도 Gated DeltaNet(GDN)의 문맥 창을 늘리는 문제를 다룬다. GDN은 과거 정보를 고정 크기의 순환 상태 S_t ∈ R^{d_k×d_v}에 압축하는 구조라서 문맥이 길어져도 계산량이 시퀀스 길이에 선형으로만 늘어난다는 장점이 있다. 문제는 기존의 문맥 확장 방식이 소프트맥스 어텐션의 위치 인코딩만 스케일링한 뒤 긴 시퀀스로 continued pretraining을 돌리고, 선형 어텐션 층 자체는 손대지 않는다는 점이다. 저자들은 여기서 원래 문맥 길이에서 학습된 순환 전이 동역학과 더 긴 문맥이 요구하는 동역학 사이에 불일치가 생긴다고 지적한다. 순환 모델은 모든 과거 토큰을 명시적으로 들고 있을 수 없고 유한 차원 상태 전이로 정보를 보존해야 하므로, 장문맥 능력은 결국 상태가 필요한 의존 거리만큼 정보를 담아둘 수 있느냐에 달려 있다는 것이 출발점이다.
어떻게 동작하나
저자들은 GDN의 상태 업데이트 S_t = A_t S_{t-1} + Δ_t, A_t = α_t(I - β_t k_t k_t^T), Δ_t = β_t v_t k_t^T에서 전이 행렬 A_t의 스펙트럼을 본다. 위치 i에서 쓴 정보가 위치 j까지 살아남는 정도는 유한 시간 전이 Φ_{i→j} = A_j A_{j-1} ... A_{i+1}로 결정되고, 이 행렬의 r번째 특이값으로 감쇠율 γ_r(i,j) = -(1/ℓ) log σ_r(Φ_{i→j})를 정의한다(ℓ = j - i). 이 감쇠율은 α_t만으로 결정되는 head 단위 성분 γ_α = -(1/ℓ) Σ log α_t와, R_{i→j} = Π(I - β_t k_t k_t^T)의 특이값 성분 γ_{R,r}로 분해된다. 두 번째 성분은 쓰기 키 k_t에도 의존해서 고치기가 더 어렵다. 의존 거리 ℓ에 대해 1/γ_r ≥ ℓ, 즉 log σ_r(Φ_{i→j}) ≥ -1을 만족하는 상태 방향들을 느린 스펙트럼 대역 S_ℓ이라 부르고, 그 크기 |S_ℓ|를 느린 대역의 폭으로 정의한다. NIAH 프로브로 분석한 결과, 검색을 잘하는 모델은 과제 거리를 커버하는 느린 모드가 더 많고(M_ℓ^slow), 그런 모드를 하나라도 가진 layer-head도 더 많으며(H_ℓ^slow), 니들 키가 살아남는 입력 부분공간에 얼마나 실리는지를 나타내는 E_write = ||V_{S_ℓ}^T k_i||² / ||k_i||² 값도 더 컸다. 결론은 두 가지다. 목표 의존 길이에 맞는 충분히 넓은 느린 대역을 확보할 것, 그리고 상태를 비우고 문맥을 전환하는 데 필요한 빠르게 감쇠하는 모드는 그대로 유지할 것.
무엇과 다른가
제안 방법 SpectralShift의 첫 번째 구성 요소는 알파 투영 재파라미터화다. 알파 투영을 a_t^ref = W_α^ref h_t = c_t + ξ_t로 분해하는데, c_t = μ_α^ref J h_t는 전역 평균에서 나오는 공유 성분이고 ξ_t = (W_α^ref - μ_α^ref J) h_t는 입력에 따라 달라지는 편차다. 여기에 스케일 s_1을 넣어 a_t(s_1) = c_t + s_1 ξ_t (0 < s_1 ≤ 1)로 다시 쓴다. Lemma 1에 따르면 s_1을 줄이면 ξ_t > 0인 토큰에서는 α_t가 커져 보존이 강해지고, ξ_t < 0인 토큰에서는 α_t가 작아져 망각이 커진다. 이 토큰별 변화가 시퀀스를 따라 누적되면 head 단위 감쇠 γ_α가 달라져서, 어떤 head는 느린 전파 쪽으로, 다른 head는 빠른 망각 쪽으로 편향된다. 즉 균일하지 않은 스펙트럼 초기화를 만들어 이후 continued pretraining의 출발점으로 삼는 것이다. 스케일 값은 s_k = (L_ref/L_tar)^k 형태의 power-law family에서 스케일 매칭으로 유도해 최적 지수 k = 0.5, 즉 s_1 = (L_ref/L_tar)^0.5를 쓴다.
어떻게 쓰나
두 번째 구성 요소는 길이 스케일 continued pretraining이다. 알파 투영의 학습률만 η_α^tar = s_2 η_α^ref로 스케일해서, 학습 중에 head 전체가 느린 영역이나 빠른 영역으로 통째로 움직이는 것을 제한한다. Theorem 1은 업데이트 한 스텝이 head 공유 감쇠에 주는 변화가 |γ_α^(u+1) - γ_α^(u)| ≤ C_α^(u) s_2 η_α^ref + O(s_2² η_α^ref)로 묶인다는 것을 보인다. 스케일하지 않은 β, key, value 업데이트는 그대로 두어 방향성 전이와 상태 쓰기는 타깃 길이 데이터에 계속 적응하게 한다. 구현을 단순화하기 위해 s_2 = s_1 = (L_ref/L_tar)^0.5로 둔다. 두 요소를 합친 최종 효과는 Theorem 2로 정리된다. 총 스펙트럼 변위를 D_r = δ_r^init + δ^CPT,α + δ_r^CPT,Δ라 하면 최종 감쇠율은 γ_r^after = γ_r^ref - D_r이고, 목표 의존 길이 ℓ에 대해 D_r ≥ γ_r^ref - 1/ℓ인 모드는 최종 느린 대역에 들어간다. 부록에서는 과제 관련 모드에 대해 D_r ≥ g⋆/(2ℓ) > 0이 유한한 CPT 동안 유지되는 충분 조건을 제시한다. 결과적으로 느린 대역이 넓어져 장문맥 쓰기가 더 많이 느린 모드에 실리고, 긴 시퀀스를 지나도 정보가 남는다는 것이 논문의 주장이다.
전제와 한계
실험은 1.5B-A0.6B 규모의 GDN-MoE 언어 모델을 Dolma3 코퍼스로 문맥 길이 8192, 500B 토큰, 글로벌 배치 1024, 상수 학습률 8.6e-4, Muon 옵티마이저로 처음부터 사전학습한 뒤 진행했다. 이 8K 베이스 모델을 32K, 64K, 128K로 확장하고, 64K와 128K는 32K 체크포인트에서 한 단계 더 늘리는 단계적 길이 커리큘럼을 썼다. 글로벌 어텐션에는 ABF로 조정한 RoPE 베이스를 쓰고, 상수 학습률 스케줄과 8M 토큰 고정 크기를 사용했다. 일반 능력은 MMLU, LAMBADA, ARC-Easy, WinoGrande, PiQA로, 장문맥은 RACE, DROP, RULER로 8K부터 128K까지 평가했다. 핵심 수치는 128K 문맥을 2단계 continued pretraining으로 확장했을 때 RULER 평균 55.18로, 베이스라인 52.38보다 약 5.35% 상대 개선을 냈다는 것이다. 저자들은 이를 느린 모드의 과도한 망각을 완화한 결과로 해석한다. 일반 능력 벤치마크에서는 베이스라인과 비슷하거나 오히려 나은 성능을 보였고, 특히 긴 문맥 길이에서 그렇다고 보고한다.
절제 실험은 128K 확장 설정에서 이뤄졌다. α 재파라미터화와 학습률 스케일링을 함께 적용하고 스케일 인자를 s^0.5로 둔 구성이 일반 능력과 장문맥 성능의 균형에서 가장 좋았고, 둘 중 하나만 제거하면 성능이 떨어져 두 요소가 상호 보완적임을 보였다. 반면 s 전체를 쓰는 공격적인 스케일링은 검색 성능은 경쟁력이 있었지만 일반 능력이 눈에 띄게 저하됐는데, 저자들은 과도한 스펙트럼 스케일링이 최적화를 불안정하게 만들 수 있다고 본다. 위치 인코딩에 대한 민감도도 확인했다. DroPE, YaRN, ABF 세 가지를 각각 쓴 상태에서 SpectralShift를 적용했을 때 대부분의 확장·평가 길이 조합에서 장문맥 성능이 개선됐고, 각 설정의 최대 평가 길이에서는 세 위치 인코딩 전략 모두에서 베이스라인을 앞섰다. 순수 GDN 모델을 처음부터 학습해 8K, 16K, 32K로 확장한 실험에서도 RULER 기준으로 모든 설정에서 베이스라인을 이겼고, 타깃 문맥 길이가 길수록 개선폭이 커졌다.
실무 관점에서 이 논문이 주는 신호는 명확하다. 하이브리드 또는 선형 어텐션 모델의 문맥 창을 continued pretraining으로 늘릴 때, 위치 인코딩 스케일링만으로는 순환 층의 감쇠 동역학을 따라가지 못할 수 있다는 것이다. 적용 지점은 알파 투영의 초기화와 학습률 두 곳이며, 스케일은 (L_ref/L_tar)^0.5, 학습률 스케일링은 알파 투영에만 걸고 β, key, value는 건드리지 않는다. 재파라미터화와 학습률 스케일링을 따로 떼어 쓰면 효과가 줄어든다는 절제 결과도 구현 시 함께 기억할 만하다. 코드는 github.com/RUCAIBox/GDN-SpectralShift에 공개되어 있다.
저자들이 밝힌 한계는 검증 범위다. 이 방법은 GDN을 위해 설계된 것이고, 실험은 1.5B MoE 베이스라인에서만 이뤄졌다. 대규모 오픈소스 하이브리드 모델들은 이미 훨씬 긴 문맥으로 확장되어 있고, 대규모 하이브리드 모델을 처음부터 학습하는 것은 저자들의 가용 컴퓨팅 자원을 넘어서기 때문에 소규모 모델에서만 검증했다고 명시한다. 또한 감쇠율 분해에서 γ_{R,r} 성분은 쓰기 키 k_t에 의존해 수정이 어렵다는 점이 분석의 전제로 깔려 있다. 논문은 윤리 규범을 준수했고 인용 자원의 라이선스를 따랐으며 원고 교정에만 AI 보조를 썼다고 밝힌다.