다국어 LLM은 첫 레이어를 풀 어텐션으로 시작할 때 더 빨리 배운다
Multilinguality in Hybrid Attention LLMs
무엇인가
긴 컨텍스트를 요구하는 에이전트·추론 워크플로가 늘면서, 최신 오픈웨이트 모델들은 풀 소프트맥스 어텐션의 O(T²) 비용을 줄이기 위해 선형 복잡도 재귀(recurrent) 어텐션을 섞는 하이브리드 구조를 사실상 표준으로 채택했다. Kimi K3, Nemotron, Qwen, MiniMax 계열이 모두 그렇다. 그런데 이 하이브리드화가 다국어 처리에 어떤 영향을 주는지는 연구된 적이 없었다. 이 논문은 재귀 레이어의 압축된 상태라는 귀납적 편향이 언어 처리 자체를 바꿀 수 있다는 가설에서 출발해, 하이브리드 어텐션과 다국어성의 상호작용을 처음으로 분석한다.
어떻게 동작하나
분석 대상은 하이브리드 모델 4개와 그에 대응하는 비하이브리드 모델 4쌍이다. Ring-linear는 입력 독립적 감쇠를 쓰는 Lightning Attention-2를, Qwen3.5는 입력 의존적 망각 게이트와 델타 규칙을 결합한 Gated DeltaNet을, Granite-4.0-H는 선택적 상태공간 모델인 Mamba-2를, OLMo-Hybrid는 Gated DeltaNet의 근접 변형을 쓴다. 세 모델은 재귀 레이어 3~4개 뒤에 풀 어텐션을 주기적으로 끼워 넣고, Granite-4.0-H만 4·14·24·34번 레이어에 풀 어텐션을 둔다. 저자들은 언어 간 표현 정렬을 측정하기 위해 SoftCKA라는 지표를 새로 만든다. 병렬 문장 쌍의 은닉 상태에 RBF 커널을 적용해 토큰 간 '소프트 매칭' 유사도를 구하고, 이를 CKA(centered kernel alignment) 방식으로 정규화한 뒤 말뭉치 전체에 집계하는 방식이다. 토크나이저가 달라 토큰이 1:1로 대응하지 않는 문제를 우회하려는 설계다. FLoRes 병렬 데이터로 영어와 13개 언어(프랑스어, 중국어, 힌디어, 태국어, 페르시아어, 벵골어, 세르비아어, 다리자 아랍어, 현대표준아랍어, 리투아니아어, 밤바라어, 오리야어, 아삼어) 사이의 정렬도를 잰다.
무엇과 다른가
관찰 결과는 네 가지다. 첫째, 하이브리드 모델은 언어 간 표현 정렬이 더 낮다. Granite-H는 중간 레이어에서 특히 두드러지고, Qwen3.5는 13개 언어 중 10개, Ring-linear는 11개에서 정렬이 낮았다. 둘째, 하이브리드 모델은 풀 어텐션 레이어가 나올 때마다 언어 간 지표가 급격히 요동친다. 비하이브리드 모델이 중간 레이어까지 완만하게 공유 표현을 쌓았다가 마지막에 되돌리는 것과 대조적이다. 셋째, 가장 급격한 변화는 첫 번째 풀 어텐션 레이어에서 발생하며, 이는 4쌍 전부와 Ling-2.6-flash에서 일관되게 나타난다. 어텐션 블록의 잔차 기여분(attn_delta)을 보면 Qwen3.5·OLMo-Hybrid·Granite-H는 이 블록의 변환이 언어 간에 매우 유사하지만, Ring과 Ling-2.6-flash는 오히려 큰 음의 스파이크를 보여 저자들은 '이벤트'라는 모호한 표현을 쓴다. 넷째, 슬라이딩 윈도우 어텐션(SWA) 하이브리드인 Tiny Aya Global과 OLMo-3에서는 이런 재조직화가 나타나지 않는다. 또한 하이브리드 모델의 풀 어텐션 레이어는 비하이브리드 모델보다 최근 토큰에 더 많은 어텐션을 배분한다.
어떻게 쓰나
효율 실험은 다국어 토크나이제이션이 왜 중요한지 보여준다. Qwen3.5의 큰 어휘 토크나이저조차 요루바어 문장을 영어보다 2.6배 길게 만들고, 영어 중심의 OLMo는 일부 비라틴 문자 언어에서 컨텍스트를 10배로 부풀린다. OneRULER 니들인헤이스택 5종으로 평가했을 때 48GB A6000 한 장에서 하이브리드 모델의 OOM이 훨씬 적었고, 128K에서 Qwen3.5는 40개 언어-태스크 평가 중 25개를 완료한 반면 Qwen3는 1개만 완료했다. Granite의 64K 평가는 하이브리드가 13.5시간, 비하이브리드가 61.5시간이 걸렸다. 흥미로운 점은 하이브리드의 검색 성능 열세가 컨텍스트가 길어질수록 오히려 줄어든다는 것이다. 가장 짧은 컨텍스트에서 격차가 가장 컸고, 저자원 언어인 세소토어가 그 격차에 가장 크게 기여했다.
전제와 한계
이 관찰을 바탕으로 저자들은 레이어 순서 자체를 실험한다. Qwen3-4B와 Granite-4.1-3B를 교사로 두고 RADLADS·HALO 방식으로 증류하되, 일부 레이어를 Gated DeltaNet으로 바꾸고 교사의 query/key/value/output 투영을 상속한 뒤 KL 발산으로 전체 학생을 학습시킨다. 풀 어텐션 비율은 25%로 고정하고(36개 중 9개, 40개 중 10개) 위치만 바꾼다. 기준이 되는 standard periodic은 4개 레이어마다 풀 어텐션으로 블록을 닫고, 나머지 네 배치(reverse periodic, sandwich, interleaved sandwich, endpoint spread)는 모두 첫 레이어에 풀 어텐션을 둔다. FineWeb2에서 영어 30%와 26개 언어를 섞어 10억 토큰으로 학습한 결과, 네 대안 배치 모두 기준을 크게 앞섰고 기준 배치가 최종 도달한 교차엔트로피 값에 단 40%의 토큰으로 도달했다. 교차엔트로피 기준으로는 reverse periodic이 가장 좋아 교사와의 평균 격차가 다른 대안보다 10% 작았고 26개 언어 중 16개에서 최저였다. Granite-4.1-3B로 반복한 실험에서도 개선이 재현됐으며, reverse periodic은 교사의 검증 손실에 0.01 nat 이내로 도달했다.
언어별 이득도 뚜렷하다. reverse periodic은 Qwen3-4B에서 26개 언어 중 23개(두 번의 실행 모두), Granite에서 25개의 퍼플렉시티를 낮췄고 예외 언어의 상승폭은 0.7% 미만이었다. 가장 큰 이득(3~13%)은 텔루구어, 말라얄람어, 타밀어, 버마어, 크메르어에서 나왔고 중간값 언어는 약 1% 개선됐다. KL 발산 감소폭이 가장 큰 8개 언어는 두 교사 모두에서 동일했는데, 텔루구어·말라얄람어·타밀어·버마어·크메르어·티베트어·암하라어·아르메니아어로 전부 비라틴 문자권이다. 저자들은 이 공통점이 첫 레이어의 가장 중요한 역할인 디토크나이제이션과 관련 있을 수 있다고 본다.
실무적으로 이 논문이 주는 지침은 두 가지다. 다국어 서비스를 만든다면 하이브리드 어텐션은 긴 다국어 시퀀스에서 메모리와 실행 시간을 크게 줄이면서 성능 손실은 길이에 따라 오히려 줄어들기 때문에 도입할 가치가 있다. 그리고 레이어 배치를 정할 때 첫 디코더 레이어를 재귀 레이어가 아니라 풀 어텐션으로 두는 것을 기본값으로 검토할 만하다. 다만 이 결론은 증류 학습 설정에서 나온 것이므로, 처음부터 사전학습하는 파이프라인에 그대로 옮기기 전에는 자체 검증이 필요하다.
저자들이 명시한 한계도 분명하다. 실험은 10억 토큰, 소형 LLM, 단일 재귀 아키텍처에 대한 증류 학습이며 컴퓨팅 자원이 제한돼 대안 배치 중 하나만 반복 검증했다. 비교 대상 4쌍도 완벽하게 대응하지 않는다. OLMo 쌍은 통제 실험이 가능하도록 설계됐지만 다국어 학습 데이터를 명시적으로 배제해서 이 연구 목적에는 가장 덜 유용하고, Granite 4.0 쌍을 제외하면 하이브리드 모델이 더 나중에 공개돼 1:1 비교가 어렵다. 또한 하이브리드 모델에서 실제로 무슨 일이 일어나는지에 대한 기계론적 설명은 여전히 미해결 과제로 남아 있다.