인과적 RNN을 남긴 하이브리드 백본도 확산 언어모델로 값싸게 적응된다
dQwen3.5: Hybrid-Attention Diffusion Language Models
무엇인가
확산 언어모델(DLM)은 위치를 순차적으로 언마스킹해 병렬 생성과 임의 순서 생성을 가능하게 하지만, 처음부터 학습하는 비용이 크다. 같은 크기의 자기회귀(AR) 모델과 대등해지려면 토큰이 한 자릿수 배 더 들 수 있어, 사전학습된 AR 모델에서 출발해 인과적 attention 층을 양방향으로 바꾸고 확산 목적함수로 이어 학습하는 AR-to-DLM 적응이 저렴한 대안으로 자리 잡았다. 문제는 지금까지의 적응이 거의 전부 full-attention 트랜스포머에서 시작했다는 점이다. 반면 AR 모델링 자체는 attention과 RNN 층을 교차 배치한 하이브리드 구조로 이동했고, RNN은 attention 마스크와 달리 순환 구조 자체에 인과성이 박혀 있어 양방향화가 간단하지 않다. 이 논문은 이 구조적 불일치에도 불구하고 하이브리드 백본이 쓸 만한 DLM이 될 수 있는지 묻는다.
어떻게 동작하나
방법은 Qwen3.5를 0.8B, 2B, 4B, 9B 네 크기로 적응해 dQwen3.5 계열을 만드는 것이다. 핵심 개입은 최소한이다. 시퀀스 처리 스택에서 attention이 차지하는 비중은 25%뿐이며(작은 두 모델은 24층 중 6층, 큰 두 모델은 32층 중 8층), 이 attention 층들의 causal mask만 꺼서 양방향으로 만든다. 나머지 다수인 Gated DeltaNet 층은 구조적으로 인과적이므로 손대지 않는다. 여기에 표준적인 토큰 시프팅을 적용한다. BOS 토큰을 앞에 붙이고 readout을 한 칸 밀어, 위치 k의 은닉 상태가 마스킹된 위치 k+1의 토큰을 예측하도록 사전학습 AR 모델의 next-token 정렬을 보존한다. 확산 학습에 필요한 세 가지 특수 토큰(마스크, 정지용 패딩, 시프트된 readout용 선행 BOS)은 임베딩 테이블을 키우지 않고 미사용 id를 재활용한다. 각각 <|fim_middle|>, <|endoftext|>, <tts_text_bos>를 쓴다. 체크포인트에 포함된 비전 구성요소와 보조 multi-token prediction head는 버리고 언어모델 백본만 적응하기 때문에, 모델 카드에 적힌 파라미터 수와 논문의 수치가 다르다. 비교를 위해 Qwen3-1.7B를 같은 레시피로 적응한 full-attention 대조군도 만들었는데, 그 trunk(임베딩·헤드 제외) 1.41B가 Qwen3.5-2B의 trunk 1.37B와 거의 일치한다.
무엇과 다른가
학습 데이터는 NVIDIA Nemotron 사전학습 릴리스에서 뽑은 14개 서브셋의 고정 혼합으로, 토큰 기준 코드 50%, 일반 텍스트 35%, 수학 15%다. 시퀀스는 4096 토큰으로 패킹하고 일부는 무작위로 잘라 모든 예제가 컨텍스트를 꽉 채우지 않게 했다. 목적함수는 Shi와 Titsias(2025)를 따른 시간 재가중 masked diffusion 목적함수이고, 옵티마이저와 warmup–stable–decay 스케줄은 전 크기 공통이며 학습률만 0.8B/2B/4B/9B에 대해 3, 2, 2, 1 × 10^-5로 달리한다. 전역 배치는 512 시퀀스 × 4096 토큰이다. 각 크기마다 25k 스텝(50B 콘텐츠 토큰)과 50k 스텝(100B 콘텐츠 토큰) 두 예산의 체크포인트를 남기고, 마지막 5개 체크포인트의 가중 평균을 공개한다.
어떻게 쓰나
가장 눈에 띄는 결과는 적응 속도다. trunk가 맞먹는 full-attention 대조군과 비교했을 때, 하이브리드는 같은 확산 손실에 도달하는 데 대조군이 중앙값 2.21배의 콘텐츠 토큰을 필요로 했다. 즉 하이브리드가 약 절반 토큰에 같은 손실에 도달한다. 다만 토크나이저가 달라 dQwen3가 4.18 bytes/token, dQwen3.5가 4.05 bytes/token이므로 토큰당 손실의 직접 비교에는 주의가 필요하다고 저자들은 밝힌다. 다운스트림에서도 신호가 나온다. 적응 전 Qwen3.5-2B는 평가한 7개 벤치마크 전부에서 Qwen3-1.7B에 뒤졌지만, 50B 적응 후 dQwen3.5-2B는 HumanEval, MBPP, MBPP+를 포함한 3/7에서 대조군을 역전했다. 약 1.4B trunk 규모에서 dQwen3.5-2B는 50B 토큰만으로 CoDA(200B 토큰)를 7개 중 6개에서 앞섰고, 6.5~7B trunk 규모에서 dQwen3.5-9B는 50B 토큰으로 Dream-7B(580B), Dream-Coder-7B(322B), LLaDA-8B(2.3T)를 상대로 7개 중 4개에서 최고 점수를 냈다. 흥미롭게도 더 긴 적응이 항상 낫지는 않다. 50B에서 100B로 늘렸을 때 0.8B는 7개 중 5개가 개선됐지만 9B는 1개만 개선됐고, 퇴행은 지식·수학에 집중된 반면 코드는 계속 적응이 도움이 되는 경향을 보였다.
전제와 한계
인과적 RNN을 남겼으니 디코딩이 좌→우로 굳어지지 않을까 하는 우려는 HumanEval에서 검증한다. 캔버스 크기 256으로 각 위치 k가 몇 번째 스텝 d_k에 디코딩되는지 기록하고, 인접 위치 간 좌→우 순서를 재는 local AR-ness(ARL)와 모든 위치 쌍에 대한 global AR-ness(ARG)를 정의했다. 무작위 순서는 둘 다 0.5, 엄격한 AR 디코딩은 1.0이다. full-canvas 디코딩에서 dQwen3.5-9B의 local AR-ness는 0.636으로, full-attention DLM 세 종의 0.631~0.652 범위 안에 정확히 들어온다. 동시에 모든 모델의 global AR-ness는 0.884~0.967로 높다. 즉 전체적으로는 좌→우로 진행하되 인접 위치는 자주 순서를 벗어나는, 기존 DLM과 같은 국소-전역 패턴을 유지한다. 병렬 디코딩에서도 dQwen3.5-9B는 1×를 넘는 모든 speedup에서 HumanEval 선두를 지켰고 MBPP와 MATH500에서도 경쟁력 있는 정확도-속도 곡선을 보였다.
저자들은 왜 소수의 양방향 attention 층으로 충분한지에 대한 해석도 제시한다. 언어 모델링의 비인과적 의존성이 소수의 앵커 토큰에 집중되어 있다고 가정하면, q(x_1,...,x_L) = q(x_A) ∏_{i∉A} q(x_i | x_<i, x_A) (단 |A| ≪ L)로 분해할 수 있다. 이때 인과적 RNN 층이 접두사 의존성을 모델링하고, 양방향 attention 층은 소수의 미래 위치에 대한 접근만 제공하면 된다는 것이다. 실무적으로 이 논문이 주는 시사점은 명확하다. 하이브리드 AR 체크포인트를 DLM으로 돌릴 때 attention 층만 양방향화하고 RNN 층은 그대로 두는 방식이 통하며, 특히 큰 모델에서는 50B 토큰 수준에서 유용한 확산 능력이 나오고 그 이상 같은 레시피로 이어 학습하면 지식·수학 벤치마크가 오히려 나빠질 수 있다. 또한 이 논문은 post-training 이전의 베이스 DLM만 평가한다는 점을 기억해야 한다. SFT나 RL은 벤치마크 성능을 크게 바꾸고 레시피에 민감하기 때문에, 적응 자체와 분리된 문제로 취급한다.
저자들이 명시한 한계도 분명하다. 직접적인 아키텍처 비교는 dQwen3.5-2B와 dQwen3-1.7B라는 한 쌍, 한 스케일에서만 이루어졌고 trunk는 비슷하지만 부모 모델과 토크나이저가 다르다. 그래서 학습 손실 비교는 적응 속도에 대한 정보로는 유효하지만, 다운스트림 차이를 백본 구조 탓으로만 돌릴 수 없다. 학습 혼합도 더 튜닝할 여지가 있고, 개발 실험에서 혼합 선택이 적응 후 살아남는 능력을 크게 바꾼다는 것을 확인했다. 향후 과제로는 동일한 토크나이저·데이터·최적화 레시피 아래에서 하이브리드와 full-attention AR 모델을 처음부터 짝지어 사전학습한 뒤 둘 다 적응시켜, 관찰된 빠른 적응이 정말 하이브리드 구조 때문인지, 그리고 RNN 층의 비율과 배치가 트레이드오프에 어떤 영향을 주는지 분리해내는 연구를 제안한다.