HC-DLM이 연속 잠재와 토큰 피드백을 맞물려 병렬 디코딩의 독립성 문제를 푼다

Hierarchical Continuous Diffusion Language Models

HF Daily2610.02193

Hui Ren, Zihan Li, Chang Liu2026-10-01

무엇인가

자기회귀(AR) 언어 모델은 텍스트를 좌에서 우로 생성한다. 이 순차 분해는 성공적이지만, 논리 퍼즐 풀이나 산술 계획처럼 전역 제약 만족이나 양방향 계산이 필요한 과제에는 맞지 않는다. 이런 과제에서 AR 모델은 되돌리기 어려운 선택을 초반에 확정해 버린다. 이산 확산 언어 모델은 모든 토큰의 결합분포를 반복적 디노이징으로 모델링해 대안을 제시하지만, 병렬 디코딩의 핵심에 구조적 병목이 남는다. 한 디노이징 스텝에서 여러 위치를 동시에 언마스킹할 때 각 위치는 부분 시퀀스에 조건화된 주변확률에서 독립적으로 샘플링되고, 그 결과 동시에 디코딩된 토큰들의 결합분포가 주변확률의 곱으로 모델링된다. 구문·논리·물리 제약으로 토큰이 강하게 얽힌 지점에서 정확히 이 근사가 깨진다. 연속 확산 언어 모델은 모든 토큰이 공유하는 연속 상태를 디노이징해 이 문제를 피하지만, 디노이저가 그 연속 상태만 입력으로 받고 목적함수의 어떤 항도 궤적 상의 토큰을 포함하지 않아 최종 디코딩 단계 전까지 유효한 토큰 구성과 묶이지 않는다. 라운딩이나 자기조건화로 모델 자신의 토큰 추정을 되먹이는 방식도 그 추정이 모델의 변수도 목적함수의 항도 아니라는 점에서 같다.

어떻게 동작하나

논문이 제안하는 HC-DLM(Hierarchical Continuous Diffusion Language Models)은 이 두 약점이 상보적이라는 관찰에서 출발한다. 병렬로 디코딩되는 토큰에는 의존할 공유 상태가 필요하고 연속 잠재가 그것을 제공하며, 디노이징되는 잠재에는 묶여 있을 이산 구성이 필요하고 토큰이 그것을 제공한다는 것이다. 그래서 역과정을 두 레벨 체인으로 구성한다. 연속 잠재 궤적 {x_t}가 스텝을 넘어 지속되는 유일한 상태다. 매 역스텝마다 토큰을 현재 잠재에서 읽기 분포 p_θ(k_t|x_t)로 읽어내고, 이를 이산 전방 커널로 다시 노이즈 처리해 다음 잠재 전이 p_φ(x_{t-1}|x_t,k_t)의 조건으로 되먹인다. 토큰 상태는 자체 전방 커널을 가진 생성 모델의 변수이며, 이것이 단순히 되먹인 추정치와 스캐폴드를 구분하는 지점이다. 생성 모델에서 k_t는 x_t를 통해서만 과거에 의존하므로 토큰은 자체 전이 체인을 갖지 않고, 모든 위치가 매 스텝 새로 읽혀 수정 가능하게 유지된다. 저자들은 이 구조를 계층적 결합(hierarchical coupling)이라 부른다.

무엇과 다른가

전방 과정은 두 궤적을 독립적으로 손상시킨다. 학습되는 부분은 인코더 q_ψ(x_0|k_0) 하나로, 깨끗한 토큰 시퀀스의 연속 잠재 표현을 만들며 생성 모델과 함께 학습되어 잠재 기하가 디노이징 요구에 적응한다. 연속 노이징은 표준 가우시안 확산이라 주변분포와 사후분포가 닫힌 형태로 나오고, 이산 노이징 커널은 흡수(마스크) 상태나 균등 상태를 쓰는 categorical 전방 과정이다. 두 전방 체인이 독립이기 때문에 두 주변분포가 모두 다루기 쉬운 형태로 유지된다. 이로부터 토큰 우도에 대한 변분 하한(ELBO)을 유도하는데, 항목은 (i) 데이터 재구성 로그우도, (ii) 학습 파라미터가 없는 종단 사전 매칭, (iii.a) 경계 연속 디노이징 로그우도, (iii.b) 인코더 엔트로피(변분 인코더가 퇴화하지 않도록 불확실성을 장려), (iii.c) 경계 이산 토큰 예측 크로스엔트로피, (iv) t≥2 구간의 디노이징 스텝으로 나뉜다. KL을 체인룰로 분해하면 (iv)는 이산 토큰 예측 항과 연속 디노이징 항으로 갈라지고, 전자는 categorical 이산 확산의 토큰 예측 KL과 같은 함수 형태를 가지므로 HC-DLM은 이산 확산 지도 신호를 유지하면서 연속 디노이징 신호를 더한 셈이 된다. 실전 목적함수는 J = λ_recon·J_recon + λ_ent·J_ent + λ_cont·J_cont로 정리되며, J_cont는 Conditional Flow Matching으로 구현한다. J_recon은 인코더 샘플 x_0에서 예측기를 평가하기 때문에 토큰 수준 그래디언트가 디노이저로 흐르지 않는다. 추론은 x_T ~ N(0,I)와 k_T ~ π에서 시작해, 각 스텝에서 디노이저로 스캐폴드 조건부 깨끗한 잠재 추정 x̂_0를 만들어 연속 상태를 x_{t-1}로 진행시키고, 토큰 예측기로 x̂_0에서 깨끗한 토큰을 읽어낸 뒤, 알려진 전방 커널로 재노이즈해 k_{t-1}을 얻는 과정을 반복한다.

어떻게 쓰나

실험은 구조적 추론(Sudoku), 수학적 계획(Countdown), 일반 언어 생성(LM1B) 세 과제에서 이뤄졌다. Sudoku는 9×9 격자(L=81, K=10)로 81칸이 모두 정답과 일치해야 정답으로 인정하며, Shah 등(2024)의 표준 분할(Easy)과 그 전략 집합 밖의 전략이 필요한 Hard 분할을 쓴다. 결과에서 HC-DLM은 Easy에서 최고 성능 마스크 확산 변형과 훨씬 큰 42M 파라미터 AR 모델을 앞섰고, 같은 6M 파라미터 규모로 재현한 하이브리드 베이스라인 CCDD는 94.65로 HC-DLM의 94.21보다 근소하게 높았다. 반면 분포 밖 Hard 분할에서는 HC-DLM이 72.41로 CCDD의 70.73을 앞섰는데, 저자들은 학습에 나타난 해법 전략을 벗어난 경우에 이점이 더 뚜렷하다고 해석한다. Countdown은 50만 문제, 목표값의 10%를 분포 밖 평가용으로 떼어 두고 입력 수 4개(CD4)와 5개(CD5)를 쓴다. 여기서도 HC-DLM은 같은 규모의 하이브리드 CCDD를 두 하위 과제 모두에서 앞섰고, 더 긴 지평인 CD5에서 격차가 벌어졌다(37.52 대 25.35). 다만 훨씬 큰 이산 확산 모델들이 전체 최고 수치는 여전히 더 좋다고 논문은 밝힌다. LM1B에서는 시퀀스 길이 128, 임베딩을 제외한 디노이저·토큰 디코더 118M 파라미터로 무조건부 생성을 평가했고, GPT-2-Large 기준 생성 퍼플렉서티를 1,024개 샘플, 128 샘플링 스텝, classifier-free guidance w=2.75 설정으로 측정했다. HC-DLM은 평가된 확산 모델 중 최고 생성 퍼플렉서티를 기록해 모든 이산 확산 베이스라인과, 끝에서 한 번만 디코딩하는 두 연속 모델을 앞섰다. 큰 배치 크기에서는 wall-clock 샘플링 시간도 더 낮게 유지됐다.

전제와 한계

어블레이션은 계층적 결합 자체가 이득의 원인이라는 가설을 검증한다. 토큰 레벨을 제거해 표준 연속 잠재 확산 모델로 만든 Latent DM은 HC-DLM에 크게 못 미쳤는데, 이는 이산 스캐폴드 없는 연속 잠재가 정밀한 토큰 수준 제약을 과도하게 평활화한다는 것을 보여준다. 잠재 레벨을 통째로 제거한 MDM 베이스라인은 독립 이산 샘플링의 한계를 드러냈다. 이산 전방 과정 설계에서는 흡수 커널에 적응적 언마스킹(top-prob., top-prob. margin)을 적용하는 것이 흡수 커널 자체를 소폭 개선했지만, 균등 커널이 계층적 샘플러에서는 훨씬 강력해 모든 주요 실험의 기본값으로 쓰였다. 저자들의 설명은 두 가지다. 이산 상태가 잠재 디노이저에 유용한 조건 스캐폴드 역할을 하는데 흡수 손상은 그 내용을 비워 버리고, 매 스텝 읽어내기는 모든 위치를 수정 가능하게 유지하는데 적응적 언마스킹은 이를 봉쇄한다는 것이다. 정보 출현 분석에서는 각 스텝의 중간 깨끗한 잠재 예측을 토큰으로 디코딩해 정확도를 재보면, t/T=1.0에서 우연 수준이던 정확도가 Latent DM보다 훨씬 이른 시점에 상승해 더 높은 정체 구간에 도달한다. 연속 디노이저를 이산 스캐폴드 k_t에 조건화하는 것이 구조적 제약을 더 일찍 고정하고, 최종 경계 스텝에서 한 번에 해결하는 대신 피드백 루프를 통해 점진적으로 정련한다는 해석이다. Hard Sudoku에서 스텝 수를 줄여도 HC-DLM은 강건하게 유지된 반면 순수 이산 MDM은 스텝이 줄수록 더 급격히 무너졌다.

개발자 관점에서 이 논문이 건드리는 지점은 병렬 디코딩의 조건부 독립 근사다. 마스크 확산 계열을 추론 서버에 얹어 스텝 수를 줄이거나 배치를 키울 때, 정확도가 스텝 수에 민감하게 흔들리는 현상은 이 근사에 기대는 정도가 크기 때문일 수 있다. HC-DLM은 토큰을 매 스텝 다시 읽어 수정 가능하게 두고 그 읽기 결과를 잠재 갱신의 조건으로 되먹이는 구조로, 스텝 수를 줄여도 정확도를 유지하는 쪽에 무게를 둔다. 다만 실제 도입을 검토한다면 몇 가지를 확인해야 한다. Sudoku와 Countdown 비교는 6M 파라미터 규모에서 이뤄졌고 CCDD 베이스라인은 원 백본을 저자들 것으로 교체해 재현한 결과이므로, 자기 환경의 모델 크기·백본에서 같은 이점이 나오는지는 별개 문제다. LM1B 평가는 길이 128의 무조건부 생성에 한정되며 조건부 생성이나 긴 문맥으로의 확장은 이 논문에서 다루지 않는다. 또한 균등 커널이 기본값이라는 점은 마스크 기반 파이프라인을 그대로 재사용하려는 팀에는 추가 구현 부담이 된다.

원문에 별도의 한계 절은 제시되지 않았다. 다만 본문에 드러난 전제는 분명하다. 모든 주요 비교는 동일 모델 크기 조건에서 이뤄졌고, Countdown에서는 훨씬 큰 이산 확산 모델들이 전체 최고 수치를 여전히 달성한다고 저자들이 직접 인정한다. Sudoku Easy 분할에서는 같은 규모의 CCDD가 HC-DLM보다 근소하게 높은 정확도를 기록했으며, 저자들은 이 방법의 이점이 학습에서 본 해법 전략을 벗어난 Hard 분할에서 더 뚜렷하다고 위치시킨다. 즉 계층적 결합의 이득은 과제의 전역 제약 강도와 분포 이동 여부에 의존한다는 것이 실험 결과가 말하는 범위다.