HC-DLM이 연속 잠재와 토큰 피드백으로 병렬 디코딩의 독립성 한계를 푼다

Hierarchical Continuous Diffusion Language Models

arXiv2610.02193v1

Hui Ren2026-10-01

무엇인가

자기회귀 언어 모델은 좌에서 우로 순차 분해해 생성한다. 이 방식은 성공적이지만 논리 퍼즐 풀이나 산술 계획처럼 전역 제약 만족이나 양방향 계산이 필요한 작업에는 맞지 않는다. 이런 작업에서 자기회귀 모델은 수정하기 어려운 선택을 초반에 확정해 버린다. 이산 확산 언어 모델은 모든 토큰의 결합분포를 반복적 디노이징으로 모델링해 임의의 토큰 부분집합을 조건으로 삼고 여러 번의 양방향 패스를 거쳐 예측을 다듬으며, 각 스텝에서 여러 토큰을 병렬 디코딩한다. 그러나 병렬 디코딩의 핵심에는 토큰 의존성이라는 병목이 남는다. 한 디노이징 스텝에서 여러 위치를 언마스킹할 때 각 위치는 부분 시퀀스를 조건으로 한 주변분포에서 독립적으로 샘플링되므로, 동시에 디코딩된 토큰들의 결합분포가 주변분포의 곱으로 모델링된다. 이는 구문·논리·물리 제약으로 토큰이 강하게 얽힌 곳에서 정확히 실패한다. 연속 확산 언어 모델은 모든 토큰이 공유하는 연속 상태를 디노이징해 이 문제를 피한다. 토큰 임베딩을 디노이징하거나 인코더가 만든 압축 잠재를 디노이징하고, 깨끗해진 결과에서 토큰을 디코딩한다. 하지만 그 약점은 이산 쪽과 대칭적이다. 디노이저는 연속 상태만 입력으로 받고 목적함수 어느 항에도 궤적상의 토큰이 등장하지 않아, 최종 디코딩 스텝 전까지 유효한 토큰 구성과 묶여 있지 않다. 라운딩이나 자기조건화는 모델 자신의 토큰 추정을 입력으로 되먹이지만, 그 추정은 모델의 변수도 목적함수의 항도 아니라는 같은 문제를 공유한다.

어떻게 동작하나

HC-DLM은 이 두 약점이 상보적이며 해법도 상보적이라고 본다. 병렬로 디코딩되는 토큰은 의존할 공유 상태가 필요하고 연속 잠재가 그것을 제공하며, 디노이징되는 잠재는 묶여 있을 이산 구성이 필요하고 토큰이 그것을 제공한다. 제안하는 생성 모델의 역과정은 2단 체인이다. 연속 잠재 궤적 {x_t}가 스텝을 넘어 지속되는 유일한 상태다. 매 역스텝마다 토큰을 현재 잠재에서 읽기 분포 p_θ(k_t|x_t)로 읽어내고, 이산 순방향 커널로 다시 노이즈를 씌운 뒤, 다음 잠재 전이 p_φ(x_{t-1}|x_t,k_t)의 조건으로 되먹인다. 토큰 상태는 자체 순방향 커널을 가진 생성 모델의 변수이며, 이것이 되먹인 추정치와 scaffold를 구분하는 지점이다. 생성 모델에서 k_t는 x_t를 통해서만 과거에 의존하므로 토큰은 자체 전이 체인을 갖지 않고 모든 위치가 매 스텝 새로 읽히며 수정 가능하게 유지된다. 저자들은 이 구조를 계층적 결합이라 부른다. 순방향 과정은 q_ψ(x_0:T, k_1:T|k_0) = q_ψ(x_0|k_0) ∏ q(x_t|x_{t-1}) q(k_t|k_{t-1})로 정의되며, 학습되는 구성요소는 깨끗한 토큰 시퀀스를 연속 잠재로 만드는 인코더 q_ψ(x_0|k_0)뿐이다. 연속 노이징은 표준 가우시안 확산, 이산 노이징은 흡수(마스크) 또는 균등 상태 분포를 쓰는 범주형 순방향 과정이다. 두 순방향 체인이 서로 독립이라 양쪽 주변분포가 다루기 쉬운 형태로 유지된다.

무엇과 다른가

학습 목적함수는 이 2단 궤적에 대한 변분 하한에서 나온다. 논문의 명제 1은 로그 우도를 재구성 항, 종단 사전 정합 항, 경계 연속 디노이징 항, 인코더 엔트로피 항, 경계 이산 토큰 예측 항, 그리고 t≥2에 대한 디노이징 스텝 항으로 분해한다. KL을 연쇄법칙으로 풀면 각 디노이징 스텝이 이산 토큰 예측 KL과 연속 디노이징 KL로 갈라지는데, 전자는 범주형 이산 확산의 토큰 예측 KL과 같은 함수 형태를 가지므로 HC-DLM은 이산 확산의 지도 신호를 유지하면서 연속 디노이징 신호를 더한다. 실용 목적함수는 J = λ_recon·J_recon + λ_ent·J_ent + λ_cont·J_cont로 정리된다. J_recon은 잠재에서 깨끗한 토큰을 복원하게 하고, J_ent는 가우시안 인코더가 결정론적 사상으로 붕괴하는 것을 막고, J_cont는 토큰을 조건으로 한 연속 디노이징 궤적을 학습시킨다. J_cont는 조건부 플로 매칭으로 구현하며, 토큰 예측기는 x_0 예측 파라미터화를 써서 깨끗한 잠재 추정을 토큰 분포로 매핑한다. 이때 J_recon은 인코더 샘플 x_0에서 평가되므로 토큰 레벨 그래디언트가 디노이저에 도달하지 않는다. 추론은 x_T ~ N(0,I), k_T ~ π에서 시작해 매 스텝 (i) 디노이저로 scaffold를 조건으로 한 깨끗한 잠재 추정을 만들고 연속 상태를 x_{t-1}로 전진시키고, (ii) 토큰 예측기로 깨끗한 토큰을 읽어내고, (iii) 알려진 순방향 커널로 재노이징해 k_{t-1}을 얻는다. 마지막 스텝 뒤에는 p_θ(k_0|x_0)에서 최종 토큰을 반환한다. 흡수 커널을 쓸 경우 (iii)에서 무작위 재마스킹 대신 신뢰도 기반 적응적 재마스킹을 적용할 수 있다.

어떻게 쓰나

실험은 구조적 추론(스도쿠), 수학적 계획(카운트다운), 일반 언어 생성(LM1B) 세 과제에서 이뤄졌다. 스도쿠는 9×9 격자(L=81, K=10)이고 81칸이 모두 유일해와 일치해야 정답으로 센다. 학습에 쓰인 일곱 가지 논리 전략으로 풀리는 Easy 분할에서 HC-DLM은 최고 성능의 마스크드 디퓨전 변형과 훨씬 큰 42M 파라미터 자기회귀 모델을 능가했고, 같은 규모로 재현한 하이브리드 베이스라인 CCDD는 94.65 대 94.21로 근소하게 앞섰다. 반면 학습에 없던 전략이 필요한 Hard 분할에서는 HC-DLM이 CCDD를 72.41 대 70.73으로 앞서, 이점이 학습에 표현된 해법 전략을 벗어날 때 더 두드러진다. 카운트다운은 입력 수가 4개(CD4)와 5개(CD5)인 설정을 쓰고 정답률을 보고한다. HC-DLM은 같은 규모의 CCDD를 두 하위 과제 모두에서 앞섰고, 지평이 긴 CD5에서 격차가 37.52 대 25.35로 벌어졌다. 다만 훨씬 큰 이산 확산 모델들이 전체 최고 수치는 여전히 달성한다. LM1B는 길이 128, 디노이저와 토큰 디코더 합계 118M 파라미터(임베딩 제외)로 무조건 생성을 평가했고, GPT-2-Large 기반 생성 퍼플렉서티를 1024개 샘플, 128 샘플링 스텝, 분류기 없는 가이던스 w=2.75로 측정했다. HC-DLM은 평가된 확산 모델 중 최고 생성 퍼플렉서티를 기록해 모든 이산 확산 베이스라인과 마지막에 한 번만 디코딩하는 두 연속 모델을 앞섰고, 큰 배치 크기에서 wall-clock 샘플링 시간도 더 낮게 유지했다.

전제와 한계

절제 실험은 설계 선택의 필요성을 뒷받침한다. 디노이저에서 토큰 상태 k_t를 제거해 표준 연속 잠재 확산으로 만든 Latent DM은 최종 스텝에서만 토큰을 디코딩하며 HC-DLM에 크게 못 미쳤고, 잠재 레벨을 통째로 제거한 MDM은 독립 이산 샘플링의 한계를 드러냈다. 두 레벨 중 하나만 없애도 성능이 떨어지며, 전역 제약 만족이 중요한 Hard 분할에서 낙폭이 특히 크다. 이산 순방향 커널 비교에서는 적응적 순서가 흡수 커널을 소폭 개선했지만, 계층적 샘플러에서는 균등 커널이 훨씬 강해 모든 주요 실험의 기본값으로 쓰였다. 저자들은 그 이유를 두 가지로 설명한다. 흡수 손상은 잠재 디노이저에게 조건 scaffold로서 줄 내용을 비워 버리고, 적응적 언마스킹은 매 스텝 새로 읽어 수정 가능하게 유지하는 성질을 막는다. 정보 출현 분석에서는 t/T=1.0에서 정확도가 우연 수준이지만 이후 Latent DM보다 훨씬 이르게 상승해 더 높은 정체기에 도달했고, 스텝 수를 줄여도 정확도가 강건하게 유지된 반면 MDM은 스텝이 줄수록 더 급격히 무너졌다.

개발자 관점에서 이 논문은 병렬 디코딩 확산 모델을 전역 제약이 강한 작업에 쓸 때 무엇을 설계해야 하는지에 대한 답을 준다. 토큰 간 의존성이 성능을 좌우하는 퍼즐 풀이, 계획, 구조적 추론 파이프라인이라면 순수 마스크드 디퓨전보다 연속 잠재와 토큰 피드백을 함께 두는 구조가 유리할 수 있다. 도입을 검토할 때 확인할 지점은 명확하다. 기본 이산 커널은 균등 커널이고, 샘플링 스텝 수와 NFE를 줄여도 정확도가 유지되는지, 배치 크기를 키울 때 wall-clock이 실제로 이득인지, 그리고 보고된 파라미터 수가 임베딩을 제외한 샘플링 시점 생성 파라미터 기준이라는 점이다. 또한 인코더를 생성 모델과 공동으로 학습해야 하므로 학습 파이프라인이 기존 마스크드 디퓨전보다 복잡해진다는 비용을 감안해야 한다.

원문에는 별도의 한계 절이 없고, 결론도 계층적 결합이 토큰 독립성 병목을 완화한다는 주장으로 끝난다. 다만 본문에서 확인되는 전제와 조건은 분명하다. 카운트다운에서는 훨씬 큰 이산 확산 모델이 여전히 최고 수치를 내며 HC-DLM은 파라미터 비용의 일부로 경쟁력을 유지하는 위치에 있다. 스도쿠 Easy 분할에서는 같은 규모 CCDD가 94.65 대 94.21로 근소하게 앞서므로, 이 방법의 이점은 학습 분포를 벗어난 Hard 설정에서 주로 나타난다고 읽어야 한다. LM1B 평가는 118M 파라미터, 길이 128, 무조건 생성, GPT-2-Large 기반 퍼플렉서티라는 특정 프로토콜에 한정되며, 절제 결과는 두 레벨 중 하나라도 제거하면 성능이 크게 떨어진다는 점을 보여 방법의 구성요소가 선택이 아니라 필수 조건임을 시사한다.