마스크 확산 언어모델은 상태가 바뀔 때만 언마스킹 전략을 바꿔야 한다

Unmask the State: When Does State Adaptation Matter for Masked Diffusion Language Models

HF Daily2609.33355

Injin Kong, Sunghwan Choi, Yohan Jo2026-09-27

무엇인가

마스크 확산 언어모델(MDM)은 마스킹된 토큰을 반복 복원하며 생성 순서가 고정되지 않아, 각 단계에서 어떤 위치를 얼마나 공개할지가 추론 결정이 된다. 기존 연구는 신뢰도·안정성·엔트로피 기반 우선순위, 병렬성, 블록·윈도우 같은 영역 제한, 재예측 가능성, 미래 디노이징 계획을 다루지만, 생성 중에 그 선택을 언제 바꿔야 하는지는 명확히 답하지 않는다. 이 논문은 고정 선택보다 대안 행동이 더 좋아지는 전략 반전(strategy reversal)을 기준으로 이 질문을 다룬다.

어떻게 동작하나

방법의 뼈대는 언마스킹 전략을 다섯 축으로 분해하는 것이다. 점수(score)는 여러 스코어링 규칙의 혼합 가중치로 우선순위를 정하고, 영역(region)은 현재 마스킹 위치에 대한 이진 마스크로 선택 가능한 후보 영역을 제한한다. 개수(cardinality)는 공개 비율 κ로 한 번에 드러낼 위치 수를 k=ceil(κ|R|)로 정하며, 확정(commitment)은 새로 공개한 예측을 되돌릴 수 있는지 이진 벡터로 나타낸다. 계획(planning)은 고정하고 앞의 네 축을 전이 수준에서 평가한다. 이 통합 행동 a_t 아래에서 기존 알고리즘은 각 구성요소를 고정하거나 제한하는 특수 사례로 볼 수 있다.

무엇과 다른가

적응 기회(adaptation opportunity)는 현재 상태 z에서 행동 a를 취한 뒤 고정 연속 정책을 따를 때의 일보 기대 효용 Q(z,a)로 정의된다. 검증 프롬프트로 고른 최선 고정 행동 a_fix*보다 상태별 최선 후보 행동이 얼마나 더 좋은지를 g(z)로 두고, 그 평균이 Δ_adapt다. 논문의 정리 1은 Δ_adapt = Pr(R)·E[g(z)|R], R={z:g(z)>0}로 분해해 적응 가치가 반전이 일어나는 빈도와 그때의 평균 이득의 곱임을 보인다. 두 행동만 있는 경우에는 Δ=(E|D|-|E D|)/2로 표현된다. 따라서 작은 평균 차이가 드문 큰 반전에서 나올 수도 있고, 흔하지만 작은 반전에서 나올 수도 있으며, 일부 상태에 기회가 집중될 수 있다.

어떻게 쓰나

선택적 적응은 두 문제를 분리한다. 행동 선택은 어떤 대안을 쓸지 정하고, 기회 검출은 지금 고정 행동에서 벗어날 가치가 있는지 판단한다. 축별 진단은 추가 디노이저 순전파 없이 궤적 통계로 후보 행동을 제안한다. 점수 축은 스코어링 규칙 간 순위 신뢰도와 중복을 보고, 영역 축은 우선순위 지형의 위치 이동을 측정한다. 개수 축은 지금 공개하는 이득과 기다려 얻을 문맥 전이를 비교하고, 확정 축은 공개 예측의 지속 문맥 가치와 나중 후验 변화에 따른 수정 압력을 비교한다. 검증 프롬프트에서 진단값을 분위 구간으로 나눠 구간별 평균 기회를 캘리브레이션한 뒤, 추정 기회가 임계값 τ 이상일 때만 진단 행동을 쓰고 아니면 검증에서 고른 고정 행동을 유지한다.

전제와 한계

실험은 LLaDA-8B-Instruct, LLaDA-1.5, Dream-7B를 CSV Missing Cells, HumanEval, Multi-Span Cloze, GSM8K, Carry RTL, TD07 Sparse Mask, JSON Mode Eval, Constrained JSON Fill, Unique List Commit, HTML Close Tags의 열 개 과제에서 평가한다. 프롬프트당 8개 상태를 샘플링하고 후보 상태-행동 효용은 4개 연속 롤아웃으로 추정하며, 개입 지평은 한 단계, 온도는 0이다. 검증 프롬프트로 고정 행동과 임계값, 기회 검출기를 캘리브레이션하고, 순위·커버리지 분석은 분리된 held-out 프롬프트에서 수행한다. 여기서 오라클은 무제한 최적 디코더가 아니라 교차적합된 후보집합 오라클이다.

결과는 적응 기회가 매우 이질적임을 보여준다. 모델-과제별 가장 강한 축의 교차적합 후보집합 오라클 격차는 LLaDA-8B 0.0025~0.0454, LLaDA-1.5 0.0025~0.0450, Dream 0~0.1325였다. 집중도에서는 LLaDA-1.5 Carry RTL/region의 양의 기회 비율이 11.4%인데 양방향 반전 질량은 0.0200으로 나타나 빈도와 효용 크기가 다를 수 있음을 보였다. 행동 선택 실험에서는 7개 과제-모델-축 조합이 탐색적 생존 스크린을 통과했고(LLaDA-8B 2개, LLaDA-1.5 2개, Dream 3개), 세 모델 모두에서 통과한 과제-축 쌍은 없었다. 가장 분명한 교차 모델 재현은 LLaDA-8B와 Dream의 HTML Close Tags/region이었다. 기회 검출의 모델 평균 AUROC는 LLaDA-8B 약 0.545, LLaDA-1.5 약 0.541, Dream 약 0.571이었고, 10% 선택적 이득이 양수인 설정은 각각 3개, 1개, 5개뿐이었다. LLaDA-8B Constrained JSON Fill/region은 AUROC 0.854로 상위 10% 상태에서 오라클 기회의 56.9%를 포착했고, 상위 5%·10%·20%에서 각각 35.3%·56.9%·84.3%를 회수했으며 실현된 일보 이득은 20% 커버리지에서 포화했다. Dream Carry RTL/cardinality는 AUROC 0.802로 10%에서 64.3%를 포착했다. 반면 Dream JSON Mode Eval/score는 AUROC 0.891이지만 상위 10%에서 효용 질량을 전혀 포착하지 못하고 이득도 없어, 이진 검출과 효용 순위화가 다르다는 점을 보여준다.

끝으로 종단 디코딩에서는 항상 진단 행동을 쓰는 적응이 세 모델의 예시 설정 모두에서 성능을 해쳤고, 선택적 적응은 최선 고정 행동 대비 LLaDA-8B 20.5%p, LLaDA-1.5 15.4%p, Dream 10.0%p 개선했다. 과제 매크로 효용은 LLaDA-8B 0.392→0.424, LLaDA-1.5 0.344→0.384, Dream 0.411→0.467로 각각 +3.2, +4.0, +5.6포인트였으며, 항상 진단 적응은 0.370, 0.334, 0.447로 더 약했다. 저자들은 적응이 무조건이 아니라 예측 가능한 기회가 있을 때만 작동하는 조건부·레짐 의존적 선택이어야 한다고 결론짓는다. 한계로는 많은 설정에서 검출기가 우연 수준에 가깝고, 오라클 기회의 존재가 예측 가능성이나 활용 가능성을 보장하지 않으며, 단일 보편 진단이 없다는 점, 계획 축을 고정했다는 점, 일보 분기 효용이 종단 생성 품질을 보장하지 않는다는 점, 오라클이 후보집합 기준이라는 점이 남는다.