DLoop가 검증 전에 드래프트를 반복해 추론 속도를 높인다
DLoop: Looped Speculative Decoding
무엇인가
이 논문은 자기회귀 생성에서 추측 디코딩(speculative decoding)이 안고 있는 낭비를 다룬다. 추측 디코딩은 각 드래프팅 단계마다 가벼운 드래프트 모델이 토큰을 제안하고, 타깃 모델이 이를 검증하는 구조다. 문제는 드래프트 모델의 성능이 점점 좋아지면서 타깃 모델이 한 드래프팅 단계에서 나온 토큰을 전부 수용하는 경우가 잦아졌다는 점이다. 그런데도 각 드래프팅 단계 뒤에는 검증이 따라붙기 때문에, 드래프팅을 계속 이어갈 수 있었던 상황에서도 불필요한 타깃 모델 포워드 패스가 발생한다. 타깃 모델 포워드 패스가 추측 디코딩 비용의 핵심이라는 점에서 이 낭비는 곧 속도 손실이다.
어떻게 동작하나
기존의 적응형 드래프트 길이(adaptive draft length) 방법은 디코딩 중에 검증 앞에 몇 개의 드래프트 토큰을 둘지 결정한다. 하지만 이런 방법은 자기회귀 드래프트 모델에서만 속도 향상을 끌어올린다. 병렬 드래프트 모델의 경우, 드래프팅을 더 진행하려면 아직 검증되지 않은 드래프트 토큰에 대한 타깃 모델 은닉 상태(hidden state)가 필요하기 때문이다. 이것이 추가 드래프팅을 가로막는 구조적 걸림돌이다.
무엇과 다른가
DLoop는 이 지점을 반복(looped) 구조로 푼다. 검증 전에 여러 드래프팅 단계를 적응적으로 수행하는 추측 디코딩의 반복 형태다. 드래프트 모델이 확신을 유지하는 동안 드래프팅을 계속 이어가고, 그렇게 누적된 드래프트 토큰을 한꺼번에 검증한다. 검증 횟수를 줄이는 대신 드래프팅을 여러 번 도는 방식이다.
어떻게 쓰나
이를 뒷받침하는 요소가 루프 인지 학습(loop-aware training)이다. 드래프트 모델이 검증되지 않은 드래프트 토큰에 대한 자기 자신의 은닉 상태에 노출되도록 학습시켜, 추가된 드래프팅 단계에서도 드래프트 모델이 신뢰할 만한 제안을 내놓게 만든다. 결과적으로 DLoop는 드래프트 모델 포워드 패스를 더 쓰는 대신, 검증에 필요한 타깃 모델 포워드 패스 수를 줄인다. 비용이 싼 쪽에 지출을 옮기는 교환이다.
전제와 한계
실험은 EAGLE-3, DFlash, Domino, DSpark, 그리고 멀티 토큰 예측(multi-token prediction) 모듈을 포함한 다양한 추측 디코딩 방법 전반에서 이뤄졌다. 이들에서 DLoop는 무손실 디코딩(lossless decoding)을 유지하면서 벽시계 기준 속도 향상을 5~41퍼센트 개선했다고 보고한다. 초록 수준에서는 어떤 데이터셋과 어떤 모델 규모를 썼는지, 베이스라인 대비 세부 수치가 어떤지는 밝히지 않는다. 코드는 공개 예정이라고만 언급한다.
실무 관점에서 이 논문이 겨냥하는 지점은 분명하다. 추측 디코딩을 서빙에 쓰고 있고 드래프트 모델 품질이 이미 높다면, 수용률이 높아질수록 검증 오버헤드가 상대적으로 커지는 구간이 생긴다. DLoop는 그 구간에서 검증 전 드래프팅을 여러 번 돌리는 선택지를 준다. 도입을 검토한다면 무손실 디코딩이 실제로 유지되는지, 벽시계 시간 기준 이득이 나오는지, 그리고 자신의 드래프트 모델을 루프 인지 학습으로 다시 적응시킬 수 있는지를 먼저 확인해야 한다.
한계도 전제로 깔려 있다. DLoop는 드래프트 모델이 확신을 유지하는 동안에만 드래프팅을 이어가므로, 확신이 빨리 떨어지는 드래프트 모델에서는 반복 이득이 제한된다. 또한 루프 인지 학습을 통해 드래프트 모델을 추가 단계에 맞춰 적응시켜야 한다는 전제가 붙고, 드래프트 모델 포워드 패스를 더 쓰는 비용 자체는 남는다. 초록은 데이터셋 구성이나 평가 범위의 한계를 구체적으로 밝히지 않으며, 코드는 아직 공개 전이다.