SwitchSD는 LLM 내부 표현으로 추측 디코딩의 복사 모드를 판별한다.

To Copy or Not to Copy: Controlling Speculative Decoding via Intrinsic Model Signals

arXiv2609.20186v1

Roy Eisenstadt2026-09-17조회 4

무엇인가

대규모 언어모델 추론에서 자기회귀 디코딩의 순차성은 테스트 시점 스케일링과 긴 사고 연쇄 생성에서 가장 큰 지연 원인이다. 추측 디코딩(Speculative Decoding, SD)은 가벼운 드래프트 모델이 후보 토큰을 제안하고 타깃 모델이 병렬 검증하는 방식으로 이를 완화해 왔는데, 여기에는 신경망 드래프트와 컨텍스트 복사라는 두 갈래 전략의 근본적 트레이드오프가 있다. EAGLE3 같은 신경망 드래프트는 다양한 텍스트에서 안정적이지만, 복사 기반 방법은 반복이 많은 구간에서 후보를 더 빠르게 만들고 긴 반복 구간을 거의 완벽하게 추측한다. 문제는 기존 복사 기반 방법들이 표면적 n-gram 겹침을 복사 의도로 오인한다는 점이다. 논문은 이를 우연적 반복(accidental repetition)이라고 부르며, 수학 추론처럼 변수명 n이 반복되는 상황에서 복사 드래프트가 잘못 발동하면 수용률 0의 검증 비용만 지불하는 추측 세금(speculation tax)이 발생한다고 분석한다. 저자들에 따르면 추론 중심 과제에서 전체 복사 시도의 50% 이상이 이런 거짓 양성이다.

어떻게 동작하나

SwitchSD의 핵심 주장은 복사가 표면 현상이 아니라 모델 내부 표현에 인코딩된 잠재 제어 신호라는 것이다. 저자들은 복사 의도 탐지를 이진 분류로 정식화하고, 어떤 토큰 위치가 컨텍스트 앞부분에 이미 등장한 최소 5개 토큰짜리 축자(verbatim) 시퀀스에 속하면 복사 모드(Y=1)로 라벨링한다. 학습 데이터는 Claude Sonnet으로 생성한 1,000개의 반복 구조 프롬프트에 타깃 모델이 완성을 생성하게 해서 만들며, 이렇게 수십만 개의 토큰 단위 라벨 인스턴스를 확보한다. 프로브는 각 레이어 ℓ마다 편향 없는 선형 투영 p_ℓ(j) = σ(w_ℓ^T H_j^(ℓ))로 구현되고, 이진 교차 엔트로피와 L2 정규화로 학습된다. 이후 검증셋에서 F1을 최대화하는 단일 레이어를 탐욕적으로 고르는데, Llama-3.1-8B에서는 중간층인 14층이 선택된다. 결정 임계값 τ도 같은 검증 분할에서 F1 최대로 정하며 Llama-3.1-8B 기준 약 0.4다. ROC 곡선의 AUC는 0.99를 넘어, 복사 모드가 잔차 스트림에서 거의 완벽하게 선형 분리된다는 것이 이 논문의 핵심 관찰이다.

무엇과 다른가

추론 시 SwitchSD는 매 디코딩 스텝에서 현재 토큰의 은닉 표현을 꺼내 프로브에 질의한다. 복사 기반 추측은 프로브 점수가 τ 이상이면서 동시에 현재 토큰에서 끝나는 κ-gram(κ=5)이 컨텍스트 안에 이전 등장을 가질 때만 켜진다. 즉 내부 의도와 외부 구조가 모두 맞을 때만 복사 경로를 연다. 복사가 발동하면 컨텍스트에서 길이 D짜리 후보 연속을 최대 W개 검색하고 최근 것 우선으로 순위를 매긴다. 이 후보들을 한 번의 타깃 모델 순전파로 검증하기 위해 블록 삼각(block-triangular) 어텐션 마스크를 쓴다. 각 후보의 토큰은 원래 프리픽스 전체와 자기 후보 내부의 선행 토큰에만 어텐션하고 다른 후보와는 격리되므로, W개 가설을 동시에 검증한 뒤 가장 길게 검증된 연속을 다음 스텝으로 채택한다. 복사 의도가 없는 생성 구간에서는 기존 SD에 드래프팅을 위임하며, 논문은 바닐라 추측 샘플링(SPS)과 EAGLE3 양쪽에 붙여 실험해 이 전환이 특정 드래프트 모델에 종속되지 않음을 보인다. 복사 경로가 채택될 때 드래프트 모델의 KV 캐시가 뒤처지는 문제는 지연 전파(lazy propagation)로 해결한다. 채택된 토큰을 다음 순전파 때 드래프트 모델에 통과시켜 동기화 비용을 다음 드래프팅 단계에 분산시키는 방식이다.

어떻게 쓰나

실험은 HumanEval(코딩), Math500(수학 추론), CNN/DailyMail(요약)에서 처리량(초당 토큰)과 자기회귀 대비 속도 향상으로 측정했다. 비교 대상은 휴리스틱 기반 PLD와 CopySpec, 신경망 전용 EAGLE3, 통계적 적응형 BanditSpec이며, 모델은 Llama-3와 Qwen-3 계열이다. 표 1의 9개 구성 전체에서 SwitchSD가 최고 처리량을 기록했고, 평균 속도 향상은 HumanEval 2.31배, Math500 2.03배, CNN/DM 1.83배다. 특히 EAGLE3 대비 최대 15% 향상으로, 신호 인지 컨텍스트 복사가 최강 신경망 추측기와 직교적이며 상보적임을 보인다. BanditSpec과의 대비가 인상적이다. Llama-3.3-70B의 Math500에서 BanditSpec은 블랙박스 탐색 비용 때문에 반복의 91%에서 복사를 선택하면서 평균 수용 길이가 0.28에 그쳐 효율이 0.99배로 붕괴한다. 같은 과제에서 SwitchSD는 복사를 8.9%만 발동하면서 평균 수용 길이 4.45를 달성해 1.48배 속도 향상을 낸다. 수용 길이 분해를 보면 이득은 빈도가 아니라 정밀도에서 온다. Llama-3.1-8B HumanEval에서 CopySpec은 수용 런 1.83인 반면 SwitchSD는 5.88이다. Qwen3-8B에 0.6B 드래프트를 붙인 SPS 구성에서도 HumanEval 처리량이 13.09 Tok/s로 SPS 12.35, CopySpec 12.31을 앞선다. 발동률은 HumanEval 7.2% 대 CopySpec 14.3%, Math500 8.6% 대 17.7%로 더 선택적인데 수용 길이는 각각 4.37 대 2.08, 4.08 대 2.05로 더 길다.

전제와 한계

4.2절의 사후 분석은 프로브가 실제로 디코딩을 두 체제로 분리한다는 증거를 제시한다. Llama-3.1-8B-Instruct의 HumanEval에서 매 스텝 복사 경로와 EAGLE3 경로를 모두 실행하고 프로브 예측으로 결과를 나눈 결과, 프로브가 비활성일 때 복사 드래프트는 0~2 토큰의 짧은 수용에 몰려 있고 활성일 때는 분포가 고수율 구간으로 크게 이동한다. 프로브 활성 시 궤적의 30.0%가 최대 추측 길이 20토큰에 도달하는데, 비활성 시에는 4.7%에 불과해 6.3배 차이다. 또한 복사 구간을 분리하면 신경망 드래프트가 맡는 토큰들이 평균적으로 더 어려워지므로 최적 룩어헤드 γ가 낮아진다. Llama-3.3-70B에서 7에서 5로 이동하는데, 저자들은 이를 전역 수용률에 맞춘 과잉 추측을 없애는 시스템 수준 최적화로 설명한다.

4.3절의 절제 실험은 설계 선택의 근거를 보여준다. 학습 데이터를 바꿔 보면 무작위 반복 토큰으로 만든 ConstructedCopy가 F1 0.65로 가장 나쁘고, WikiText-103이 0.81, 모델 생성 완성을 활용한 CopyDiversity(제안 방법)가 0.87이다. 복사 의도가 단순 구조 현상이 아니라 모델의 의미 처리와 연결돼 있음을 시사한다. 표현 위치 실험에서는 자기어텐션 서브레이어 이후 표현으로 학습한 프로브가 MLP 서브레이어 이후보다 일관되게 우수했고, 이는 복사 의도가 어텐션 기반 유도 회로(induction head)에 실린다는 가설과 맞는다. 신호 강도는 중간층에서 정점을 찍고 마지막 층에서는 어휘 로짓으로 변환되며 약해진다.

실무 관점에서 이 논문이 주는 메시지는 추측 디코딩의 병목이 드래프트 모델의 품질만이 아니라 드래프트 정책 선택에 있다는 것이다. 코드 생성이나 수학 풀이처럼 반복 구간과 새로운 추론 구간이 번갈아 나오는 워크로드에서 표면 n-gram 매칭 휴리스틱은 거짓 양성으로 처리량을 깎아먹는다. SwitchSD는 타깃 모델의 중간층 은닉 상태에 선형 프로브 하나를 붙이는 것으로 그 판단을 대체하며, 프로브 자체는 벡터 방향만 보는 선형 투영이라 오버헤드가 무시할 수준이라고 저자들은 주장한다. 도입을 검토한다면 자신의 모델과 레이어 조합에서 프로브를 다시 학습해야 하고(논문은 Llama-3.1-8B에서 14층, τ 약 0.4를 보고), κ=5 같은 구조 조건과 임계값이 정밀도와 발동률의 트레이드오프를 어떻게 움직이는지 자체 검증셋으로 확인해야 한다. EAGLE3를 이미 쓰고 있다면 대체가 아니라 위에 얹는 오케스트레이션 레이어로 접근하는 편이 논문의 설계 의도에 맞다.

저자들이 명시한 전제와 한계도 분명하다. 학습 라벨은 최소 5개 토큰의 축자 반복이라는 보수적 대리 지표이며, 저자들은 복사 의도가 정확한 n-gram 겹침만으로 완전히 규정된다고 주장하지 않는다고 밝힌다. 프로브가 표면 반복 패턴 탐지를 넘어 내부 복사 의도 신호를 포착한다는 해석과 그 한계는 부록 E에서 더 논의된다. 또한 학습 데이터는 Claude Sonnet으로 생성한 1,000개 프롬프트에 타깃 모델 완성을 붙여 만든 합성 자극 세트라 모델마다 재구성이 필요하고, 반복이 자연히 약한 CNN/DailyMail에서는 이득이 더 완만하다. 프로브의 레이어와 임계값 선택도 검증셋 F1 최대화에 의존한다.