Tacit-TTS가 마스크 예측으로 참조 전사 없는 음성 복제를 10배 빠르게 한다

Tacit-TTS: From Autoregressive Decoding to Masked Prediction for Efficient Transcript-Free Voice Cloning

HF Daily2609.38658

Jian Chen, You Zhang, Mark Vinton2026-09-29조회 2

무엇인가

제로샷 음성 복제는 짧은 참조 녹음만으로 처음 보는 화자의 음색과 감정을 재현하는 기술이다. 문제는 품질과 비용이 함께 커진다는 점이다. IndexTTS2 같은 산업 규모 시스템은 수만 시간의 음성으로 학습해 강한 제로샷 품질을 보이지만, 텍스트→시맨틱 단계를 자기회귀(AR)로 순차 디코딩하기 때문에 지연이 크다. 비자기회귀(NAR) 방식은 병렬 생성으로 이를 줄이지만, 대개 참조 음성의 전사(transcript)를 요구하고, 생성 전에 목표 길이를 미리 정해야 하는 고정 길이 디코딩 제약을 안고 있다. Tacit-TTS는 이 두 제약을 동시에 없애려는 시도다.

어떻게 동작하나

Tacit-TTS는 IndexTTS2를 교사로 증류한 2단계 시스템이다. 1단계 텍스트→시맨틱(T2S)에서 교사의 자기회귀 디코더를 마스크 예측 기반 양방향 DiT로 교체한다. 참조 조건은 그대로 물려받는데, 사전학습 인코더가 뽑은 고정 길이 화자 임베딩(32×d)과 감정 임베딩을 프리픽스 토큰으로 붙인다. 목표 텍스트 임베딩은 목표 시맨틱 길이 T로 업샘플링해 시맨틱 토큰 임베딩과 결합·선형 투영하므로, 트랜스포머 시퀀스 길이가 T+N_text가 아니라 T로 유지되고 텍스트-시맨틱 정렬 사전 정보가 명시적으로 주어진다. 디코딩은 완전 마스크 상태에서 시작해, 매 반복마다 마스킹된 위치를 병렬로 예측하고 확신도 높은 것부터 확정한 뒤 나머지를 다시 채우는 방식이다. 전방 패스 횟수가 출력 길이와 무관하게 고정된다는 점이 AR과의 결정적 차이다.

무엇과 다른가

NAR은 디코딩 전에 목표 시맨틱 길이 T가 필요하다. 저자들은 참조 전사나 학습된 duration predictor 대신, 참조 파형에서 직접 말 속도를 재는 학습 불필요(training-free) 전략을 쓴다. 앞뒤 무음을 제거한 참조 길이 D_r에 코덱 프레임레이트 f를 곱해 T_r을 얻고, 참조 오디오에서 추정한 음절 수 N_r^a로 나눠 속도 계수 ρ_r = T_r/(κ·N_r^a)를 만든다. 이 값을 [7,12]로 클리핑하고(κ는 중국어 0.92, 그 외 1), 목표 텍스트의 음절 수 N_x^t를 곱해 T̂ = round(N_x^t·ρ̃_r)를 얻는다. 최소 길이는 8이다. 참조 음절 수는 전사 없이 RMS 에너지 피크로 근사한다. 30ms 윈도우·10ms 홉으로 프레임 에너지를 dB로 바꾸고, YIN으로 유성 구간을 찾아 무성 프레임 에너지를 억제한 뒤, 적응형 임계값과 국소 돌출도, 최소 100ms 간격 조건을 만족하는 피크만 센다. 텍스트 음절 수는 중국어는 글자당 1음절, 영어는 textstat의 규칙 기반 추정기를 쓴다.

어떻게 쓰나

학습은 원시 음성 말뭉치가 아니라 교사가 합성한 데이터로 이뤄진다. 참조 음성에 내용과 무관한 목표 문장을 짝지어 교사에 통과시키고, 그 출력을 정답으로 쓴다. 손실은 같은 트랜스포머 몸통을 공유하는 두 헤드의 합이다. 마스크 예측 헤드는 마스크 비율 r=cos(u), u~U(0,π/2)로 마스킹한 위치에만 교차엔트로피를 건다. 마스크 비율은 16개 버킷으로 양자화해 AdaLN 변조 신호로 쓴다. 잔차 복원 헤드는 교사 표현을 S = vq2emb(y) + Δ로 분해했을 때 이산 코드 임베딩으로 설명되지 않는 연속 성분 Δ를 복원한다. IndexTTS2가 S2Mel 렌더러 성능을 끌어올린 그 GPT 잠재 특징을 NAR 구조에서도 유지하려는 설계다. 2단계 S2A에서는 교사 렌더러를 우리 T2S 출력 분포에 먼저 파인튜닝한 뒤, 원래 25 스텝이던 오일러 적분을 reflow로 4~8 스텝까지 줄인다. 학습 데이터는 T2S 87.4만 샘플(약 2천 시간, 참조 화자 2739명 중 영어 2342·중국어 397), S2A 결합 쌍 8천 개(약 36시간)로, IndexTTS2가 쓴 5.5만 시간에 크게 못 미친다.

전제와 한계

평가는 IndexTTS2가 쓴 네 개 제로샷 테스트셋 전량이다. LibriSpeech test-clean(영어, 2544개), SeedTTS test-en(1088개)·test-zh(2020개), AISHELL-1 test(중국어, 1000개). 베이스라인은 CosyVoice2, SparkTTS, MaskGCT, F5-TTS, 그리고 교사인 IndexTTS2다. Tacit-TTS는 배포 가능한 시스템 중 영어 화자 유사도(SS)가 가장 높고 내용 정확도에서도 최상위 베이스라인과 경쟁한다. 중국어 성능은 상대적으로 약한데, 저자들은 화자 커버리지 불균형(영어 2342 대 중국어 397)을 부분 원인으로 든다. 지각 품질(UTMOS·DNSMOS)은 네 테스트셋 모두에서 IndexTTS2에 근접한다.

같은 32개 발화(테스트셋당 8개, 평균 길이 약 5초)를 단일 A100에서 측정했을 때, 참조 조건 추출은 약 470ms로 교사와 동일한 일회성 비용이다. 차이는 T2S에서 나온다. 자기회귀를 마스크 예측으로 바꾸면서 5274ms가 199ms로 줄어 26.5배 빨라졌고, reflow가 S2A를 875ms에서 310ms로 줄였다. 생성 합계는 6149ms에서 509ms로 12.1배 단축된다. 모델 크기도 AR T2S 트랜스포머 527M을 269M 마스크 생성기로 대체해 줄었다. 속도 향상은 발화 길이에 따라 달라 4초에서 9.0배, 30초 부근에서 최대 14.9배, 62초에서 13.8배, 125초에서 11.8배다. 1분을 넘으면 NAR 단계의 완전 셀프 어텐션 O(n²) 비용이 따라붙기 때문이다. 기본 설정은 T2S 언마스킹 12스텝, reflow S2Mel 8스텝이다.

참조 전사가 필요 없는 조건은 교차언어·비어휘 참조에서 특히 드러난다. FLEURS에서 일본어·한국어·독일어·스페인어·러시아어·아랍어·힌디어·요루바 8개 언어 참조를 골라 영어·중국어 목표 문장을 생성했을 때, Tacit-TTS는 영어 목표에서 SS 0.789·WER 0.10%, 중국어 목표에서 SS 0.692·CER 1.90%를 기록했고 8개 언어 전체에서 오류율이 3.4% 아래로 유지됐다. 전사 의존 베이스라인들은 ASR이 참조 언어를 잘 지원하지 못하면 반복되거나 무관한 내용을 내놓거나 아예 생성에 실패했다. 유아 옹알이(70개 녹음)와 합성 횡설수설(10개 참조) 같은 비어휘 참조에서도 전사 없는 시스템은 모두 생성에 성공했고, Tacit-TTS는 유아 옹알이에서 영어·중국어 목표 모두 IndexTTS2보다 높은 화자 유사도를 보였다.

실무적으로 이 논문이 주는 신호는 두 가지다. 첫째, 참조 전사에 의존하는 TTS 파이프라인은 지원하지 않는 언어나 비언어적 발성, 음성 장애 화자의 녹음을 입력으로 받는 순간 조용히 무너진다. w2v-BERT 특징을 Perceiver로 압축한 자기지도 표현 조건을 쓰면 이 입력 단계 자체를 제거할 수 있다. 둘째, 자기회귀 시맨틱 디코딩은 출력 길이에 비례해 비용이 늘어나므로, 문단 길이 이상의 긴 발화를 대량 생성하는 워크로드에서는 마스크 예측 대체만으로도 10배 안팎의 처리량 차이가 난다. 다만 저자들이 밝힌 전제를 확인해야 한다. Tacit-TTS는 처음부터 학습한 모델이 아니라 IndexTTS2를 교사로 한 증류 모델이며, 목표는 교사 성능을 가능한 한 보존하면서 추론 효율을 높이는 것이다. 학습 데이터는 교사가 합성한 것으로, 교사의 원래 대규모 말뭉치에 접근하지 않는다. 중국어 품질은 화자 커버리지 불균형의 영향을 받고, 1분을 넘는 초장문에서는 O(n²) 어텐션 때문에 속도 이점이 줄어든다. 윤리 성명에서 저자들은 전사 없는 복제가 임의 녹음으로부터의 음성 복제 장벽을 더 낮춘다고 인정하며, 배포 시 화자 동의와 오디오 워터마킹·합성 음성 탐지 같은 안전장치를 함께 둘 것을 권고한다.