억양 유추 가이던스로 크로스링구얼 음성 복제의 화자 유사도를 지킨다

Accent Analogy Guidance: More Speaker Similarity at Equal Accent in Cross-Lingual Voice Cloning

HF Daily2609.29123

Yoomee Cho, Jisun Lee2026-09-24

무엇인가

자동 더빙은 번역된 대사를 원 화자의 목소리로 다시 입히는 작업이고, 제로샷 TTS가 짧은 참조 음성(보통 화자 자신의 원어 대사)으로 그 목소리를 복제한다. 참조와 목표가 다른 언어일 때 모델은 발음까지 함께 베껴서 더빙이 외국어 억양처럼 들린다. 기존 추론 시점 해법은 조건부 무분류기 가이던스(CFG)를 조작하는 것, 즉 참조와 텍스트에 다른 가중치를 주거나 스텝별로 가중치를 바꾸거나 잔차를 분해하거나 언어 태그 대비를 쓰는 것이었다. 문제는 이런 재가중이 같은 참조 증거를 다시 스케일링할 뿐이라 억양과 화자가 같이 움직인다는 점이다. 논문은 이를 화자 정체성 대 억양의 하나의 트레이드오프 곡선으로 정식화하고, 그 곡선 위에서 같은 억양일 때 화자 유사도가 얼마나 더 높은지(ΔSIM)를 방법의 점수로 삼는다.

어떻게 동작하나

제안 방법은 억양 유추 가이던스(AAG)로, 학습이 필요 없는 샘플러 항이다. 핵심 착상은 언어만 다른 한 목소리의 두 렌디션, 즉 프록시 음성이 원어를 말할 때와 목표 언어를 말할 때의 모델 예측 차이를 빼면 화자가 상쇄되고 억양 방향만 남는다는 것이다. 수식으로는 d_v = ℓ(c_v^src) − ℓ(c_v^tgt)가 원어 억양과 목표 언어 억양의 로그 확률 차이가 된다. 이를 M개의 프록시에 대해 평균 내고, 기존 이중 가중 가이던스 식 ℓ = ℓ_u + a_t(ℓ_t − ℓ_u) + a_s(ℓ_c − ℓ_t)에서 이 방향을 β/M만큼 빼준다. β = a_s로 두면 이는 "같은 화자, 목표 언어 억양"이라는 반사실적 참조로의 가이던스와 같아지는데, 그런 오디오는 존재하지 않지만 방향으로는 존재한다. 프록시는 언어쌍·성별당 하나씩 M=2로 쓰고 테스트 화자는 쓰지 않는다. 실전 설정은 a_s=3에서 β=5였고, β 하나로 트레이드오프 전체를 훑을 수 있다. 비용은 프록시마다 스텝당 네트워크 평가가 두 번 추가되는 정도로, RTX 3090에서 OmniVoice 한 라인당 2.0초가 3.3초가 된다.

무엇과 다른가

실험은 공개 체크포인트 5개(OmniVoice, MaskGCT, F5-TTS, X-Voice, CosyVoice 2)에서 이뤄졌다. 베이스라인은 같은 잔차를 재가중하는 4가지 변형과 방향을 더하는 3가지 변형, 총 7개 추론 시점 변형이며, 이들은 모두 모델 자신의 재가중 곡선(상부 볼록 껍질)을 0.05 이상 벗어나지 못했다. 반면 AAG는 OmniVoice의 공개 Zeroth-Korean에서 (3,5,5) 설정으로 억양을 2.86에서 3.49로 올리면서 화자 유사도 0.457(튜닝 설정 0.514)을 유지해 ΔSIM +0.11[+0.04,+0.16], Δaccent +0.33을 기록했다. 홀드아웃 더빙 세트에서는 억양이 3.51에서 4.28로 오르고(참조 없는 음성 4.33과 0.05 차이) 화자 유사도는 0.294로, 같은 억양에서 곡선이 0.02밖에 유지하지 못하는 지점에서 ΔSIM +0.27[+0.02,+0.34]이었다. 중국어가 원어인 THCHS에서는 화자 유사도 변화 없이 억양 +0.39, ΔSIM +0.15였다. 41명 화자 폐집합 식별(우연 2.4%)에서 AAG는 95/97%, 99/90%, 69/81%를 유지한 반면 같은 억양까지 재가중을 밀면 81%, 71%, 홀드아웃 4%로 무너졌다. WER은 1%p 이내, UTMOS는 0.20 이내 차이다.

어떻게 쓰나

다른 모델로의 전이와 사전 진단도 함께 보고된다. MaskGCT는 음향 단계가 화자 프롬프트 음색을 다시 입혀 재가중만으로도 유사도가 유지되므로 이득이 작지만, 대안 설정 (1.5,5,2)는 모든 재가중 설정보다 더 원어민적(3.10 대 최대 3.04)이면서 유사도 0.48 대 0.29로 곡선 위 +0.20이었다. F5-TTS는 재가중이 억양을 거의 못 움직이는(최대 1.76) 경우로, AAG (2,5,2)가 모든 재가중 설정보다 +0.36 더 원어민적이면서 유사도 0.38 대 0.24를 지켰다. CosyVoice 2는 전제가 약하게만 성립(0.86)하는데도 주 설정이 곡선 위 +0.07이고 자체 크로스링구얼 모드보다 +0.37 더 원어민적이었다. X-Voice는 전제가 깨져 AAG가 이득이 없는(−0.05) 유일한 모델로, 사전에 예측된 예외다. 통제 실험은 효과가 언어 특정적임을 보인다. 잘못된 언어의 프록시는 이득을 없애고(ΔSIM +0.03, 유의하지 않음), AAG 방향 중 참조 잔차와 평행한 성분은 이득의 37% 이하만 설명하며, 프록시 정체성 누출은 프록시 2개일 때 +0.02~+0.06에 그친다. LLM 판정 외에 Whisper 언어 ID와 한국어 원어민 11명을 포함한 12명 청취 패널도 같은 결론을 냈다.

전제와 한계

개발자 관점에서 이 논문이 주는 실무적 신호는 세 가지다. 첫째, 더빙 파이프라인에서 억양을 낮추려고 CFG 가중치를 만지는 접근은 화자 정체성을 함께 잃는 곡선 안에 갇혀 있으므로, AAG처럼 억양 방향을 별도 항으로 분리해 빼는 편이 같은 억양에서 더 나은 화자 유사도를 준다. 둘째, 도입 전에 전제 테스트를 돌려야 한다. 참조 언어를 바꿔도 억양이 거의 변하지 않는 모델(X-Voice)에서는 AAG가 아무것도 제거하지 못한다. 셋째, β는 모델별로 작은 스윕이 필요하고 프록시 세트 선택에도 민감하므로, 자체 언어쌍·화자 세트에서 검증한 뒤 고정하는 편이 안전하다. 학습이 필요 없고 토큰·로짓·플로우 샘플러 모두에 적용되며 β=0이면 원본 샘플러와 토큰 단위로 동일하다는 점은 기존 서비스에 얹기 쉬운 조건이다.

저자들이 밝힌 한계는 분명하다. 주 평가지표가 LLM 판정(Gemini 2.5 Pro)이라는 점인데, Whisper 언어 ID는 THCHS와 스페인어 목표, F5-TTS에서 판정과 어긋난다. 프록시 세트에 민감해서 같은 11개 목소리에서 뽑은 다른 두 세트는 홀드아웃에서는 비슷한 이득(+0.26, +0.23)을 냈지만 Zeroth에서는 절반(+0.05, +0.06)에 그쳤다. β도 모델별 소규모 스윕이 필요하고, MaskGCT와 CosyVoice 2의 주 설정은 통계적으로 유의하지 않았다. 또한 AAG는 참조 언어가 유발하는 억양만 제거할 수 있다는 전제 위에 서 있으며, 이 전제만으로는 8개 결과의 순위를 설명하지 못하고 곡선의 도달 범위를 함께 봐야 한다.