화자 검증 EER 대신 임베딩 기하학으로 음성 유사도를 평가해야 한다

Rethinking Automated Voice Similarity by Shifting from EER to Embedding Geometry

HF Daily2609.33999

Szu-Chi Chen, Jia-Kai Dong, Yi-Cheng Lin2026-09-27조회 2

무엇인가

TTS나 음성 변환 시스템에서 합성 음성이 레퍼런스 화자의 음색을 얼마나 잘 재현했는지는 핵심 기능이다. 사람이 직접 채점하는 비용이 비싸기 때문에 실무에서는 화자 임베딩의 코사인 유사도를 자동 지표로 쓰고, 그 임베딩을 뽑을 모델은 화자 검증(SV) 성능, 즉 EER이 가장 낮은 것으로 고른다. 이 논문은 그 전제를 정면으로 검증한다. 사람의 음성 유사도 판단은 "매우 비슷함"과 "약간 비슷함"을 구분하는 연속적 판단인데, SV는 같은 화자인지 아닌지만 구분하는 이진 과제라는 불일치에서 출발한다.

어떻게 동작하나

방법의 핵심은 두 지표다. 먼저 사람 지각 정렬도 ρ_align은 VoxSim의 서로 다른 화자 쌍(16,905쌍)에 대해 임베딩 코사인 유사도와 청취자 평균 평점 사이의 스피어만 순위상관계수로 정의한다. 같은 화자 쌍을 넣으면 동일인 여부라는 이진 신호가 상관을 부풀리기 때문에(같은 화자 1, 다른 화자 0만 부여하는 베이스라인도 SRCC 0.715를 얻는다) 다른 화자 쌍만 평가한다. 다음으로 임베딩 기하를 재는 유효 차원 d_eff는 화자별로 평균 낸 1,251개 화자 중심 벡터를 L2 정규화·중심화한 뒤, 그 PCA 고유값 스펙트럼의 참여비(participation ratio)로 계산한다. 화자들이 몇 개의 독립적인 방향으로 퍼져 있는지를 나타내는 연속적 랭크 개념이다.

무엇과 다른가

실험은 아키텍처·입력·임베딩 폭이 다른 5개 모델 조건(ECAPA-TDNN 192차원, ReDimNet-B2 192차원, Fast ResNet-34 512차원, WavLM Base+ 트렁크를 얼린 WavLM-p1과 해제한 WavLM-p2)에서 진행했다. 각 조건마다 7개 목적함수(분류 계열 NSL·AM-Softmax·AAM-Softmax, 메트릭 계열 Prototypical·Angular Prototypical·GE2E·SupCon)를 3개 시드로 학습해 총 35개 조합을 만들고, VoxCeleb2-dev 5,994명으로 학습한 뒤 VoxCeleb1-O에서 EER을, VoxSim에서 ρ_align을 측정했다.

어떻게 쓰나

결과는 통념을 뒤집는다. 35개 조건 전체에서 EER과 ρ_align의 스피어만 상관은 +0.07에 불과했고, 단일 모델 조건 안에서는 부호가 -0.68에서 +0.61까지 불안정했으며 어떤 순열 검정도 영가설을 기각하지 못했다(p ≥ .11). 공개 SOTA 체크포인트들은 EER은 낮지만 정렬은 나쁜 좌하단 영역에 몰렸다. 반면 목적함수는 정렬을 크게 좌우했다. 모든 모델 조건에서 최고와 최저 목적함수의 ρ_align 차이가 3배를 넘었고 EER 손해는 없었다. Prototypical 계열이 0.395~0.499로 가장 높고 분류 계열이 0.080~0.298로 가장 낮았으며 AM-Softmax가 항상 최하위였다. ECAPA 조건에서 AAM-Softmax(0.111±0.013)를 Angular Prototypical(0.406±0.007)로 바꾸면 정렬이 거의 4배가 되면서 EER은 1.47%로 공동 최고를 유지했다.

전제와 한계

이 차이는 임베딩 기하로 설명된다. d_eff와 ρ_align의 스피어만 상관은 모델 조건별로 -0.71에서 -1.00, 35개 조건 통합 시 -0.95였고, ECAPA 조건 21개 런은 대각선에 밀착했으며 7개 조건 평균끼리는 -0.96이었다. 즉 화자를 더 적은 방향으로 퍼뜨린 모델이 사람 판단과 더 잘 맞는다. 이를 직접 조작한 실험이 차원 병목이다. ECAPA-TDNN을 n_out ∈ {512, 32, 10, 3}으로 재학습시키자 192에서 512로 넓히는 것은 EER·ρ_align·d_eff 모두 거의 바꾸지 못했지만(임베딩 차원은 상한일 뿐이다), 내재 차원 아래로 압축하자 d_eff가 줄고 ρ_align이 네 목적함수 모두에서 올랐다. 최하위였던 AM-Softmax는 n_out=3에서 ρ_align 0.738, d_eff 1.5로 이 연구 전체 최고 정렬을 기록했다. 다만 그때 EER은 20.5%로, VoxSim에서 사람이 보인 17.7%, VoxCeleb1의 15.8~26.5% 범위와 비슷한 수준까지 나빠진다.

개발자 관점에서 실무 지침은 두 가지다. 첫째, TTS·VC의 화자 유사도 평가에 쓸 임베딩 모델을 EER만 보고 고르지 말고, 후보 모델의 d_eff를 화자 중심 벡터의 PCA 참여비로 직접 계산해 보라. 사람 평점 없이도 정렬도를 가늠할 수 있는 값이다. 둘째, 목적함수 선택이 체크포인트 선택보다 정렬에 더 큰 영향을 준다. Prototypical·Angular Prototypical 계열이 분류 마진 계열보다 사람 지각에 가깝고, 검증 정확도를 크게 잃지도 않는다. 반대로 화자 식별 자체가 목적이라면 낮은 d_eff가 오히려 해가 된다.

저자들이 밝힌 전제와 한계도 분명하다. 모든 학습은 화자 ID 라벨만 사용하며 지각적 지도 신호는 쓰지 않는다. 평가는 서로 다른 화자 쌍에만 한정했고, ReDimNet-B2 조건에서는 d_eff와 ρ_align의 상관이 p=.088로 유의하지 않았다. 차원을 3까지 줄이면 학습이 불안정해져 AAM-Softmax는 3개 시드 중 2개가 수렴에 실패했고(d_eff≈1.1, EER>40%), n_out=3에서 EER은 13~37%까지 상승한다. 정렬 향상이 검증 성능과 맞바꾸는 관계라는 점, 그리고 이 결론이 VoxSim·VoxCeleb이라는 특정 코퍼스와 영어권 청취자 평점에 기반한다는 점을 감안해야 한다.