정렬 후 추론으로 무음 영상 더빙 립싱크를 판정한다

Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing

HF Daily2610.00825

Rui Liu, Bhavin Jawade, Haoqi Li2026-09-30

무엇인가

이 논문이 푸는 문제는 더빙 품질 검수용 무참조 판정기다. 검수 시점에는 더빙 오디오가 아직 없고 참조 전사도 없으므로, 무음 영상 V와 후보 텍스트 라인 c만으로 "이 대사가 입 모양과 내용·타이밍 양쪽에서 맞는가"를 판정해야 한다. 실패 모드는 두 갈래다. 내용 오류는 후보 라인이 보이는 조음과 incompatible한 경우, 시간 오류는 내용은 맞지만 순서나 타이밍이 어긋난 경우다. 저자들은 기존 모델이 이 설정에 부적합하다고 주장한다. 시각 음성 인식 모델(Auto-AVSR, AV-HuBERT, LLaMA-AVSR, VSP-LLM)은 임의의 후보 라인을 채점하는 게 아니라 전사를 복원하도록 설계됐고, SyncNet류 동기화 모델은 오디오가 필요하며 후보 텍스트에 조건화되지 않는다. 비디오-언어 모델도 마찬가지다. 텍스트를 고정한 채 프레임을 뒤집거나 밀거나 멈춰도 Qwen3.5 2B~9B는 chance 근처에 머물렀고, 논문은 이를 "멀티모달 사전학습이 시간 추론을 보장하지 않는다"는 근거로 든다.

어떻게 동작하나

해법은 두 단계다. 1단계는 후보 조건부 단조 정렬 채점기다. 시각 립 인코더(Auto-AVSR)가 프레임별 임베딩 h_1:T를, 음소 텍스트 인코더(XPhoneBERT)가 후보 라인을 음소 단위 u_1:N으로 바꾸고, 코사인 유사도 행렬 M_t,n을 만든다. 무음 구간을 흡수하려고 학습된 스칼라 로짓 b를 가진 blank 상태를 추가하고, CTC를 적용한다. 핵심은 라벨 정의를 바꾼 것이다. 일반 CTC의 고정 문자·음소 어휘 대신, 라벨 n은 현재 후보 라인의 n번째 음소 위치를 뜻한다. 즉 타깃 시퀀스가 (1,2,…,N)이고, 길이로 정규화한 CTC 로그우도를 정렬 점수로 쓴다. 이 구조에서 음소 하나는 여러 프레임에 걸칠 수 있고 음소 사이에 blank가 끼어도 되지만, 순서는 반드시 지켜져야 한다. 그래서 점수 하나에 음소 적합성과 시간 진행이 함께 담긴다. 학습은 대조 방식이다. 콘텐츠 네거티브(mismatch, shuffle, dub)는 영상을 고정하고 텍스트를 바꾸고, 시간 네거티브(reverse, shift, freeze, swap)는 텍스트를 고정하고 영상을 망가뜨린다. smooth margin loss h(Δ)=log(1+exp(1−Δ))로 정답 쌍의 점수를 네거티브보다 높인다. 여기에 프레임 임베딩에 음소 인식 헤드를 붙여 실제 전사의 음소열로 CTC 보조 손실을 준다. 이 감독은 학습 때만 쓰이고 추론에는 필요 없다.

무엇과 다른가

2단계는 LLM 리즈너인데, 정렬 점수 하나만으로는 왜 실패했는지 알 수 없고 잘 정렬된 오답과 정답을 구분하기 어렵다는 게 도입 이유다. 리즈너는 두 종류의 증거를 받는다. 첫째는 소프트 토큰이다. 각 후보 음소 단위 n에 대해 유사도 행렬에서 프레임 정규화 어텐션 가중치를 구해 시각 요약 h̄_n을 만들고, 최고 매칭 ρ_n과 음소 임베딩 u_n을 이어붙인 x_n=[u_n | h̄_n | ρ_n]을 LM hidden 크기로 투영해 토큰 위치에 놓는다. 어휘 항목이 아니라 채점기가 만든 연속 벡터이며, 프롬프트 토큰 임베딩 앞에 붙는다. 둘째는 캘리브레이션된 전역 스칼라다. 별도 캘리브레이션 분할의 정답 쌍에서 평균 μ_s와 표준편차 σ_s를 추정해 sigmoid((s_align−μ_s)/σ_s)를 두 자리 수로 프롬프트에 적는다. 리즈너 학습은 같은 영상의 정답 라인과 K개 콘텐츠 네거티브를 묶어 Yes/No와 함께, 가장 약한 단위 n*=argmin ρ_n이 라인의 앞·중간·뒤 중 어디인지 밝히는 짧은 설명을 지도한다. 추론 시 최종 립싱크 점수는 Yes와 No 토큰의 로짓 차, 즉 log P(Yes|V,c)/P(No|V,c)다.

어떻게 쓰나

실험 규모부터 보면, 화면 대사 구간에서 만든 약 5만 개 다국어 학습 샘플과 2,100개 테스트 샘플을 쓰고, 테스트는 영어·스페인어·프랑스어·일본어·한국어·브라질 포르투갈어·터키어 7개 언어에 균형을 맞췄다. 평가는 정답 쌍을 양성, 손상 쌍을 음성으로 두는 pooled AUC와 짝별 정확도다. 결과가 뚜렷하다. Qwen3.5 SFT 베이스라인은 콘텐츠 축에서는 스케일링 효과가 있어 mismatch 0.730, shuffle 0.737, dub 0.743까지 올라가지만, 네 가지 시간 축 AUC는 0.510~0.520으로 chance 수준에 머문다. Auto-AVSR은 시간 신호를 일부 잡아 0.582~0.670이지만 ATR에 크게 못 미친다. ATR을 Qwen3.5-9B에 붙이면 콘텐츠 0.786/0.974/0.862, 시간 0.964/0.931/0.970/0.952로 평균 AUC 0.920을 낸다. 가장 강한 베이스라인 평균 0.610 대비 상대 50.8%, 절대 +0.310이다. 리즈너 스케일별로는 Qwen3.5 SFT 대비 평균 AUC가 2B에서 59.4%, 4B에서 50.2%, 9B에서 50.8% 개선됐고, LLaMA-3.1-8B는 0.890(짝별 정확도 0.916), Mistral-7B는 0.894(0.926)로 백본을 바꿔도 유지된다. Claude Opus 5, Gemini 3.1 Pro, GPT-5.6 계열 같은 프런티어 모델도 shuffle에서 0.990까지 가지만 시간 축 전체로는 0.656~0.737에 그친다는 비교도 제시된다.

전제와 한계

일반화 실험도 있다. 학습에 없던 MuAViC의 독일어·아랍어·러시아어로 옮겼을 때, Auto-AVSR은 아랍어·러시아어 콘텐츠 축에서 0.546~0.552로 실패하고 Qwen3.5-9B Base는 모든 시간 축에서 0.501~0.502다. 재학습 없이 ATR-9B는 Qwen3.5-9B Base보다 평균 AUC +0.237(+46.1%)을 냈고, 도메인 시프트로 정답 쌍이 결정 경계를 벗어나는 문제를 해결하려고 타깃 언어 정답 샘플 300개로 정규화 파라미터 μ_s, σ_s 두 개만 다시 적합시켰다. 이 재캘리브레이션으로 freeze가 0.572에서 0.937로 살아나고 평균 AUC 0.875, Qwen3.5-9B Base 대비 +0.361(+70.2%), Auto-AVSR 대비 +0.297(+51.4%)가 된다.

절제 실험은 설계 선택의 기여를 분리한다. 보조 음소 감독을 빼면 평균 AUC가 0.920에서 0.898로 떨어지고 콘텐츠 축 손실이 가장 크다. 소프트 토큰을 빼면 0.872로 떨어진다. 가장 큰 타격은 캘리브레이션된 전역 스칼라를 제거한 경우로 0.920에서 0.672까지 내려가고 reverse·shift·swap이 chance 근처가 된다. 논문은 그 이유를 구조에서 설명한다. 소프트 토큰의 영상 의존 성분은 프레임 위를 풀링하므로 시간 순서를 명시적으로 보존하지 않는 반면, 전역 정렬 점수는 단조 정렬 경로에서 계산돼 순서를 직접 담는다는 것이다. freeze가 상대적으로 잘 탐지되는 것은 프레임 순서가 아니라 프레임 내용 자체가 바뀌기 때문이라고 덧붙인다.

합성 손상 외에 실제 더빙 라인으로 만든 두 다운스트림 과제도 평가한다. 더빙 라인 재랭킹은 2,100개 테스트 샘플마다 전문 더빙 라인 하나와 의미를 유지하고 길이가 ±15% 이내인 LLM 패러프레이즈 세 개를 묶어 전문 라인을 1위로 올리는 과제로, chance Top-1은 0.250이다. ATR-9B가 0.479, 최강 립리딩 베이스라인이 0.316으로 상대 52% 개선이다. 스크립트-클립 배정은 같은 작품·언어에서 클립 5개와 전문 더빙 라인 5개를 섞어 25개 쌍을 채점한 뒤 최대 가중 일대일 매칭을 푸는 과제로, chance가 클립별 0.200, Exact Block 0.008이다. ATR-9B는 클립별 0.746, Exact Block 0.522를 기록해 Auto-AVSR을 클립별 상대 17.7%, Exact Block 절대 +0.139 앞서고, 길이 매칭 휴리스틱도 클립별 절대 +0.090 앞선다. MuAViC에서는 2지선다 형태로 ATR 0.704 대 Auto-AVSR 0.598(+17.7%)이다.

개발자 관점에서 이 논문의 실용적 포인트는 판정기를 두 부품으로 쪼갠 인터페이스다. 시간 추적은 CTC 단조 정렬 채점기가 맡고, 의미 판단은 LLM이 맡는다. 그래서 립리딩이나 VLM을 그대로 판정기로 쓰는 대신, 후보 라인을 음소열로 바꿔 정렬 점수를 뽑고 그 증거를 프롬프트에 주입하는 파이프라인을 세울 수 있다. 다만 도입 전에 확인할 것이 있다. 첫째, 정렬 채점기의 캘리브레이션 통계(μ_s, σ_s)는 도메인에 민감해서 새 언어·새 콘텐츠로 가면 정답 샘플 수백 개로 재적합이 필요하다. 둘째, 전역 스칼라를 빼면 성능이 0.672로 무너지므로 이 신호를 프롬프트에 반드시 넣어야 한다. 셋째, 학습 데이터가 화면 대사 구간 기반이라 실제 더빙 워크플로의 노이즈 분포와 얼마나 겹치는지 따로 봐야 한다.

저자들이 밝힌 한계는 분명하다. 리즈너는 지도 미세조정(SFT)으로만 학습했고, 최근 LLM·멀티모달 추론을 강화하는 강화학습은 다음 단계로 남겨 뒀다. 또 정렬 점수의 스칼라 분포가 도메인에 따라 이동하면 정답 쌍이 결정 경계 밖으로 밀려나므로, 모델 파라미터를 건드리지 않는 대신 타깃 도메인 정답 샘플로 정규화 파라미터만 다시 맞추는 절차를 전제로 한다. 정렬 채점기 자체는 프레임 단위 정렬 라벨 없이 대조 학습으로만 학습된다는 점, 그리고 소프트 토큰만으로는 시간 순서를 보존하지 못한다는 점도 실험으로 드러난 구조적 제약이다.