영상이 더 평등한 결합 생성에서, 한쪽으로만 흐르는 교차 어텐션을 KL로 되돌리는 RecCAR

All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation

HF Daily2609.27901

Ohad Rahamim, Dvir Samuel, Idan Schwartz2026-09-23조회 7

무엇인가

이 논문이 다루는 문제는 결합 멀티모달 생성(joint multimodal generation)의 기능적 비대칭이다. 영상과 동반 모달리티(3D 인체 모션, 오디오 등)를 같은 디노이징 과정에서 함께 생성하는 디퓨전 트랜스포머는 양방향 교차 어텐션으로 두 스트림을 연결한다. 영상→모달리티(V→M)와 모달리티→영상(M→V)이라는 두 개의 상호 경로가 아키텍처상 모두 열려 있다. 그런데 저자들은 사전학습된 결합 생성기에서 이 두 경로가 대등하게 발달하지 않는다는 것을 관찰한다. 동반 모달리티는 영상에 대한 강한 대응 관계를 학습하지만, 그 역방향, 즉 동반 모달리티가 영상을 제약하는 경로는 현저히 약하게 남는다. 표준 생성 목적함수는 각 방향이 얼마나 유용한 정보를 실어야 하는지에 대해 아무 제약도 걸지 않기 때문에, 모델은 한쪽 경로에만 의존하고 반대쪽은 거의 쓰지 않는 상태로 학습될 수 있다. 결과적으로 아키텍처는 양방향이지만 기능은 단방향에 가까워지고, 한 스트림에 담긴 정보가 다른 스트림의 불일치를 교정하지 못한다. 이는 결합 생성을 하는 주된 이유 자체를 약화시킨다.

어떻게 동작하나

방법의 핵심은 두 방향을 같은 대상 위의 확률분포로 맞춰 놓는 데서 시작한다. V→M에서는 모달리티 토큰이 영상 토큰을 질의하므로 소프트맥스가 원래 영상 토큰 위에 정규화되어 있고, 이것이 각 모달리티 토큰이 영상 어디에 대응하는지를 나타낸다. 반면 M→V는 영상 토큰이 모달리티 스트림을 질의하는 구조라 원래는 모달리티 토큰 위에 정규화된다. 저자들은 같은 어텐션 로짓을 영상 토큰 축으로 다시 정규화해서 두 방향을 직접 비교 가능하게 만든다. 논문은 이 재정규화가 순전파에서 실제로 쓰이는 어텐션 분포는 아니라는 점을 명시한다. 이렇게 맞춰 놓으면 두 분포가 같은 질문, 즉 "모달리티 토큰 j에 가장 강하게 연관된 영상 토큰은 어디인가"에 답하게 된다. 논문의 예시에서 머리 모션 토큰은 V→M 분포에서는 머리 위치를 짚지만 M→V 분포에서는 상체 쪽에 더 많은 확률 질량을 둔다.

무엇과 다른가

이 불일치를 정량화한 것이 상호 대응 격차(reciprocal correspondence gap)다. 관련 교차 어텐션 레이어들과 모달리티 토큰들, 그리고 어텐션 헤드에 대해 V→M 분포와 M→V 분포 사이의 KL 발산을 평균 낸 값이다. RecCAR(Reciprocal Cross-modal Attention Regularization)는 이 격차를 줄이되, 이미 잘 확립된 V→M 대응을 정지 기울기(stop-gradient)로 고정한 참조로 삼고 약한 M→V 경로를 그쪽으로 정렬한다. 즉 Ĉ(V→M)을 타깃으로 두고 KL(Ĉ(V→M) ‖ C(M→V))를 최소화하며, 전체 손실은 기존 생성 손실에 λ_RecCAR를 곱한 정규화 항을 더한 형태다. 외부 대응 라벨이나 보조 모델이 필요 없고, 추론 시 추가 구성 요소도 없다. 사전학습 백본은 얼리고 어텐션 투영에 LoRA만 붙여 미세조정한다.

어떻게 쓰나

영상-인체 모션 실험은 EchoMotion 위에 올린다. 학습 데이터는 VidProM에서 뽑은 1,500개 텍스트 프롬프트(테스트용 1,000개는 별도 보류)로 16개 시드를 달리해 약 18,000개의 후보 영상-모션 쌍을 만들고, MPJPE와 NMPJPE가 모두 0.15 미만인 쌍만 통과시키는 필터를 적용해 최종 4,292쌍을 남겼다. 이 임계값은 25개 영상에 대해 Gemini로 해부학적 타당성을 평가한 소규모 실험에서 정했다. 3D 포즈는 생성된 모션이 아니라 CameraHMR로 영상에서 추정한 모션을 쓴다. 학습은 결합 셀프 어텐션 가중치 전체에 rank 128 LoRA, 10 에폭, λ=0.01, AdamW 학습률 1e-5, 유효 배치 8, H100 4장으로 약 48 GPU-시간이다. 1,000개 프롬프트 테스트셋에서 VBench Human Anatomy 점수가 0.69에서 0.75로 올랐고 나머지 지표도 함께 개선됐으며, Dynamic Degree는 EchoMotion과 비슷하게 유지됐다. 비교 대상은 EchoMotion, CoMoVi, FlowMo다.

전제와 한계

영상-오디오 실험은 LTX-2와 JavisDiT++ 백본에서 수행한다. VGGSound 학습 분할에서 약 4,300개 클립을 별도 필터링 없이 샘플링해, 모든 교차 어텐션 가중치에 rank 128 LoRA를 적용하고 10 에폭, λ=0.01로 학습한다. T2AV-Compass(500개 프롬프트)에서 LTX-2에 RecCAR를 적용하면 절대 AV Desync가 0.804에서 0.752로 줄어 평가된 방법 중 최고 점수를 기록했고, JavisDiT++의 동기화 지표도 개선됐다. AVGen-Bench(235개 프롬프트)에서도 두 백본 모두 DeSync가 줄었는데, 비교 대상인 ITS는 JavisDiT++에서 미미한 감소만 보였고 LTX-2에서는 감소가 없었다. 두 백본 모두 CLAP과 AV-CLIP은 유지되거나 소폭 개선됐다. 정성적으로는 말이 속보로 달릴 때 기준 LTX-2가 말발굽 접지보다 앞서거나 뒤처진 파형을 만드는 반면 RecCAR는 파형을 걸음걸이에 더 잘 맞춘다.

절제 실험은 이득이 단순한 추가 미세조정에서 오는지 정렬 목적함수에서 오는지를 분리한다. 영상-모션에서 같은 데이터로 표준 미세조정만 하면 N-MPJPE와 MPJPE가 오히려 늘고 Human Anatomy 점수는 떨어진다. 영상-오디오에서도 표준 미세조정은 DeSync에 거의 영향을 주지 않는다. 반면 RecCAR를 더하면 두 설정 모두에서 일관되게 개선된다. 저자들은 이를 근거로 이득이 데이터가 아니라 교차 어텐션 정렬에서 온다고 주장한다.

실무 관점에서 이 방법이 유용한 지점은 비용 구조다. 아키텍처 변경도, 추론 시 오버헤드도, 외부 대응 라벨도 없이 LoRA 미세조정만으로 두 스트림 사이의 정보 흐름을 손볼 수 있다. 다만 도입 전에 확인할 것이 있다. 첫째, 자신의 모델이 실제로 이 비대칭을 보이는지 상호 대응 격차를 재봐야 한다. 둘째, RecCAR는 강한 방향을 정답으로 삼아 약한 방향에 복사하는 방식이므로, V→M 대응 자체가 틀렸다면 그 오류를 그대로 증폭시킨다. 셋째, λ와 정규화를 걸 레이어 선택이 백본별로 다르며 논문은 두 과제 모두 λ=0.01, rank 128로 고정했다. 넷째, 영상-모션 쪽은 MPJPE/NMPJPE 임계값 필터링과 CameraHMR 포즈 추정이 포함된 데이터 큐레이션 파이프라인을 요구하므로, 오디오 쪽보다 준비 비용이 크다.

논문에는 별도의 한계 절이 없다. 대신 곳곳에 전제가 깔려 있다. 방법은 두 방향 중 하나가 이미 잘 확립되어 있다는 가정 위에 서 있고, 비교를 위해 쓰는 M→V 분포는 순전파의 실제 어텐션 분포가 아니라 로짓을 영상 토큰 축으로 재정규화한 것이다. 데이터 필터 임계값 0.15는 25개 영상이라는 작은 표본에서 정해졌고, 검증은 과제별로 백본 두 개(LTX-2, JavisDiT++)와 한 개(EchoMotion)에 한정된다. 큐레이션한 영상-모션 데이터셋은 공개하겠다고 밝혔지만 논문 시점에서는 아직 공개 전이다.

관련 논문