Prism이 2K 영상 오디오 생성을 희소 어텐션으로 네이티브 학습한다
Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training
무엇인가
이 논문은 2K 해상도에서 영상과 오디오를 함께 생성하는 확산 모델을 처음부터 네이티브로 학습할 때 생기는 비용과 학습 신호 희석 문제를 다룬다. 2K 12초 24fps 클립은 VAE 압축 후에도 100만 개가 넘는 토큰을 만들고, 전체 어텐션은 이 토큰들 사이의 이차 비용을 요구한다. 해상도가 올라가면 얼굴이나 빠른 움직임 같은 정보성 토큰은 국소적으로 남고 반복 배경 토큰이 대부분을 차지해, 전체 어텐션이 정보성 내용에 줄 가중치가 희석되고 사전학습된 사전 지식이 흔들린다고 저자들은 주장한다. 기존 희소 어텐션은 학습 없는 가속이거나, 오디오-영상 상호작용이 소리 나는 영역 주변에 집중된다는 결합 데이터 구조를 반영하지 못한다는 것이 문제 설정이다.
어떻게 동작하나
제안 방법 Prism은 MOVA DiT를 기반으로 영상 자기어텐션만 동적 희소 어텐션으로 바꾼다. 토큰 격자를 T×H×W의 겹치지 않는 시공간 매크로 존으로 나누고, 각 존에서 헤드별·레이어별로 블록 모양을 정한다. 이를 위해 영상 값 특징의 채널별 분산을 축별로 계산해 시공간 축마다 내용이 얼마나 빠르게 변하는지 나타내는 비등방성 비율 r_v,d를 만들고, 오디오에서 영상으로 가는 교차 어텐션 결과의 L2 노름으로 각 영상 영역이 오디오 영향을 얼마나 강하게 받는지 측정한다. 존별 오디오 결합 강도 a_bar(m)는 0과 1 사이로 정규화되며, g_d(m)=r_v,d(m)+a_bar(m)·v_hat_a,d(m)+ε로 결합된다. 소리 나는 영역에서는 오디오 항이 블록 모양을 오디오-영상 결합 방향으로 이끌고, 조용한 영역에서는 오디오 항이 사라진다.
무엇과 다른가
블록 크기 B는 존의 정보 밀도 ρ로 정한다. ρ는 존 내부 공간 분산과 시간축 프레임 차이 분산을 합쳐 계산하고, 임계값 τ128=0.5, τ256=0.25에 따라 B를 64, 128, 256 중 하나로 고른다. B가 정해지면 후보 16개 모양 중에서 블록 내부 정보 손실을 최소화하는 모양을 고른다. 목표식은 g_T·(b_T²−1)+g_H·(b_H²−1)+g_W·(b_W²−1)을 최소화하는 것이고, 라그랑주 승수로 닫힌 형태 b*_d ∝ g_d^(−1/2)를 얻는다. 즉 분산이 큰 축에는 짧은 변을 주어 더 잘게 쪼개고, 변 길이는 {2,4,8}로 양자화한다. 각 매크로 존의 모든 토큰은 같은 블록 모양을 공유하며, Triton 커널의 64토큰 타일 제약 때문에 토큰별 모양 대신 존 단위 결정을 쓴다고 설명한다.
어떻게 쓰나
블록 선택은 쿼리별로 희소성을 다르게 준다. Q, K, V가 같은 블록 분할을 공유하고 키 블록은 평균 풀링으로 대표 벡터가 된다. 쿼리 블록과 키 블록 대표의 내적으로 블록 관련도 P_i를 구한 뒤, Top-k와 Top-p를 합집합으로 선택한다. Top-k는 최소 커버리지를 보장하고, Top-p는 누적 가중치가 p를 넘을 때까지 블록을 늘려 어텐션이 넓게 퍼진 쿼리에 계산을 더 배분한다. 학습은 영상 자기어텐션에만 희소성을 적용하고, 영상·오디오 플로우 매칭 손실을 쓴다. 구현에서는 100k 2K 클립을 UltraVideo와 인터넷 영상에서 모아 MOVA로 초기화한 뒤 5에폭, 학습률 1e-5, Top-k 95%, Top-p 0.2, τ128=0.5, τ256=0.25로 학습했다. 평가는 MOVA-Bench, VABench, 그리고 인터넷에서 고른 300개 미공개 2K 10초 영상으로 만든 2K-Bench에서 수행했다.
전제와 한계
결과적으로 저자들은 전체 어텐션 대비 2.5배 학습 가속과 더 나은 생성 품질을 보고한다. 2K-Bench에서 같은 네이티브 2K 데이터로 전체 어텐션을 쓴 MOVA, Ovi, MagiHuman보다 Prism이 앞서며, 이는 2K에서 중복 토큰이 어텐션 가중치를 독식해 정보성 내용이 소외된다는 주장을 뒷받침한다. LTX-2.3은 720p로 생성한 뒤 2K로 업스케일하므로 세부 묘사가 저해상도 단계에 묶인다고 지적한다. 720p VABench와 MOVA-Bench에서도 Prism이 모든 경쟁자를 앞서지만 격차는 더 작다. 절제 실험에서는 SpargeAttn2 대비 MotionQ 46%, DeSync 30% 개선을 보고했고, 전체 어텐션은 2K에서 나쁘고 고정 모양 블록 희소성은 최악이며 학습 없는 희소 방법은 전체 어텐션보다도 낮았다. MOVA 전체 어텐션 백본과 비교해 추론 시간 3배 감소, GPU 메모리 47% 감소, AQ 45%, MotionQ 68%, DeSync 40% 개선도 제시한다. LTX-2.3과는 추론 속도가 비슷하면서 품질 지표는 크게 앞선다고 한다.
개발자 관점에서는 2K급 영상-오디오 DiT를 처음부터 학습하거나 파인튜닝할 때, 전체 어텐션을 유지한 채 해상도만 올리는 전략이 학습 신호를 희석할 수 있다는 점을 확인하는 자료다. 적용하려면 MOVA 같은 백본에서 영상 자기어텐션을 교체하고, Triton 커널의 64토큰 타일·블록 크기 배수 제약, 존 단위 블록 모양, 오디오 교차 어텐션 노름을 학습 중에 계산하는 비용을 함께 검토해야 한다. 논문은 영상 자기어텐션만 희소화하고 교차 어텐션과 오디오 분기는 짧아 비용이 무시할 만하다고 전제하므로, 자신의 모델에서 그 전제가 성립하는지 확인해야 한다. 또한 720p 평가는 학습셋을 720p로 줄여 수행했고 2K-Bench는 저자들이 별도로 구성한 평가셋이라는 점, 상용 모델과 비교에서는 시각적 사실감과 오디오 미학이 대형 모델·데이터 때문에 앞선다고 인정한 점을 감안해야 한다. 원문은 별도의 한계 절을 두지 않았지만, 토큰별 동적 모양을 쓰지 않는 이유와 캐스케이드 방식의 저해상도 편향, 학습 없는 희소 방법의 한계를 전제로 명시한다.