비디오 확산 모델 물리 위반 원인은 RoPE 기반 어텐션감쇠와 운동계획 해석이다.

Why Do Video Diffusion Models Violate Physics? Unveiling the Flaws in Attention Mechanisms

HF Daily2609.23658

Yueyan Li, Haibo Wang, Caixia Yuan2026-09-20조회 4

무엇인가

텍스트-투-비디오 확산 모델은 미학적 품질과 지시 수행 능력이 크게 향상됐지만, 최신 모델조차 농구공이 공중에서 멈추거나 낙하 궤적이 꺾이는 등 실세계 물리 법칙을 위반하는 영상을 생성한다. 기존 해법은 물리 시뮬레이터를 조건으로 넣거나, 물리 현상이 풍부한 특수 데이터셋을 추가하거나, LLM으로 프롬프트를 재작성하는 방식이었다. 저자들은 이런 접근이 확장성이 낮거나 근본 원인을 건드리지 못한다고 보고, 시선을 모델 내부로 돌린다. 이 논문은 텍스트-투-비디오 확산 모델의 '운동 계획(motion planning)' 과정을 다룬 최초의 해석 가능성(interpretability) 연구를 표방한다. 여기서 운동 계획이란 조건 프롬프트의 의미 정보를 비디오 잠재 표현에 주입하고, 이를 각 프레임에 배분해 객체 위치를 정하면서 프레임 간 일관성을 유지하는 두 단계 전체를 가리킨다. 저자들은 물리 상식의 범위를 고체 역학으로 좁혀 추적 가능한 운동 궤적을 분석 대상으로 삼는다.

어떻게 동작하나

분석은 cross-attention에서 시작한다. 조건 의미를 비디오 잠재 표현에 전달하는 유일한 모듈이기 때문이다. Wan2.1-T2V-1.3B로 '농구공이 흰 배경에서 수직 낙하해 나무 바닥에 튕긴다'는 프롬프트를 50스텝 추론(기본 시드 26)으로 돌리며, 객체 토큰에 대한 cross-attention 맵의 진화를 레이어별·스텝별로 시각화한다. 그 결과 첫 5개 디노이징 스텝에서 각 프레임의 객체 위치가 랜덤 노이즈에서 궤적 위에 흩어진 여러 후보 영역으로 바뀌고, 스텝 5 부근에서 결정적 형태로 수렴한 뒤 스텝 7에서 뚜렷한 궤적이 나타난다. 이를 정량화하기 위해 attention entropy와 support quality(어텐션 분포가 최종 궤적 마스크와 겹치는 정도)를 정의했고, 레이어 15에서 두 지표 모두 스텝 5 부근에 급변점이 생긴다. 이어 어떤 헤드가 실제로 운동 계획을 담당하는지 가리기 위해 두 지표를 더 만든다. convergence speed는 처음 10스텝의 support quality 평균이고, head contribution은 인과 개입(attribution patching)으로 헤드를 제거했을 때 조건 분기와 무조건 분기의 속도 예측 차이가 기준 영역에서 얼마나 변하는지를 재는 값이다. 산점도는 헤드를 네 유형으로 나눈다. 유형 1·2는 궤적 패턴이 없거나 흐릿하고, 이들을 제거해도 객체 운동은 사실상 변하지 않는다. 유형 3은 궤적 패턴이 뚜렷하고 제거하면 궤적이 붕괴한다. 유형 4는 궤적 패턴이 뚜렷한데도 제거 시 초기 위치가 약간 밀릴 뿐 전체 궤적은 그대로다. 즉 궤적 패턴이 보인다고 해서 그 헤드가 운동 계획을 담당하는 것은 아니다.

무엇과 다른가

다음은 self-attention이다. 프레임 간 관계를 조율하며 앞선 현상의 직접 원인이다. 쿼리 영역 하나를 골라 모든 프레임에 대한 어텐션을 보면, cross-attention과 달리 대부분의 self-attention이 궤적 패턴을 보이지 않고 다른 프레임의 같은 위치에 집중한다. 저자들은 이를 RoPE(Rotary Position Embedding)의 공간적 앵커링 효과로 설명한다. 쿼리 q와 키 k의 내적이 위치 차이 Δp에 대한 회전 위상항의 실수부로 표현되는데, 장거리 감쇠 때문에 각 영역은 공간적으로 가까운, 즉 Δp_h와 Δp_w가 작은 영역을 선호하게 된다. 그 결과 디노이징 중·후반에도 궤적 밖에 추가 하이라이트 영역이 남는다. 초기 후보 영역의 경쟁을 정량화하기 위해 각 프레임의 후보 영역을 추출하고, 스텝 49·레이어 27의 영역을 기준 앵커로 삼아 anchor-distance와 mutual consistency를 계산한다. 실패 사례(시드 20, 공중에서 튕기다 멈추는 영상)를 보면 초기에는 후보들이 우열 없이 불안정하게 경쟁하고, 일부 프레임(4, 8, 10)이 먼저 위치를 확정한다. 프레임 14의 영역 K1이 스텝 2에 우세했지만 스텝 3에 K3에 역전당하는데(K1 0.21 대 K3 0.33), 프레임 10의 K1이 스텝 3에 신뢰도 0.63으로 일찍 고정된 탓에 공간적으로 인접한 다른 프레임의 영역들이 그 위치로 끌려 올라간 결과다. 물리적으로 더 타당한 후보가 RoPE 감쇠 때문에 억제되는 것이다.

어떻게 쓰나

제안 방법은 이 결함을 겨냥한 경량 아키텍처 수정이다. RoPE 변환에서 높이와 너비 차원의 회전 각도에 1보다 작은 변조 계수 λ_h, λ_w를 곱해(즉 f_h(q,p) = q^h e^{i p^h λ^h θ}, f_w(q,p) = q^w e^{i p^w λ^w θ}) 공간 어텐션의 감쇠 속도를 늦춘다. 키에도 동일하게 적용한다. 회전 각도 크기를 줄여 감쇠를 완화함으로써, 운동 계획 단계에서 모델이 더 많은 후보 영역을 탐색하도록 유도하는 것이 목적이다. 실제로는 디노이징 첫 5스텝에만 미리 정한 λ를 적용하며, 기본값은 0.75다. 학습 기반 설정에서는 첫 10% 타임스텝을 높은 확률 p_early로 샘플링하는 커스텀 타임스텝 샘플러를 쓰고, λ를 0에서 목표값까지 서서히 올리면서 LoRA(배치 32, 학습률 1e-4)로 파인튜닝한다.

전제와 한계

평가는 먼저 여러 시드의 '농구공 자유 낙하' 사례로 빠르게 검증하고, 이후 VideoPhy(고체-고체, 고체-유체, 유체-유체 등 재료 상호작용을 다루는 343개 테스트 케이스)로 체계적으로 평가한다. 지표는 Semantic Adherence(SA)와 Physical Commonsense(PC)다. 학습 데이터는 17개 물리 법칙을 다루는 사람이 큐레이션한 8만 개 영상(WISA)을 사용한다. 비교 대상은 학습 불필요(training-free) 쪽이 베이스 모델과 프롬프트 개선(Xue et al., 2025), 학습 기반 쪽이 LoRA와 외부 비디오 파운데이션 모델을 지도로 쓰는 VideoREPA다. 저자들에 따르면 학습 기반 결과가 지시 수행과 물리 일관성 모두에서 학습 불필요 방식과 다른 베이스라인보다 대체로 우수하며, 이점은 큰 폭의 운동이 많은 solid-* 부분집합에 주로 나타난다. 다만 본문에 제시된 범위에서는 Table 1의 구체적 수치가 제시되지 않았고, 14B 모델 검증 결과도 부록에 있다고만 언급된다. 추가로 저자들은 세 가지를 보고한다. 프롬프트 개선의 물리 일관성 향상은 주로 지시 수행 강화에서 오며 제안 방법과 결합하면 물리 일관성을 더 높일 수 있다. 시드 42로 학습했지만 같은 λ로 다른 시드의 궤적도 개선되어 일반화가 좋다. LoRA로 어텐션 모듈만 튜닝한 것이 미학 저하 없이 더 좋은 결과를 냈는데, 이는 물리 실패가 FFN보다 어텐션에서 비롯된다는 해석의 완결성을 뒷받침한다.

개발자 관점에서 이 논문의 실용적 의미는 명확하다. 물리 위반 영상을 데이터 부족이나 프롬프트 모호함으로만 진단하면 원인을 놓칠 수 있다. 위치 인코딩, 특히 RoPE의 공간 감쇠가 초기 디노이징에서 후보 위치를 조기에 고정시키는지 확인해야 한다. 적용 지점도 좁다. 추론 시 첫 5스텝에만 RoPE 주파수 스케일을 낮추는 것으로 시도해 볼 수 있고, 여유가 있으면 어텐션 모듈에만 LoRA를 걸어 λ에 적응시키는 편이 낫다. 다만 λ는 수동 튜닝이 필요하다고 저자들이 명시했으므로, 모델·해상도·프레임 수에 따라 값을 다시 찾아야 한다. 또한 이 방법은 큰 변위 운동이 있는 고체 역학 장면에서 이득이 크고 유체-유체 같은 부분집합에서는 상대적으로 이점이 작다는 점을 감안해 적용 대상을 판단해야 한다.

한계와 전제도 분명하다. 저자들은 물리 상식을 고체 역학으로 한정했고, 모델이 모든 생성물에서 물리 법칙을 지키는 것을 보장할 수 없으므로 물리 상식 자체를 강하게 주장하지 않고 먼저 생성 메커니즘을 탐구한다는 입장을 취한다. 분석은 Wan2.1-T2V 계열(DiT 기반)과 특정 프롬프트·시드 조합에 기반하며, 1.3B 모델을 주 분석 대상으로 삼은 이유는 더 큰 14B 모델이 물리에서 더 나은 성능을 보이지 않았기 때문이라고 밝힌다. 학습 불필요 방식은 λ 수동 튜닝이 필요하고, 학습 기반 방식은 별도 데이터셋과 파인튜닝 비용을 요구한다. 저자들은 이 발견이 I2V나 few-step 자기회귀 확산 모델 같은 다른 아키텍처로 확장될 수 있다고 보지만, 이는 향후 과제로 남겨 두었다.