GenCine이 단일 이미지에서 카메라와 객체의 3D 운동을 함께 조율한다

Generative Cinematographer: Composing Camera and Object Motion in 3D

arXiv2610.02180v1

Jiahan Zhang2026-10-01

무엇인가

영상 생성 모델은 이제 한 장의 이미지에서 그럴듯한 움직임을 만들어내지만, 그 움직임을 정확히 지정하는 일은 여전히 어렵다. 기존의 제어 가능한 영상 생성 시스템은 객체 운동을 2D 모션 궤적이나 드래그 신호로 지정하는데, 같은 2D 궤적이 서로 다른 3D 운동에 대응할 수 있다는 점이 근본적인 모호함이다. 카메라와 객체가 동시에 움직이면 이 모호함은 더 커진다. 텍스트 프롬프트는 동작을 서술할 뿐 정확한 경로를 지정하지 못하고, 물리 시뮬레이터나 범주별 사전지식에 의존하는 방법은 지원하는 재료와 객체에 적용 범위가 묶인다. 결과물이 그럴듯해 보여도 아티스트가 의도한 운동과 다른 운동을 따를 수 있다는 것이 이 논문이 지적하는 문제다.

어떻게 동작하나

GenCine은 한 장의 이미지를 편집 가능한 3D 장면 스캐폴드로 끌어올린다. 먼저 기성 깊이 추정기로 깊이 D0를 구하고 첫 프레임의 카메라 좌표계를 월드 좌표계로 삼는다. 각 픽셀 u=(u,v)를 p_u = D0(u) K0^-1 (u,v,1)^T로 역투영하고 이미지 색을 붙여 점군 P를 만든 뒤, 예측된 동적 마스크로 정적 배경 P_bg와 움직일 수 있는 전경 P_fg로 나눈다. 아티스트는 3D 뷰포트에서 전경 영역을 골라 각각에 궤적을 부여하는데, 선택된 영역은 모션 핸들로 동작해 소속 점들이 하나의 강체 그룹처럼 함께 움직인다. 핸들 i의 점 인덱스 집합을 I_i라 하면 프레임 t에서의 월드 공간 지지집합은 H_t,i = {p_t,j | j ∈ I_i}로 정의된다. 핸들을 여러 개 두면 한 피사체의 서로 다른 부위를 독립적으로 움직일 수 있어, 스켈레톤이나 물리 시뮬레이터, 범주별 사전지식 없이 비강체 운동을 조각별 강체로 근사한다. 카메라 내부 파라미터와 월드-투-카메라 자세도 같은 월드 좌표계에서 지정된다.

무엇과 다른가

이 제어 신호를 사전학습된 영상 모델에 전달하기 위해 세 종류의 가이던스 맵 F_bg, F_fg, F_id를 만든다. 배경점과 핸들점을 u_t = π(K_t(R_t p_t + t_t))로 각 프레임에 투영하고, 깊이로 가시성을 해소한 뒤 월드 좌표 XYZ를 RGB 값으로 적는다. 좌표는 클립 전체에 고정된 정규화 N(p) = (1/2)[(p-o)/σ + 1]을 거치는데, o는 1프레임 유효 점들의 바운딩 박스 중심, σ는 반범위다. 배경점은 카메라가 움직여도 월드 위치와 XYZ 색이 그대로이고 화면상 위치만 바뀌는 반면, 전경 제어점의 XYZ 색은 세계 속에서 움직인 만큼 변한다. 두 맵이 같은 o, σ를 쓰기 때문에 전경과 배경의 위치가 같은 좌표계와 스케일로 표현되고, 카메라 이동과 객체 이동을 구분할 수 있다. 다만 움직이는 점은 색이 계속 바뀌므로 대응 관계를 유지할 수 없어, 핸들마다 시간 불변의 색 c_i를 부여한 아이덴티티 맵을 따로 렌더링한다. 핸들 점 집합을 3D 가우시안으로 근사해 2D로 투영하고, 투영 중심에서 가장 큰 가우시안 가중치 α를 곱해 c_id = α_t,i(u_t) c_i를 만든다. 겹치는 곳은 깊이 순서로 가시 핸들을 정한다.

어떻게 쓰나

모델은 Wan2.1-Fun-V1.1-14B-Control 위에 올린다. VAE와 베이스 확산 가중치는 동결하고, 기하 가이던스를 위한 경량 사이드 브랜치와 브랜치 사이 컨볼루션 투영, 메인 브랜치의 LoRA 어댑터만 학습한다. 동결된 VAE가 세 가이던스 맵 시퀀스를 인코딩하고, 사이드 브랜치는 세 맵과 함께 배경 투영 유효 마스크 M_bg, 핸들 픽셀 마스크 M_fg, 1프레임 동적 영역 마스크 M_dyn을 받는다. 사이드 브랜치는 메인 브랜치의 절반 공간 해상도에서 동작하고 0으로 초기화된 잔차 투영을 통해 특징을 주입한다. 학습 데이터는 카메라와 객체 운동이 다양한 45k 클립으로, 약 5k는 Dynamic Replica와 PointOdyssey 같은 합성 데이터에서 온 것으로 정답 기하와 궤적을 제공한다. 나머지는 SpatialVid-HQ를 포함한 실사 데이터이며, 깊이·카메라 자세·동적 마스크는 자체 기하 추출 파이프라인으로, 운동 궤적은 CoWTracker로 추정한다. 실사 클립에서는 첫 프레임의 동적 마스크를 이용해 기하가 유효한 가시 전경 점에서 공간적으로 떨어진 핸들을 샘플링하고, 장면 스케일의 3D 공 안에 있는 가까운 트랙들을 하나의 핸들로 묶는다. 핸들의 개수와 배치를 구성별로 바꿔 아티스트의 부분적 제어를 흉내 낸다. 모든 클립은 480×832로 처리되고, 캡션은 Qwen2.5-VL-72B로 생성해 umT5로 인코딩하며, 4대의 H100에서 약 20k 반복 학습한다.

전제와 한계

평가는 DAVIS와 SpatialVid 테스트셋에서 뽑은 75개 예제를 Camera Shooting과 Object Interactions 두 묶음으로 나눠 진행한다. 비교 대상은 Wan2.1과 제어 가능한 다섯 방법으로, ATI·Wan-Move·Go-with-the-Track에는 정답 영상에서 추출한 조밀한 2D 전경·배경 궤적을 주고, VerseCrafter와 SymphoMotion에는 카메라 제어와 거친 객체 수준 운동 제어를 준다. GenCine은 희소한 3D 모션 핸들과 목표 카메라 궤적만 쓴다. 결과적으로 GenCine은 두 범주 모두에서 가장 낮은 이동 오차와 R-LPIPS를 기록했고 회전 오차는 Go-with-the-Track에 이어 두 번째였다. Camera Shooting에서는 PSNR 16.64와 R-PSNR 17.16으로 앞섰고 LPIPS 0.36으로 Wan-Move, Go-with-the-Track과 공동 최저를 이뤘다. Object Interactions에서는 LPIPS 0.35로 가장 낮았고 PSNR 16.54로 Go-with-the-Track의 16.59에 이어 두 번째였다. 다른 방법들도 각자 강점을 유지했는데, Camera Shooting의 피사체 일관성은 Go-with-the-Track이, Object Interactions의 이미징 품질은 VerseCrafter가, R-PSNR과 배경 일관성은 Wan-Move가 앞섰다. 정성적으로는 거실 예제에서 Wan-Move와 VerseCrafter보다 왜곡이 적게 초록 터널을 움직였고, 버스 예제에서는 카메라 풀백과 함께 의도한 회전을 조율했으며, 로봇 팔 예제에서는 말단 장치 경로를 따르면서 연결된 팔 마디까지 움직여 직접 제어하지 않은 영역으로 운동을 추론해냈다.

어블레이션은 Camera Shooting 예제에서 배경 XYZ 맵, 전경 XYZ 맵, 사이드 브랜치 공간 다운샘플링 계수 s_side를 하나씩 바꿔 측정한다. 배경 XYZ 맵 F_bg를 빼면 R-LPIPS가 0.184에서 0.235로 나빠지고 R-PSNR이 17.16에서 16.20으로 떨어져, 배경 대응이 전경 제어의 기준점 역할을 한다는 것을 뒷받침한다. 전경 XYZ 맵 F_fg를 빼면 R-LPIPS가 0.223, R-PSNR이 15.26으로 나빠졌는데, 피사체 일관성은 0.912로 가장 높았다. 즉 일관성 지표가 좋아도 전경 운동을 충실히 재현하지는 못한다는 뜻이다. 모든 맵을 유지한 채 s_side를 1에서 2로 올리면 R-LPIPS가 0.189에서 0.184로 개선되고 R-PSNR은 17.17에서 17.16으로 소폭 낮아지며, 피사체 일관성 0.897에서 0.902, 배경 일관성 0.942에서 0.944, 이미징 품질 0.686에서 0.691로 모두 올랐다. 기본 설정이 테스트한 변형 중 가장 낮은 R-LPIPS와 가장 높은 배경 일관성·이미징 품질을 낸다.

실무 관점에서 이 논문은 영상 생성 파이프라인에 3D 공간 제어를 넣으려는 팀에 참고가 된다. 2D 드래그 인터페이스를 만들면서 카메라 이동과 객체 이동이 섞여 결과가 흔들리는 문제를 겪었다면, 배경과 전경을 같은 월드 좌표계에서 정규화해 서로 다른 맵으로 분리하는 표현이 하나의 해법이 된다. 특히 베이스 모델을 다시 학습하지 않고 사이드 브랜치와 LoRA만 학습하는 구조라, 기존 Wan 계열 체크포인트를 유지한 채 제어 능력만 얹는 비용을 가늠할 수 있다. 다만 입력이 단일 이미지에서 리프팅된 점군이라는 점, 학습 시에는 실제 영상에서 복원한 궤적을, 추론 시에는 아티스트가 지정한 핸들을 쓴다는 점을 확인해야 한다. 평가에서 조밀한 2D 궤적을 받은 베이스라인과 희소 3D 핸들만 받은 GenCine을 비교하는 입력 비대칭이 있다는 점도 저자들이 명시하고 있다.

저자들이 밝힌 한계는 분명하다. 단일 이미지 스캐폴드는 가려진 영역을 모델링하지 않으므로, 큰 시점 변화에서는 생성기가 보이지 않던 표면을 합성해야 한다. 국소 강체 핸들은 관절 운동에는 잘 맞지만 파괴, 찢김, 유체 역학에는 적합하지 않고, 분산된 변형을 다루려면 핸들을 많이 배치해야 해서 작업이 번거로워진다. 독립적으로 지정된 핸들 사이에는 물리적 제약이나 인과적 상호작용이 없다. 저자들은 기하 완성, 자동 핸들 배치, 학습된 상호작용 사전지식이 아티스트가 구성할 수 있는 샷의 범위를 넓힐 수 있다고 본다.