PhysStream 생성영상 자체서 장면기억 갱신하는 물리기반상호작용비디오생성기다

PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control

arXiv2609.17521v1

Chuhao Chen2026-09-15조회 4

무엇인가

이 논문은 이미지-투-비디오 생성에서 사용자가 생성 도중에 물리적으로 의미 있는 개입을 할 수 있게 하는 문제를 다룬다. 기존 제어 가능 비디오 생성은 깊이 맵, 카메라 궤적, 객체 트랙, 키포인트, 힘·속도 같은 조건을 쓰지만 대부분 비자기회귀 방식이라 생성 전에 전체 제어 스케줄을 정해야 하고, 픽셀 공간 신호가 객체 위치를 직접 지정하는 경우가 많다. 저자들은 상호작용 창작과 물리 기반 시뮬레이션에 필요한 네 가지 속성으로 희소 제어, 물리 기반, 상호작용, 장면 수준을 제시한다. 표 1에서 대표 방법을 비교하며, 동시대 연구 RealWonder만 네 속성에 근접하지만 외부 3D 재구성과 물리 시뮬레이터에 의존해 재구성 장면 상태가 실제 생성 비디오와 어긋날 수 있고 배경 객체가 물리 상호작용에 참여하지 못한다고 지적한다.

어떻게 동작하나

PhysStream은 자기회귀 이미지-투-비디오 모델이다. 초기 프레임 x0, 생성할 프레임 x1:N, 선택적 텍스트 y가 주어질 때 인과 모델은 pθ(x1:N|x0,y)=∏ pθ(xi|x0,x<i,y)로 분해한다. 여기에 두 종류의 역사 기반 신호를 추가한다. 하나는 구조화 장면 기억으로, 단안 깊이 추정에서 얻는 정규화 위치 맵 c_pos와 인스턴스 분할·추적에서 얻는 객체 추적 맵 c_track이다. 다른 하나는 사용자가 지정하는 희소 속도 증분 맵 c_Δv이다. 모든 조건은 생성 중인 프레임보다 과거 정보만 쓰도록 c_<i로 제한된다. 훈련은 두 단계다. 1단계에서 양방향 Wan2.2-TI2V-5B를 속도 증분 조건만 소비하도록 미세조정하고, 2단계에서 인과 자기회귀 모델로 바꾸면서 구조화 장면 기억과 인과 어텐션을 함께 학습한다. 저자들은 세 가지 분포 이동, 즉 속도 증분 제어, 구조화 장면 기억, 양방향에서 인과로의 전환을 한 번에 학습할 수 없다고 본다. 장면 기억이 전체 객체 이력을 기록하면 모델이 과거 속도 신호를 일부 무시할 수 있고, 양방향 어텐션에서는 프레임별 기억 맵이 미래 장면 상태를 누출하기 때문이다.

무엇과 다른가

1단계는 pθ^bi(x1:N|x0,y,c0:N^Δv)를 모델링하며, 속도 증분 조건이 유일한 사용자 제공 운동 신호다. 첫 프레임에서 동적 강체 객체 집합 O와 각 객체의 이진 인스턴스 마스크 M^(o)를 정의하고, 이 마스크를 비디오 전체의 속도 증분 이벤트에 재사용한다. 사용자는 U={(t_j,o_j,Δv_j)} 형태의 희소 이벤트를 주며, Δv_j는 각 카메라 축에서 최대 입력 속도 Vmax로 제한된 카메라 프레임 속도 변화다. 각 이벤트는 0과 1 사이로 선형 정규화되는데 1/2·1이 속도 변화 0, 0과 1이 각각 -Vmax와 +Vmax를 뜻한다. 프레임별 속도 증분 맵 c_t^Δv(p)는 해당 이벤트가 있는 객체의 첫 프레임 마스크 위치에 정규화된 속도 값을 칠하고 나머지는 중립값으로 둔다. 중요한 설계는 객체가 이미 이동했더라도 항상 첫 프레임 마스크 위치에 신호를 칠한다는 점이다. 프레임 t_j의 실제 마스크에 칠하면 양방향 훈련에서 객체의 이동 궤적이 조건 채널로 누출되고, 2단계 인과 모델에서는 미래 프레임 마스크에 접근할 수 없어 조건 분포가 급변해 품질이 나빠진다고 설명한다. 같은 이유로 구조화 장면 기억은 1단계에서 제외된다.

어떻게 쓰나

2단계는 Eq. 2를 인과 자기회귀 형태로 직접 구현한다. 각 프레임 xi는 과거 프레임과 텍스트, 그리고 c_<i^Δv, c_<i^pos, c_<i^track를 조건으로 샘플링된다. 위치 맵 추정기 Φ_pos는 Depth-Anything-3를 최근 L개 픽셀 프레임에 실행해 메트릭 깊이 D̂_t와 내부 파라미터 K_t를 얻고, 각 픽셀 p=(u,v)를 3D 카메라 좌표 P_t(p)=D̂_t(p)K_t^{-1}[u,v,1]^T로 역투영한다. 좌표는 첫 프레임에서 한 번 계산한 정규화 앵커와 등방성 스케일 ρ=1/2 max_a(P_max,a-P_min,a)로 [0,1]^3에 정규화된다. 실제로는 L=4, 즉 잠재 프레임 하나면 충분하다고 한다. 객체 추적 맵 추정기 Φ_track는 첫 프레임 객체 마스크들을 SAM2로 비디오 전체에 전파하고, 각 객체를 최대 분리 RGB 팔레트 K=10에서 서로 다른 색으로 검은 배경에 칠해 c_t^track을 만든다. 온라인 갱신은 잠재 프레임 하나가 생성될 때마다 수행된다. Wan VAE의 시간 업샘플링으로 잠재 프레임 하나가 픽셀 프레임 네 개로 디코딩되면, 새 프레임을 디코딩하고 두 추정기를 실행한 뒤 조건 맵을 다시 잠재 공간으로 인코딩한다. VAE는 캐시된 특징으로 새 잠재 프레임만 처리하고, Φ_pos는 최근 L개 프레임만 보며, Φ_track는 SAM2 메모리 뱅크를 쓰기 때문에 전체 비디오 길이와 무관하게 단계별 비용이 일정하다. 훈련은 인과 어텐션 아래 Teacher-Forcing으로 하며, 각 프레임 xi를 깨끗한 정답 과거 프레임과 과거 조건에만 어텐션시킨다. 조건 주입은 Wan VAE로 인코딩한 조건 잠재를 채널 방향으로 결합하되 한 프레임 앞으로 시프트한다. z̃=Concat(z_noisy, Shift(z_Δv), Shift(z_pos), Shift(z_track))이고, 시프트 덕분에 잠재 프레임 ℓ의 조건은 항상 이전 잠재 프레임 내용에서 온다. 새 조건 분기는 0으로 초기화되어 미세조정 시작 시점에는 사전학습 백본과 수치적으로 동일하다.

전제와 한계

실험 데이터는 SAGE의 사전 생성 실내 장면 1만 개를 바탕으로 만들었다. 탁상 강체 역학, 충돌, 마찰 접촉, 작은 물체의 텀블링에 초점을 맞추고, PyBullet으로 다물체 역학을 시뮬레이션하고 Blender로 렌더링했다. 각 비디오는 832×480 해상도 49프레임이며 약 10만 개를 렌더링했고 3천 개를 검증·평가용으로 남겼다. 합성 벤치마크에서 이미지-투-비디오와 속도 증분 정렬이 가능한 일곱 베이스라인, 즉 Force Prompting, PhysCtrl, DragAnything, Tora, FlashMotion, DragStream, RealWonder와 비교했다. 평가는 단일 객체 단일 속도 증분 64개 비디오와 다중 객체 상호작용 제어 64개 비디오 두 세트로 나뉜다. 지표는 FVD, FVMD, CoTracker3 기반 traj-ADE, traj-ADE-median, 실패율, VBench++ 장면 일관성, SAM2 기반 객체 일관성, WorldScore 방식 광도 일관성이다. 논문은 테스트 세트 (ii)에서 PhysStream이 FVMD, traj-ADE, traj-ADE-median, 실패율 같은 물리 민감 지표에서 모든 베이스라인을 앞선다고 보고한다. 초록에 제시된 수치로는 합성 벤치마크에서 가장 강한 베이스라인 대비 운동 분포 거리 FVMD를 33% 줄이고 궤적 오차를 12% 줄였다. 다만 일관성 지표는 객체가 거의 정지하거나 픽셀 공간에서 강체처럼 표류하는 퇴화 생성에서 부풀려질 수 있다는 경고도 붙인다.

절제 실험은 테스트 세트 (ii)의 64개 사례에서 마지막 10개 체크포인트 평균으로 수행했다. 비교 구성은 1단계 양방향 속도 전용, 2단계 인과 속도 전용, 속도+위치 맵, 속도+추적 맵, 전체 모델이다. 전체 모델이 거의 모든 지표에서 최고 또는 근접 최고였고, FVD만 조건이 적은 구성이 약간 더 좋았다. 이는 FVD가 훈련 분포와의 유사도를 재는 지표라 조건이 늘면 수렴이 더 오래 걸리기 때문이라고 해석한다. 모든 자기회귀 구성은 이미 수렴한 양방향 1단계 모델을 크게 앞섰고, 물리 역학이 본질적으로 인과적이라 인과 모델이 더 적합하다고 주장한다. 위치 맵의 효과는 깊이 이동이 큰 객체에서 더 커져 상위 10% 객체에서 traj-ADE 이점이 15.5%에 이르지만 전체 집합에서는 2.1%로 작다. 추적 맵은 지그재그 테스트에서 결정적이어서, 추적 맵이 있는 구성만 세라믹 접시가 여러 번 급회전해 연속 화병을 맞히는 궤적을 완주했다. 런타임 분석에서는 가속 없는 시스템에서 50스텝 디노이징이 68%, Depth-Anything-3가 19%, VAE가 8%, SAM2가 4%를 차지한다. 4스텝 인과 생성기로 증류하면 지연이 절반으로 줄고 합성 벤치마크 평균 지표 저하는 1% 미만이며, 깊이 추정기를 4배 작은 모델로 바꾸고 I/O를 최적화하면 3.4배 빨라지고 메모리도 줄어든다.

야생 데이터 평가는 세 설정이다. 규칙으로 만든 속도 증분 신호와 20개 입력 이미지, OCID의 복잡한 실내 장면 16개, Physics-IQ의 실제 비디오 10개, 그리고 변형 가능한 공과 천에 같은 제어·장면 기억 패러다임을 적용한 비강체 장면이다. 정답 비디오가 없는 경우가 많아 VideoPhy를 따라 GPT-4o로 의미 적합성 SA와 물리 상식 PC를 1~5점으로 평가하고, 야생 장면에서는 사람이 물리 타당성, 운동 정확도, 시각 품질 축에서 최고 결과를 고르게 했다. 본문 4.3은 모든 축에서 80% 이상 선호되었다고 쓰고, 초록은 야생 비교에서 85% 이상 선호라고 요약한다. OCID의 복잡한 장면에서도 SA와 PC가 야생 설정만큼 높았고, Physics-IQ의 선택된 고체 역학 부분집합에서는 공식 점수 47.9를 기록했다. 생성된 운동은 실제 방향과 충돌 타이밍을 따르지만 객체 속도가 주된 남은 차이였다. 비강체는 재료별로 만든 1만 클립, 5천 반복의 작은 합성 데이터셋으로 전체 모델을 미세조정해 변형 공의 탄성 바운스와 천의 접힘·펄럭임을 같은 조건 패러다임으로 구동했고 SA/PC가 강체 결과와 비슷했다. 긴 비디오는 49프레임으로 훈련했지만 구조 변경 없이 301프레임, 즉 6배 길이의 다중 객체 탁상 장면 5개 벤치마크로 확장했다. 누적 외형 드리프트 때문에 일관성은 점차 떨어지지만 제어 응답률과 정확도는 높게 유지되어, 드리프트가 제어 능력이 아니라 외형을 저하시킨다고 본다.

개발자 관점에서 PhysStream은 비디오 생성 모델을 스트리밍 방식으로 제어하려는 시스템에 참고할 만한 패턴을 준다. 사용자 입력은 전체 궤적이 아니라 선택 객체에 대한 희소 3D 속도 증분이고, 모델은 이전 생성 프레임에서 깊이·분할·추적을 온라인으로 추정해 장면 기억으로 되먹인다. 따라서 생성 중간 개입, 다중 객체 장면, 물리량 기반 제어가 필요한 창작 도구나 로봇·시뮬레이션 데이터 생성 파이프라인에서 출발점이 될 수 있다. 다만 실제 도입 전에 확인할 점이 있다. 검증 범위는 정적 카메라의 탁상 강체 장면에 제한되고, 저자들도 매우 복잡한 운동 특히 텀블링에 여전히 어려움을 겪는다고 밝힌다. 더 풍부한 재료는 추가 미세조정 데이터에 의존하며, 실시간 생성은 미래 과제로 남겨져 있다. 또한 일관성 지표가 퇴화 생성으로 부풀려질 수 있고, FVD는 조건이 늘수록 동일 훈련 시간에서 불리할 수 있다는 점도 해석 시 주의해야 한다.

관련 논문