물리 편집 뒤 운동 변화를 강체 장면 재구성으로 생성하는 VideoPhysEdit

VideoPhysEdit: Physical Counterfactual Video Editing via Rigid-Body Physical Scene Reconstruction

HF Daily2609.35134

Conghan Yue, Yuanjie Chen, Yue Han2026-09-28조회 5

무엇인가

이 논문이 다루는 문제는 물리적 반사실 영상 편집(Physical Counterfactual Video Editing, PCVE)이다. 기존 영상 편집 연구는 그림자, 반사, 가림처럼 편집이 만드는 시각적 결과에는 진전이 있었지만, 편집 이후의 운동과 상호작용이 어떻게 달라지는지라는 물리적 결과는 상대적으로 다뤄지지 않았다. 저자들은 물체 삽입·제거, 물체의 운동 상태 변경, 물체나 장면의 물리 파라미터 변경이라는 세 종류의 편집을 정의하고, 원본 영상과 자연어로 주어진 물리 편집, 그리고 그 실행 프레임이 주어졌을 때 실행 프레임 이전은 사실적 이력을 보존하고 이후는 바뀐 물리 조건 아래 진화하는 반사실 영상을 생성하는 과제로 정식화한다. 어려운 점은 두 가지다. 하나는 장면 물리를 이해하고 개입이 유발하는 하류 운동·상호작용을 추론해야 한다는 것이고, 다른 하나는 짝지어진 사실·반사실 데이터와 전용 평가 지표가 자연적으로 존재하지 않는다는 것이다. 영상은 사실적 진화만 기록할 뿐 대안적 개입 아래의 진화를 보여주지 않으며, 기존 영상 편집 지표는 결과 운동이 물리적으로 맞는지 측정하지 않는다.

어떻게 동작하나

제안 방법 VideoPhysEdit은 강체 장면을 대상으로 하는 학습 불필요(training-free) 파이프라인이며, 7개 단계로 구성된다. 먼저 비전-언어 모델과 오픈보캐뷸러리 검출기, 비디오 객체 분할 모델로 편집에 관련된 객체를 식별하고 프레임별 마스크를 일관된 정체성으로 추적한다. 다음으로 점 추적과 마스크를 결합해 2D 위치·방향·관측 신뢰도를 추정하고, 관측된 운동을 단순 운동 모델로 설명되는 안정 구간과 운동 변화 주변의 전이 에피소드로 조직한다. 이때 공유 월드 좌표계의 기준이 되는 정준 프레임과 각 안정 구간의 운동 앵커 프레임을 고른다. 정준 프레임과 인접 프레임에서 카메라 파라미터와 점군, 정적 평면을 복원하고 각 객체를 텍스처 구체나 박스 메시로 피팅한 뒤, 스케일 σ>0, 회전 R∈SO(3), 이동 t∈R³를 배치 손실 L_place = λ3D·L3D + λIoU·L_IoU + λDice·L_Dice + L_reg + λsup·L_sup로 최적화한다. 이 손실은 3D 대응, IoU·Dice를 통한 실루엣 정렬, 초기화 정규화, 지지 관계 일관성을 결합한 것이다. 이어 안정 구간과 전이 에피소드, 앵커 장면을 이용해 관측을 월드 좌표계로 들어올려 6DoF 운동 사전(motion prior)을 만들고, 이를 바탕으로 물리 역산을 수행한다. 물리 역산에서는 충돌 프록시를 만들고 지지 관계와 운동 사전에서 강체 제약을 유도하는데, 안정 구간은 힘 평형·마찰·구름·에너지를, 접촉 사건은 운동량 평형·반발계수·마찰을 제약한다. 이렇게 초기화한 η=(Θ, s₁, G_col)를 시뮬레이션 탐색으로 정련하며, 프레임 h까지의 객체·프레임 쌍 집합 Ω_h에 대해 시뮬레이션 가시 마스크와 관측 마스크의 L_mask^(h)(η) = (1/|Ω_h|) Σ [1 − IoU(M̂_i,t(η), M_i,t)]를 최소화한다. 각 단계에서 최선 시뮬레이션과 최대 두 개의 대안을 보존하고, 마지막에 저장된 모든 시뮬레이션을 전 프레임에서 비교해 최선을 다시 정련한다. 편집 적용 단계에서는 지시문을 Add, Delete, Set 구조화 연산으로 파싱해 원본 영상에서 복원한 영구 정체성에 객체 참조를 결속하고, 실행 프레임 t_e에서 사실 상태에 연산을 적용해 이후 진화를 시뮬레이션한다. 그 결과를 투영 점 궤적과 실행 프레임의 편집된 참조 이미지로 변환하고, 사전학습된 영상 생성 모델을 점 궤적·참조 이미지·장면 프롬프트로 조건화해 반사실 영상을 만든다.

무엇과 다른가

평가를 위해 저자들은 PCVE-RigidBench를 구축했다. 충돌, 반동, 구름, 미끄러짐, 낙하, 연쇄 충돌을 아우르는 20개의 합성 강체 장면을 PyBullet으로 시뮬레이션하고 Blender로 렌더링했으며, 129개의 편집 과제마다 원본 영상과 물리 편집, 반사실 목표 영상, 물리 정답을 짝지어 제공한다. 편집 종류는 객체 삽입·제거와 초기 속도, 질량, 마찰, 반발계수 변경을 포함하고, 개입 시점은 첫 프레임이거나 영상 중간이며, 각 과제는 실행 프레임과 수치·공간 변화를 명시한 정량 설명과 방향·대략적 시점을 주는 정성 설명을 함께 제공한다. 새 지표인 Physical Edit Score(PES)는 원본 영상에 존재하면서 개입 후 운동이나 존재가 바뀌는 객체만 평가 대상으로 삼아, 생성 영상과 변경 없는 원본 영상의 반사실 목표 대비 궤적 오차 비율로 PES = max(1 − Σ TE_i^pred / Σ TE_i^null, −1)로 정의한다. 1은 오차가 0임을, 0은 원본 대비 개선이 없음을, 음수는 원본보다 나쁨을 뜻한다.

어떻게 쓰나

실험에서 VideoPhysEdit은 비교한 오픈소스 방법(VACE, Ditto)과 상용 모델(MiniMax H3, Seedance 2.5)보다 물리 편집 정확도가 크게 높았다. 가장 강한 경쟁 방법 대비 궤적 오차(TE)를 54.0% 줄였고, Mask IoU와 PES가 가장 높았으며, 비교 방법 중 유일하게 PES가 양수인 0.376을 기록했다. 편집의 결과로 운동이 바뀌는 다른 객체들에 대해서도 유일하게 양수 PES인 0.276을 얻었다(부록 표 9). 시각적 충실도에서는 PSNR, SSIM, LPIPS, CLIP 이미지 유사도에서 Seedance 2.5에 근접하면서 FVD는 가장 좋았다. 객체 제거 과제만 따로 비교한 표 2에서는 제거 전용 방법 VOID보다 TE를 37.0% 줄이고 PES와 Mask IoU가 가장 높았으며, VOID가 PSNR은 가장 높았고 VideoPhysEdit은 SSIM과 FVD가 가장 좋았다. 저자들은 또한 편집 지시문에 하류 결과를 명시적으로 서술해도 일관된 개선이 없었다고 보고하며(부록 C.5), 이는 개입의 결과를 암묵적으로 추론하는 대신 관측된 운동과 상호작용을 재현하는 실행 가능한 물리 장면에 개입을 근거시키는 편이 더 신뢰할 만한 토대라는 해석으로 이어진다.

전제와 한계

중간 산출물 분석도 제시된다. 3단계의 정준·운동 앵커 장면이 원본 장면을 복원하고, 4단계 운동 사전이 전체 시퀀스에서 이 정합을 유지하며, 5단계가 관측 운동에 하나의 물리 롤아웃을 피팅한다. 시뮬레이션 탐색과 최종 정련은 이 사실 롤아웃과 6단계 반사실 궤적을 모두 개선하고, 7단계 영상 생성은 그 운동을 대체로 보존한다(대응 객체·프레임에서 TE는 거의 그대로, PES와 Mask IoU는 소폭 향상). 불완전하거나 모호한 관측에 대한 강건성은 여러 단계에 걸쳐 불확실성을 점진적으로 해소하는 방식으로 확보하며, 7단계에서는 적응적 시간 스케일링과 상호작용 ROI로 빠른 궤적을 따라가고 접촉 중 작은 물체를 보존한다. 다만 파이프라인이 유효한 편집 영상을 만들지 못한 두 장면도 경계 사례로 보고된다.

개발자 관점에서 이 논문의 의미는 물리적 결과가 중요한 편집 작업에서 생성 모델에 물리 추론을 위임하지 않고, 복원한 장면을 시뮬레이터로 굴려 얻은 궤적을 생성 조건으로 쓰는 아키텍처를 제시한다는 점이다. 실제로 적용하려면 강체 장면이라는 전제, 객체 마스크와 점 추적이 신뢰할 만큼 나오는지, 다수의 사전학습 모듈(Qwen3-VL, Grounding DINO, SAM 2, CoTracker3, VGGT+SuperGlue, PyBullet, ObjectClear, Insert Anything, Cube3D, Wan-Move)을 조합한 파이프라인의 실행 시간과 GPU 메모리(부록 C에 보고)가 감당 가능한지를 먼저 확인해야 한다. 또한 정량 평가는 합성 벤치마크에서 이뤄졌고 실제 영상은 정성 비교에 그쳤다는 점, 편집 지시문에 결과를 명시하는 것만으로는 성능이 오르지 않았다는 점도 실무 적용 시 염두에 둘 만하다.

저자들이 밝힌 한계와 전제는 분명하다. 방법은 강체 장면을 대상으로 하며, 향후 과제로 카메라 운동, 더 풍부한 기하, 관절체나 능동 제어 에이전트를 위한 물리 모델을 꼽는다. 또한 파이프라인이 유효한 편집 영상을 만들지 못한 경계 사례가 존재하고, 물리 역산은 관측이 결정하지 못하는 양에만 명시적 사전을 쓰는 방식으로 동일한 2D 관측을 설명할 수 있는 여러 조합 중 시뮬레이션이 관측 운동을 재현하는 장면을 찾는 접근이라는 점에서 본질적으로 ill-posed 문제를 다룬다. 논문 본문은 코드 공개를 언급하지만 실제 URL 대신 자리표시자 문구만 제시되어 있어, 저장소 주소는 원문에서 확인되지 않는다.