영상 편집 지시의 숨은 의도를 MLLM 추론으로 먼저 해석하는 ThinkV2V

ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing

HF Daily2609.38541

Donghao Zhou, Haoyang He, Fan Zhang2026-09-29

무엇인가

이 논문이 겨냥하는 문제는 지시 기반 영상 편집에서 사용자가 주는 명령이 목표 외형을 직접 서술하지 않는다는 점이다. 저자들은 많은 지시가 암시적이고 간접적이며, 실행 가능한 편집 목표를 드러내려면 인과적·의미적 추론이 필요하다고 본다. 그런데 기존 편집기들은 멀티모달 대형 언어모델(MLLM)을 프롬프트와 원본 영상을 함께 처리하는 더 강한 의미 인코더로만 쓰고, 명시적인 사고 과정은 꺼내 쓰지 않는다. 그 결과 명시적 프롬프트에는 통하지만, 시간적 역학이나 객체 관계, 논리적 인과가 얽힌 지시에서는 표면 키워드에 매달려 실제 편집 목표를 놓친다. 저자들은 병목이 생성 품질이 아니라 복잡한 언어를 신뢰할 수 있는 편집 계획으로 바꾸는 '편집 전 사고' 절차의 부재라고 규정한다.

어떻게 동작하나

구조는 MLLM에서 DiT로 이어지는 3단 구성이다. MLLM으로 Qwen3-VL-Thinking-8B를 쓰고, 원본 영상과 원본 지시를 입력받아 사고 연쇄 추론을 수행하게 한다. 이 과정에서 사고 내용, 정제된 프롬프트, 그리고 </think> 태그 뒤에 생성된 답변 토큰의 마지막 레이어 은닉 상태를 얻는데, 다음 모듈로 넘어가는 것은 이 답변 은닉 상태뿐이다. 중간에 놓인 커넥터는 512개의 학습 가능한 쿼리 토큰으로 이 은닉 상태에 크로스 어텐션을 걸어 고정 길이 조건 특징을 뽑아낸다. 이는 특징 압축과 모듈 간 정렬을 동시에 수행해, 길고 불안정할 수 있는 토큰 열을 DiT가 안정적으로 소비할 수 있는 형태로 바꾼다. DiT 백본은 Wan-2.1-5B이며, 커넥터 특징은 원본 지시의 텍스트 임베딩과 토큰 차원으로 이어 붙여 크로스 어텐션으로 주입하고, 원본 영상의 VAE 특징은 노이즈 latent와 채널 차원으로 결합한다. 정제된 프롬프트를 텍스트 입력으로 그대로 쓰지 않고 원본 지시를 남겨 둔 것은, 압축된 MLLM 특징에만 의존할 때 생기는 정보 병목과 세부 묘사 손실을 막기 위한 설계다.

무엇과 다른가

학습과 추론에는 별도의 레시피가 붙는다. 점진적 커리큘럼 학습은 해상도와 지시 복잡도 두 축을 따라 3단계로 진행된다. 1단계 기본 정렬은 480p에서 OpenVE-HQ-1M으로 2에폭, 학습률 1e-5로 MLLM 특징을 DiT 조건 공간에 매핑하는 법을 익힌다. 2단계 고해상도 적응은 720p에서 0.5에폭, 학습률 1e-6으로 화질과 안정성을 다진다. 3단계 추론 집약 튜닝은 720p에서 ThinkV2V-150K로 1.5에폭, 학습률 1e-6으로 암시적 의도와 인과 관계를 다룬다. 학습 중에는 커넥터와 DiT만 최적화하고 MLLM은 동결해 일반적인 사고 능력을 보존한다. 32개 GPU 클러스터가 쓰였다. 추론 시 사고 스케일링은 정제된 프롬프트를 MLLM에 다시 넣는 직렬 정제로 후보를 여러 개 만들고, 그중 원래 편집 의도와 원본 영상에 가장 맞는 후보를 MLLM이 직접 고르는 best-of-N(N=8) 선택을 결합한다. 선택된 후보의 캐시된 은닉 상태가 커넥터와 DiT로 전달된다.

어떻게 쓰나

데이터와 평가셋도 새로 만들었다. ThinkV2V-150K는 OpenVE-3M에서 전역 스타일, 배경 변경, 국소 제거, 국소 추가, 국소 변경의 다섯 범주만 남기고 자막 편집처럼 추론 중심 편집에 덜 맞는 범주는 제외해 구성했다. 다섯 범주에서 200만 샘플을 거른 뒤 Gemini-2.5-Flash로 재점수화하고, 프레임 간 CLIP 유사도와 시간적 깜빡임을 계산해 상위 50%를 OpenVE-HQ-1M으로 남겼다. 여기서 범주별 2만~4만 샘플을 골라 Gemini-2.5-Pro로 실제 사용자 요청에 가까운 복잡한 추론형 지시를 생성해 15만 영상 쌍을 얻었다. ThinkV2V-Bench는 OpenVE-Bench의 원본 지시를 Gemini-3.1-Pro로 추론형으로 재작성해 다섯 범주에 걸친 308개 영상-지시 쌍으로 만들었다.

전제와 한계

실험은 VACE, OmniVideo, ReCo, InsVIE, Lucy-Edit, ICVE, DITTO, OpenVE-Edit와 비교했다. ThinkV2V-Bench에서 DITTO는 전역 스타일에, ReCo는 국소 제거에, OpenVE-Edit은 배경 변경에 각각 국소적 강점을 보였지만 이런 이점은 특정 편집 유형에 몰려 있었다. ThinkV2V는 Seed-1.6-VL과 Gemini-2.5-Pro 두 판정 모델 모두에서 종합 최고 점수를 냈고, 표준 벤치마크인 OpenVE-Bench에서도 두 판정 모델 기준 최고 종합 점수를 기록하며 국소 변경과 국소 제거에서 특히 강했다. 5B 규모 DiT 백본을 쓰고도 10B 규모 베이스라인들을 앞선다는 점을 저자들은 아키텍처 설계와 학습·추론 레시피의 효과로 설명한다.

절제 실험 수치는 논문의 주장을 뒷받침한다. MLLM을 정적 의미 인코더로 쓰면 종합 점수 2.51이지만, 명시적 사고를 켜고 모든 특징을 쓰면 2.63, 답변 토큰의 은닉 상태만 쓰면 2.68로 올라간다. 사고 과정의 중복을 줄이고 실행 지향 조건을 얻는 쪽이 낫다는 해석이다. 학습 순서 비교에서는 복잡한 지시만 쓴 경우 2.10, 복잡한 것에서 단순한 것으로 가는 경우 2.41, 단순·복잡 혼합 2.47, 단순한 것만 쓴 경우 2.52인 반면, 단순한 것에서 복잡한 것으로 가는 순서가 2.68로 가장 높았다. 추론 스케일링에서는 직렬 정제만 적용하면 2.67로 기본 모델 대비 개선이 없었고, 여기에 후보 선택을 더했을 때 2.72로 이 그룹 최고치를 기록했다. 반복 정제만으로는 국소적 모호성을 증폭시킬 수 있어 선택 단계가 필요하다는 결론이다.

개발자 관점에서 이 논문이 주는 실무적 신호는 두 가지다. 첫째, 자연어 지시를 그대로 확산 모델에 넣는 대신 추론 모델을 앞단에 두고 그 출력을 조건으로 변환하는 파이프라인이 복잡한 지시에서 유리하다는 점이다. 둘째, MLLM과 생성기 사이의 조건 전달에서 정보 병목을 어떻게 관리하느냐가 성능을 가른다는 점으로, 커넥터로 압축한 고수준 특징과 원본 텍스트·원본 영상 특징을 함께 넣는 다중 조건 설계가 그 답으로 제시된다. 도입을 검토한다면 32개 GPU 규모의 3단계 학습 비용, MLLM을 동결한 채 커넥터와 DiT만 학습한다는 전제, 720p 해상도와 5개 편집 범주라는 적용 범위, 그리고 추론 시 best-of-N 선택이 만드는 지연과 비용을 확인해야 한다. 또한 개선폭이 판정 모델 기반 주관 평가 점수로 보고된다는 점도 실제 배포 전 자체 검증이 필요한 지점이다.

원문에 별도의 한계 절은 없고, 결론에서 더 효율적인 사고 포함 프레임워크를 향후 과제로 언급하는 수준이다. 본문에서 확인되는 전제는 명확하다. MLLM은 학습 내내 동결되므로 사고 능력 자체가 편집 데이터로 개선되지는 않는다. 데이터는 OpenVE-3M 파생이고 자막 편집 등 세 범주를 의도적으로 제외했으며, 벤치마크는 308개 쌍으로 규모가 작다. 평가는 Seed-1.6-VL과 Gemini-2.5-Pro라는 판정 모델에 의존하고, 정성 비교에서도 기존 방법들이 의도를 오해해 스타일 변환이 불완전하거나 엉뚱한 대상을 제거하는 사례를 근거로 제시한다.