EditWorld는 스트리밍 편집 지시와 참조 이미지로 세계모델을 실시간 수정한다

Precise Editing and Flexible Referencing for Interactable Worlds

HF Daily2609.34470

Xinyao Liao, Xianfang Zeng, Zhu Liang2026-09-28조회 2

무엇인가

기존 비디오 월드 모델은 주로 내비게이션에 집중해 왔다. 사용자가 생성된 세계를 탐험할 수는 있지만, 이미 존재하는 세계 콘텐츠를 추가·삭제·교체·스타일화하는 식으로 정밀하게 바꾸는 제어권은 제한적이었다. YUME 1.5, HY-WorldPlay 1.5, LingBot-World 2.0, DreamX-World 같은 후속 연구가 텍스트 기반 이벤트 생성 범위를 넓혔지만, 이들은 새 이벤트를 '촉발'하는 데 초점을 두었고 기존 콘텐츠를 지정해 수정하는 일은 다루지 않았다. 참조 이미지도 XGEN-JING, ABot-World처럼 초기 조건으로만 쓰이는 경우가 대부분이라, 상호작용 도중 원하는 시점에 다른 참조 이미지를 주입하는 유연성은 부족했다. 이 논문은 이 두 가지 공백, 즉 정밀 편집과 유연한 참조를 동시에 겨냥한다.

어떻게 동작하나

EditWorld는 LingBot-World-Base라는 양방향 비디오 월드 모델 위에 구축된다. 초기 프레임을 세계 사전(prior)으로 삼고, 카메라 포즈·텍스트 프롬프트·참조 이미지를 조건 신호로 받아 자기회귀적으로 청크 단위 영상을 생성한다. 생성 과정은 p(x_1:T|c_1:T) = ∏ p(x_t | x_<t, c_≤t)로 인과적으로 분해된다. 핵심 구성 요소는 Gated Causal Attention이다. 각 청크는 장면 설명 프롬프트를 항상 포함하되, 편집 지시 프롬프트는 해당 청크가 'during' 상태로 라벨링된 경우에만 활성화된다. 프롬프트가 청크마다 바뀔 때 생기는 급격한 화면 전환을 줄이기 위해, 각 청크는 자기 프롬프트뿐 아니라 직전 두 청크의 프롬프트까지 함께 참조한다. 참조 이미지 토큰은 VAE로 인코딩되어 시간축으로 영상 잠재와 이어 붙고, 자기 참조 이미지 내부만 볼 수 있는 단방향 게이티드 셀프 어텐션을 쓴다. 영상 청크가 특정 참조 이미지를 볼 수 있는지는 그 청크의 텍스트 컨텍스트가 해당 참조를 가리키는 의미를 담고 있을 때만 허용된다. 또한 참조 토큰에는 음의 시간 RoPE 마진 m(i+1)을 부여해 단순 복사·붙여넣기 행동을 억제한다.

무엇과 다른가

긴 영상에서 컨텍스트가 무한히 커지는 문제는 Sparse Context로 막는다. 목표 청크를 생성할 때 싱크 청크 x_0와 최근 두 청크는 항상 유지하고, 나머지 이력에서는 평균 풀링한 pre-RoPE 쿼리·키의 코사인 유사도로 상위 k개 청크의 KV 캐시를 골라 활성 컨텍스트에 넣는다. 이렇게 하면 컨텍스트 예산이 고정된다. 학습에서는 같은 전략을 쓰되 나머지 이력에서 무작위 개수의 청크를 샘플링해 다양한 희소 이력에 노출시킨다. 학습 커리큘럼은 세 갈래다. 인과 목적함수만 최적화하면 영상 이어붙이기에 치우치고 조건 반응성이 약해지므로, 자기회귀 목적과 양방향 목적을 같은 파라미터·같은 데이터로 어텐션 패턴만 달리해 동시에 최적화한다. 여기에 어닐링된 자기 재샘플링을 적용해, 학습이 진행될수록 정답 이력 대신 모델이 생성한 이력을 조건으로 쓰는 비율을 점차 높여 오차 누적에 강건하게 만든다. 마지막으로 PCM으로 4 NFE(청크당 함수 평가 4회) 소수 스텝 모델을 만든 뒤 Self Gradient Forcing으로 분포 증류를 수행한다.

어떻게 쓰나

데이터 파이프라인도 별도로 설계했다. 내비게이션 데이터는 Sekai·OmniWorld·SpatialVID, 편집 데이터는 Ditto-1M·OpenVE-3M에서 가져온다. 전역 편집(날씨·계절·시간·조명·색조·화풍)은 약 200개 주 속성과 100개 보조 속성 어휘에서 Qwen3.6-27B가 영상 내용에 맞는 조합을 뽑고, Qwen-Image-Edit으로 앵커 프레임을 편집한 뒤, 깊이 제어 모델 Wan2.2-FLF2V-A14B-Control로 원본 프레임과 편집 앵커 프레임 사이의 전환 구간을 합성하고 Wan2.2-I2V-A14B-Control로 이후 구간을 이어 붙인다. 지역 편집(요소 추가·삭제·교체, 색·재질·형태·상태 변경)은 공개 편집 데이터셋을 2단계 VLM 필터링으로 걸러 소스 프레임과 타깃 프레임 사이 전환을 같은 방식으로 합성한다. 각 영상에는 장면 설명, 편집 지시, 청크별 편집 상태(before/during/after), ViPE로 재추정한 카메라 포즈가 주석으로 붙는다. 참조 이미지는 지역 편집의 경우 Grounded-SAM으로 대상 객체를 분할한 뒤 Qwen-Image-Edit으로 보정해 만들고, 이때 텍스트 지시에서 참조가 이미 담고 있는 내용을 제거해 의미 누출을 막는다.

전제와 한계

평가는 새로 만든 WBench-Editing에서 이뤄진다. 약 150개 케이스, 각 240~480프레임(15~30초), 케이스당 1~3개의 편집 지시가 들어가고 일부는 참조 이미지를 포함한다. 편집 능력은 의도한 수정이 제대로 실행됐는지, 편집 후 세계의 품질, 편집과 무관한 내용이 보존됐는지를 VLM 질의응답으로 평가한다. 기존 모델 대부분이 참조 이미지를 상호작용 조건으로 지원하지 않으므로 공정 비교를 위해 모든 모델을 텍스트 전용 스트리밍 편집 지시로 평가했다. 결과는 종합 73.8로 2위 YUME 1.5보다 6.8점 높고, 핵심 편집 지표에서는 80.0으로 2위 54.8을 25.2점 앞선다. Physical 67.9, Navigation 74.3, Quality 74.4, Setting 60.9, Consistency 83.8을 기록해 편집 성능 향상이 다른 세계 모델링 능력을 희생하지 않았음을 보인다. 참조 이미지가 포함된 하위 집합에서는 종합 74.0, 편집 74.6으로 참조 조건 모델들보다 높다. 원래 WBench에서는 양방향 추론 SFT 모델이 평균 81.2로 전체 4위, LingBot-World(base-camera) 78.5를 81.2로 끌어올렸고 Setting은 72.6에서 84.6으로 뛰었다. 인과 자기회귀 추론은 77.7, 증류된 4스텝 모델은 79.4(Setting 85.9, Consistency 89.2)를 기록했다.

절제 실험은 설계 선택의 근거를 보여준다. 자기회귀 목적만 쓴 변형과 비교해 자기회귀+양방향 공동 학습은 Editing Overall을 69.7에서 80.0으로, Detail Accuracy를 34.9에서 53.2로 올렸다. 참조 토큰과 영상 토큰을 양방향으로 서로 보게 한 변형은 영상 토큰이 참조 표현을 바꿔 세부 디테일과 객체 정체성이 약해졌고, 단방향 어텐션이 이를 더 잘 보존했다. 직전 두 청크의 프롬프트를 함께 보지 않고 현재 프롬프트만 보는 변형은 편집 프롬프트가 160~240프레임 사이에서 바뀔 때 뚜렷한 장면 이동과 급격한 시간 전환이 나타났다.

개발자 관점에서 이 논문이 유용한 지점은 '생성 중 편집'을 시스템 설계로 푼 방식이다. 편집 지시를 청크 단위 상태(before/during/after)로 라벨링해 게이팅에 연결하고, 참조 이미지 노출 시점을 텍스트 컨텍스트로 제어하며, 이력 컨텍스트를 고정 예산으로 유지하는 패턴은 인터랙티브 생성 파이프라인 전반에 참고할 만하다. 다만 실제 도입 전에 확인할 것은 세 가지다. 첫째, 평가가 VLM 기반 질의응답이라는 점에서 지표가 평가 모델에 의존한다. 둘째, 데이터 합성 품질이 Qwen-Image-Edit, Wan2.2 계열 등 기성 모델에 의존하므로 이들의 한계가 학습 데이터에 전이될 수 있다. 셋째, 참조 이미지 조건 비교는 참조를 지원하는 소수 모델로 제한된 하위 집합에서만 이뤄졌다.

저자들은 별도의 한계 절을 두지 않았다. 원문에서 확인되는 전제는 다음과 같다. 기존 월드 모델 대부분이 참조 이미지를 상호작용 조건으로 받지 못해 주요 비교표는 텍스트 전용 편집 지시로 수행됐고, 참조 조건 비교는 WBench-Editing의 참조 포함 하위 집합에 한정된다. 또한 편집 능력 평가가 VLM 질의응답 기반이며, 전역·지역 편집 데이터 모두 깊이 제어 영상 생성 모델과 이미지 편집 모델 같은 기성 도구의 출력을 감독 신호로 사용한다는 점이 결과의 전제로 깔려 있다.