StoryEngine이 이야기 상태를 명시 전파해 장편 영상 일관성을 지킨다

StoryEngine: A State-Grounded Agentic Framework for Video Storytelling

HF Daily2609.33627

Yingrui Wang, Zeqing Wang, Yeying Jin2026-09-27조회 3

무엇인가

최신 영상 생성기는 텍스트나 이미지에서 그럴듯한 단편 클립을 잘 뽑아내지만, 여러 샷이 이어지며 하나의 이야기를 밀고 나가는 장편 스토리텔링은 여전히 어렵다. 기존 에이전트 파이프라인은 대부분 텍스트 샷 계획이나 이전에 생성된 픽셀에 다음 샷을 조건화하는데, 사건의 결과가 이후 샷에 어떻게 반영되는지, 영상 세계의 상태가 샷 사이에서 어떻게 유지되는지를 명시적으로 다루는 장치가 없다. 그 결과 누락된 시각 디테일이 부정확하게 복원되고, 시각적 드리프트가 뒤 샷으로 전파되면서 서사적 일관성과 시각적 일관성이 함께 무너진다. 논문은 배낭을 사물함에 넣고 교실로 노트를 가지러 갔다가 다시 사물함으로 돌아오는 예시를 든다. 단순해 보이지만 배낭은 학생이 교실에 있는 동안 사물함에 남아 있어야 하고, 노트는 회수되기 전까지 책상 위에 있어야 한다.

어떻게 동작하나

StoryEngine의 핵심은 권위 있는 의미 계획과 신뢰할 수 없는 시각 관측을 분리하는 것이다. 1단계인 story-state propagation에서 계획 모델 F_state는 요청 x와 목표 샷 수 N을 받아 의미 계획 P_s를 만든다. 여기에는 반복 등장 엔티티 집합 E, 환경 카탈로그, 초기 세계 상태 S_1, 그리고 각 샷의 순서 있는 이벤트 목록 A_i와 공간 의도 η_i, 샷 단위 요구사항과 교차 샷 순서 제약이 담긴다. 세계 상태 S는 각 엔티티를 배치와 스토리 관련 속성의 쌍으로 매핑한다. 배치는 장면 위치와 함께 캐릭터가 들고 있음, 표면 위에 놓임, 컨테이너 안에 저장됨 같은 관계를 포함하고, 속성은 열려 있음, 깨짐, 비어 있음처럼 이야기나 그 시각적 실현에 변화가 중요한 조건을 담는다. 결정론적 상태 리듀서 R은 이벤트 효과를 서사 순서대로 적용해 S_{i+1} = R(S_i, A_i)를 계산하고, (S_i, S_{i+1}) 쌍이 그 샷의 의미 상태 계약이 된다. 중요한 점은 S_{i+1}이 생성된 영상에서 복원한 추정치가 아니라 계획된 효과를 따른다는 것이다. 그래서 놓치거나 손상된 디테일은 다음 샷의 새로운 서사적 사실이 되지 않고 국소적 실행 오류로 남는다.

무엇과 다른가

2단계 grounded render planning은 그 사실들이 픽셀에서 어떻게 보여야 하는지를 채운다. 반복 등장 엔티티마다 정식 정체성 참조를 만들고, 스토리에 중요한 속성이 외형을 바꾸면 상태별 참조를 따로 만든다. 반복 환경마다 정식 파노라마 참조를 만들어 외형과 의미 레이아웃을 고정하고, 후보 자산은 정체성 또는 레이아웃 기준으로 평가한 뒤 선택해 공유 라이브러리 L을 구성한다. 이어서 샷별 grounded context U_i가 행동에 맞는 장면 뷰와 카메라 사양, 상태에 맞는 자산 바인딩을 묶고, 컴파일러 C_render가 렌더 계약 r_i = (S_i, A_i, S_{i+1}, U_i, K_i)를 만든다. K_i는 start, motion, end로 태그된 기준 집합으로, 각각 열기 구성과 반드시 일어나야 할 전환, 샷 끝에 필요한 증거를 규정한다. 3단계 continuity-aware generation은 이전 샷의 선택된 꼬리 프레임을 관측으로 취급하고, Gate가 이를 r_i의 start 기준과 비교해 reuse, reference, fresh 중 하나를 고른다. 호환되는 꼬리 프레임은 열기 프레임으로 그대로 쓰고, 일부만 맞으면 맞는 내용만 남기고, 맞지 않으면 버린다. 생성 후에는 VLM을 평가자로 둔 유계 수리 루프가 돈다. 실패 또는 불명으로 판정된 기준 집합 B_i^(t)를 원래 정식 문장과 함께 다시 넣어 v_i^(t+1) = F_gen(r_i, c_i; B_i^(t))를 생성하고, 예산 T=3 안에서 모든 필수 기준을 만족하는 첫 후보를 반환한다. 예산이 소진되면 상태, 행동, 정체성, 연속성 요구를 가장 잘 만족하는 후보를 택하고 남은 위반은 국소 열화로 기록한다.

어떻게 쓰나

평가는 60개 멀티샷 스토리 벤치마크로 구성했다. 20개씩 세 진단 스위트로 나뉘어 N20은 서사 실현, T20은 교차 샷 일관성, C20은 시각 일관성을 겨냥한다. 각 스위트는 Store, Food, Transit, Workshop, Control Room 다섯 범주에서 4개씩 뽑았고, 각 스토리는 두 개의 반복 장소에 걸쳐 10개 샷을 요청한다. N20은 화면에서 보이는 변화로 일어나야 할 10개 이벤트를 나열하고 다른 N20 스토리에서 가져온 6개 방해 이벤트를 섞어 거짓 양성을 드러낸다. T20은 9개 컷마다 양쪽에 보여야 하는 크고 구별되는 앵커 엔티티를 지정하는데, 180개 앵커 컷 중 71개가 장소 전환과 겹치며, 각 스토리는 자유롭게 배치하되 절대 되돌리면 안 되는 상태 변화 3개를 명시한다. C20은 단일 캐릭터가 두 장소를 5~6회 오가며, 13개 스토리는 장소 간 조명 대비를 추가로 규정한다. 지표는 8개로 PEC와 ECS는 N20, APR, SPS, LAR은 T20, GPC와 LCS는 C20, MIR은 60개 전체에 적용하며, Gemini-3.5-Flash를 temperature 0으로 호출해 판정한다.

전제와 한계

베이스라인은 에이전트 시스템 ViMax와 MovieAgent, 그리고 계획기 없이 각 샷을 독립 생성하는 Direct I2V이며, 백본은 Veo 3.1과 Wan2.2-TI2V-5B 두 가지다. StoryEngine은 두 백본 모두에서 영상 기반 7개 지표 전부 1위이고, 계획을 산출하는 방법 중에서는 PEC도 가장 높다. 평균 점수는 Veo 3.1에서 0.7690, Wan2.2-TI2V-5B에서 0.7372로, 최강 베이스라인 ViMax를 각각 0.1416과 0.1304 앞선다. 오픈소스 Wan2.2로 백본을 바꾸면 모든 방법의 ECS가 떨어지는데 ViMax는 0.9067에서 0.7750으로 급락하는 반면, StoryEngine의 ECS 격차는 0.0158에서 0.0383으로 오히려 벌어진다. 컷 단위 구조에서 격차가 특히 크다. 베이스라인의 APR은 0.5500 이하에 머물고 Wan2.2에서는 Direct I2V의 0.6722보다도 낮아지는데, StoryEngine은 0.9389와 0.8444를 기록했다. LAR은 0.9800과 0.9749, LCS는 0.5691과 0.5372로 베이스라인의 0.21~0.27을 크게 웃돈다. 다만 SPS는 모든 방법이 0.67 미만에 그쳤다.

Veo 3.1 백본에서 단계를 하나씩 제거한 실험도 이를 뒷받침한다. grounded render planning을 뺀 w/o GRP가 평균을 0.7690에서 0.7119로 가장 크게 떨어뜨렸고 GPC와 LCS가 각각 0.1074, 0.1411 하락했다. continuity-aware generation을 뺀 w/o SCVC는 평균 0.7251로 ECS, APR, MIR이 세 변형 중 가장 낮았다. story-state propagation을 뺀 w/o SSP는 평균 하락이 0.0142로 가장 작았지만 SPS가 0.0307, APR이 0.0278 떨어졌고, SPS는 w/o GRP에서 0.0725로 더 크게 하락해 보이는 상태 진행이 전파된 상태와 상태를 담은 객체의 그라운딩을 모두 필요로 함을 시사한다. 플래너를 GPT-5.5에서 Gemini-3.5-Flash로 바꾸면 PEC가 0.8872, 평균이 0.7357로 내려가고 MIR은 0.4072에서 0.4179로 소폭 오르는데, 그래도 GPT-5.5로 계획한 Veo 3.1 베이스라인 전부보다 높다.

실무 관점에서 이 논문이 주는 설계 교훈은 명확하다. 여러 샷에 걸쳐 사물의 위치나 상태가 유지되어야 하는 튜토리얼, 제품 데모, 시리즈형 콘텐츠 자동 생성 파이프라인이라면, 상태를 자유 형식 프롬프트에 맡기는 대신 배치와 속성으로 구조화하고 이벤트를 결정론적 전이로 적용하는 편이 낫다. 생성된 이미지와 영상은 계획을 수정할 수 없는 관측으로 격리하고, 이전 샷의 꼬리 프레임은 다음 샷의 열기 상태와 호환될 때만 재사용해야 한다. 도입 전에 확인할 것은 세 가지다. 상태 표현이 다루는 범위가 자기 도메인에 충분한지, 반복 등장 자산의 정식 참조 품질을 어떻게 확보할지, 그리고 VLM 판정과 수리 루프가 감당할 비용과 예산 T를 어떻게 정할지다. 백본이 약할수록 이 구조의 이득이 커진다는 점도 참고할 만하다.

저자들이 밝힌 한계는 분명하다. 되돌릴 수 없는 상태 진행을 재는 SPS가 모든 방법에서 0.67 미만으로, 열린 문제로 남아 있다. 더 긴 이야기와 더 많은 장소, 더 많은 캐릭터로 확장하는 것도 남은 과제다. 또한 세계 상태는 인과적·시각적 연속성에 필요한 사실만 담는 압축적 표현이지 물리 세계 전체를 재구성하지 않으며, 수리 루프는 예산이 소진되면 남은 위반을 국소 열화로 기록한 채 최선 후보를 반환한다.