실시간 720p 디지털 휴먼을 위한 스트리밍 멀티모달 레퍼런스 생성과 선제적 에이전트 계획

FlowAct-R2: Beyond Talking Avatar via Streaming Multimodal References and Proactive Agent Planning

arXiv2609.35728v1

Ziyao Huang2026-09-28조회 2

무엇인가

기존 디지털 휴먼 시스템은 대화, 재능 공연, 라이브 커머스와 제품 시연처럼 단일 시나리오에 갇혀 있었다. 열린 라이브 상호작용을 위해서는 일관된 페르소나와 장기 맥락을 유지하고, 다음에 무엇을 할지 스스로 조직하며, 예기치 않은 사용자 입력에 반응하면서도 진행 중인 활동을 버리지 않고, 음성·몸동작·객체 상호작용·장면 수준 행동을 조율해야 한다. 논문은 여기서 결합된 두 난제를 지목한다. 생성기는 동적으로 변하는 이미지·오디오·비디오 레퍼런스를 정체성과 시간 연속성을 잃지 않고 받아들여야 하고, 에이전트는 복잡한 활동을 미리 준비하면서 온라인에서 지연에 민감한 결정을 내려야 한다.

어떻게 동작하나

생성기 쪽은 사전학습된 Seedance 2.0 Mini 레퍼런스-투-비디오(R2V) 백본을 적응시킨 Streaming Multimodal Reference Diffusion Transformer다. Diffusion Forcing이 시퀀스 토큰마다 독립적인 노이즈 레벨을 부여하는 성질을 청크 단위 생성에서 스트리밍 멀티모달 레퍼런스로 확장해, 백본의 양방향 시공간 모델링을 유지한 채 자기회귀 스트리밍 추론을 수행한다. 컨디셔닝 자체가 스트림이 되어 롤링 액션 프롬프트, 구동 오디오, 그리고 세션 도중 갱신·교체되는 이미지·오디오·비디오 레퍼런스를 받는다. 비디오 기반 회전 위치 임베딩(RoPE) 변형이 들어오는 레퍼런스 청크를 해당 생성 타임라인에 정렬하고, (R+I)2V로 표기된 레퍼런스+이미지 조건화를 명시적으로 학습해 정체성과 외형을 고정한다. 또한 부분적으로 노이즈가 섞인 과거 모션 프레임에 조건화해 불완전한 생성 이력에 대한 강건성을 높이고 오류 누적을 줄인다. 오디오 구동 학습으로 발화·입모양·표정·머리 자세를 동기화하고, coarse-to-fine 추론으로 시각 디테일을 점진 복원한다.

무엇과 다른가

에이전트 쪽은 지연에 민감한 상호작용 루프 밖으로 장기 준비를 빼내는 2단계 설계다. 오프라인 계획 단계에서 텍스트·이미지·오디오·비디오·수작업 자료 등 멀티모달 캐릭터 자산으로부터 페르소나를 도출하고, 세션을 장기 아젠다로 조직하며, 복잡한 행동을 재사용 가능한 멀티모달 스킬로 컴파일한다. 페르소나는 캐릭터가 어떻게 행동할지, 아젠다는 추구할 활동을, 스킬은 실행용 준비 자원을 규정한다. 온라인 스케줄링·응답 단계에서는 준비된 아젠다·스킬에 관객의 텍스트나 오디오 이벤트, 요약된 상호작용 히스토리를 결합해 무엇을 수행할지(행동 결정)와 언제 어떻게 수행할지(스케줄 결정)를 정한다. 행동은 맥락에 따라 개시·오버레이·지연·중단·재개될 수 있어, 아바타가 지속적 프롬프트 없이 아젠다 기반 활동을 이어가면서 관객 이벤트가 오면 반응한다. 스케줄은 idle·listening·speaking·스킬 실행 구간으로 표현되며, 이 구간들이 DiT에 롤링 프롬프트·오디오·멀티모달 레퍼런스 갱신을 공급한다. 에이전트는 세션 행동과 타이밍을, 생성기는 그 결정을 연속 영상 스트림으로 실현하는 상보적 계층이다.

어떻게 쓰나

결과는 실시간 720p 생성과 시간 단위 스트리밍이다. 엔터테인먼트 스트림(관객 대화 + 노래·춤 등 스킬), 쇼핑 스트림(제품 제시, 착용, 제품 레퍼런스 간 전환), 화상 채팅(청취와 표현력 있는 턴테이킹), 라이브 브이로그(장면 전환 + 관객 주도 분기) 네 설정에서 레퍼런스 변경과 관객 상호작용을 시연한다. Vidu-S1과의 인간 평가에서 GSB 점수는 영상 품질 +54.76%, 실시간 상호작용 +40.48%를 기록했고, 비교는 시각적 선명도, 모션 자연스러움과 표현력, 행동 반응성, 대화의 맥락 적합성 개선을 서술한다. 청취 단계에서 FlowAct-R2는 시선·머리 자세·표정 변화로 연속적 청취 상태를 만드는 반면 Vidu-S1은 같은 정면 포즈·미소·손 제스처에 머문다. Vidu-S2와의 정성 비교에서는 동일 제품 레퍼런스에 대해 FlowAct-R2가 빨간 패키징 레이아웃, 초록 파우치의 미세한 선 패턴, 얕은 팔각 상자를 유지한 반면, Vidu-S2는 인접 제품 속성이 섞여 흰 패키징, 두드러진 가지 그래픽, 높은 다각형 틴을 만들어냈고 실린더 예에서는 옅은 패턴 랩을 여러 색 줄무늬로 바꿔버렸다. 즉 레퍼런스 전환 시 객체 융합과 패키징 디테일·비율 충실도 저하가 드러났다.

전제와 한계

개발자 관점에서 이 시스템은 라이브 커머스, 버추얼 스트리머, 화상 채팅, 라이브 브이로그처럼 장시간 자율 진행과 즉각적 반응이 동시에 필요한 응용을 겨냥한다. 도입 전에 확인할 것은 세 가지다. 첫째, 생성 품질이 사전학습 백본(Seedance 2.0 Mini R2V)에 의존하므로 자체 도메인 제품 이미지에서 레퍼런스 전환 충실도가 유지되는지 직접 검증해야 한다. 둘째, 페르소나·아젠다·스킬을 오프라인에서 준비하는 파이프라인이 전제이므로 콘텐츠 제작 비용과 자산 관리 방식이 운영 부담이 된다. 셋째, 720p 실시간과 시간 단위 스트리밍이라는 주장은 지연·처리량·비용 관점에서 자체 인프라로 재현해봐야 한다. 프로젝트 페이지와 Hugging Face Space 데모가 공개되어 있어 동작을 먼저 확인할 수 있다.

논문은 별도의 한계 절을 두지 않았고, 제공된 본문에는 정량 데이터셋·학습 규모·지연 수치 표가 제시되지 않았다. 평가는 Vidu-S1에 대한 인간 GSB 점수와 Vidu-S2에 대한 정성 비교에 한정되며, 4개 시나리오 시연은 정성적 사례다. 또한 사전학습 백본 적응, 오프라인 페르소나·아젠다·스킬 준비, 그리고 관객 이벤트와 상호작용 히스토리 요약에 의존한다는 전제가 깔려 있다. 참고로 지원 시나리오 나열이 서론(화상 채팅, 라이브 쇼핑, 엔터테인먼트 스트리밍, 인터랙티브 게이밍)과 결과 절(라이브 브이로그)에서 다르게 제시된다는 점도 원문에서 확인된다.