OneStreamer가 스트리밍 영상에서 기억 기록과 응답 시점을 함께 학습한다
OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
무엇인가
실시간 영상 스트림을 다루는 LLM은 두 가지를 동시에 해야 한다. 어떤 관측이 나중에 중요해질지 모르는 시점에 그 증거를 남겨두어야 하고, 증거가 충분해지는 순간 사용자에게 보이는 응답을 내놓아야 한다. 논문은 기존 접근의 한계를 세 갈래로 정리한다. 메모리 압축·검색 계열은 먼 과거의 시각 토큰을 보존하지만 그 토큰들이 최근 관측과 제한된 컨텍스트를 두고 경쟁해 실시간 지각을 약화시킬 수 있다. 스트리밍 thinking 계열은 추론 흔적을 유지하지만 그 흔적이 나중 과제에 재사용할 수 있는 시간 정박 사실 기록이 되지는 않는다. 상태 토큰 기반 응답 제어는 능동적 출력을 가능하게 하지만, 반복되는 침묵 라벨이 희소한 응답 결정보다 훨씬 많아 상태 지도가 편향된다.
어떻게 동작하나
OneStreamer는 이 문제를 능동적 생성의 역할 재정의로 푼다. 사용자에게 보이는 응답을 만드는 것에 더해, 관측된 증거를 재사용 가능한 사실 기록으로 바꾸는 일 자체를 같은 생성 과정에 넣는다. 구조적으로는 영상 스트림을 시간 순서가 있는 클립 단위로 증분 처리하고, 비전 인코더가 각 클립의 시각 토큰을 뽑아 프로젝터로 LLM 임베딩 공간에 사상한다. 최근 N프레임에 해당하는 시각 토큰만 Recent-N FIFO 슬라이딩 윈도우에 남기고, 여기에 누적된 캡션 기록과 대화로 이루어진 텍스트 히스토리를 인터리브한다. 이렇게 만들어진 인과적 시각-언어 시퀀스에는 현재 시점에 이용 가능한 정보만 들어간다. 모델은 이 시퀀스에서 과제별 제어 토큰을 예측하고, 예측된 상태가 출력을 개시하면 그에 딸린 텍스트를 생성한다. 제어 토큰은 Observe(국소 디테일 캡션 기록), Summary(완료된 이벤트의 의미 요약), Standby(증거가 나오는 중이지만 아직 답할 준비가 안 됨), Response(사용자 가시 응답 개시), Silence(기록도 응답도 없이 계속 관찰)로 나뉜다.
무엇과 다른가
Proactive Hierarchical Caption Memory(PHCM)는 최근 시각 토큰을 시간 정렬된 텍스트 캡션으로 보완한다. 두 층위의 기록을 만드는데, Observe는 짧은 구간에서 직접 관측한 객체·행동·장면·상태 변화를 담은 조밀한 국소 디테일 캡션을, Summary는 더 거친 시간 입도에서 완료된 이벤트나 세그먼트를 요약한 성긴 의미 요약을 담당한다. 각 기록은 자신의 소스 구간과 연결되고, 두 입도가 국소 디테일과 이벤트 수준 요약의 계층을 이룬다. 학습 시에는 인과적 스트리밍 캡션 타깃이 관측된 영상 프리픽스의 해석을 지도하고, 추론 시에는 모델이 스스로 생성한 기록을 텍스트 히스토리에 덧붙여 이후 예측의 명시적 컨텍스트로 쓴다. 핵심은 소스 프레임이 Recent-N 윈도우를 떠난 뒤에도 그 내용이 텍스트로 남아, 과거 시각 특징을 다시 검색하거나 재방문하지 않고 장거리 맥락을 확보한다는 점이다.
어떻게 쓰나
Proactive State Transition Learning(PSTL)은 상태 토큰 지도의 불균형을 다룬다. 조밀한 상태 지도는 반복되는 침묵 토큰에 과도한 가중을 주고, 상태 변화만 지도하면 현재 상태가 언제 지속되어야 하는지를 직접 감독하지 못한다. PSTL은 모든 출력 앵커에서 지도를 보존하면서 상태 변화와 상태 지속을 대표하는 토큰을 선택한다. 구체적으로 과제 τ의 출력 앵커 집합 A_τ에 대해, 연속한 주석 상태 사이 전이 X→Y의 발생 횟수 n(X→Y)를 세고, 감독 할당량 q를 q = max_X max_{a∈A_τ} n(X→a)로 정의한다. 각 전이 그룹 X→Y에서 균일 무복원 샘플링으로 min(n(X→Y), q)개의 상태 토큰 인덱스를 뽑고, 선택된 인덱스 집합에 속한 상태 토큰만 상태 손실에 기여한다. 선택되지 않은 상태 토큰은 인과 시퀀스에는 그대로 남지만 상태 손실에서는 빠진다. 마스킹은 상태 손실에만 적용되고 캡션과 과제 출력은 전부 감독된다. 추론 시에는 PSTL이나 외부 전이 정책을 적용하지 않고 학습된 조건부 분포에서 제어 상태와 텍스트를 직접 생성한다.
전제와 한계
학습 데이터는 별도로 합성한다. 오프라인 영상 자원을 스트리밍 학습 시퀀스로 바꾸는 파이프라인을 만들고, 캡션 브랜치와 QA 브랜치로 나눈다. 캡션 브랜치는 의미 검색·장면 검출·시각적 풍부함 평가로 후보 풀을 만들고 저품질·정지 구간·블랙 프레임·과도한 샷 분절을 걸러낸 뒤, Gemini와 Seed로 프레임/클립·세그먼트·비디오 수준의 타임스탬프 기반 캡션을 생성하고 사실·시간 정합성을 검증한다. 이후 프레임/클립 캡션은 지원 구간이 끝나는 시점의 Observe 타깃으로, 세그먼트 캡션은 세그먼트 경계의 Summary 타깃으로 변환하고, 스트림 종료 후 전체 영상 요약 지시를 붙여 비디오 수준 캡션을 Response 뒤의 정답 타깃으로 쓴다. QA 브랜치는 응답 시점을 증거 가용성에 맞추는 것을 원칙으로 삼는다. 과제별 템플릿으로 QA 쌍을 만들고, VLM으로 답을 뒷받침하는 거친 증거 구간을 위치화한 뒤 해당 클립만 주고 답이 맞는지 검증해 실패 예시를 버린다. 그 구간 안에서 슬라이딩 윈도우로 후보 타임스탬프를 평가하는데, 추론형 QA는 각 영상 프리픽스가 주어졌을 때 참조 답의 조건부 우도로, 지각형 과제는 각 윈도우와 목표 이벤트의 시각-텍스트 유사도로 점수를 매기고, 신뢰 기준을 만족하는 가장 이른 타임스탬프를 응답 시점으로 확정한다. 이렇게 만든 합성 예시와 정제한 오픈소스 데이터를 합쳐 100만 건이 넘는 OneStreamer-1M을 구성한다.
구현은 Qwen3-VL-4B-Instruct에서 초기화해 OneStreamer-1M과 LLaVA-Video에서 샘플링한 오프라인 데이터로 단일 단계 지도 미세조정을 수행한다. 비전 인코더는 동결하고 멀티모달 프로젝터와 LLM을 1 에폭 최적화하며, 최대 시퀀스 길이 131,072 토큰, 최대 학습률 1e-5, 32장의 NVIDIA H200에서 학습한다. 지각·기억 계열 4개 벤치마크에서 OVOBench 72.1, StreamingBench Real-Time 86.9, OVBench 66.8, ODVBench 71.3으로 비교 방법 중 최고 집계 점수를 냈다. 같은 4B 크기의 Qwen3-VL 베이스보다 각각 13.3, 5.1, 11.4, 13.7점 높고, 11B MOSS-VL-Realtime보다 1.9, 4.0, 13.1, 7.4점 높다. 능동 응답 계열 4개에서는 ProactiveVQA 48.7, OmniMMI 36.6(ASR 포함), OVO-Timing 41.6, ViSpeak 2.87을 기록했다. 앞 세 벤치마크에서 Qwen3-VL 베이스보다 14.4, 7.2, 12.2점, MOSS-VL-Realtime보다 1.5, 3.9, 3.1점 높고, ViSpeak에서는 2.87로 Qwen3-VL의 2.41, MOSS-VL-Realtime의 2.48을 앞선다.
절제 실험은 세 가지를 보인다. 첫째, 같은 체크포인트와 Recent-16 윈도우에서 생성된 캡션 기록을 유지하는지 여부만 바꿨을 때 OVOBench-Backward의 ASI가 63.5에서 71.6으로, EPM이 62.0에서 62.6으로 올랐다. 소스 프레임이 윈도우를 떠난 뒤에도 기록이 질의 독립적 기억으로 쓸모가 있다는 뜻이다. 둘째, PHCM은 단순한 절충이 아니다. FIFO와 같은 Recent-16 윈도우를 쓰면서 OVOBench Real-Time을 80.9에서 81.4로, StreamingBench Real-Time을 86.3에서 86.9로 올렸고, 전체 시각 히스토리를 유지하는 Full보다 ASI에서 4.0점 높다(71.6 대 67.6). EPM은 Full보다 근소하게 낮지만(62.6 대 63.0), OVOBench Overall은 PHCM 72.1로 Full 70.9, FIFO 70.1을 앞선다. 셋째, PSTL은 주석된 상태 토큰의 27.5%만 감독하고도 ProactiveVQA 48.7, OmniMMI 36.6, OVO-Timing 41.6으로 세 벤치마크 모두에서 조밀 지도와 전이만 지도하는 방식, 같은 감독 비율의 무작위 희소 샘플링보다 좋다. 효율은 360초 OVOBench 샘플에서 Full이 62,094 컨텍스트 토큰, 25.18GB GPU 메모리, TTFT 4.560초를 쓰는 반면 PHCM은 컨텍스트 길이를 93.1%, GPU 메모리를 60.4% 줄이고 TTFT를 0.124초로 낮춘다. FIFO 대비 추가 비용은 1,272 토큰, 0.29GB, 0.030초에 불과하다.
실무 관점에서 이 논문이 주는 것은 두 가지다. 하나는 실시간 영상 에이전트에서 과거 프레임을 통째로 들고 가는 대신 모델이 스스로 만든 시간 정박 텍스트 기록으로 대체하는 컨텍스트 설계이고, 다른 하나는 응답 시점 라벨을 증거 가용성에 맞춰 합성하는 데이터 파이프라인이다. 라이브 스트림 요약, 웨어러블 어시스턴트, 보안 모니터링처럼 언제 말할지가 무엇을 말할지만큼 중요한 시스템에 바로 적용할 수 있는 형태다. 다만 도입 전에 확인할 점이 있다. PHCM의 기억은 추론 시 모델이 생성한 기록 자체이므로 캡션 생성 오류가 누적되면 이후 QA가 그대로 오염될 수 있는데, 논문은 이 오류 전파를 정량적으로 다루지 않는다. 학습 데이터의 캡션과 QA는 Gemini·Seed 같은 외부 모델 주석에 의존하므로 파이프라인을 재현하려면 그 의존성을 감수해야 한다. 평가는 8개 스트리밍 벤치마크에 한정되고 4B 단일 모델·단일 단계 SFT 설정에서만 검증됐으며, PSTL의 마스킹이 상태 손실에만 적용된다는 전제 위에서 동작한다. 논문 본문에는 별도의 한계 절이 제시되어 있지 않다.