조기 시각 확신이 스트리밍 메모리를 오염시키는 문제를 미래 검증 주장으로 해결하는 OST

Omni-Streaming Thinking

HF Daily2609.15128

Enjun Du, Siyi Liu, Ziyu Zheng2026-09-14조회 2

무엇인가

이 논문은 스트리밍 옴니모달 모델이 지금까지 관찰한 비디오 청크와 동기화된 오디오만으로 무엇을 언제 답할지 결정하는 문제를 다룬다. 핵심 실패 모드는 조기 교차모달 확신(premature cross-modal commitment)이다. 예를 들어 화면에 Gate 6이 보이고 곧 Gate 12로 이동한다는 안내 방송이 시작될 때, 모델이 화면만 보고 Gate 6을 메모리에 사실로 기록하면 이후 추론이 그 항목을 계속 재사용해 안내가 끝난 뒤에도 잘못된 값을 유지할 수 있다. 저자들은 오디오와 비디오가 결정적 증거를 제공하는 시점이 다른 현상을 modality-asymmetric evidence maturation이라고 부르고, 스트리밍 메모리가 시각 편향을 지속시키며 오류가 요약과 답변으로 전파된다고 지적한다.

어떻게 동작하나

OST는 현재 해석을 여섯 필드 Omni-State로 표현한다. visual_evidence, audio_state, audio_evidence, conflict, forecast, sufficiency이며 앞 네 필드가 state body를 이룬다. audio_state는 오디오를 present, absent, uncertain으로 표시하고 audio_evidence는 들리는 사건과 발화를 기술한다. 지각은 매초 실행되고 결정 청크는 Δ_chunk=4초이며 t_s = min(s Δ_chunk, T_end)로 경계가 정해진다. 각 청크에서 질문과 보존된 증거, 이전 Omni-State, claim, 검증 결과로 reasoning context C_s를 만들고 state body를 생성한다. 해석이 불확실하면 미래 증거를 예측하는 claim c_i = (x_i, m_i, I_i, σ_i)를 등록한다. x_i는 예측 텍스트, m_i는 검증 모달리티, I_i=(t_s, t_s+δ_i]는 미래 증거 창, σ_i는 지원 범위다. claim은 초기 신뢰도 ρ_i=1로 고유 식별자와 함께 저장되고, 이후 상태나 claim이 이를 전제로 쓰면 식별자를 기록해 반증이 의존 추론으로 전파되게 한다.

무엇과 다른가

검증은 claim의 증거 창 I_i가 끝난 첫 청크 경계에서 지정된 모달리티로 수행된다. verifier V_φ^{m_i}가 (ν_i, γ_i)=V_φ^{m_i}(x_i, O_{I_i}^{m_i})를 출력하며, ν_i는 Confirmed, Refuted, Unresolved 중 하나이고 γ_i∈[0,1]은 반증 강도를 나타내는 contradiction margin이다. 오디오 claim은 오디오로, 시각 claim은 비디오로, source attribution 같은 관계형 claim은 두 모달리티 쌍으로 검증한다. 반증이 나오면 의존성을 acyclic provenance graph로 기록한 뒤 ρ_i ← min{ρ_i, α(γ_i)}, ρ̄_j = ρ_j min_{k∈Anc(j)} ρ_k로 신뢰도를 낮추고, 디코딩 시 attention logits에 log ρ̄_j를 더해 반증된 claim과 그 의존 상태의 영향을 줄인다. Proposition 1은 paraphrases, derived states, compressed summaries가 기록된 의존성을 통해 이 상한을 상속한다고 말한다. 이어서 verdict-conditioned decoding이 새 증거로 state body를 재작성한다. 반증된 claim 집합 X_s가 비어 있지 않으면 ℓ~_s = ℓ_s^+ + λ_s(ℓ_s^+ − ℓ_s^-), λ_s = λ_0/|X_s| Σ_{i∈X_s} γ_i로 다음 토큰 로짓을 조정하고, Theorem 1은 강한 guidance가 correction이 더 선호하는 토큰의 상대 오즈를 높인다고 보인다. answer gate는 질문, 잠정 Omni-State, effective reasoning ledger를 읽어 Suff_s∈{0,1}과 아직 검토를 기다리는 answer-critical claim 집합 A_s(q)를 확인하고, T* = inf{t_s: Suff_s=1 ∧ A_s(q)=∅}에서 답하거나 스트림 종료 시 답한다. 창이 만료된 미해결 claim은 A_s(q)에서 제거되고, 그에 의존한 답은 낮은 신뢰도 플래그를 받는다.

어떻게 쓰나

학습에서는 백본을 고정한다. 단일 모달리티 도구들이 speech, sound event, visual observation의 타임스탬프 증거 후보를 만들고, schema-constrained Gemini-3.6-Flash annotator가 오디오와 무음 비디오를 별도 패스로 구조화한다. 세 번째 패스가 오디오와 시각 레코드 식별자를 연결해 오프라인 fact table을 만들고, 이를 이용해 지금까지 관찰한 비디오 청크와 오디오를 미래 지원 claim에, claim을 실현된 증거에 짝지어 forecasting과 verification을 지도한다. gate 라벨은 Omni-State가 질문에 답할 충분한 사실 집합을 포함하면 Answer, 아니면 Wait이며, 낮은 신뢰도나 충돌 사실은 unresolved로 남긴다. 같은 비디오에 오디오만 바꾼 paired audio 예시도 만들어 원본 유지, 소리 제거, 간섭음 대체, 간섭음 추가를 학습한다. 먼저 forecaster, verifier, gate를 fact-table supervision으로 훈련하고, forecaster는 CE로 claim을 생성한 뒤 미래 증거가 지지하는 예측을 선호하도록 preference loss L_F2 = −log sigmoid[β_F log (p̄θ(x_i^+|C_s) p̄ref(x_i^-|C_s))/(p̄θ(x_i^-|C_s) p̄ref(x_i^+|C_s))]를 쓴다. 다음 LoRA policy를 관찰·수정된 Omni-State와 답변으로 SFT하고, 마지막으로 on-policy objective J_on(ϑ)=E_{τ∼OST(π_old)}[min(r_ϑ Â, clip(r_ϑ,1−ε_−,1+ε_+)Â) − β_KL D_KL(π_ϑ||π_ref)]로 claim–verify–retract 루프 전체를 훈련한다. 보상은 답변 정확도, 응답 시점, 출력 형식을 포함한다.

전제와 한계

실험은 세 축이다. 스트리밍·오디오비주얼 과제 성능, 교차모달 일치·충돌에서 청각 증거 사용, 각 단계의 기여도다. 기본 스트리밍 테스트는 SOVBench이고 추가로 StreamingBench, Video-Holmes(32 frames), Daily-Omni(1 FPS), OmniVideoBench를 평가한다. 모든 OST 결과는 Qwen3-Omni-30B-A3B-Instruct를 사용하며, Table 1의 Qwen3-Omni 행은 수정하지 않은 백본을 1 fps 오프라인으로 평가한 것이다. OST는 두 context 설정 모두에서 SOVBench-O 질문 유형의 최고 온라인 정확도를 기록했다. 오디오비주얼 context에서 평균 정확도는 StreamOV의 81.6에서 87.8로, 이전 QA context도 있을 때는 83.8에서 88.4로 올랐다. 오디오비주얼 설정에서 StreamOV 대비 가장 큰 향상은 Recall로 73.2에서 82.5다. 응답 트리거링도 SOVBench-T F1이 90.5에서 92.4로 증가했고 Answer와 Wait 모두 precision과 recall이 높아졌다. Figure 3은 네 개 추가 벤치마크 각각에서 가장 강한 open baseline 대비 향상을 보여준다.

OST-DiagBench는 비디오를 고정하고 오디오를 편집해 일치, 부재, 모순, 공존, 자막–발화 충돌을 시험한다. Clean은 원본 트랙 유지, Mute는 낮은 배경음으로 대체, Swap은 간섭음을 배경에 추가, Mix는 같은 간섭음을 원본 트랙에 추가한다. Clash는 발화의 한 사실을 바꾸되 옛 값은 자막에 남기고 편집된 사실을 질문한다. 결과에서 오디오를 보지 못하는 모델은 Clean과 Mute에서 같은 설명을 내 d'=0이었다. Qwen3-Omni는 Clean source recall 92.55를 내지만 Mute hallucination rate가 73.73이고, naive streaming thinking에서는 Clean recall 92.55를 유지한 채 Mute hallucination rate가 81.96으로 올랐다. Qwen2.5-Omni-7B와 Qwen3-Omni-30B-A3B는 오디오만 있을 때 donor recall이 각각 77.84, 79.80으로 비슷하지만 비디오와 함께일 때 Swap attribution은 60.00, 35.29로 나타났다. 세 naive-streaming baseline은 편집된 오디오만으로 Clash에서 95.69, 80.78, 94.12를 얻지만 낡은 자막이 보이면 0.59, 4.90, 0.00으로 떨어진다. OST는 Clean recall 95.49와 Mute hallucination rate 10.39를 함께 달성해 d'=2.95를 기록했고, open baseline은 최대 1.38이었다. Swap attribution과 Mix joint recall에서도 앞서며 Clash accuracy는 46.47로 open baseline 최대 4.90을 크게 웃돈다.

절제 실험은 각 구성 요소의 필요성을 보여준다. 오디오와 비디오가 retention budget을 공유하면 SOVBench-O Recall이 82.5에서 74.2로 떨어지고, Omni-State를 자유 형식 scratchpad로 바꾸면 Video-Holmes TCI가 53.1에서 40.7로 떨어진다. claim을 등록 시점에 바로 검사하면 SOVBench-O Avg가 87.8에서 83.6으로, 미래 명제를 비예측 이슈로 바꾸면 84.1로 낮아진다. typed ownership을 제거하면 d'가 2.95에서 1.95로, Swap attribution이 81.76에서 63.73으로 줄어든다. claim만 철회하고 descendants로 전파하지 않으면 SOVBench-O Recall이 73.2, Video-Holmes TCI가 47.6으로 떨어지고, verdict-conditioned rewriting을 제거하면 Video-Holmes Avg가 60.0에서 56.2로 낮아진다. λ_0=0으로 두면 검증된 correction을 강조하는 decoding contrast가 사라진다. hard support check를 제거하면 SOVBench-O Avg가 85.2로 떨어지고, gate-only control은 OST의 평균 응답 청크 인덱스와 비슷하면서도 83.3 대 87.8로 뒤진다.

개발자에게 이 논문은 실시간 음성·영상 에이전트에서 화면이 먼저 보여준 잘못된 단서가 이후 발화로 정정되지 않고 답변까지 오염되는 문제를 다룬다. 스트리밍 메모리를 설계할 때 모달리티별 보존 예산, 미래 검증 창, claim 의존성 그래프, 반증 전파, 응답 게이트를 분리해 구현해야 한다는 시사점을 준다. 다만 제공된 원문 범위에는 별도의 한계 절이 없고, 방법론상 전제가 분명하다. 모든 OST 결과는 Qwen3-Omni-30B-A3B-Instruct 하나의 고정 백본과 lightweight adaptation에 기반하며, 검증은 지정된 미래 구간이 끝날 때까지 기다려야 하고, 만료된 미해결 claim은 제거되며 그에 의존한 답은 낮은 신뢰도로 표시된다. 또한 OST-DiagBench는 비디오를 고정하고 오디오를 편집한 진단 벤치마크이므로 실제 야외 스트림의 모든 분포 이동을 대표하지는 않는다. 세부 임계값, 병합 규칙, 프로토콜은 Appendix A와 C에 의존한다.