OmniSeek이 오디오·비디오 근거를 스스로 찾아 멀티턴으로 추론한다

OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

arXiv2610.02181v1

Haibo Wang2026-10-01조회 3

무엇인가

Omni-LLM은 텍스트·오디오·영상을 함께 처리하지만, 여전히 전체 오디오·비디오 스트림을 단일 패스로 통째 인코딩하는 수동적 구조에 머문다. 답에 필요한 근거는 모달리티와 시간축에 흩어져 있는데, 컨텍스트가 길어질수록 미세한 시각 디테일과 짧은 음향 이벤트가 무관한 내용에 묻힌다. 그러면 모델은 입력 안에 존재하는 근거를 분리·조합하지 못하고 언어 사전지식이나 단일 모달 지름길로 후퇴한다. 기존 멀티모달 추론 강화 기법들은 Chain-of-Thought를 확장했지만 텍스트 모달리티에 갇혀 있어, 고정된 전역 컨텍스트 위에서 추론하거나 검색한 근거를 텍스트 설명으로 바꿔버릴 뿐 원본 오디오·비디오 신호로 되돌아가지 않는다. 논문이 지목하는 빠진 능력은 "능동적 근거 획득"이다.

어떻게 동작하나

OmniSeek은 옴니모달 추론을 에이전트적 근거 탐색 과정으로 정식화한다. 모델은 매 턴마다 think → tool_call → observe → answer로 이어지는 상태 기계를 돌며, 두 개의 도구를 쓴다. get_audio_clip(start, end)는 지정한 시간창의 오디오 구간을 잘라 확인하고, get_video_clip(start, end, fps, resolution)은 에이전트가 스스로 정한 시간 경계와, 전역 입력보다 높은 프레임레이트·해상도로 국소 클립을 가져온다. 도구가 반환한 원본 오디오·비디오 세그먼트는 observe 노드로 컨텍스트에 다시 덧붙여져 작업 기억을 계속 보강한다. 모달리티별로 도구 호출이 분리돼 있어, 예컨대 먼저 오디오 단서를 잡고 나서 전혀 다른 비디오 구간을 고해상도로 검사하는 거친 단계에서 세밀한 단계로의 탐색이 가능하다. 루프 종료 조건은 하드코딩되지 않는다. 매 턴의 think 단계에서 현재 정보 상태를 평가해 누적된 교차 모달 근거 사슬이 답을 도출하기에 충분한지 스스로 판단하고, 부족하면 다음 도구 호출을 계획하며 충분하면 답을 낸다.

무엇과 다른가

이 행동을 콜드 스타트하기 위해 3단계 데이터 엔진으로 OmniTraj-170K를 합성한다. 1단계는 구조화된 오디오·비디오 정렬로, PySceneDetect로 장면 전환을 찾아 샷을 나누고 인접 샷을 약 15초 단위로 병합한 뒤 Qwen3.5-397B-A17B가 장면별 타임스탬프 캡션을 생성한다. 오디오 축은 원본 영상의 ASR 전사나 Qwen3-Omni-Captioner·Qwen3-ASR로 타임스탬프 오디오 캡션을 뽑아, 모든 사건이 절대 타임스탬프에 고정된 이중 트랙 컨텍스트를 만든다. 2단계는 근거 기반 QA 생성으로, 두 모달 중 하나만으로는 답할 수 없는 19종의 질문 유형을 만들고 각 질문마다 2~7개의 순서 있는 근거 구간 목록을 붙인다. 근거 사슬에는 반드시 오디오 구간과 비디오 구간이 각각 최소 하나씩 포함되도록 구조적으로 강제한다. 3단계는 인터리브 궤적 조립으로, 도구 호출과 관찰 내용은 미리 정해진 근거 사슬에서 결정론적으로 구성하고 모델은 think 노드만 생성하게 해 환각을 줄인다. 결과물은 39,797개 영상에 걸친 169,725개 궤적이며, 근거 구간 대부분이 3~10초, 76.1%가 도구 호출 2회, 23.9%가 3회 이상을 요구한다.

어떻게 쓰나

학습은 3단계다. 1단계 SFT는 OmniTraj-170K로 형식과 행동을 정렬하되, 일반화 보존을 위해 학습 샘플의 10%만 도구 호출 궤적을 쓰고 90%는 표준 단일 턴 QA로 채운다. 2단계는 정답 검증이 가능한 데이터(OmniVideo100K의 객관식 30K + VideoHolmes 학습 분할 1K)에서 GSPO로 RL을 수행하며, 정답 일치를 보는 정확도 보상, 구조 태그 위반을 벌하는 형식 보상, 도구를 최소 한 번 호출하고 정답을 맞힌 경우에만 주는 도구 사용 보상을 합산한다. 3단계는 2단계 체크포인트가 실패한 사례에서 클래스 균형을 맞춘 8K 하드 예제를 모아 롤아웃 크기를 G=16으로 키우고, 오디오·비디오 필요성 보상 r_avn을 추가한다. r_avn은 어텐션 마스크에서 한 모달의 키를 0으로 지운 두 번의 teacher-forcing 순전파를 돌려 토큰별 로그우도 하락을 측정하고, 음수는 max(0,·)로 잘라 평균 낸 뒤 min(nec_A, nec_V)로 결합한다. 평균이 아니라 min을 쓰는 이유는 한쪽 모달 의존이 강하면 다른 쪽 의존이 거의 0이어도 상쇄되어 버리기 때문이며, 정답 여부 게이트를 곱해 성공한 궤적에만 적용한다. 추가 롤아웃 없이 no_grad 순전파 두 번만 필요하다.

전제와 한계

베이스 모델은 Qwen3-Omni-30B-A3B-Instruct이고, 10개 옴니모달 벤치마크와 4개 일반 비디오 이해 벤치마크에서 평가한다. 긴 영상 벤치마크인 MMOU에서 70.4%, LVOmni에서 44.2%로 베이스 Qwen3-Omni-Instruct를 각각 +16.3%, +8.4% 앞선다. 시각 단서가 드문드문 흩어져 능동적 검사가 필요한 VideoHolmes 74.6%, OmniVideoBench 47.7%로 텍스트 전용 CoT 모델인 OmniVideo-R1(62.9%, 44.8%)을 크게 앞서고, FutureOmni·VideoHolmes·JointAV에서는 Gemini-2.5-Pro도 넘는다. 일반 비디오 이해에서는 Video-MME 78.5%, MLVU 77.1%로 베이스를 웃돌며 72B급인 Qwen2.5-VL·LLaVA-OneVision보다 높다. 학습 단계별로는 1단계 SFT에서 정렬 세금(alignment tax)이 나타나 Daily-Omni가 71.9%에서 69.1%로, WorldSense가 55.1%에서 50.3%로 떨어지지만, 2단계 RL이 이를 회복해 LVOmni를 35.0%에서 41.6%, VideoHolmes를 55.9%에서 69.6%로 끌어올린다. 3단계에서 G=8은 WorldSense 55.0→58.6%, VideoHolmes 69.6→72.6%, G=16은 Daily-Omni 75.9→78.2%, FutureOmni 56.4→58.1%를 만든다. r_avn 추가는 WorldSense +3.2%, OmniVideoTest +2.2%를 더한다.

도구 호출 횟수와 정확도의 관계도 분석한다. JointAVBench 같은 교차 모달 상관 과제는 도구 호출 3회에서 정확도가 68.1%에서 80.8%로 정점을 찍고, Daily-Omni는 4회에서 87.1%까지 오른다. 반대로 VideoHolmes와 MMOU 같은 장편 추론에서는 5회 이상 호출할 때 각각 75.9%, 73.3%로 최고치를 기록한다. 즉 과제 복잡도에 따라 검색 깊이를 스스로 조절한다. 텍스트 전용 CoT 베이스라인과의 비교에서는 텍스트 추론이 Daily-Omni를 71.9%에서 73.0%로 소폭 올리지만 WorldSense는 55.1%에서 54.3%로 오히려 떨어뜨리는데, OmniSeek은 OmniVideoTest +13.5%, WorldSense +8.1%, Daily-Omni +7.0%의 격차를 낸다. 데이터 유용성 실험에서는 OmniTraj-170K 100K 서브셋으로 단일 턴 SFT만 해도 LVOmni +5.8%, Daily-Omni +3.9%가 오르고, OmniVideo-100K 대비 Daily-Omni +2.1%, OmniVideoBench +1.7%로 일반화가 넓다. 다만 OmniVideoTest에서는 59.2% 대 61.7%로 뒤지는데, 이는 OmniVideo-100K와 해당 벤치마크가 같은 출처·분포를 공유하기 때문이며, 그래도 베이스 대비 +4.7%는 확보한다.

실무에서는 긴 영상·음성 입력에서 특정 순간의 단서를 찾아야 하는 질의응답, 예컨대 녹화된 회의나 교육 영상에서 "언제 무슨 소리와 화면이 함께 나타났는가"를 묻는 파이프라인에 직접 적용할 만하다. 다만 도구 호출이 늘어날수록 지연과 비용이 커지므로, 벤치마크별 최적 호출 횟수가 3~5회 이상으로 갈린다는 점을 감안해 자체 도메인에서 조기 종료 임계를 확인해야 한다. 또 이 방식은 고해상도 클립을 다시 가져오는 도구가 실제로 연결돼 있어야 이득이 나므로, 서빙 환경에서 임의 구간 재디코딩이 가능한지부터 점검하는 편이 좋다. r_avn 같은 보상 설계는 정답률만 보면 단일 모달 지름길이 조용히 강화되는 상황을 잡아내는 지표로도 참고할 수 있다.

원문은 별도의 한계 절을 두지 않고 결론으로 끝난다. 대신 전제가 곳곳에 드러난다. 학습 데이터의 근거 구간은 FineVideo 계열 영상에서 뽑은 3~10초 단위로 타이트하게 국소화돼 있어, 근거가 훨씬 길거나 경계가 모호한 입력에서도 같은 검색 행동이 유지되는지는 검증되지 않았다. 1단계 SFT가 멀티턴 도구 형식을 강제할 때 발생하는 정렬 세금은 저자들도 명시적으로 인정한 현상이며, 이를 되돌리는 것은 2단계 RL의 몫이다. 또한 OmniVideoTest에서 OmniVideo-100K가 더 높은 점수를 내는 것은 데이터 출처가 겹치기 때문이라고 저자들이 직접 밝히고 있어, 벤치마크 간 분포 중복이 수치 해석에 영향을 준다는 점을 감안해야 한다.