LEAP가 시간 단위 영상에서 근거 구간만 골라 문맥 한계를 넘는다

LEAP: Learned Block-wise Evidence Retrieval for Long Audio-Video Perception

HF Daily2609.39938

Juyi Lin, Zhiqiang Lao, Jiali Cui2026-09-30

무엇인가

시간 단위 오디오-비디오 질의응답(AVQA)은 근거가 긴 녹음 곳곳에 흩어져 있는데, 전체를 한 컨텍스트에 넣으면 컨텍스트와 메모리가 금방 고갈되고, 균일하게 시간 압축을 하면 세밀한 음향·시각 근거가 희석된다. 논문은 이 딜레마를 정면으로 지적한다. 기존 접근은 크게 세 갈래인데, 선택(selection)은 거친 뷰에서 고르다 보니 답에 필요한 윈도를 놓치고, 압축(compression)은 남긴 것의 디테일을 깎아내며, 에이전트 방식은 어디를 볼지 일반 목적 모델의 추론 프롬프트에 맡겨 근거 위치 학습이 없다. 저자들은 전체 컨텍스트를 넣지 않고도 답에 필요한 몇 분을 짚어낼 수 있는지를 질문으로 던진다.

어떻게 동작하나

LEAP의 구조는 시계로 고정된 블록 격자다. 녹음을 600초짜리 비중첩 블록 M개로 나누고, 각 블록을 다시 75초짜리 후보 윈도 8개로 타일링한다. 각 블록마다 질문 조건부 경량 로컬라이제이션 패스를 한 번 돌려, 프롬프트에 글자 옵션으로 나열된 후보 윈도의 다음 토큰 로짓을 읽고 시그모이드를 취해 윈도 점수 r을 얻는다. 블록 점수는 그 블록에서 가장 높은 윈도 점수, 즉 g_m = max_k r_{m,k}로 정한다. 상위 B=3개 블록을 남기고, 각 블록에서 상위 W=3개 윈도를 뽑아 최대 B·W=9개 윈도만 답변 패스로 넘긴다. 답변 패스는 이 윈도들만 원본 녹음에서 다시 불러와 절대 타임스탬프와 함께 재인코딩한다. 윈도당 컨텍스트는 75초 구간에 비디오 프레임 32장과 해당 구간 오디오를 백본 네이티브 레이트로 넣는 식으로 고정돼 있어, 녹음 길이 T가 늘어도 답변 입력과 최대 컨텍스트는 변하지 않는다. 여기에 전체 녹음을 한 번만 전사해 만든 분 단위 타임스탬프 개요(최대 4,000토큰, 초과분은 질문 관련 분을 우선 채움)를 답변 패스가 함께 읽는다. 로컬라이제이션 패스는 블록 하나만, 답변 패스는 선택된 윈도 묶음만 읽으므로 패스당 최대 컨텍스트와 메모리는 T에 대해 O(1)이고, 질문당 순전파 횟수는 M+1로 B에 의존하지 않는다. 참고로 전체 녹음을 한 번에 읽으면 시간당 약 47k 토큰이 들어 백본의 65,536 토큰 위치 한계가 약 81분에서 소진된다.

무엇과 다른가

학습은 두 단계로 분리된다. 백본(Qwen3-Omni-30B-A3B, MiniCPM-o 4.5) 가중치는 얼려 두고, 셀프 어텐션의 query·key·value·output 투영에 rank-16 LoRA 두 개를 각각 붙인다. 로컬라이제이션 어댑터는 LongVALE에서 파생한 질문으로 학습하는데, 정답 라벨은 주석된 근거 구간 J*와 겹치는 면적이 가장 큰 후보 윈도이고, 손실은 배포 시 읽는 것과 동일한 옵션 글자 로짓에 대한 크로스 엔트로피다. MiniCPM-o 4.5의 선택기는 겹침 비율 기반 BCE로 학습한다. 답변 어댑터는 정답 근거 세그먼트에 다른 녹음에서 가져온 방해 세그먼트를 이어 붙인 시퀀스를 조건으로, 답변 토큰과 턴 종료 토큰에 크로스 엔트로피를 건다. 두 어댑터는 절대 동시에 쌓지 않고 각자 학습된다. 저자들이 강조하는 점은 로컬라이제이션 손실이 블록 하나 안에서 정의되므로, 학습도 추론도 한 블록 이상을 읽지 않는다는 것이다. 답변 정확도가 아니라 근거 위치만 지도하므로 선택기가 특정 답변 모델이 무엇을 맞히는지 학습하지 않는다.

어떻게 쓰나

실험은 TraceAV-Bench, LVOmniBench, VideoOdyssey-AV(모두 60분 초과 영상), MMOU 네 개 주요 벤치마크와 OmniVideoBench, 그리고 비디오 전용인 LVBench·CG-Bench mini·Video-MME에서 이뤄졌다. 같은 백본·같은 스택 베이스라인 대비 네 개 주요 벤치마크 모두에서 유의하게 앞서며, Qwen3-Omni-30B-A3B 베이스라인 대비 4.5~16.8% 향상, MiniCPM-o 4.5로 전이했을 때는 공개 결과를 3.1~13.0% 상회한다. 절제 실험도 구체적이다. 블록 집계를 max 대신 mean으로 바꾸면 블록 랭킹이 쓰는 마진이 사라져 근거 커버리지 대부분을 잃고, 같은 윈도를 녹음 위 임의 위치로 다시 뽑으면 TraceAV와 VideoOdyssey에서 정확도가 유의하게 떨어지며, 균등 간격 블록보다 블록 랭킹을 쓴 쪽이 VideoOdyssey에서 정확도와 근거 커버리지 모두 유의하게 앞선다. 답변 어댑터를 고정하고 읽는 대상만 전체 클립과 LEAP 윈도로 바꾼 비교에서도 네 벤치마크 모두 LEAP이 앞선다. 개요를 제거하면 TraceAV·VideoOdyssey·MMOU에서 정확도가 유의하게 하락하고, 남긴 윈도가 근거를 놓친 질문에서 개요의 이득이 가장 크다.

전제와 한계

전사 채널과 스트리밍도 논문이 따로 다루는 부분이다. 미디어 채널은 모든 블록의 비디오·오디오에 로컬라이제이션 패스를 한 번씩 쓰지만, 질문 전에 녹음을 한 번 전사해 두고 전사만으로 윈도를 고르는 두 번째 채널을 만들 수 있다. 두 채널 모두 같은 답변 패스에 윈도를 넘기며, 전사 채널은 미디어 채널보다 로컬라이제이션 토큰을 4.7~6.2배 적게 쓰고 모든 벤치마크에서 더 빠르게 답한다. 근거가 말로 표현된 비율이 높을수록 전사 채널의 근거 보존이 미디어 채널에 근접한다. 블록 격자는 시계로 고정돼 있고 각 후보 윈도는 자기 블록 안에서 점수가 매겨지므로 인과 질의를 자연스럽게 지원한다. StreamArena에서 스트리밍 전용 학습 없이 그대로 돌아가며, 질의 시점까지의 접두사만 읽는 같은 백본과 균등 분포 윈도 베이스라인을 유의하게 앞선다. 다만 전사 채널로 고른 윈도를 원본 미디어 대신 전사로 답하면 가장 먼 거리 구간을 제외한 모든 구간에서 정확도가 유의하게 떨어진다.

실무 관점에서 이 논문이 주는 것은 '긴 영상을 어떻게 자르고 어디만 다시 읽을 것인가'에 대한 구체적인 레시피다. 블록 600초·윈도 75초·블록 3개·윈도 3개라는 설정을 데이터셋 전반에서 바꾸지 않고 그대로 쓴다는 점, 두 어댑터를 분리 학습해 서로 쌓지 않는다는 점, 로컬라이제이션 학습이 블록 하나 안에서 끝난다는 점은 재현과 비용 산정을 쉽게 만든다. 다만 로컬라이제이션 학습 데이터(LongVALE 파생)는 모든 클립이 한 블록 안에 들어가고, 배포 시 읽는 8개 글자와 맞추기 위해 긴 클립은 8등분하고 짧은 클립은 최대 8개 세밀 윈도로 타일링하는 별도 구성을 쓴다는 전제를 확인해야 한다. 또한 선택기가 답변 정확도가 아니라 근거 위치만 지도하므로, 답변 모델을 교체하면 선택기 재학습이 필요할 수 있다.

저자들이 밝힌 한계와 열린 방향은 분명하다. 첫째, 경계가 정해진 비용 구조 안에서 더 강한 검색 점수를 얻는 것이다. 둘째, 남긴 윈도가 근거를 놓쳤음을 답변 패스 스스로 판단해 스캔으로 되돌아가 더 가져오는 능력인데, 현재 구조에는 이 되돌아가기가 없다. 셋째, 전사 채널은 근거가 말로 표현된 녹음에서만 미디어 채널의 값싼 대체재이고, 전사만으로 답하면 정확도 손실이 생긴다. 넷째, 로컬라이제이션 지도는 근거 위치만 표시하고 답변 정확도는 표시하지 않으므로 선택기가 답변 모델의 오류 특성을 학습하지 않는다는 점도 전제로 남는다.