VLM이 정책과 도구를 함께 진화시켜 초장시간 영상 구간을 찾는다
CoEvoWhen: Policy-Tool Coevolution for Ultra-Long Video Temporal Grounding
무엇인가
초장시간 영상 temporal grounding은 수십 분에서 수 시간짜리 영상에서 자연어 질의가 가리키는 시간 구간을 정확히 짚어내는 문제다. 영상이 길어질수록 목표 이벤트는 전체 타임라인의 극히 일부만 차지하기 때문에, 넓은 시간 범위를 훑는 장거리 증거 탐색과 국소적인 이벤트 디테일·행동 변화·경계 판단을 동시에 해야 한다. 그런데 시각 예산은 한정되어 있어서 성긴 관찰은 짧은 이벤트를 놓치고, 반복적인 정밀 관찰은 비용을 폭발시킨다. 기존 에이전트 방식들은 다단계 검색과 도구 사용의 가능성은 보여줬지만, 관찰 메커니즘과 미디어 처리 능력이 대부분 미리 정의되어 있었다. 이 논문의 핵심 통찰은 도구 사용 정책과 도구 설계가 서로 맞물려 있다는 것이다. 어떤 증거가 필요한지, 언제 얻을지, 탐색을 어떻게 조직할지는 정책이 정하고, 모델이 실제로 받는 시각 입력의 형태와 입도는 도구가 정한다. 정책만 다듬으면 기존 도구 능력에 발목이 잡히고, 도구만 늘리면 에이전트가 그 능력을 활용하지 못한다.
어떻게 동작하나
제안하는 CoEvoWhen은 고수준 정책과 실행 가능한 미디어 도구를 하나의 재사용 가능한 외부 스킬로 묶어 함께 진화시킨다. 스킬은 S=(Π, T)로 표현되며, Π는 과제 계획과 관찰 오케스트레이션을, T는 실행 가능한 도구 집합을 담당한다. 각 도구 τ는 능력 설명 d, 인터페이스 명세 σ, 소스 코드 f의 세 요소로 구성된다. 진화는 K라운드에 걸쳐 진행된다. 동결된 VLM이 현재 스킬로 초장시간 영상 grounding 배치를 수행하면, 궤적 R_i(S^(k))가 정답 구간과 짝지어져 피드백 배치 B_k를 이루고, 외부 스킬 업데이터 U가 이를 분석해 정책 패치 ΔΠ와 도구 패치 ΔT를 만든다. 정책 쪽에서는 실행 궤적에서 드러난 후보 누락, 경계 오류, 동적 모호성을 전이 가능한 경험으로 증류해 탐색 결정과 관찰 조율 전략을 고친다. 도구 쪽에서는 업데이터의 코딩 능력을 이용해 기존 도구의 설명·인터페이스·소스 코드를 수정하거나, 새 도구를 만들거나, 능력을 통합하거나, 부적합한 도구를 퇴출시킨다. 즉 개선이 프롬프트와 호출 순서를 넘어 실제 증거 샘플링과 제시 능력까지 확장된다. 실험에서는 Qwen3.5-27B를 동결한 채 Codex(GPT-5.5, xhigh)를 업데이터로 쓰고, 질의 4개 단위 배치마다 정책 문서를 개정하고 도구를 수정·생성하며, 진화 세트를 한 번 통과한다. 시작 스킬은 기본 grounding 프로토콜과 이미지·비디오 관찰, 미디어 프로빙, 프레임 추출, 클립 추출만 제공하는 최소 구성이다.
무엇과 다른가
추론 시에는 진화된 스킬 S*를 고정해 같은 VLM에 적용한다. 진화된 정책은 시스템 프롬프트에 들어가고 도구들은 호출 가능한 함수로 등록되어 멀티턴 추론에 쓰인다. 모델은 질의와 누적 히스토리, 정책 지침을 바탕으로 매 라운드 도구 j_t와 인자 η_t를 스스로 고르고, 관찰 결과를 히스토리에 쌓는다. 별도의 더 강한 플래닝 모델에 의존하지 않는다는 점이 명시적인 설계 목표다. 최대 추론 라운드는 24회이며 thinking을 켜고 그리디 디코딩으로 평가한다. 증거가 충분하다고 판단하거나 라운드 상한에 도달하면 종료 도구를 호출해 최종 구간 예측을 제출한다.
어떻게 쓰나
실험은 초장시간 grounding 벤치마크 3개와 장시간 QA 벤치마크 2개에서 이뤄졌다. VUE-LVTR은 VUE-TR과 VUE-TR-V2의 시각 질의 중 30분 이상 영상만 추린 것이고, ExtremeWhenBench는 평균 약 76분, CoMET-Bench는 30분 이상 영상의 다중 이벤트 grounding을 다룬다. 진화에는 서로 다른 영상에서 뽑은 어려운 VUE-LVTR 질의 100개를 쓰고, VUE-LVTR 결과는 겹치지 않는 held-out 세트에서 보고한다. 비교 대상은 Qwen3.5-27B, InternVL3.5-8B, TimeLens-7B, Gemini 2.5 Flash, GPT-5.6 Luna와 에이전트 기반 VideoMind-7B, EvoGround-7B다. 진화된 스킬은 보고된 모든 지표에서 최고 성능을 냈다. VUE-LVTR held-out에서 IoU AUC가 0.4107에서 0.5137로 올랐고, ExtremeWhenBench에서는 mIoU가 74.9%, [email protected]가 88.4% 개선됐다. CoMET-Bench에서는 mIoU가 0.0280, Rejection-F1이 10.93포인트 올랐다. 목표 이벤트가 없는 질의까지 포함한 다중 이벤트 환경에서 증거 획득·검증·선택이 나아졌다는 뜻이다.
전제와 한계
효율도 함께 개선됐다. 질의당 평균 시각 토큰이 VUE-LVTR held-out에서 202.6k에서 141.9k로 30.0% 줄었고, ExtremeWhenBench에서 11.4%, CoMET-Bench에서 18.9% 감소했다. 모델 호출 수도 세 벤치마크 모두 줄었다. ExtremeWhenBench를 자세히 보면 이미지 기반 관찰 토큰은 179.3k에서 197.5k로 늘어난 반면 비디오 기반 관찰 토큰은 47.8k에서 3.7k로 급감했다. 진화 과정에서 시각 예산이 이미지 쪽으로 재배분된 것이다. 백본을 바꿔도 효과가 유지되어 Qwen3.5-9B에서 ExtremeWhenBench mIoU가 99.2%, Qwen3.6-27B에서 24.7% 올랐다. 진화된 grounding 스킬을 과제별 진화 없이 장시간 QA에 그대로 적용해도 Qwen3.5-27B의 LVBench 정확도가 8.65포인트, LSDBench가 7.98포인트 상승했다.
절제 실험은 설계 근거를 뒷받침한다. 도구를 고정하고 정책만 진화한 변형과 정책을 고정하고 도구만 진화한 변형 모두 베이스 스킬보다 정확도가 높았지만, 둘을 함께 진화한 쪽이 IoU AUC에서 정책만 진화한 경우를 0.0243, 도구만 진화한 경우를 0.0735 앞서면서 시각 토큰 비용은 각각 40.6%, 25.5% 더 줄였다. 특히 정책을 고정했을 때의 정확도 손실이 도구를 고정했을 때보다 컸는데, 이는 더 강한 관찰 능력이 효율적인 증거 탐색 과정으로 조직될 때 큰 이득을 낸다는 해석으로 이어진다. 이미지 전용·비디오 전용 절제에서도 이미지+비디오 조율이 모든 grounding 지표에서 단일 모달리티를 앞서면서 토큰은 더 적게 썼다. 이미지 관찰은 먼 후보 구간을 압축적으로 비교하는 데, 비디오 관찰은 행동 순서·상태 전이·연속성·경계 판단에 적합하다는 전제가 실측으로 확인된 셈이다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 명확하다. 긴 영상 검색 파이프라인을 만들 때 프롬프트와 도구 목록을 손으로 튜닝하는 대신, 실행 궤적과 정답을 모아 정책 문서와 도구 코드를 함께 갱신하는 루프를 설계할 수 있다. 특히 도구를 코드로 정의하고 설명·인터페이스·구현을 모두 진화 대상으로 두는 구조는, 관찰 입도를 바꾸는 것만으로도 정확도와 토큰 비용을 동시에 움직일 수 있음을 보여준다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, 진화에 쓰는 질의 세트와 평가 세트가 분리되어 있는지(이 논문은 100개 진화 질의와 held-out을 분리했다). 둘째, 진화된 스킬이 특정 백본에 묶여 있는지 여부다. 논문은 여러 VLM에서 각각 진화시켜 이득을 확인했지만 하나의 스킬을 모든 모델에 이식하는 실험은 제시하지 않는다. 셋째, 시각 토큰 절감이 이미지/비디오 예산 재배분에서 오는 만큼, 자신의 워크로드에서 그 비율이 그대로 재현되는지 확인해야 한다.
한계와 전제는 저자가 명시적으로 정리한 별도 한계 절 없이 결론부가 잘려 있어, 원문에서 확인 가능한 범위에서만 정리한다. 진화는 VLM 파라미터를 갱신하지 않는 대신 외부 스킬 업데이터의 코딩 능력에 의존하며, 실험에서는 Codex(GPT-5.5, xhigh)가 그 역할을 맡았다. 업데이터 성능이 진화 결과를 좌우할 수 있다는 전제가 깔려 있다. 진화 세트는 VUE-LVTR에서 뽑은 100개 질의이고 진화는 한 번만 통과하며, 추론 라운드 상한은 24회로 고정되어 있다. 또한 여러 VLM에서 스킬을 각각 진화시켜 일반화를 확인했지만, 단일 스킬의 범용성이나 업데이터 없이 스킬을 재사용하는 방법은 원문에 수치가 제시되지 않았다.