장시간 영상 기억을 물리적 개체의 전기로 재구성한다

Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies

arXiv2609.38155v1

Hui Ren2026-09-29조회 3

무엇인가

장시간 영상에 대한 질문은 몇 시간, 며칠에 걸쳐 같은 물체가 등장한 사건들을 연결해야 답할 수 있다. 그런데 기존 메모리 프레임워크는 시간순 서술과 텍스트에서 뽑아낸 엔티티에 의존하기 때문에 물리적 동일성이 해결되지 않는다. 서로 다른 물체가 같은 서술을 공유할 수 있고, 같은 물체의 관측이 상태나 위치가 바뀌면서 다른 이름으로 흩어질 수 있다. 논문은 컵 예시를 든다. 줄무늬 빨간 머그에 커피를 따랐고 나중에 다른 단색 빨간 머그가 식기세척기에 들어갔다면, 두 서술을 모두 검색해도 같은 인스턴스인지 알 수 없다. 관련 사건을 검색하는 것만으로는 질문이 묻는 특정 개체의 전기(biography)를 복원하지 못한다는 것이 이 논문의 출발점이다.

어떻게 동작하나

GEB는 녹화를 T개의 짧은 클립으로 나누고, 관측 o_i를 한 클립 안에서 추적된 하나의 대상으로 정의한다. 각 관측은 가시적 시간 구간, 추적된 이미지 영역, 상태와 상호작용 서술, 원본 클립과 지원 맥락 참조를 보존한다. 여기에 엔티티 식별자 ẑ_i를 부여하고, 엔티티 k의 전기를 시간순으로 정렬된 관측 집합으로 정의한다. 메모리 자체는 그래프 G=(N,R)로 표현되며, 노드 집합은 영속 엔티티 노드, 관측 노드, 에피소드 노드, 소스 클립 노드의 합집합이다. 세 가지 관계가 관측을 정체성, 맥락, 시각 증거에 연결한다. 엔티티 소속 엣지, 관측을 지역 에피소드에 잇는 맥락 엣지, 원본 클립으로 잇는 출처 엣지다. 에피소드 층위 안에는 시간적 인접성과 상위 에피소드로의 포함 관계도 있다. 같은 엔티티에 배정된 두 관측은 엔티티 노드를 경유하는 경로로 이어져, 서술이 전혀 달라도 며칠을 건너 하나의 이력으로 묶인다.

무엇과 다른가

메모리를 쓰는 과정은 두 결정을 분리한다. 먼저 open-vocabulary 검출기와 클립 내 추적기가 반복 검출을 관측으로 묶고, 비전언어 모델이 대상 크롭, 장면 프레임, 타임스탬프가 붙은 내레이션과 대화를 함께 읽어 각 관측을 서술한다. 프롬프트는 대상을 시각적으로 확립하고 텍스트 맥락은 그 대상에 관한 것일 때만 쓰도록 지시한다. 다음으로 연관은 보수적으로 수행된다. 관측을 시간순으로 처리하며 임베딩 유사도로 후보 엔티티를 찾고, 두 임계값 θ_cons < θ_match를 이용해 세 조건을 모두 만족할 때만 배정한다. 새 관측이 후보의 모든 참조 관측과 최소 유사도 θ_cons 이상이어야 하고, 그중 최소 하나와는 θ_match 이상으로 강하게 맞아야 하며, 공유 프레임에서 바운딩 박스 IoU가 임계값 아래로 떨어지는 분리 증거가 하나도 없어야 한다. 참조 집합은 최근 관측 일부로 제한해 비교 비용을 묶는다. 여러 후보가 자격을 얻으면 평균 유사도가 가장 높은 것을 고르고, 아무도 자격을 얻지 못하면 새 엔티티를 시작한다. 사람도 같은 절차를 따르며, 이름이 있는 참가자는 별도 단계로 식별자를 통합하고 식별 특징이 공유되면 판단을 보류한다.

어떻게 쓰나

질문 시점의 검색은 매치된 관측을 입구로 삼는다. 관측 서술과 에피소드 캡션이 의미·어휘 색인으로 함께 인덱싱되고, 질의의 초기 매치는 이 공유 색인과 소스 클립에 대한 시각 매치에서 나온다. 관련성은 엔티티 소속을 따라 같은 인스턴스의 다른 관측으로, 맥락 링크를 따라 주변 에피소드로 전파되며, Personalized PageRank로 계산해 질의-텍스트 유사도와 결합해 순위를 매긴다. 검색 예산은 전체 상한과 엔티티별 상한으로 제한해 자주 등장하는 대상이 예산을 독점하지 않게 한다. 컨트롤러에게 전달되는 전기 발췌에는 이번 라운드에서 선택된 관측이 시간순으로 담기고, 아직 선택되지 않은 등장은 시각과 횟수로 요약되어 다음 검색의 구체적 목표가 된다. 보수적 연관 때문에 하나의 물리적 인스턴스가 여러 식별자로 남을 수 있는데, 같은 이름을 가진 전기가 함께 검색되면 시각적 분리 증거가 있는 쌍과 정체성이 미해결인 쌍을 구분해 알려준다.

전제와 한계

실험은 EgoLifeQA(약 52시간, 500문항), Ego-R1-Bench(50문항), MM-Lifelong(같은 주간의 Test@Week와 23.6시간 게임플레이 Test@Day), MultiHop-EgoQA(3분짜리 Ego4D 클립 360개, 1,080문항)에서 수행됐다. MAGIC-Video, WorldMM, ReMA 등과 비교했고, 메모리 프레임워크 간 비교에서는 컨트롤러와 답변 모델을 Qwen3.5-35B로 통일했다. EgoLifeQA에서 72.0%로 MAGIC-Video의 67.6%를 4.4%p 앞섰고, Ego-R1-Bench에서는 같은 조건에서 6.6%p 향상됐다. Test@Week는 36.83%로 WorldMM을 5.41%p 앞섰고, Test@Day는 ReMA 대비 0.83%p 우위였지만 신뢰구간이 0을 포함한다. MultiHop-EgoQA에서는 답변 점수가 WorldMM의 2.74에서 3.11로, mIoU가 1.6%p 올랐다. 증거 접근성도 개선됐는데, EgoLifeQA에서 주석된 증거 구간과 겹치는 문항 비율이 37.6%에서 58.9%로, MultiHop-EgoQA의 완전 증거 커버리지가 35.4%에서 52.1%로(상대 47% 증가) 올랐다. MAGIC-Video의 라운드당 검색 단위를 3개에서 6개로 늘려 비슷한 검색 길이를 맞춰도 완전 커버리지는 GEB보다 낮았다.

절제 실험은 이득의 출처를 분해한다. 연관 없이 관측마다 별도 엔티티로 두면 3.4%p, 이름 키로 정체성을 묶으면 2.8%p 하락했고, 서술을 캡션에 덧붙이는 방식은 3.8%p 떨어졌다. 동일 인스턴스 엣지만 제거하면 3.0%p, 관측에서 에피소드와 소스 클립으로 가는 연결을 끊으면 3.8%p, 두 엣지 계열을 모두 제거하면 5.0%p 하락했다. 전기 텍스트를 컨트롤러와 답변 모델 모두에서 빼면 4.0%p, 답변 모델에서만 빼면 1.2%p, 아직 선택되지 않은 관측 참조를 제거하면 1.8%p 떨어졌다. MM-Lifelong에서도 서술 덧붙이기가 Test@Week 3.25%p, Test@Day 5.08%p 하락을 보였다.

개발자 관점에서 이 논문은 영상 RAG나 장시간 메모리 시스템에서 엔티티 해소를 텍스트가 아니라 시각 근거로 수행하라는 설계 지침에 가깝다. 검색 단위와 프레임 한도, 엔티티별 예산 상한, 임계값 캘리브레이션이 성능을 좌우하며, 오매칭이 사건 사이에 거짓 경로를 만들기 때문에 매칭을 보수적으로 가져가는 대신 미탐을 감수하는 트레이드오프를 택했다. 도입을 검토한다면 컨트롤러와 답변 모델을 고정한 조건에서의 비교인지, 오디오를 쓰지 않는 메모리 구축인지, 검색 예산이 베이스라인과 동일한지를 먼저 확인해야 한다.

저자들이 밝힌 전제와 한계도 분명하다. 보수적 연관은 하나의 물리적 인스턴스를 여러 식별자로 남길 수 있고, 메모리 구축에는 오디오가 사용되지 않는다. MultiHop-EgoQA에서는 메모리 없이 클립 전체의 60프레임을 답변 모델에 주는 참조가 더 높은 점수를 냈는데, 이는 완전한 클립에서 답하는 것과의 격차가 남아 있음을 보여준다. Test@Day의 개선은 신뢰구간이 0을 포함해 통계적으로 확실하지 않고, WorldMM은 GEB와 비슷한 완전 증거 커버리지를 얻으면서도 검색 단위가 클립의 더 많은 부분을 차지하고 답변 점수는 낮아, 커버리지만으로 답변 품질이 설명되지 않는다는 점도 함께 지적된다.