MemLife가 1인칭 에피소드 메모리로 장기 영상 QA를 개선한다
MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories
무엇인가
스마트 글래스나 GoPro로 하루를 계속 기록하면 1인칭 영상은 수개월에서 수년, 수백 시간 단위로 쌓인다. 이때 "내 여권을 어디에 뒀지?" 같은 질문에 답하려면 매 질의마다 원본 클립을 다시 처리해야 하는데, 이는 계산적으로 감당이 안 된다. 그래서 영상을 텍스트 메모리로 압축해 두는 방식이 대안으로 쓰이지만 실제 벤치마크에서는 두 가지 방식으로 무너진다. 하나는 메모리가 핵심 증거를 보존하지 못하는 경우이고, 다른 하나는 검색 공간이 커지면서 검색 경쟁이 심해져 리트리버가 관련 항목을 찾아내지 못하는 경우다. 저자들은 압축의 근본적인 트레이드오프를 지적한다. 공격적으로 압축하면 미래의 질문이 묻는 정보가 사라지고, 보수적으로 압축하면 사소한 디테일이 검색을 희석하고 QA 시점 처리를 부풀린다. 여기에 작성자가 영상에 없는 내용을 환각하면 거짓 증거가 메모리에 심긴다. 논문이 던지는 질문은 "기억할 가치가 있는 것만, 충실하게, 그리고 쉽게 떠올릴 수 있는 형태로 어떻게 기억하게 만들 것인가"다.
어떻게 동작하나
첫 번째 제안 MemLife는 작성자(writer)와 읽는 자(reader)를 분리한 에이전트형 메모리 시스템이다. 작성자는 질문과 무관하게 미리 메모리를 만들어 두는데, 세 가지 설계를 따른다. 첫째 멀티모달 융합으로 프레임과 음성 전사를 함께 해석해 두 모달리티의 증거를 한 항목에 담는다. 둘째 엔티티 그라운딩으로 전사에 이름으로 등장한 인물·사물을 해당 구간에서 관찰된 시각적 지시체에 연결한다. 셋째 1인칭 서술로, "내가"를 주어로 쓰는 사용자 질문과 메모리 사이의 간극을 좁힌다. 각 클립을 독립적으로 처리해 순차 의존성과 오류 전파를 피하고 전체 계산·저장량을 기록 길이에 선형으로 유지한다. 앞 세그먼트의 텍스트 또는 멀티모달 컨텍스트를 조건으로 주는 변형도 실험했지만 집계 정확도는 오히려 개선되지 않았다.
무엇과 다른가
읽는 자는 질문과 질의 시각을 받아 여러 라운드에 걸쳐 행동을 고르는 에이전트다. 행동 공간은 Rewrite, SearchMemory, FetchMemory, FetchVideo, Answer로 구성된다. Rewrite는 현재 정보를 바탕으로 입력을 표적 검색 질의와 시간 구간으로 바꾸고, SearchMemory는 그 구간 안에서 유사도 검색으로 상위 k개 항목을 가져온다. 시간 구간만 주어지면 FetchMemory가 구간 내 모든 텍스트 메모리를, FetchVideo가 원본 멀티모달 조각과 샘플링한 프레임을 반환한다. Answer는 검색 결과로 답을 생성한다. 원본 영상이 없으면 FetchVideo는 비활성화된다. 영상이 있는 설정(MemLife-V)에서도 저장 공간과 프라이버시 때문에 저해상도로 가린 영상만 보관하고 제한된 수의 프레임만 샘플링한다. 검색된 에피소드는 시간순으로 제시되어 긴 이력에 대한 추론을 돕는다.
어떻게 쓰나
두 번째 제안 MemOpt는 리더는 고정한 채 작성자만 강화학습으로 최적화하는 프레임워크다. 이론적 근거로, 검색된 컨텍스트를 쓸 때 생기는 답에 대한 추가 불확실성이 메모리 작성 손실과 메모리 회상 손실로 정확히 분해된다는 식을 제시한다. 이에 대응하는 FIRM 보상은 충실성, 정보성, 검색성 세 축이다. 충실성은 토큰 단위로 평가한다. 같은 동결 모델에게 생성된 메모리를 원본 구간과 대조하게 하면서 지원되는 내용은 그대로 재현하고 지원되지 않는 구간만 최소로 고치게 하고, 각 토큰에서 평가자가 가장 선호하는 다음 토큰 확률과 실제 생성 토큰 확률의 차이를 1에서 빼서 0~1 사이 값을 만든다. 정보성은 동결된 기본 작성자 모델을 핵심 사실 추출자 겸 함의 판정자로 써서, 해당 구간이 증거가 되는 질문들에 대해 후보 메모리가 그 사실을 함의할 확률을 평균낸다. 검색성은 에폭 시작 시 리더를 모든 학습 질문에 돌려 메모리 접근 행동을 캐시해 두고, 후보마다 그 고정 행동을 재생해 반환된 컨텍스트에 후보가 포함되는 질문 비율로 계산한다. 세 보상은 곱셈으로 결합되어, 충실하면서 정보성과 검색성이 모두 높을 때만 토큰이 높은 크레딧을 받는다. 토큰 단위 이점은 후보 내부에서 먼저 평균을 낸 뒤 그룹 통계를 구하는 방식으로 정규화해 긴 메모리가 정규화를 지배하지 않게 했고, 이후 GRPO를 따른다.
전제와 한계
실험은 SuperMemory-VQA, EgoLifeQA, 그리고 확장 설정 두 개(SuperMemory-LVQA, EgoLife-EQA)에서 이뤄졌다. SuperMemory-LVQA는 열 개 히스토리를 모두 합쳐 교차 피험자 방해 항목으로 검색 공간을 키운 것이고, EgoLife-EQA는 반복 이벤트에 대한 질문으로 증거를 원본 기록과 수동 대조해 검증했다. MemOpt는 SuperMemory-VQA의 S1~S6으로 학습하고 S7~S8로 검증, S9~S10으로 테스트했으며 나머지 벤치마크는 테스트 전용이다. 작성자와 리더 모두 Qwen3.5-9B를 백본으로 쓰고 일반화 연구에서 Qwen3.6-27B도 평가했다. 학습 없는 베이스라인은 Video ReCap, EgoRAG, Video-RAG, VideoARM, EGAgent, WorldMM이고, 학습 베이스라인은 EgoButler, VST, TaskMem, M3-Agent다. 결과적으로 MemLife는 학습 없는 시스템들을 정확도에서 앞서며 최강 학습-불필요 베이스라인 대비 최대 12.0% 향상했다. 영상 접근을 켠 MemLife-V는 변화가 미미했는데, 이는 이득이 원본 기록 재확인에 의존하지 않는다는 뜻이다. MemOpt를 얹으면 모든 벤치마크에서 MemLife가 개선되어 2.7~5.0%가 더 오르고, 결합 시스템은 최강 기존 베이스라인을 4.0~17.0% 앞서면서 메모리 크기는 최대 31배 줄였다. SuperMemory-VQA만으로 학습했는데도 나머지 세 벤치마크가 개선되어 영상 분포, 질문 유형, 메모리 규모를 넘나드는 전이가 확인됐다.
메모리 품질 분석에서는 검색 재현율, 일반 검색에서의 정확도, 증거 정렬 항목을 직접 준 오라클 정확도를 나눠 측정했다. EgoRAG와 비교해 MemLife는 모든 카테고리에서 재현율을 올리고 오라클 정확도도 전반적으로 높였으며, MemOpt의 이득은 질문 유형에 따라 검색이 좋아지는 쪽과 저장된 내용의 답 유용성이 좋아지는 쪽으로 갈렸다. RelationMap에서는 EgoRAG가 재현율과 오라클 정확도가 더 낮은데도 표준 정확도는 최적화된 MemLife와 동등했는데, 주석 밖의 유용한 맥락을 표면화할 수는 있어도 관계를 답하는 데 필요한 증거는 안정적으로 보존하지 못한다는 해석이 붙는다. 저장 내용이 실제로 어떻게 바뀌는지 보여주는 예시도 있다. 학습 전 작성자가 렌틸을 옥수수로 잘못 본 것을 MemOpt가 주변 행동은 유지한 채 바로잡았고, 모호한 대명사만 쓰고 음식을 빠뜨린 메모리를 인물을 특정하고 구운 닭고기까지 기록하도록 바꿨다. 일반화 실험에서 MemOpt는 두 백본 모두에서 모든 작성자-리더 조합을 개선했고 작성자 규모 차이는 작았다. 더 강한 Qwen3.6-27B 리더를 쓰면 절대 정확도는 크게 오르지만 MemOpt의 이득은 줄어들어, 리더 용량이 작성 메모리의 결함 일부를 보상할 수 있음이 드러났다. EgoRAG 작성자를 최적화해 native EgoRAG 리더와 MemLife 리더로 각각 읽힌 실험에서도 학습이 원래 파이프라인을 개선했고, 최고 성능은 학습된 MemLife 작성자에서 나왔다. 절제 실험에서는 엔티티 그라운딩이 정확도를 올리되 재현율 이득은 적고, 1인칭 서술이 정확도와 EgoLifeQA 재현율을 일관되게 끌어올렸다. 리더 쪽에서는 시간 앵커링이 최적화된 EgoLifeQA 메모리에서 가장 뚜렷한 이득을 냈고 시간순 정렬이 정확도를 더 올렸다. 보상 설계 비교에서는 Qwen3.6-27B 교사 모방이 소폭에 그쳤고 최종 답 정확도 감독은 벤치마크마다 결과가 엇갈렸다. 검색성 단독은 재현율은 올리지만 정확도는 불안정했고, 정보성을 더하면 SuperMemory-VQA에는 강하지만 EgoLifeQA로 전이되지 않았다. 충실성을 정규화 항으로 넣은 완전한 목적함수가 두 벤치마크 모두에서 최고 정확도를 냈고, 토큰 단위 충실성에 곱셈 집계를 쓴 구성이 전체 최고였다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 명확하다. 원본 영상을 질의 시점에 다시 디코딩할 예산이 없는 개인 기록 서비스라면, 메모리 작성 단계에서 엔티티를 명시하고 1인칭으로 서술하는 것만으로도 검색 매칭이 눈에 띄게 좋아진다. 또한 메모리 품질을 최종 답 정확도로만 평가하면 리더의 도구 호출 노이즈가 섞여 학습 신호가 흐려지는데, 이 논문은 충실성·정보성·검색성을 분리해 각각 다른 감독원(원본 구간, 핵심 사실, 고정된 리더 행동)에서 얻는 방식을 택했다. 검색성 보상을 위해 리더 행동을 에폭마다 캐시해 재생하는 트릭은 에이전트형 RAG 파이프라인을 학습시킬 때 재사용할 만한 패턴이다. 다만 도입 전에 확인할 것은 자신의 워크로드가 텍스트 메모리만으로 답이 되는 질문인지, 아니면 프레임 수준 세부가 필요한 질문인지다. 후자라면 FetchVideo 경로와 저해상도 영상 보관 정책이 필요하고, 프라이버시 요구사항이 그 설계를 제약한다.
한계와 전제는 논문 본문에 흩어져 있다. MemLife-V는 저장 공간과 프라이버시 때문에 저해상도로 가린 영상만 보관하고 제한된 프레임만 샘플링하며, 원본 영상이 아예 없으면 FetchVideo 도구 자체가 비활성화된다. MemOpt는 리더를 고정하고 작성자만 학습하므로 리더 실행 노이즈와 분리된다는 장점이 있지만, 그 대가로 리더가 바뀌면 검색성 감독의 기반도 다시 수집해야 한다. 실제로 더 강한 리더를 쓰면 MemOpt의 상대적 이득이 줄어든다. 재현율 변화는 벤치마크마다 혼합되어 있어 정확도 향상이 주석된 증거를 더 잘 찾아서만이 아니라 더 답에 유용한 내용을 저장해서도 나온다는 점을 저자들 스스로 인정한다. SuperMemory-LVQA에서는 재현율이 더 낮은데도 정확도가 유지되는 불일치가 관찰되는데, 교차 피험자 상호작용이 주석 밖 맥락을 제공했을 가능성으로 설명하며 명확한 결론을 유보한다. 제공된 본문 범위에는 별도의 한계 절이 없어, 이 외의 저자 명시적 한계는 확인되지 않는다.