Ledger가 자기중심 영상에서 3D 객체 기억을 구축해 공간 질문에 답한다
Never Look Back: Understanding Persistence in 3D Object Memory from Egocentric Videos
무엇인가
사람은 하루 동안 요리를 하고 차고를 정리하고 축구를 하면서도 자기가 어디에 렌치를 두었는지, 어느 선반에 예비 배터리가 있었는지 기억한다. 그 물건이 나중에 필요해질 줄 모르는 시점에도 그렇다. 이 논문은 착용형(자기중심) 영상만 보고 이런 기억을 쌓는 구체화된 에이전트를 다룬다. 영상 속 사람이 무엇을 만지고 어디를 지나갔는지 관찰해서, 나중에 장면을 다시 보지 않고도 위치·내용·이동 이력을 답할 수 있는지를 묻는다. 저자들이 지적하는 핵심 난점은 세 가지다. 물체는 가려지거나 잠깐만 보이고 다른 시점에서 찍히며, 실제로 움직이기도 하는데 3D 위치 추정 오차 때문에 멈춰 있던 물체가 움직인 것처럼 보인다. 게다가 탐색 시점에는 어떤 물체가 나중에 질문 대상이 될지 알 수 없어서, 불완전한 관측에서 무엇을 남길지 스스로 결정해야 한다.
어떻게 동작하나
제안 시스템은 Ledger(Long-horizon Egocentric Descriptions, Geometry, and Event Records)다. 질문과 무관하게 녹화 단위로 한 번, 오프라인에서 구축되는 영구적 3D 객체 기억이다. 각 인스턴스마다 라벨과 함께 타임스탬프가 붙은 관측 집합(이미지 박스, 장면 좌표계의 3D 위치)을 저장한다. 이 관측들을 '휴식 구간(rest segment)'으로 묶는데, 각 구간은 시작·종료 시각, 추정 3D 위치, 그리고 물체와 주변 맥락을 서술한 짧은 설명으로 구성된다. 새 구간은 현재 휴식 위치에서 임계값 이상 떨어진 관측이 연속 k번 나타난 뒤에만 확정된다. 즉 위치 추정 잡음을 이동으로 오인하지 않도록 '반복 증거' 규칙을 둔 것이 핵심 설계다. 구축 절차는 다음과 같다. Qwen3.5-9B가 샘플링된 프레임에서 물체 이름을 뽑고 동의어를 병합해 YOLO-World용 어휘를 만든다. 이때 사람이 만진 물체만이 아니라 보이기만 한 물체도 탐지·3D 리프팅 예산 안에서 기억에 들어간다. WildDet3D가 카메라 좌표계의 3D 박스를 예측하고 카메라 포즈가 그 중심을 장면 좌표로 옮긴다. 관측은 라벨과 최신 위치까지의 거리로 시간 순서대로 기존 인스턴스에 매칭되며, 3D 연관이 하나의 물체를 여러 트랙으로 쪼갠 경우에는 SAM 3 비디오 트래커가 마스크를 전파해 조각들을 병합한다. 맥락 설명은 물체 외곽선을 그린 프레임에서 Qwen3.5-9B가 생성하며, 용기 안에 든 것, 받치고 있는 표면, 상호작용을 기록한다. 시점이 충분히 벌어져 있고 추정이 안정적일 때는 다시점 삼각측량으로 휴식 위치를 다듬는다.
무엇과 다른가
질의 시점에는 원본 영상이나 이미지를 전혀 보지 않는다. HD-EPIC의 박스 질의는 해당 타임스탬프에 가장 가까운 샘플 프레임의 3D 점으로 올려지고 ±6초 안에 관측된 가장 가까운 인스턴스 4개가 검색된다. VQ3D는 물체 이름을 주면 저장된 위치를 그대로 반환하고, UCS-Bench는 질문에서 대상을 추론해 단어 중첩과 시간 근접도로 항목을 정렬한다. 이렇게 모은 라벨, 순위 신호, 구간 이력(시각·위치·설명)을 텍스트로 렌더링한 뒤 Qwen3.5-9B나 GPT-5.4를 한 번 호출해 답을 얻는다. 질문당 입력 토큰은 약 2.0k로, 48개 프레임을 넣는 9.6k에 비해 훨씬 싸다.
어떻게 쓰나
실험 결과는 이렇다. HD-EPIC의 3D Perception·Object Motion 2,400문항에서 GPT-5.4의 프로토타입 평균 정확도가 29.7%에서 42.6%로 올랐다. Ego4D VQ3D 검증 질의 164개에서는 반환한 예측에 대해 중앙값 0.99m 오차로 물체를 찾았다. UCS-Bench에서는 초록 기준 33.8%에서 38.5%로, 본문의 48프레임 조건에서는 DirectMe 그래프를 붙인 42.9% 대비 46.3%를 기록했다. 기억은 테스트한 모든 답변 모델(Qwen3.5-9B, GPT-5.4, GPT-5.6)에서 블라인드 대조군보다 11~18점 높았고, 특히 착용자가 한 번도 만지지 않은 물체에서 이득이 컸다. 반대로 상호작용 횟수 세기와 휴식 시작 시점 같은 과제에서는 AMEGO의 손-물체 트랙릿이 더 나았고, UCS-Bench의 물체 개수 질문은 개선되지 않았다. 연관 단계가 한 물체를 여러 트랙으로 쪼개면서 다른 물체를 놓치기 때문이다.
전제와 한계
절제 실험은 설계 선택의 값을 분리한다. 주석된 이동의 절반은 0.8m보다 짧고 위치 추정 오차의 95백분위수는 0.84m라서, 거리 임계값만으로는 이동과 잡음을 구분할 수 없다. 0.3m 임계값을 쓰면 세는 이동 수가 대략 두 배가 되고, 0.8m로 올리면 정답 ±1 안에 드는 비율이 57.3%에 그친다. 0.3m를 유지하되 연속 3회 변위 관측을 요구하면 이 비율이 67.4%로 오른다. 지속성 규칙을 제거하면 이동 계수 성능이 15.5점 떨어진다. 기하 오차 중에서는 물체 좌표보다 카메라 기준 좌표계 오차가 더 치명적이어서, 추정 포즈는 비품 위치 질문에서 11점(중력 정렬을 안 하면 29점)을 깎아먹는다. 반면 삼각측량으로 물체 좌표를 다듬는 것은 전체 2.2점으로, 지속성(5.5점)이나 맥락 설명(4.9점)보다 기여가 작다.
검색의 영향도 정면으로 다룬다. 같은 에이전트가 두 기억을 읽게 하면 Ledger 기록이 ReMEmbR의 캡션보다 HD-EPIC에서 5.0점(p<10⁻⁸), VQ3D 1m 이내 질의에서 26점 앞서고 UCS-Bench에서는 동률이 된다. ReMEmbR이 네이티브 설정에서만 앞서는 41.4 대 39.0의 격차도, 착용자 행동을 서술하는 이벤트 라인을 추가하면 41.0으로, 공유 에이전트를 쓰면 42.1로 좁혀진다. 반대로 HD-EPIC에서는 단일 호출 리더가 에이전트보다 7.8점 높으면서 토큰은 13분의 1만 쓴다. 즉 '어느 기억이 더 낫다'는 결론은 리더를 고정해야만 의미가 있다. 녹화 길이가 길어져도 최대 75분 구간까지 기억의 이득은 10~18점으로 유지되지만, 장면이 바뀌면 무너진다. 100개의 이어붙인 스트림 실험에서 같은 장면으로 돌아오는 것은 거의 손해가 없었으나 장면 전환은 성능을 블라인드 수준까지 끌어내렸다. 검색이 다른 장면의 기록을 보여주고, 구축 단계가 한 장소에 속할 수 없는 라벨을 버리며 포즈 게이트가 이음매에서 스트림 전체를 거부하기 때문이다. 현재 장면으로 검색을 제한하면 3.0점, 장면별로 기억을 따로 구축하면 손실의 약 절반이 회복된다.
개발자 관점에서 이 논문의 실용적 메시지는 명확하다. 첫째, 착용형 영상 기반 어시스턴트에서 '만진 물체만 기억한다'는 접촉 기반 게이팅은 비품 위치 질문에서 손해다. 보이기만 한 물체도 저장해야 한다. 둘째, 3D 위치 추정 잡음과 실제 이동은 크기 분포가 겹치므로 임계값 튜닝으로는 분리되지 않는다. 반복 관측을 요구하는 상태 기계를 두고, 그 대가로 짧은 이동을 놓친다는 점을 감수해야 한다. 셋째, 기억 표현과 검색기를 분리해서 평가해야 한다. 같은 기록도 리더에 따라 순위가 뒤집히고, 비싼 반복 검색이 모든 과제에서 이득이 되지도 않는다. 넷째, 텍스트 전용 답변이 가능하다는 점은 비용 면에서 매력적이지만, 최근 프레임 리더가 HD-EPIC에서 기억만 쓰는 답변을 능가하고 UCS-Bench에서는 프레임 단독이 기억 단독을 앞선다. 기억은 프레임을 대체하는 것이 아니라 더하는 쪽으로 써야 한다.
저자들이 밝힌 한계도 분명하다. 구축은 오프라인이라 질문 시각으로 기록을 필터링해도 인과적 온라인 기억을 보장하지 않는다. 개수 세기와 연속 휴식 구간 추정은 미해결 과제로 남아 있고, 물체가 가장 빽빽한 1시간짜리 녹화에는 구축이 아직 확장되지 않는다. HD-EPIC은 캘리브레이션된 포즈를 쓰지만 VQ3D는 크롭이 아니라 이름으로 질의하며, 대부분의 UCS-Bench 기억은 미터 스케일이 없다. HD-EPIC에 쓰인 분할·검색 규칙, 삼각측량 임계값, 비품 동의어 그룹은 평가와 분리된 캘리브레이션 영상에서 개발됐다는 점도 전제다. 마지막으로 저자들은 평가가 위치 추정 정확도만이 아니라 '답할 수 있는 증거'를 함께 측정하고, 검색 예산과 장면 경계를 명시해야 한다고 주장한다.