FAR는 미래 예측 유용성으로 세계 모델의 기억 검색과 단서 선택을 학습한다
Learning What to Recall: Adaptive Multi-Cue Episodic Memory for World Models
무엇인가
이 논문은 세계 모델이 미래 관측을 예측할 때 현재 관측과 행동만으로는 부족하고, 멀리 떨어진 과거 관측에 의존해야 하는 상황을 다룬다. 에피소드 기억은 과거 관측을 개별적으로 보존하지만 기억이 쌓일수록 어떤 기억이 현재 예측에 유용한지, 그리고 시간·자세·시각·오디오 같은 검색 단서 중 무엇을 믿어야 하는지가 문제가 된다. 최근성, 시야 겹침, 시각 임베딩 유사도 같은 고정 기준은 환경과 질의에 따라 불안정하다. 예를 들어 ㄱ자 복도에서는 자세 기반 검색이 벽 건너편의 가까운 기억을 선호할 수 있고, 시각 외형은 비슷한 복도 구간에서 모호할 수 있으며, 공간 오디오가 더 유용한 단서가 될 수 있다.
어떻게 동작하나
저자들은 Future-Aware Recall(FAR)을 제안한다. 훈련 중에는 미래가 관측되므로, 각 후보 기억이 실제 미래를 얼마나 잘 설명하는지를 예측 유용성으로 측정한다. 구체적으로 관측 o_t와 행동 a_t로 질의 Q_t=(o_t,a_t)를 만들고, 과거 관측 집합 M_{t-1}에서 크기 K의 문맥 C_t를 고른 뒤 세계 모델이 pθ(o_{t+1}|C_t,Q_t)를 예측하도록 한다. 예측 유용성은 uθ(C_t|o_{t+1},Q_t)=log pθ(o_{t+1}|C_t,Q_t)로 정의되며, 이는 해당 문맥을 조건으로 줄 때 실제 미래의 가능도가 높아지는 정도다. 논문은 상호정보량이 이 로그 가능도에서 데이터 분포 항을 뺀 값으로 하한이 잡힌다는 명제 1을 제시하고, 데이터 분포 항은 문맥과 무관하므로 예측 유용성을 학습 신호로 쓸 수 있다고 설명한다.
무엇과 다른가
검색기는 추론 시 미래를 볼 수 없어야 하므로, 훈련 때만 미래를 아는 교사를 만든다. 미래를 모르는 검색 분포 rφ(C_t|Z_{t-1},R_t)는 점수 sφ에 대해 exp 비례 분포로 정의되고, 미래 인지 사후분포 qθ,φ는 exp[sφ(C_t|Z_{t-1},R_t)+uθ(C_t|o_{t+1},Q_t)]에 비례한다. 즉 미래 없이 매긴 관련도와 실제 미래가 준 예측 크레딧을 합친 것이다. FAR는 이 사후분포를 stop-gradient로 고정한 뒤 rφ가 이를 따라가도록 KL 발산을 최소화한다. 이렇게 관측된 미래의 예측 크레딧을 추론 시 미래를 보지 않는 검색기로 옮긴다. 전체 문맥 집합을 열거하는 것은 조합적으로 불가능하므로 EMDR2에서 가져온 후보 수준 잠재변수 근사를 쓴다.
어떻게 쓰나
다중 단서 활용은 단서별 관련도와 질의별 가중치로 나뉜다. 단서 m에 대해 각 과거 관측의 점수 s^m_{φ,i}를 계산하고, 단서마다 점수 스케일이 다르므로 기억 전체에서 표준화한 뒤 s_{φ,i}=Σ_m λ^m_{φ,t} \tilde{s}^m_{φ,i}로 융합한다. λ^m_{φ,t}는 현재 질의에 사용 가능한 단서별 검색 신호로부터 학습된 게이트가 만들며 합은 1이다. 문맥 점수는 선택된 관측들의 융합 점수 합이고, Top-K는 가장 높은 K개를 고른다. 비디오 확산 세계 모델 구현에서는 시각·오디오 같은 고차원 단서의 메모리 쪽 인코더를 대조 학습으로 미리 학습해 동결하고 키를 캐시하며, 질의 쪽 어댑터와 단서 융합만 FAR로 학습한다. 확산 모델의 정확한 가능도는 비싸므로 실제 미래에 대한 음의 확산 예측 손실을 네 개 확산 타임스텝에서 평균해 예측 유용성을 근사한다. 또한 가까운 프레임이 Top-K를 중복 차지하지 않도록 기억을 시간 청크로 나누고 청크별 최고 점수 관측만 대표로 남긴다.
전제와 한계
실험은 LoopNav, SoundSpaces, AI2-THOR 세 환경에서 이뤄진다. 각 궤적은 탐색 단계와 복귀 단계로 구성되고, 세계 모델은 탐색 단계 관측을 기억 풀로 두고 복귀 단계 비디오를 생성한다. LoopNav는 정적 마인크래프트 환경에서 메타데이터와 시각 단서를 평가한다. 비교 대상은 최근 관측을 쓰는 시간 기반, 목표와 시야 겹침이 큰 프레임을 검색하는 WorldMem, 재구성 임베딩 유사도로 검색하는 LongLive-RAG다. 결과에서 시간 기반이 가장 나쁘고, 학습된 시각 검색기는 LongLive-RAG보다 DreamSim이 17% 낮았으며, 학습된 메타데이터 검색기는 같은 단서 유형을 쓰는 WorldMem보다 DreamSim이 19% 낮았다. WorldMem은 시야 겹침은 크지만 목표가 가려진 프레임을 고르는 반면, 학습된 메타데이터 검색기는 예측에 더 유리한 시점을 고른다. 메타데이터와 시각을 융합한 Multi-Cue는 수평선 전반에서 둘 중 더 나은 쪽을 따라가며 적응적으로 단서를 강조한다.
SoundSpaces는 공간 오디오가 추가된 실내 내비게이션 데이터셋으로, 탐색 중 주기적 360도 스캔을 하는 밀집 기억 코퍼스와 탐색 끝점에서만 스캔하는 희소 코퍼스를 만든다. FAR는 두 코퍼스 모두에서 시간 기반과 WorldMem을 일관되게 앞선다. 주기적 스캔에서는 메타데이터만으로도 강한 검색 신호가 되고 메타데이터와 오디오의 Multi-Cue 이득은 크지 않지만, 희소한 끝점 스캔에서는 복귀 단계 길이가 길어질수록 Multi-Cue의 이점이 커지며 특히 LPIPS와 DreamSim에서 두드러진다. 논문은 ㄱ자 복도 예시에서 시간 기반과 WorldMem이 최근 관측 또는 시야 겹침이 큰 관측을 골라 먼 복도 구간 정보가 부족하고, 메타데이터 FAR도 복도 구조에 가려지지만, 오디오 단서를 더하면 목표 주변을 더 잘 보는 문맥을 검색해 예측이 충실해진다고 설명한다.
AI2-THOR는 물체를 옮겨 세계 상태가 바뀌는 상호작용 가정 환경이다. 같은 위치에 대해 상충하는 상태의 관측이 생기고, 복귀 단계에서는 이전 상호작용이 정한 상태와 일치하는 관측을 생성해야 한다. 상태 렌더링 정확도는 변경된 상태에서 d(o_GT,o_Pred)<d(o_GT,o_Stale)를 만족하는 비율로 측정하며, o_Stale은 자세가 맞는 상호작용 이전 관측이고 d는 변경 영역 크롭의 LPIPS다. Multi-Cue FAR는 메타데이터와 시각을 융합해 표면 변경과 컨테이너 공개 모두에서 시간 기반 및 기하 기반 검색을 크게 앞선다. 특히 컨테이너 공개에서는 현재 관측이 숨은 내용에 대한 정보를 거의 주지 않아 관련 상호작용 이력을 기억하는 것이 중요하므로 이점이 더 크다. 현재 상태와 낡은 상태가 국소적으로만 다를 때는 모든 방법의 성능이 떨어지는데, 이는 확산 예측 목적이 작은 시각 변화에 둔감하기 때문이라고 저자들은 해석한다.
추가 실험은 기억 검색이 미래를 바꾸는 사례를 보여준다. 현재 관측과 행동을 고정하고 이전 이력만 달리한 반사실 예시에서, 토마토를 냉장고에 넣은 이력에서는 FAR가 냉장고 안에 토마토가 있는 미래를 생성하고 넣지 않은 이력에서는 그렇지 않다. 시간 기반과 WorldMem은 이 상호작용 의존 상태를 보존하지 못하고, WorldMem은 시야 겹침이 큰 낡은 문맥을 우선해 토마토를 예전 탁자 위치에 환각한다. 두 에이전트 복도 실험에서는 A2가 문을 통해 간헐적으로 보이는 상황에서 A1이 방을 나가 복도를 볼 때 A2 위치를 예측한다. 각 검색 문맥은 1.5초 간격의 관측 두 개로 구성되며, 시간 기반과 WorldMem은 각각 41.9%와 32.4% 정확도에 그친 반면 FAR는 메타데이터만으로 67.1%, A2 관측 단서를 융합한 Multi-Cue는 94.6%를 기록했다. 절제 실험(Table 1)에서는 동결된 사전학습 시각 인코더가 강한 검색 신호를 주고, 질의 표현을 MLP로 적응시키면 PSNR이 16.25에서 16.48로 오르며 LPIPS와 DreamSim도 개선된다. 메타데이터 단서를 고정 융합 λ=0.5로 넣으면 PSNR이 16.91로 더 오르고, 융합 가중치를 학습하면 모든 지표에서 최고 성능을 낸다. 이는 메타데이터와 시각 단서가 상보적이며 균일 융합보다 적응적 가중이 낫다는 근거다.
개발자 관점에서 FAR는 외부 에피소드 기억을 가진 세계 모델이나 에이전트에서 최근성·자세·임베딩 유사도만으로 Top-K를 고르는 설계를 대체할 수 있는 레시피를 준다. 다만 저자들이 밝힌 한계도 분명하다. 이 연구는 외부 에피소드 기억에서의 검색에 집중하며 기억 쓰기, 압축, 망각, 검색된 기억들 사이의 고차 상호작용은 향후 과제로 남긴다. FAR는 유용한 검색 단서가 있어야 하고 예측 유용성 평가를 위한 추가 훈련 계산이 필요하다. 확산 손실 기반 유용성은 의미적으로 중요한 국소 변화를 과소평가할 수 있어 과제 인지 유용성 함수가 대안으로 제시된다. 실험도 통제된 시뮬레이션이므로 더 풍부한 실제 환경과 학습된 기억 형성, 지속 상태 표현과의 통합이 필요하다고 저자들은 말한다.