다자 음성 대화의 장기 기억을 화자 관계까지 담아 검색하는 VoxPolyMem
Beyond Dyadic Memory: Interaction-Aware Multimodal Memory with Adaptive Agentic Retrieval for Multi-Party Spoken Conversations
무엇인가
기존 장기 기억 연구는 주로 1대1 텍스트 대화나 이미지-텍스트 대화를 다뤄 왔고, 여러 사람이 말하는 음성 대화의 장기 기억은 거의 탐구되지 않았다. 이 설정은 세션을 넘나들며 대화 내용을 보존하는 것만으로 충분하지 않다. 화자를 재식별해야 하고, 누가 누구에게 말했는지라는 상호작용 역할까지 남겨야 한다. 음성을 ASR 전사문으로만 저장하면 목소리에 담긴 정체성 단서가 사라지고, 기존의 시간 그래프·의미 추상화 방식 메모리는 발화자와 수신자 역할을 명시적으로 저장하지 않는다. 논문은 이 세 가지(내용 보존, 세션 간 참여자 식별, 발화 대상 보존)를 동시에 요구하는 문제로 정식화한다.
어떻게 동작하나
제안 시스템 VoxPolyMem은 먼저 온라인 화자 식별을 수행한다. 각 발화 오디오를 ECAPA-TDNN 인코더로 임베딩하고 L2 정규화한 뒤, 저장된 화자 임베딩 집합과 코사인 유사도를 비교해 가장 가까운 항목을 찾는다. 유사도가 임계값 τ_match 이상이면 기존 익명 speaker_id에 배정하고, 그보다 높은 τ_update 이상일 때만 지수이동평균(가중치 α)으로 임베딩을 갱신한다. 두 임계값 사이의 점수는 식별자만 연결하고 임베딩은 건드리지 않아 불확실한 매칭이 누적되는 것을 막는다. 세션이 끝나면 누적 음성 증거로 조각난 임시 ID를 보수적으로 병합해, 사전 화자 명단이나 화자 수를 요구하지 않는다. 이 식별자들은 이후 LLM 기반 추출 단계에서 이름·별칭과 연결된다.
무엇과 다른가
메모리는 세 계층으로 나뉜다. 상호작용 메모리는 텍스트·이미지·전사문과 타임스탬프를 원본 증거로 보관하면서, 참여자 노드와 메시지 노드로 이루어진 방향 그래프로 표현된다. 간선은 speaker_i →speaks→ u_i 와 u_i →addresses→ p(수신자 집합 소속) 두 종류로, 누가 말했고 누구에게 향했는지를 기록한다. 사실 메모리는 (내용, 발화자, 수신자, 시간) 형태의 자기완결적 진술을 저장하고, 참여자 프로필은 이름·별칭·연결된 음성 임베딩·배경 및 선호 속성을 담는다. 사실과 프로필은 현재 턴과 직전 최대 3개 턴을 함께 넣어 공동 추출하며, 각 레코드는 원본 대화 턴을 가리키는 refer_id 링크를 유지한다.
어떻게 쓰나
검색은 고정 파이프라인이 아니라 순차적 의사결정으로 정식화된다. 상태는 질의, 질문자 신원(음성 질의면 프로필 음성 임베딩으로 매칭), 지금까지 축적한 증거, 이전 행동 이력, 남은 예산으로 구성되고, 정책은 메모리 계층(상호작용/사실/프로필)과 도구(벡터 유사도, BM25, 텍스트→이미지, 이미지→이미지), 재작성된 질의, 선택적 화자·수신자 필터를 고른다. 검색 결과는 RRF 융합과 중복 제거를 거쳐 컨텍스트에 반영되고, LLM이 부족한 정보를 판단해 추가 검색을 이어가거나 최대 3라운드에서 답한다. 학습에는 EG-GRPO를 쓴다. 각 상태에서 K=8개 후보를 샘플링해 최대 15개 레코드를 남기고, 정답 근거 ID 집합 대비 새로 확보한 근거의 커버리지와 컨텍스트 내 순위(로그 감쇠)를 결합해 보상을 계산한다. 이전에 이미 보유한 근거는 보상에서 제외해, 같은 예산 안에서 서로 보완적인 검색을 유도한다.
전제와 한계
평가를 위해 18개 시나리오, 176개 세션, 18.9시간 합성 음성, 1,527개 QA 쌍으로 구성된 VoxPolyBench를 직접 구축했다. 각 시나리오는 8~12개 세션에 걸쳐 동일 참여자가 재등장하며, 메모리 진화·개인화 응답·검색 및 추론·상호작용 귀속을 평가한다. Whisper large-v3-turbo 기준 코퍼스 수준 WER은 2.14%다. VoxPolyBench에서 VoxPolyMem은 종합 85.0점으로 가장 강한 외부 베이스라인을 23.6점 앞섰고, 개인화 응답 76.1점, 상호작용 귀속 87.5점을 기록했다. 공개 벤치마크인 Mem-Gallery에서 89.6점, H2HMem-Multi에서 74.4점으로 각각 최강 공개 메모리 베이스라인을 11.8점, 8.4점 상회했으며, 세 벤치마크 가중 평균은 86.6 대 68.1이다. 주목할 점은 RL 없이도 모든 외부 베이스라인을 넘어 가중 평균 84.4를 달성했다는 것으로, 메모리 구조와 에이전트 검색 자체의 기여가 크다는 뜻이다.
구성 요소 제거 실험에서 사실 메모리와 참여자 프로필을 빼면 H2HMem-Multi가 72.1에서 63.6으로 가장 크게 떨어졌고, 상호작용 간선과 관계 기반 필터를 제거하면 VoxPolyBench가 84.0에서 78.6으로 하락했다. 단일 라운드 검색은 질의를 그대로 두고 여러 라운드를 도는 것보다 더 큰 성능 저하를 일으켰다. 검색 정책 비교에서는 Search-R1의 종료 답변 보상이 오히려 점수를 낮췄고, 종료 시점 커버리지 보상은 재현율만 올리고 답변 품질은 일관되게 개선하지 못했다. MoT-GRPO는 VoxPolyBench와 Mem-Gallery에서 두 지표를 모두 올렸지만, EG-GRPO가 세 벤치마크 답변 점수와 두 벤치마크 재현율 모두에서 앞섰다. Mem-Gallery 기준 MoT-GRPO 대비 답변 87.1→89.6, 재현율 91.5→93.6이며, 평균 검색 라운드도 1.2~1.3회로 RL 없는 버전(1.4~1.7회)과 MoT-GRPO(1.4~1.8회)보다 적다. 화자 추적기는 참조 발화 경계 기준으로 IEMOCAP 95.0%, AMI 87.9% 귀속 정확도를 보였다.
실무 관점에서 이 논문이 주는 시사점은 명확하다. 회의록 요약이나 음성 비서처럼 여러 화자가 등장하는 서비스에서 메모리를 설계할 때, 전사문만 저장하는 구조로는 "누가 누구에게 약속했는가" 같은 질의에 답하기 어렵다. 화자 임베딩과 발화 대상 간선을 1급 데이터로 두고, 검색을 한 번의 벡터 검색이 아니라 계층·도구·질의 재작성을 고르는 반복 의사결정으로 다루는 설계가 유효하다는 근거를 제시한다. 다만 실험 설정을 그대로 재현하려면 주의할 점이 있다. VoxPolyMem과 그 변형은 화자 식별을 자동으로 수행하는 반면 베이스라인들은 정답 화자 레이블을 받는 조건에서 비교가 이루어졌고, 답변 모델은 GPT-4.1-mini, 검색 정책은 8B Qwen-VL, 메모리 추출은 GPT-4.1-mini로 고정되어 있다. 검색 정책 학습에는 Mem-Gallery 300개, LoCoMo 400개, VoxPolyBench 200개 등 약 900개 QA 인스턴스가 쓰였고, 정답 근거 주석은 학습 시에만 사용된다.
저자들이 명시한 한계도 분명하다. VoxPolyBench는 생성된 대화와 합성 음성으로 만들어졌기 때문에 실제 화자, 억양, 녹음 환경에 대한 강건성을 입증하지 못한다. 음성 임베딩과 신원 연결, 참여자 프로필은 민감 정보를 담을 수 있어 원치 않는 추적이나 노출로 이어질 수 있으며, 실제 배포에는 사전 동의, 접근 제한, 보존 기간 제한, 저장 정보의 정정·삭제 수단이 필요하다고 밝힌다. 또한 벤치마크 성능을 감시나 고위험 신원 판단의 허가로 해석해서는 안 된다고 못박는다. 향후 과제로 음향적·대화적 다양성이 더 큰 실제 음성 상호작용으로 평가를 확장하는 것을 제안한다.