Remory가 요약 뒤에 학습된 잔차 메모리 토큰을 붙여 컨텍스트 압축 손실을 줄인다
REMORY: Learning Residual Memory for Context Compaction
무엇인가
장기 실행 에이전트는 유한한 컨텍스트 창 안에서 계속 일해야 하므로 관찰·도구 출력·결정이 쌓이면 이력을 압축한다. Claude Code나 Codex CLI의 /compact처럼 이전 상호작용을 텍스트 요약으로 대체하는 방식이 흔하고, 입력 길이는 상호작용과 함께 늘었다가 압축 시점에 떨어지고 다시 늘어나는 톱니 모양을 그린다. 논문이 지적하는 문제는 요약이 메인 흐름을 보존하더라도 이후의 모든 결정을 뒷받침한다는 보장이 없다는 점이다. 과제가 진행되면서 이전 맥락의 관련성이 바뀌기 때문에, 요약 너머로 필요한 정보를 미리 식별하거나 열거할 수 있다고 가정하지 않는다. 저자들은 인간의 작업 기억이 소수의 청크만 유지하면서도 장기 기억에 접근해 복잡한 프로젝트를 수년간 이어가는 점, 그리고 부분 단서가 과거 경험의 분산 표상을 재활성화하는 해마 색인 이론을 비유로 든다.
어떻게 동작하나
제안 방법인 Remory는 요약에 덧붙이는 신경 메모리 네트워크다. 압축 경계 i에서 H_i는 이전 요약과 잔차 메모리, 그리고 마지막 경계 이후의 상호작용을 담는다. 새 요약 S_i가 주어지면 메모리 네트워크가 M_i = C_φ(H_i; S_i), |M_i| ≤ m 을 만들어낸다. M_i는 동결된 액터의 입력 공간에 있는 벡터 열이며, [S_i; M_i] 결합은 시퀀스 차원을 따라 놓인 잔차 연결의 유사물로 작동한다. 액터는 고정 지시문, 이 시퀀스, 그리고 새 상호작용을 차례로 읽고, 이후 압축에서도 같은 과정이 반복되어 메모리가 경계를 넘어 정보를 운반한다. 구조적으로는 동결된 액터 특징과 학습된 쿼리로 메모리 벡터를 병렬 예측하고, 요약에 대한 게이트 교차 어텐션을 쓴다. 최대 1,024개 소스 위치 블록마다 64개의 소프트 토큰을 만들고, 계층적 압축으로 최종 메모리를 소스 순서를 유지한 채 4,096 슬롯으로 제한한다. Qwen3.8-27B에는 DFlash를, GLM-5.3-Flash에는 그룹 동적 합성곱을 쓴 DFlash-2를 적용해 각각 1.94B, 1.502B개의 학습 가능 파라미터를 갖는다. 출력은 어휘 토큰이 아니라 연속 메모리이며, 정확한 기록은 기존 아카이브와 파일 검색 도구로 접근한다.
무엇과 다른가
학습은 두 단계다. 1단계 재구성에서는 교사가 소스 구절과 이를 반복하라는 지시를 받고, 학생은 구절을 소프트 메모리로 대체한 뒤 같은 지시를 받는다. 둘 다 소스 텍스트를 예측하며, MMFineReason-Full-2.3M의 텍스트 필드를 사용한다. 2단계 요약 조건부 연속에서는 교사가 원래 상호작용 이력을, 학생이 해당 이력으로 만든 고정 요약과 메모리를 받고 둘 다 동일한 후속 어시스턴트 응답을 예측한다. 메모리 인코더는 미래 응답을 절대 보지 못하며, Open-PerfectBlend 프롬프트를 포함한 추론·코딩 궤적과 미리 계산된 요약, Qwen 생성 응답을 선행 맥락 길이 순 커리큘럼으로 쓴다. 두 단계 모두 같은 동결 액터를 공유하고, 학생에서 교사로의 역방향 KL로 전체 어휘와 전체 응답에 걸친 손실을 최적화하며 앞쪽 위치에 약간 더 큰 가중치를 준다. 갱신되는 것은 φ뿐이다. 2단계에서는 요약이 이미 주어져 있으므로 메모리는 남은 예측 격차를 겨냥하며, 요약 내용과 겹쳐도 되고 생략된 모든 사실을 복원할 필요는 없다.
어떻게 쓰나
SummHay 실험은 10개 컬렉션의 92개 쿼리를 Qwen3.8-27B로 평가하며, 원본 컨텍스트, 요약 단독, 동일 예산의 텍스트 보충을 붙인 summary++, 요약+잔차 메모리 네 조건을 비교한다. 액터·쿼리·디코딩·기본 요약은 압축 조건들에서 고정되고, 답변 생성에는 도구나 아카이브 접근, 소스 검색이 없다. 잔차 메모리는 인용 F1을 4.04점, 결합 점수를 3.55점 올렸고 커버리지 변화는 0.40이었다. 결합 점수 이득의 95% 부트스트랩 구간은 [+0.74, +6.21]이다. 두 요약 조건이 공통으로 커버한 553개 인사이트에서도 인용 F1은 57.31에서 61.41로 올랐다. 커버리지가 거의 그대로인데 귀속이 더 크게 개선된 것은 메모리가 복원된 주장을 근거에 연결하는 데 도움을 준다는 해석을 뒷받침한다. 평균 입력은 원본 96,872 위치, 요약 단독 1,393, 요약+메모리 5,024로, 마지막 조건은 원본의 5.2% 위치만 쓰고도 결합 점수에 근접했다. 같은 예산을 생성 텍스트에 준 summary++는 요약 단독에 가까이 머물렀다.
전제와 한계
에이전트 벤치마크는 BrowseComp 1,266개, Terminal-Bench 2.1 89개, AutomationBench 600개(Qwen, 5회 실행), JobBench 65개(Qwen, 5회 실행) 전체 태스크로 평가했다. 액터 내 비교는 가중치, Codex CLI 하네스, 프롬프트, 도구, 디코딩, 예산, 압축 정책을 고정하고 두 구성 모두 정확한 이력을 검색할 수 있게 했다. Qwen과 GLM의 컨텍스트 창은 각각 262,144와 100만 위치이며, 개입은 압축 시점에 최대 4,096개의 잔차 슬롯을 추가한다. Qwen은 AutomationBench에서 9.8점, JobBench에서 7.6점, Terminal-Bench에서 4.5점, BrowseComp에서 3.0점 올랐고, GLM은 Terminal-Bench 3.3점, BrowseComp 4.1점 올랐다. 즉 더 강한 액터와 더 큰 컨텍스트 창에서도 개선이 유지된다. 반복 도구 출력은 네 액터-벤치마크 조합에서 17.9~29.8% 줄고 오류는 25.3~49.7% 줄었다. 생성 비용은 JobBench를 빼고 모든 비교에서 감소했는데, JobBench는 점수가 오르는 대신 태스크당 3.09달러에서 3.21달러로 늘었다.
압축 직후 첫 행동도 따로 봤다. Qwen BrowseComp 궤적 100개에서 뽑은 488쌍의 다음 행동에 대해 고정 프롬프트와 요약을 두고 GPT-5.6-Sol이 익명화된 행동을 평가했는데, 잔차 조건이 345승(70.7%), 21무(4.3%), 122패(25.0%)를 기록했다. 사례 연구로는 같은 컨텍스트 정책을 쓰는 두 Qwen 모의투자 계좌가 9월 23일 기준으로 잔차 없이 ROI -11.86%, 잔차 사용 시 +5.11%를 기록했고 생성 비용은 303.81달러와 170.30달러였다. 압축은 56회에서 45회로, 응답 수는 5,336에서 3,013으로 줄었고 평균 라이브 컨텍스트는 메모리를 포함해 105,372에서 101,185 위치로 감소했다. Terminal-Bench 셀 세그멘테이션 과제에서는 압축 전 리팩터가 헬퍼 함수를 삭제했고 요약이 정확한 편집 명령을 생략했는데, 요약과 메모리가 있는 액터가 두 파일을 다시 읽고 헬퍼를 복원해 9개 검증 테스트를 모두 통과했다.
개발자 관점에서 이 논문이 건드리는 지점은 압축 정책 자체가 아니라 요약 뒤에 붙는 슬롯이다. 액터 가중치를 바꾸지 않고 별도 네트워크만 학습시켜 인터페이스를 맞추며, 정확한 기록 접근은 기존 아카이브·파일 검색에 그대로 맡긴다. 따라서 이미 요약 기반 컴팩션을 쓰는 하네스에 비교적 국소적인 변경으로 얹을 수 있다는 것이 저자들의 주장이다. 다만 도입 전에 확인할 것은, 비용 추정이 액터와 요약 토큰만 가격을 매기고 소스 특징 인코딩과 메모리 네트워크 실행, 도구 비용을 제외한다는 점, 메모리가 최대 4,096 슬롯으로 상한이 걸려 있다는 점, 그리고 메모리가 요약에 조건화되므로 요약 품질이 나쁘면 보완 능력도 제한된다는 점이다.
저자들이 명시한 전제와 한계도 분명하다. 메모리는 요약 내용과 겹칠 수 있고 생략된 모든 사실을 재구성할 필요가 없으며, 2단계에서는 요약이 이미 주어져 있어 메모리가 남은 예측 격차만 겨냥한다. 첫 행동 평가는 제안된 행동에 대한 판단일 뿐 그 반사실적 행동이 실제로 낳았을 결과의 측정이 아니다. 라이브 트레이딩 두 궤적은 시장 선택과 타이밍이 달라 수익 비교에는 제한이 있고, 셀 세그멘테이션 사례는 어떤 생략된 세부가 메모리에서 왔는지 입증하지 못한다. 비용 수치는 2026년 9월 미캐시 제공자 요율로 액터와 요약 토큰만 계산한 토큰 가격 기준 생성 비용이며, 전체 실행 비용이 아니다.