EpiCon이 에이전트 간 멀티모달 경험 공유로 파라미터 없이 성능을 올린다
EpiCon: Collective Agent Learning through Co-Evolving Multimodal Memory
무엇인가
이 논문이 푸는 문제는 에이전트가 남긴 실행 경험이 다른 에이전트에게는 쓸모없이 버려진다는 점이다. LLM 기반 다중 에이전트 시스템(MAS)은 해결 절차, 실패 모드, 관련 근거에 대한 경험을 쏟아내지만, 이를 다음 추론에 활용하려면 보통 호스트 모델 파라미터를 갱신해야 한다. 저자들은 하네스(Codex, DeepSeek-Harness)나 백본(Qwen3.8-27B, Gemma4-31B)이 달라져도 재사용되고, 경험을 제공한 시스템 자신도 나중에 그 축적분의 이득을 다시 받는 구조를 목표로 삼는다.
어떻게 동작하나
EpiCon의 구조는 전용 메모리 하네스와 독립적으로 학습된 두 개의 2B 모델로 이뤄진다. 메모리 컨트롤러 C_θ는 질문 하나 안에서 텍스트 지침과 시각 근거를 함께 고쳐 나가고, 트리 자기조직화 모델 S_φ는 질문을 넘어 지속되는 경험 뱅크 B를 관리한다. 뱅크는 MAS와 독립적으로 유지되며, 질문 x_i에 대해 조직화 모델이 경험 R_i를 한 번 검색하고 MAS가 답과 실행 트레이스 τ를 만든다. 뱅크 갱신은 B(k+1) = S_φ(B(k), U_k)로, 여기서 k는 개별 질문이 아니라 유지보수 단계이고 한 단계가 여러 교훈을 함께 처리한다.
무엇과 다른가
질문 수준 메모리는 W = (M_text, M_vis)로 표현된다. 텍스트는 실행 가능한 지침·적용 조건·주의사항을 담고, 시각 메모리는 원본 이미지의 근거 영역을 가리킨다. 새 시도가 생기면 컨트롤러가 이전 메모리, 질문과 이미지, 최신 답, 실행 트레이스를 받아 텍스트·이미지·영역을 함께 갱신하며, 지침이 바뀌면 시각 근거를 유지·교체·삭제할 수 있다. 이때 게이트 g∈{0,1}이 다음 시도에 시각 메모리를 넣을지 결정하는데, 이는 저장된 시각 메모리를 지우는 것이 아니라 입력에 포함할 내용만 고르는 장치이고, 현재 질문의 원본 이미지는 어느 경우든 계속 제공된다.
어떻게 쓰나
뱅크 쪽은 트리로 교훈을 조직한다. 잎은 질문별 교훈을, 내부 노드는 관련 경험을 묶고 요약한다. 유지보수 시 조직화 모델이 Place, Merge, Split + Lift, Consolidation 연산을 제안해 범주 배정, 그룹 병합, 광범위 그룹 분리, 공통 절차와 조건 요약을 수행하고, 하네스가 이를 검증·실행하며 용량 기반 분할을 강제할 수 있다. 내부 노드는 근거가 충분하면 재사용 가능한 규칙이 된다. 검색은 R_i = S_φ^retrieve(x_i, Recall(x_i, B))로, Recall이 동결된 텍스트 인코더로 후보를 뽑고 조직화 모델이 적용 가능한 규칙, 구체 경험, 또는 아무것도 선택하지 않는다.
전제와 한계
학습 데이터는 Qwen3.8-27B를 초기 교사로, Qwen3.8-Flash-Next를 선택적 개선용으로 써서 두 개의 감독 데이터셋을 만든다. MathNet, MathV360K, ChartQA, InfoVQA, DocVQA, ChartNet에서 CAMEL·Codex·DeepSeek-Harness 실행 궤적을 모으고, 실패한 시도를 성공으로 바꾸는 Repair 변환과 성공을 유지하며 텍스트를 줄이는 Compress 변환을 리플레이로 검증해 약 25K개의 컨트롤러 감독 예시를 남긴다. 트리 조직화는 스키마·노드 참조·분할·출처 검사를 통과한 약 6.5K개 연산 시연으로 학습된다.
실험은 문서 이해, 시각-코드 생성, 시각 근거 수학, 일반 시각-언어 추론의 네 영역에 걸친 11개 벤치마크 4,538개 질문에서 이뤄진다. 비교 대상은 No Memory, Mem0, Cognee, A-Mem, Agent-KB다. 모든 평가는 질문당 단일 해결 시도로 하고 질문 수준 메모리 갱신을 끄며, 1,000개 구성 질문으로 각자 뱅크를 만든다. 백본 크기 EpiCon은 네 가지 호스트 구성 모두에서 11개 벤치마크 매크로 평균 1위를 차지했고, 각 구성에서 가장 강한 외부 메모리 베이스라인을 1.9~5.9점 앞섰다. Codex + Qwen3.8-27B에서는 ParseBench가 57.1에서 68.5로, MATH-Vision이 20.4에서 48.6으로 올랐다. 2B 변형은 매크로 평균이 0.9~3.6점 낮은 대신 메모리 연산 시간을 약 67~74%, 전체 시간을 25~35% 줄이면서도 No Memory 대비 1.7~4.9점 향상을 유지한다. WorldBench는 네 구성 모두에서 +3.2~+7.8점이었지만 ReasonMap(+0.5~+1.9)과 BabyVision(−2.7~+4.8)은 작거나 일관되지 않았다.
경험 전이는 Codex + Qwen3.8-27B가 만든 뱅크를 Codex + Gemma4-31B와 DeepSeek-Harness + Qwen3.8-27B가 그대로 재사용하는 방식으로 측정한다. 백본 전이 +3.2점, 하네스 전이 +4.2점의 매크로 평균 향상이 나왔고, 백본 전이에서 MATH-Vision이 25.8에서 33.0으로, 하네스 전이에서 ParseBench가 52.4에서 65.7로 올랐다. 다른 하네스가 뱅크를 확장했을 때 원래 만든 쪽의 성능도 올라 Codex는 53.5에서 55.7로, DeepSeek-Harness는 53.4에서 56.6으로 개선됐다(각 +2.1, +3.2점, 11개 중 8개와 9개 벤치마크 향상). 다만 효과는 과제 의존적이어서, DeepSeek-Harness가 확장한 뒤 Codex의 ParseBench는 63.4에서 58.9로 떨어졌고 MATH-Vision에서 DeepSeek-Harness는 56.6에서 53.4로 하락했다.
어블레이션에서 트리 뱅크는 평면 뱅크보다 모든 점수가 높았고(ParseBench 52.2→67.3, BabyVision 13.2→15.3), 적응적 시각 메모리 주입은 8개 중 7개 점수를 올리면서 Codex 실행 시간을 약 25%, DeepSeek-Harness를 약 17% 줄였다. GPT-5.6-Luna를 쓴 Codex에서도 4개 벤치마크 모두 향상됐다(ParseBench 63.8→66.5). 저자들이 밝힌 전제와 한계는 분명하다. 트리 연산은 스키마·참조·분할·출처 검사로 구조적 타당성만 확인했고 다운스트림 리플레이로 개별 연산을 검증하지 않았다. 교차 하네스 진화의 이득은 과제와 기여 시스템에 따라 달라 일부 벤치마크는 오히려 떨어진다. 평가 중 뱅크와 모델 파라미터는 동결되고, 참조 답안은 오프라인 채점에만 쓰인다.