실패를 기억하는 이종 그래프로 소형 언어모델 도구 에이전트의 신뢰성을 높이는 FRESH
Learning from Failures: Heterogeneous Graph Memory for Small Language Model Tool-Using Agents
무엇인가
이 논문은 소형·중형 언어모델을 도구 사용 에이전트의 실행기로 쓸 때 생기는 구조적 실패를 다룬다. 긴 호흡의 상태 기반 환경에서 이런 모델은 필요한 관찰을 건너뛰고, 쓰기 동작을 너무 일찍 수행하고, 실패한 호출을 반복하고, 행동 사전조건을 위반하기 쉽다. 그 결과 잘못된 상태 업데이트, 정책 위반, 되돌리기 어려운 부작용이 발생할 수 있어 신뢰 가능한 도구 실행이 배포의 핵심 난제가 된다. 기존 파인튜닝은 많은 데이터와 연산을 요구하고, 평면 메모리는 실패한 행동을 인과적 맥락이나 안전 조건 없이 검색할 수 있다는 문제가 있다.
어떻게 동작하나
저자들이 제안하는 FRESH는 실패 인식 검색을 경험 구조 이종 그래프 위에서 수행하는 외부 경험 프레임워크다. 학습·개발 단계에서 성공 및 실패 궤적을 모아 도구, 인자, 엔터티, 관찰을 정규화하고 행동 수준의 신용 할당을 한다. 실패한 행동마다 실패 원인, 빠진 사전조건, 대응 복구를 추출해 그래프에 넣는다. 그래프는 과제, 도구, 행동, 관찰, 오류, 사전조건, 복구, 추론 기억, 성공·실패 궤적을 노드로 하고 calls, requires, guards, verified_by, fails_because, fixed_by 같은 관계로 의존성을 표현한다. 예를 들어 예약을 올바르게 읽은 행동은 검증된 증거로 남기고, 자격 확인 전에 취소한 행동은 실패로 표시하며, 빠진 자격 확인을 설명하는 오류 노드와 취소를 보호하는 사전조건 노드, 올바른 읽기-확인-확정-쓰기 순서를 나타내는 복구 노드를 만든다.
무엇과 다른가
검색기는 과제 요청과 상호작용 맥락으로 질의를 만들고, 희소 검색으로 상위 K0 노드와 H홉 타입 이웃을 뽑아 후보 서브그래프를 구성한다. 감독 신호는 환경 피드백에서 자동으로 나온다. 검증된 행동, 성공한 추론 기억, 효과적인 복구, 성공적 쓰기를 지원한 사전조건은 긍정으로, 실패 행동, 반복 호출, 정책 위반, 무관한 기억, 안전하지 않은 패턴은 부정으로 둔다. 예를 들어 '환불 전에 자격을 확인하라'는 반성은 유용한 지침으로 긍정이지만, 실제 조기 환불 행동은 부정 예시다. 이종 GNN은 관계별 메시지 패싱으로 노드 표현을 갱신하고, MLP 점수 s_phi(q_i,v)=MLP(h_v^(L) || q_i || h_v^(L) ⊙ q_i)를 계산한다. 학습 목표는 긍정 노드가 부정 노드보다 높은 점수를 받도록 하는 pairwise ranking 손실 L_rank = -Σ log σ(s_phi(q_i,v+) - s_phi(q_i,v-))와 정규화 항 L_HG = L_rank + λ_reg ||φ||_2^2이다. 이때 검색기만 최적화되고 실행기 언어모델은 동결된다.
어떻게 쓰나
테스트 시에는 경험 그래프와 검색기가 동결된다. 현재 요청과 이력으로 같은 검색 과정을 거쳐 상위 노드를 Do, Avoid, Check, Repair 네 범주로 정리하고, 고정된 문맥 예산 안에서 M_t = Serialize(R_t^Do, R_t^Avoid, R_t^Check, R_t^Repair)라는 압축 메모리 시트로 만든다. 동결된 실행기는 이력, M_t, 도구 스키마를 조건으로 후보 행동을 생성한다. 위험도가 낮은 읽기 행동은 바로 실행할 수 있지만, 상태를 바꾸거나 종료하거나 정책에 민감한 행동은 정책·사전조건 게이트로 보낸다. 게이트는 요구 사전조건 P_t, 실시간 관찰 O_t, 도메인 정책 B_t를 보고 d_t = g(a~_t, P_t, O_t, B_t)를 Allow, Revise, Block, Transfer 중 하나로 결정한다. 학습·개발 중에는 실행 피드백으로 기억 노드 효용을 u_v^(t+1) = (1-β)u_v^t + β Δ(F_t,v)처럼 갱신하고, 새로운 실패 원인·복구·사전조건을 그래프에 삽입해 추가 검색기 학습 쌍을 만들 수 있다. 평가에서는 이 자기진화가 멈춘다.
전제와 한계
실험은 τ-bench의 Airline과 Retail, AppWorld의 normal 및 challenging 분할에서 수행됐다. τ-bench에서는 pass^k를 k=1,2,3,4로 보고하고, AppWorld에서는 Pass Rate와 평균 실행 스텝을 보고한다. 백본은 Llama-3.2-1B-Instruct, Qwen3-8B, Gemma-4-26B-A4B이며 모두 파라미터가 동결된다. 비교 대상은 no-memory, Train-Text, Vector-RAG, Expel, ReasoningBank, Mem0, H-EPM이다. 저자들은 FRESH가 세 실행기 모두에서 전체 최고 성능을 냈다고 주장한다. 특히 약한 Llama-3.2-1B에서 이득이 크고, Qwen3-8B에서는 일부 개별 지표에서 베이스라인이 앞서도 평균 최고를 기록했다고 한다. AppWorld에서는 두 분할 모두 최고 과제 완료율을 보였고 Test-N에서 가장 적은 스텝을 사용했으며 Test-C에서도 경쟁력 있는 실행 효율을 유지했다고 서술한다. 절제 실험에서는 전체 FRESH가 가장 좋았고, 정책 게이트는 Airline에서, 학습된 HGNN 검색기는 AppWorld에서 특히 중요했으며, 실패 기억을 제거하면 일관되게 성능이 떨어졌다. 다만 제공된 본문에는 표 1과 표 2의 구체적인 수치가 포함되어 있지 않아 실제 개선폭은 확인할 수 없다.
개발자 관점에서 FRESH는 파인튜닝 없이 소형 모델의 도구 사용 신뢰성을 올리는 외부 기억 설계로 읽힌다. 로컬·온프레미스·대규모 서빙에서 모델 파라미터를 고정한 채 정책 민감한 상태 변경 작업을 다룰 때 유용하다. 구현 시에는 그래프 구축 품질, 실패 원인·복구·사전조건 추출의 정확도, 검색기 학습에 쓰는 긍정·부정 라벨이 환경 피드백과 얼마나 잘 맞는지, 게이트 규칙이 실제 도메인 정책을 충분히 반영하는지, 효용 갱신이 학습·개발 단계에만 머무는지, 평가 시 그래프와 검색기가 동결되어 정보 누출이 없는지를 확인해야 한다. 또한 압축 메모리 시트의 문맥 예산과 게이트 호출이 추가 지연·비용을 만든다는 점도 배포 전에 측정해야 한다.
저자들이 명시한 전제는 평가 시 경험 그래프와 검색기를 동결해 held-out 테스트 과제로부터 정보가 새지 않게 하고, 자기진화 루프는 학습·개발 단계에서만 허용한다는 것이다. 게이트는 자동 실행이 부적절하거나 사람 개입이 필요하면 Transfer로 과제를 넘긴다. 제공된 본문에는 별도의 한계 절이 없고, 표의 구체 수치도 제시되지 않아 어떤 조건에서 얼마나 개선되는지는 정량적으로 판단할 수 없다. 따라서 실제 도입 전에는 자신의 도메인 정책과 도구 스키마에서 실패 그래프가 충분히 포괄적인지, 게이트의 Block·Transfer가 과도한 중단을 만들지 않는지 검증해야 한다.
관련 논문
- 다자 대화 기억의 발화자 귀속과 상태 재구성을 위한 이중 트랙 메모리다자간 대화의 장기 메모리를 발화자 귀속과 관계 이해, 상태 재구성 문제로 정의하고, 발화자 라벨 원문과 인물·그룹 상태를 이중 트랙으로 저장하는 SpeakerMem-R1을 제안한다. 벤치마크에서 최고 수준 결과를 보고하며, RL이 구조화 메모리 작성 정확도를 높인다.
- 읽기 시점에 과제별로 기억을 조립하는 LLM 에이전트 메모리, JitMemLLM 에이전트의 기억을 쓰기 시점이 아니라 읽기 시점에 현재 과제에 맞게 압축하는 JitMem을 제안한다. ALFWorld, WebShop, τ²-bench에서 기존 write-time 메모리보다 최대 16.3%p 높은 성공률을 보고했다.
- 도구 응답 예측 대신 에이전트의 추론-행동을 판정·수정해 장기 과제 오염을 막는 AEWMLLM 에이전트의 장기 작업에서 누적되는 작업 상태 오염을 다루며, 툴 응답을 예측하는 대신 추론·행동이 미래 작업 진행에 미치는 영향을 모델링하는 AEWM과 EditAct를 제안한다. 기존 언어 월드 모델이 환경 관측을 예측하는 방식과 달리 실제 실행 피드백을 활용해 의사결정 기반 상태를 직접 바꾸는 접근으로, 여러 벤치마크에서 개선을 보고한다.
- RAFT는 트러블슈팅 이력을 단계별로 검색하는 상태 기반 RAG다.기업 고객 지원 문제 해결 에이전트를 위해 종료된 사례를 시간순 항목 체인으로 구조화하고 항목 단위로 검색하는 상태 기반 RAG 프레임워크 RAFT가 제안됐다. 기존 RAG가 사례를 정적 문서로 취급하며 놓쳤던 다단계 흐름을 겨냥한다.
- 16일·8개 세계 멀티에이전트 적대적 스트레스 테스트에서 모델 정렬≠시스템안전이다상시 배포된 다중 에이전트의 실패가 메모리·도구·다른 에이전트·환경 상태로 전파되는 문제를 다룬다. 동일 조건에서 10개 에이전트로 구성된 8개 월드를 병렬로 돌리는 상시 가동 적대적 스트레스 테스트 환경 Emergence World를 제안한다.