ExpVoyager가 과거 경험을 탐색해 에이전트 스킬을 실시간 합성한다
ExpVoyager: Direct Experience Navigation for Dynamic Agent Skill Synthesis
무엇인가
LLM 에이전트를 자기 진화형으로 만드는 핵심은 과거 실행 경험을 재사용 가능한 절차적 지식, 즉 스킬로 바꾸는 것이다. 문제는 기존 방식이 미래 과제의 요구를 알기 전에 경험을 고정된 절차 지식으로 추상화한다는 점이다. 이 논문은 그 결과 나중에 결정적으로 필요해질 지식은 버려지고, 정작 미래 과제와 무관한 인스턴스 특수 디테일은 남는다고 지적한다. 저자들은 스킬 합성을 "과거 경험에 대한 동적 탐색 문제"로 재정의하고, 현재 과제에 맞춰 원본 경험을 능동적으로 찾아 들어가는 ExpVoyager를 제안한다.
어떻게 동작하나
저자들은 이 문제를 실증하기 위해 두 가지 사전 분석을 수행했다. ALFWorld 테스트 과제에서 후보 스킬을 실행해 검증하는 생성-검증 루프를 거쳐 유용성이 확인된 오라클 스킬 80개를 모으고, 훈련셋에서 뽑은 소스 트래젝토리 300개에 오라클 지식 주석을 달았다. 그 결과 사전 구축 스킬을 쓰는 기존 방법 중 가장 좋은 성능을 낸 방법조차 원본 경험에 담긴 오라클 지식의 대부분을 보존하지 못했다. 두 번째 분석에서는 기존 검색 패러다임이 타깃 과제에 필요한 지식을 충분히 끌어오지 못하며, 검색 깊이 k를 키워도 지식 재현율의 한계 이득이 중복·무관 지식에 빠르게 잠식되어 정밀도가 급락한다는 것을 보였다.
무엇과 다른가
ExpVoyager의 구조는 두 축이다. 먼저 스킬 큐레이터에게 원본 경험을 여러 해상도로 노출하는 Navigable Interface를 준다. 트래젝토리 수준 뷰는 순서화된 행동 시퀀스, 실행 결과, 환경 메타데이터로 전체 절차를 압축해 보여주고, 스텝 수준 뷰는 관찰·기록된 추론·실행된 행동·즉각적 결과를 주변 맥락과 함께 보여준다. 큐레이터는 search_exp로 뷰 수준, 필드, 정규식 패턴, 결과 개수를 지정해 새 레코드를 찾고, 매치는 문맥을 보존한 완전한 스텝 또는 트래젝토리 레코드로 반환된다. 더 넓은 맥락이 필요하면 레코드가 가진 소스 참조로 inspect_traj를 호출해 전체 트래젝토리를 시간순으로 펼친다. 즉 검색 단위를 트래젝토리 하나로 고정하지 않고, 조사 목적에 맞는 해상도를 스스로 고르게 한 것이다.
어떻게 쓰나
두 번째 축은 Navigation State다. 매 라운드마다 큐레이터는 새로 관찰한 내용을 해석해 상태 Z_r = (K_r, Q_r)를 갱신한다. K_r은 현재 타깃을 위해 정리된 지식 항목으로, 관찰 중 무엇이 소스 경험에 특수한지, 무엇이 현재 과제로 전이 가능한 절차 관계인지, 무엇이 실행 중 검증이 필요한 조건인지를 구분해 누적한다. Q_r은 아직 해결되지 않은 질문으로, 지식의 공백을 다음 탐색의 구체적 목표로 바꾼다. 예를 들어 과거 트래젝토리에서 물체를 특정 위치에서 찾았다는 관찰은 물체 탐색·이동 절차 지식으로는 쓸 수 있지만, 현재 환경에서도 같은 위치에 있다는 것을 보장하지는 않는다는 식이다. 탐색이 끝나면 큐레이터는 Z_R로부터 skill.md를 합성해 고정된(frozen) 실행자에게 추가 컨텍스트로 넘기고, 미해결 조건은 실행 시점 체크로, 실패 교훈은 주의·복구 지침으로 남긴다.
전제와 한계
실험은 ALFWorld, WebShop, ScienceWorld 세 벤치마크에서 진행됐다. 비교 대상은 스킬 없는 ReAct 에이전트, 사전 구축 스킬 계열인 AWM·ReasoningBank·Trace2Skill, 테스트 시점 스킬 합성 계열인 SkillTTA다. ExpVoyager는 세 벤치마크 모두에서 기존 접근을 앞서고 실행 스텝 수도 줄였다. 큐레이터와 실행자의 백본을 다양하게 바꿔도 성능이 일관되게 올랐고, 작은 큐레이터가 훨씬 큰 실행자의 성능을 끌어올리기도 했다. 구성 요소 제거 실험에서는 전체 63.7% 성공률이 Navigable Interface 제거 시 55.3%, Navigation State 제거 시 58.9%로 떨어졌다. 온라인 자기 진화 설정에서는 경험이 적을 때 이득이 제한적이거나 성능이 오히려 나빠질 수 있었지만, 경험이 쌓일수록 베이스라인은 정체하고 ExpVoyager는 계속 개선되며 격차를 벌렸다. 오프라인 확장 실험에서도 소스 경험이 늘어날 때 베이스라인 성능은 하락한 반면 ExpVoyager는 꾸준히 향상됐다. 사전 구축 스킬과의 결합에서는 기존 스킬을 초기 지식으로 주고 원본 경험을 탐색해 다듬게 하면 베이스라인 성능이 크게 올랐고, 단독 ExpVoyager보다 과제 수행 비용도 줄었다. 에이전트 검색 확장과의 예산 비교에서는 ExpVoyager가 동일 토큰 예산에서 우세했고, 탐색 라운드를 20회까지 늘릴 때 이득이 있었지만 그 이후에는 성능이 하락했다.
개발자 관점에서 이 논문의 실무적 시사점은 경험 저장소를 어떻게 운영할지에 대한 것이다. 실행 로그를 미리 요약해 스킬로 굳히는 파이프라인은 미래 요구를 모르는 상태에서 정보를 버리는 위험이 크고, 경험이 늘어날수록 오히려 스킬 품질이 나빠질 수 있다. 대신 원본 트래젝토리를 보존해 두고 과제 시점에 필요한 뷰와 해상도로 탐색하게 하는 편이 확장에 유리하다. 또한 이미 만들어 둔 스킬을 버릴 필요는 없다. 사전 스킬을 출발점으로 두고 온디맨드 탐색으로 특수화하는 조합이 비용과 성능 양쪽에서 유리하다는 결과는, 기존 스킬 저장소를 유지하면서 탐색 계층만 얹는 점진적 도입 경로를 시사한다. 탐색 예산은 무한정 늘리는 것이 답이 아니라는 점, 즉 20라운드 전후가 실용적 상한이라는 관찰도 운영 파라미터를 정할 때 참고할 만하다.
저자들이 명시한 전제와 한계도 분명하다. 온라인 자기 진화 설정에서 축적된 경험이 적을 때는 이득이 제한적이고 성능이 오히려 저하될 수 있으며, 탐색 라운드를 늘리면 어느 지점부터 성능이 떨어진다. 또한 이 프레임워크는 실행자 모델의 가중치를 바꾸지 않고 스킬이라는 추가 컨텍스트만으로 성능을 올리는 구조이므로, 실행자 자체의 능력 향상을 대체하지는 않는다. 논문 본문에는 별도의 한계 절이 따로 마련되어 있지 않고, 위 내용은 온라인·예산 실험 결과에서 드러난 범위다.