새 환경을 스스로 탐색해 재사용 가능한 기억을 쌓는 멀티에이전트, RSIAgent
RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
무엇인가
이 논문이 다루는 문제는 디지털 에이전트가 프리트레인 지식만으로는 인터페이스, 도구, 관례, 실패 모드가 온전히 커버되지 않는 새 환경에서 작업해야 한다는 점이다. 기존 적응 방식은 추가 상호작용 데이터를 모아 재학습하는 쪽에 기대며, 종종 사람의 도움을 필요로 한다. 효과는 있지만 비용이 크고, 사설 환경이나 계속 변하는 환경에는 적용하기 어렵다. 저자들은 학습 없는 적응(training-free adaptation)을 문맥 관리로 수행하는 대안에 주목하면서, 단순히 성공 궤적을 외우는 것을 넘어 행동, 환경 조건, 결과 사이의 안정적인 인과 관계를 발견하고 이를 재사용 가능한 인과 구조로 조직해야 한다고 주장한다. 그래서 던지는 핵심 질문은 이것이다. 에이전트가 새 환경에서 인과 관계를 스스로 발견해 재사용 가능한 기억으로 만들고, 그것으로 자신을 개선할 수 있는가.
어떻게 동작하나
방법의 골격은 세 역할로 나뉜 멀티에이전트 하네스다. 액터 에이전트는 주 정책 모델로 환경을 이해하고 실행 가능한 행동을 생성하며, 환경 특화 지식과 재사용 가능한 절차·스크립트, 이전 실행에서 얻은 교훈을 담는 지속적 기억을 갖는다. 이 기억은 진화한다. 검증 에이전트가 결과를 평가한 뒤 액터가 근거 있는 경험을 통합해 새 지식을 추가하고, 오래된 정보를 수정하거나 제거한다. 검증 에이전트는 독립 평가자로 실행 결과, 인터페이스 상태 등 환경 피드백을 직접 확인해 성공·실패 판정과 근거를 반환하며, 액터의 사적 추론과 기억으로부터 격리되어 상관된 오류를 줄인다. 커리큘럼 에이전트는 고수준 조정자로, 현재 목표와 누적 기억, 이전 탐색 결과를 바탕으로 선수 기술, 정보성 있는 변형, 실패 기반 연습, 스트레스 테스트 케이스를 골라 다음에 무엇을 탐색할지 정한다. 생성된 과제가 더 이상 실질적 새 지식을 주지 않을 것 같으면 탐색을 멈춘다. 구현은 코드-애즈-정책(code-as-policy) 형태로, 각 행동은 실행 가능한 프로그램이다. 형식화하면 a_t ~ π_θ(·|q, h_t, M), (s_t, o_t) ~ E(·|s_{t-1}, a_t)이며, 상호작용 이력 h_t는 과제가 바뀌면 초기화되지만 기억 M은 과제를 넘어 유지된다.
무엇과 다른가
탐색은 두 단계다. 1단계 넓은 재귀 자기탐색(BRS)은 새 환경에 대한 넓은 이해를 빠르게 쌓는 것을 목표로 한다. 커리큘럼 에이전트가 서로 다른 탐색 방향을 아우르는 여러 과제를 한 번에 제안하고, 액터들이 병렬로 실행하며, 검증 에이전트들이 결과를 평가한다. 궤적과 검증된 피드백을 모은 뒤 커리큘럼 에이전트가 남은 지식 공백을 식별해 다음 반복에서 더 정보성 있는 과제를 만든다. 2단계 깊은 재귀 자기탐색(DRS)은 실행 중 드러난 중요한 지식 공백, 어려운 케이스, 경계 조건을 파고드는 단계로, 난이도를 점진적으로 높이는 순차 루프를 돈다. 커리큘럼 에이전트가 예측 불가능한 문제나 숨은 제약, 현재 기억의 약점을 드러낼 만한 도전 과제를 제안하면, 액터가 누적 기억을 활용해 시도하고 검증 에이전트가 근거 있는 피드백을 준다. 그 성공·실패·새로 드러난 불확실성을 바탕으로 다음 반복에서 더 어려운 후속 과제를 생성하며, 검증된 경험은 다음 과제가 제안되기 전에 기억에 통합된다. 탐색이 끝나면 기억은 동결되고, 테스트 시점에는 커리큘럼 에이전트와 모든 기억 갱신이 비활성화된 채 액터가 저장된 절차·발견된 제약·실패 교훈을 그대로 재사용하고, 검증 에이전트가 요구사항 충족을 확인할 때까지 행동-검증 루프를 반복한다.
어떻게 쓰나
실험은 OSWorld 2.0(0808 오프라인) 82개 과제와 Agent's Last Exam(ALE) Near-term 67개 과제에서 수행했고, 지표는 부분 점수(partial score)와 전 과제 만점 비율인 이진 정확도(binary accuracy)다. GLM-5.3이 기본 액터, Kimi-K3가 별도 문맥의 검증자이자 커리큘럼 에이전트를 맡았다. BRS는 명목 예산 8개 탐색 프로젝트에 최대 4개 동시 실행, DRS는 커리큘럼 에이전트가 더 이상 유용한 연습이 필요 없다고 판단할 때까지 순차 진행한다. 결과적으로 OSWorld 부분 점수는 71.97에서 78.98로, 이진 정확도는 37.80에서 42.68로 올랐다. ALE는 부분 점수 83.75에서 84.82, 이진 정확도 49.25에서 50.75로 개선됐다. 저자들은 이 수치가 GPT-6 Astra보다 각각 6.38%포인트, 2.56%포인트 높고 Claude Opus 5보다도 두 벤치마크 모두에서 앞선다고 보고한다. 즉 모델 파라미터를 갱신하지 않고도 오픈소스 모델이 프런티어 폐쇄형 모델을 앞지를 수 있다는 주장이다.
전제와 한계
세부 결과도 제시된다. OSWorld 2.0의 T044(영상 편집), T049(프레젠테이션 복구), T065(철도 예약)에서 스텝 8 기준 부분 점수가 각각 100%, 80%, 100%에 도달했고, BRS가 다양한 절차와 환경 지식을 쌓은 뒤 DRS가 과제 특화 세부를 다듬으면서 병목이 풀릴 때 점수가 계단식으로 뛴다고 설명한다. 절제 실험은 T080(WPS 스프레드시트 복구), T085(REAPER 오디오 편집), T089(브라우저 기반 프레젠테이션 복구), T106(3D Slicer 간 분할)에서 수행했는데, 전체 RSI의 평균 점수는 74.54%로 넓은 탐색만 쓴 경우 65.52%, 깊은 탐색만 쓴 경우 56.50%를 앞섰다. 넓은 탐색만 쓴 변형은 모든 과제에서 베이스라인을 넘었지만, 깊은 탐색만 쓴 변형은 T085와 T089에서 베이스라인 아래로 떨어졌다. 게임 환경 실험에서는 GameCraft-Bench에서 무작위로 뽑은 40개 과제로 반복 플레이테스트와 코드 수정 기반 베이스라인 Play2Code와 비교했는데, RSIAgent는 약한 생성기와 강한 생성기 모두에서 게임 품질을 일관되게 개선한 반면 Play2Code는 기반 게임이 강해질수록 이득이 줄고 이미 품질이 높은 게임을 오히려 퇴화시킬 수 있었다.
한국 개발자 입장에서 이 논문의 실무적 의미는 분명하다. 사내 도구나 낯선 SaaS처럼 프리트레인 지식이 잘 맞지 않는 환경에 에이전트를 붙일 때, 파인튜닝 대신 탐색 단계에서 기억을 만들어 동결하고 추론 시 재사용하는 패턴을 쓸 수 있다는 것이다. 다만 비용 구조를 봐야 한다. 개선의 대가는 테스트 시점의 추가 탐색 연산이며, 성능은 유한한 탐색 예산과 정지 정책, 학습된 기억의 품질에 좌우된다. 또 검증 에이전트가 모델 기반이라는 점이 핵심 리스크다. 검증이 틀리면 그 오류가 이후 탐색과 기억 갱신으로 전파된다. 따라서 도입 시에는 검증 신호를 환경 피드백에 얼마나 단단히 접지했는지, 기억에 조건과 불확실성이 보존되는지, 정지 기준이 언제 발동하는지를 먼저 확인해야 한다.
저자들이 밝힌 한계는 네 가지다. 첫째, 재귀적 자기개선은 추가 테스트 시점 탐색과 연습을 요구해 상당한 계산 비용을 유발할 수 있다. 둘째, 성능이 유한한 탐색 예산, 정지 정책, 학습된 기억의 품질에 의존한다. 셋째, 모델 기반 검증 에이전트가 잘못된 판정을 내리면 그것이 이후 탐색과 기억 갱신으로 전파된다. 넷째, 환경마다 필요한 도구와 검증 신호, 탐색 전략이 다르며, 현재 실험은 모든 구성 요소의 기여도를 완전히 분리해 내지 못한다. 실패 모드 분석에서는 목표에 충분히 겨냥되지 않은 탐색, 불완전한 검증, 신뢰할 수 없는 기억 통합이라는 세 가지 메커니즘을 지목한다. 예컨대 검증자가 공식 루브릭상 근거 없는 필드 값이나 산출물 불일치에도 PASS를 반환하거나, 액터가 결측 표식을 유효한 답으로, 정보 없음을 부정 답변으로 해석하는 규칙을 기억에 남겨 이후 시도에서 그대로 재사용하는 사례가 보고된다. 윤리적으로는 의도치 않은 행동, 무단 접근, 프라이버시 유출 위험이 있어 실험은 허가된 도구와 데이터 접근이 보장된 통제 환경에서 수행했다고 밝힌다.