탐색 기록을 리플레이 시뮬레이터로 바꾼 재귀적 자기개선 프레임워크 Dream-RSI
Dream-RSI: Recursive Self-Improvement through Evolving Worlds
무엇인가
이 논문이 다루는 문제는 자율 AI 에이전트의 재귀적 자기개선(RSI)에서 탐색(exploration)을 어떻게 관리하고 개선할 것인가이다. 저자들은 알고리즘 설계, 수학적 최적화, 시스템 설계 같은 영역에서 발견 루프가 이미 성과를 내고 있지만, 목표가 어려워질수록 수천 번의 제안-평가 사이클에 걸친 장기 탐색이 필요해진다고 본다. 이때 기존 시스템은 두 가지 딜레마에 빠진다. 수동으로 설계한 고정 탐색 전략은 검색 공간이 커져도 적응하지 못하고, 온라인 정책 최적화는 메타 수준의 피드백이 지연되고 비싸며 메타 정책 공간 자체가 방대하다. 개별 후보의 품질을 재는 것과 달리 탐색 정책의 품질은 여러 사이클에 걸친 롤아웃을 지켜봐야 드러나므로, 탐색 계층에서 자기개선 루프를 닫기가 매우 어렵다는 것이 논문의 출발점이다.
어떻게 동작하나
핵심 착상은 완료된 발견 이력이 곧 시뮬레이터라는 것이다. 저자들은 과거 탐색 결정과 그 실행 결과를 구조화한 발견 트리(discovery tree)를 리플레이 시뮬레이터, 즉 월드로 재해석한다. 트리의 루트 r은 초기 워크스페이스 상태이고, 루트가 아닌 각 노드는 하나의 부모를 가지며 부모의 저장된 워크스페이스에서 새 시도를 시작해 파일시스템 스냅샷, 생성 산출물, 평가 진단, 점수 s_v를 기록한다. 탐색 정책이 보는 선택 가능 노드 집합은 A(T) = {r} ∪ {T의 리프}이고, 병렬 워커 수 W에 대해 정책의 행동은 |C| ≤ W인 배치 C ⊆ A(T)다. 즉 정책은 어디서 탐색을 이어갈지, 몇 개를 동시에 던질지를 결정한다. Dream-RSI는 이 결정 인터페이스를 명시적이고 프로그래밍 가능하게 만드는 가벼운 오케스트레이션 계층을 두고, 그 아래의 코딩 에이전트와 평가자는 건드리지 않는다.
무엇과 다른가
절차는 세 단계의 루프다. 첫째, 온라인 탐색에서 현재 정책 π_t가 이전 이력 H_{t-1}을 참고해 실제 발견을 수행하고, 최대 K1 라운드 동안 매 라운드 배치를 골라 워커에 배정한다. 워커는 부모 노드의 워크스페이스에서 새 후보를 만들고 평가자가 점수를 매기며, 완성된 자식들이 트리에 붙는다. 롤아웃이 끝나면 최종 트리 T_t를 이력에 추가해 H_t = H_{t-1} ∪ {T_t}로 확장한다. 둘째, 시뮬레이터 구축 단계에서 기록된 트리들이 재사용 가능한 리플레이 시뮬레이터 풀로 변환된다. 셋째, 드리밍 기반 정책 개선 단계에서 M개의 정책 버전 π_t^0 … π_t^{M-1}을 각각 모든 과거 트리 T_i (i = 1…t) 위에서 평가한다. 리플레이는 새 후보를 생성하지 않고 선택된 노드의 기록된 자식을 결정론적으로 드러내며, 최대 K2 라운드, 빈 배치 선택, 또는 모든 노드 공개 시 종료된다. 이때 정책은 각 분기를 얼마나 깊이 파고들지, 시도를 어떻게 병렬 배치로 묶을지, 언제 다른 분기를 열거나 멈출지를 다르게 결정할 수 있다.
어떻게 쓰나
리플레이 목적함수는 발견 품질, 실행 비용, 병렬성을 함께 저울질한다. V_i^m = max_{v∈T_i^{m,⋆}} s_v − β1·N_i^m + β2·N_i^m / max{1, k_i^{m,⋆}}로, 첫 항은 리플레이 중 얻은 최고 점수, 둘째 항은 시도한 생성 횟수 N_i^m에 대한 페널티, 셋째 항은 결정 라운드당 평균 시도 수를 보상하는 병렬성 보너스다. 정책 버전의 점수는 고정된 이력 전체에 대한 평균 V^m = (1/t) Σ V_i^m이고, 정책 개발 에이전트가 리플레이 궤적과 점수, 이전 수정 피드백을 보고 실행 가능한 정책 코드를 고쳐 다음 버전을 만든다. M번 수정 후 m* = argmax V^m인 버전을 다음 온라인 정책 π_{t+1}로 배포한다. 후보 집합에 현재 정책이 포함되므로 V^{m*} ≥ V^0이 보장되고, 따라서 선택된 정책은 고정된 이력 H_t 위에서 평균 리플레이 점수 기준으로 현재 정책보다 나쁘지 않다. 개선된 정책은 다시 온라인에 배포되어 새 발견 경험을 만들고 시뮬레이터 풀을 넓힌다.
전제와 한계
실험은 알고리즘 엔지니어링, 수학적 최적화, GPU 커널 엔지니어링의 세 영역에 걸친 8개 과학적 발견 과제에서 수행됐다. 주 통제 베이스라인은 동일한 발견 에이전트, 평가자, 초기화, 자원 제약을 쓰되 탐색 정책을 고정한 Recursive Fixed Exploration이고, 여기에 과제별 베이스라인을 더했다. 알고리즘 엔지니어링 과제는 Lasso 정규화 경로求解기로, SimpleTES와 같은 17개 합성 인스턴스로 발견하고 생물·비생물 도메인의 6개 홀드아웃 데이터셋으로 일반화를 평가했다. Gemini-3.1 Pro 백본에서 Dream-RSI는 6개 홀드아웃 데이터셋 평균 런타임을 3587.1ms에서 2931.0ms로 줄이면서 발견 에이전트 호출을 550회 대신 317회만 사용했고, Gemini-3.7-Flash에서는 2516.7ms를 2350.6ms로 줄이면서 3200회 대신 1879회를 썼다. 두 경우 모두 sklearn과 glmnet보다 6개 데이터셋 전부에서 우수했고, 51,200 세대를 쓰는 SimpleTES보다 약 두 자릿수 적은 호출로 더 낮은 평균 런타임을 달성했다. 라운드당 예산은 Gemini-3.1 Pro가 병렬 워크스페이스 10개 × 최대 11 리파인먼트 = 110 호출, Gemini-3.7-Flash가 32 × 20 = 640 호출이며, Lasso는 5라운드, 수학 과제는 10라운드를 돌렸다. 초록 기준으로는 SimpleTES 대비 최대 162배, 고정 탐색 베이스라인 대비 1.7배 호출 절감이 보고됐다.
수학적 최적화에서는 Sum-Difference, Circle Packing, Autocorrelation Inequalities 세 과제에서 Gemini-3.1 Pro로 10라운드를 수행해 AlphaEvolve, AlphaEvolveV2, OpenEvolve, CodeEvolve, ShinkaEvolve, TTS-Discovery, ThetaEvolve, EvoX, SimpleTES와 비교했다. Dream-RSI는 Sum-Difference에서 1.145427로 SimpleTES와 Recursive Fixed Exploration을 앞섰고, Circle Packing에서 2.635983으로 비교 방법 중 최강 보고 결과와 동률을 이뤘으며, Autocorrelation에서 1.456375로 경쟁력 있는 수준을 유지했다. SimpleTES가 Autocorrelation에서 최신 결과를 내지만 51,200 세대가 필요한 반면 Dream-RSI는 1,000 세대 미만을 쓴다는 점이 강조된다. GPU 커널 엔지니어링에서는 KernelBench의 VGG16, LayerNorm, ConvDiv, ConvMax 네 과제에서 정확성 검사를 통과한 구현의 역런타임(1/ms)을 측정했는데, VGG16과 LayerNorm은 각각 2.43배, 1.79배 적은 세대로 비슷한 최종 성능에 도달했고, ConvDiv와 ConvMax는 같은 예산에서 각각 2.09배, 1.44배 높은 성능을 냈다.
추가 분석은 실무적으로 시사하는 바가 크다. 과거 궤적을 고수준 방향성 인사이트로 추상화해 프롬프트에 명시적 의미 지침으로 주입하는 방식은, Recursive Fixed Exploration과 Dream-RSI 양쪽 모두에서 같은 예산의 비지도 버전보다 일관되게 성능이 떨어졌다. 병렬 스레드가 여러 개 도는 장기 탐색에서는 미래 탐색 방향에 대한 강한 의미적 편향이 검색 공간을 과도하게 제약해 다양성을 해친다는 해석이다. 또한 ConvDiv에서 학습된 탐색 정책의 진화를 보면 성능이 오르는 구간에서는 평가 시도 수를 110회에서 50회로 줄이며 계산을 아끼고, 진전이 정체되면 다시 탐색 노력을 늘리는 적응 패턴이 나타났다. 개발자 입장에서는 에이전트 파이프라인의 병목을 모델 교체가 아니라 탐색 스케줄링 계층에서 찾아야 한다는 신호이며, 실행 로그를 단순 컨텍스트가 아닌 평가 가능한 리플레이 자산으로 설계해 두는 것이 재사용 가치를 만든다는 점을 확인해야 한다.
전제와 한계도 분명하다. Dream-RSI가 바꾸는 것은 탐색 정책 코드뿐이고 기반 모델, 평가자, 실행 인터페이스는 고정된다. 리플레이는 기록된 부모-자식 순서대로만 분기를 따라가며 T_i 바깥의 결과는 결코 생성하지 않으므로, 시뮬레이터는 이미 관측된 탐색 공간의 부분에 대한 경험적 모델이라는 한계를 갖는다. 정책 선택의 개선 보장도 온라인 성능이 아니라 고정된 이력 H_t 위에서의 평균 리플레이 점수에 대한 것이며, 목적함수는 β1, β2 계수와 K1, K2 라운드 한도, 워커 수 W 같은 하이퍼파라미터에 의존한다. 제공된 본문에는 별도의 한계(Limitations) 절이나 리플레이-온라인 괴리에 대한 정량적 분석이 제시되지 않았고, 실험도 Gemini 계열 백본과 특정 벤치마크 조합에 한정되어 있다는 점을 감안해 읽어야 한다.