재귀적 자기개선과 반복적 정책개선을 하나의 순환으로 묶는 GAI 프레임워크
Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement
무엇인가
이 논문은 재귀적 자기개선(RSI)을 하나의 형식적 틀로 설명하려는 시도다. 문제의식은 분명하다. RSI는 여러 규모에서 주장되고 있지만, 어떤 시스템이 실제로 자기 자신을 개선하는지 판정할 기준이 없다. 고전적 대응물인 반복적 정책 개선에는 GPI(일반화된 정책 반복)라는 잘 정리된 프레임워크가 있으나, GPI는 개선 메커니즘과 보상이 모두 에이전트 바깥에 있다는 전제 위에서만 성립한다. 재귀적 자기개선에서는 그 전제가 깨지는데, 그 경우를 같은 수준의 형식으로 다루는 체계가 없었다는 것이 저자들의 진단이다.
어떻게 동작하나
제안하는 GAI(Generalized Agent Iteration)는 시스템을 다섯 구성요소의 튜플 χ = (π, V, m, U, ρ)로 정의한다. π는 세계 행동을 고르는 정책, V는 정책을 평가하는 행동 비평자, m은 시스템이 어떻게 바뀌어야 하는지 제안하는 수정자(modifier), U는 제안된 변경이 목표 G에 봉사하는지 평가하는 수정 비평자, ρ는 비평자들이 기준으로 삼는 평가 기반이다. 이 중 수정 가능한 부분의 집합 Ag를 에이전트라 부르고, 에이전트 인스턴스 ξ를 시스템에 끼워 넣는 것을 χ[ξ]로 쓴다. 학습 과정은 두 연산의 순환으로 모델링된다. 에이전트 평가에서는 비평자가 평가 기반 ρ에 비추어 에이전트 부분을 채점하고, 에이전트 개선에서는 수정자가 새 에이전트 인스턴스 ξ ~ m(·|χ)를 제안하면 시스템이 이를 채택해 χ ← χ[ξ]로 이동한다.
무엇과 다른가
이 순환에서 인스턴스를 구분하는 것이 두 개의 다이얼이다. 첫째 다이얼은 개선 메커니즘 m이 에이전트 안에 있는지다. m이 Ag에 속하지 않으면 m의 내용이 고정되어 외부 개선 연산자 역할을 하고, 이것이 GPI다. 이때 Ag = {π, V}이고 갱신은 V ← E_m(V, π; ρ_V), π ← I_m(V)로, 유한 MDP에서 최적 정책으로 수렴한다. m이 Ag에 속하면 시스템이 자기 수정자를 다시 쓸 수 있고, 재귀가 m에서 닫히며 외부 메타 계층이 없다. 이것이 RSI다. 이때 갱신은 정책 수준 갱신에 더해 ξ ~ m(·|χ), χ ← χ[ξ], m′ ← (ξ)_m, U′ ← (ξ)_U로 이어진다. 둘째 다이얼은 평가 기준 ρ가 외부에 근거(grounded)되어 있는지다. 기준이 에이전트 바깥에 고정되면 Anchored, 에이전트가 기준을 다시 쓸 수 있으면 Goal Drift, 외부 기준이 아예 없으면 완전 자기참조(fully self-referential)다. 저자들은 자기개선자가 갖추어야 할 내적 구조를 두 개의 자기일관성 조건으로 제시한다. 수정 비평자가 기반에 맞게 보정되어야 한다는 조건 U(χ) = E_{ξ~m(·|χ)}[ρ_U(χ,ξ) + γU(χ[ξ])]와, 수정자가 비평자의 추정에서 개선되는 인스턴스만 제안해야 한다는 조건 supp m(·|χ) ⊆ argmax_ξ [ρ_U(χ,ξ) + γU(χ[ξ])]이다. 중요한 것은 이 조건들이 강제되는 갱신이 아니라 서술적 성질이라는 점이다.
어떻게 쓰나
실험이나 벤치마크 결과는 이 논문에 없다. 형식적·개념적 기여를 하는 논문으로, 저자들 스스로 정의가 도달 가능성이나 복잡도 주장을 담지 않는다고 밝히고, 결함이 실증되는 경우에는 측정 대신 해당 시스템을 인용한다고 명시한다. 원문에 등장하는 유일한 수치는 Meng 등(2026)의 벤치마크 인용으로, 에이전트가 고정된 목표 모델과 고정된 외부 평가 아래에서 자기 학습 데이터 전략을 수정하는 설정에서 첫 유효 시도에서 개선된 경우가 58.33%인 반면, 최고 점수를 넘어 계속 탐색한 경우의 78.26%가 최종 시도에서 더 낮은 점수로 끝났다는 것이다. 저자들은 이를 개선 단계가 단조적이지 않다는 근거로 쓴다.
전제와 한계
논문은 RSI의 결함을 GPI가 보장하던 조건이 하나씩 깨지는 지점으로 정리한다. 첫째, 후보 자기 자신들에 대한 탐색 문제다. 개선 단계는 무한한 내용 공간에 대한 argmax인데, 어떤 후보가 최선인지 결정하는 일반 절차가 없다. 괴델 머신의 증명 게이트가 대표적 우회책이다. 둘째, 자기평가 문제다. U가 에이전트 구성요소가 되면 평가 대상과 평가 도구가 일치하고, 보고되는 값 자체가 수정 가능해진다. 셋째, 근거 없는 기반의 결과다. ρ_U가 근거하지 않으면 자기일관성 조건은 (m, U) 쌍만 제약할 뿐 목표 G를 전혀 언급하지 않으므로, 해가 유일하지 않고 목표에 충실하다는 보장도 없다. Ring과 Orseau의 delusion box가 초기 형식적 유사 사례다. 넷째, 목표 표류다. G는 고정인데 ρ_U가 에이전트 구성요소가 되면, 움직이는 것은 목표가 아니라 진척을 재는 기준이다. Red Queen 괴델 머신이 그 사례로 인용된다. 저자들은 같은 기준을 세 곳에 놓는 최소 예시를 든다. 코딩 에이전트가 통과한 테스트 비율로 변경을 채점할 때, 테스트를 고정해 두면 Anchored, 에이전트 저장소 안에 두면 Goal Drift, 에이전트 자신의 판단으로 대체하면 완전 자기참조가 되며, 자기일관성 조건은 세 경우 모두 성립하지만 목표에 봉사하는 것은 첫 번째뿐이다.
개발자 관점에서 이 프레임워크의 실용적 가치는 분류와 진단에 있다. 프롬프트·메모리·도구·제어 흐름을 담은 하네스를 수정하는 현재의 언어 에이전트 루프는 대부분 수정자가 에이전트 안에 있되 평가가 외부 벤치마크에 고정된 Anchored 사례이며, 모델 가중치와 평가 벤치마크는 수정 가능 집합 밖에 남는다. 즉 이들은 고정된 메커니즘 안에서의 유계 자기개선이고, 도달 가능한 품질은 그 메커니즘에 의해 상한이 정해진다. 또한 외부 판정자나 보상 모델은 학습 데이터가 무엇이든 Anchored로 분류된다는 점도 실무적으로 중요하다. 다이얼이 묻는 것은 기준이 어디에 있는지이지 목표에 얼마나 충실한지가 아니며, 근거 있는 프록시도 목표를 저버리고 만족될 수 있다. 자기개선 루프를 설계할 때 확인해야 할 것은 개선 루틴 자체가 수정 대상인지, 평가 기준이 에이전트의 편집 권한 안에 들어가는지, 그리고 개선 단계가 단조적인지다.
한계는 저자들이 명시한다. 이 틀은 시스템이 어떻게 변하는지를 기술할 뿐 그 변화를 어떻게 계산하는지는 다루지 않는다. 구성 공간은 참조용 이상화이며, 도달 가능성·복잡도 주장이 없고, 세계 행동과 에이전트 갱신의 교대를 계산량이 아니라 스텝으로 센다. 괴델 머신의 증명 게이트나 코딩 벤치마크 같은 실무적 보호장치는 수정자가 제안할 수 있는 것을 제한하는 외부 메커니즘으로 취급되며, 그 보호장치 자체가 에이전트 구성요소여야 하는지는 열린 설계 문제다. 사람이 개입해 승인·감사·롤백하는 경우는 형식 체계 밖에 있다. 저자들은 또한 RSI가 단순히 구성에 대한 MDP가 아니라고 못박는다. MDP는 전이 법칙과 보상을 에이전트 밖에 고정하지만, 여기서는 다음 구성이 에이전트 내부의 수정자에 의해 추출되고 평가 기준도 내부에 있을 수 있기 때문이다. 남은 열린 문제로는 자기일관성 조건의 해 집합 특성화, RSI에서 GPI로의 환원을 명시적 가정을 가진 명제로 만드는 일, 그리고 시스템 내부의 모니터가 자기 수정 비평자의 충실성을 스스로 판정할 수 있는지가 제시된다.