Memento 3가 얼린 LLM으로 세계 모델을 스스로 고쳐 쓴다

Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks

HF Daily2610.11794

Haoyu Zhao, Zhengxu Yu, Zhiyuan He2026-10-08

무엇인가

낯선 환경에 들어간 에이전트는 어떤 행동이 유용한지뿐 아니라 그 행동이 세계를 어떻게 바꾸는지도 모른다. 논문이 겨냥하는 핵심 난점은 유한한 관찰 기록이 여러 세계 모델을 동시에 지지한다는 점이다. 예를 들어 관찰된 모든 벽이 7번 열에 있었다면 "상자가 벽에서 멈춘다"와 "상자가 7번 열에서 멈춘다"는 같은 궤적을 설명하면서도 벽이 다른 곳에 나타날 때 다른 결과를 예측한다. 리플레이는 관찰과 모순되는 프로그램을 걸러낼 수는 있어도, 일관된 후보들 중 옳은 규칙을 골라내지는 못한다. Memento 시리즈의 앞선 작업들이 정책 쪽(에피소드 메모리, 반성적 학습, 재사용 가능한 스킬)을 개선했다면, Memento 3는 모델 쪽, 즉 세계가 어떻게 움직이는지를 규정하는 규칙을 학습하는 문제로 확장한다.

어떻게 동작하나

제안 방법의 이름은 Code as Model이다. 에이전트는 객체·행동 의미론·동역학·목표·종료 조건에 대한 현재 가설을 자연어 규칙서(rulebook)에 적어 영속적인 의미 메모리로 삼고, 이를 예측과 계획에 쓸 실행 코드로 컴파일한다. 학습 상태는 상호작용 기록 H_t, 규칙서 ψ_t, 실행체 θ_t의 세 쌍 Z_t=(H_t, ψ_t, θ_t)로 정의된다. 실행체는 자체 내부 상태 공간, 초기화 함수, 전이 예측 함수, 관찰 함수, 목표 상태 집합을 가지며, 기록된 행동을 재생(replay)해 현재 내부 상태를 복원한다. 갱신된 코드는 두 조건을 모두 통과할 때만 채택된다. LLM이 코드가 규칙서에 충실하다고 판정해야 하고(θ_t ∈ [[ψ_t]]), 셀 단위로 정확한 재생이 관찰된 모든 전이를 재현해야 한다. 중요한 전제는 기반 LLM의 파라미터가 고정된다는 것이다(φ_{t+1}=φ_t=φ). 학습은 가중치가 아니라 외부 메모리에서 일어난다.

무엇과 다른가

갱신 루프는 다섯 단계다. 관찰이 기록을 늘리면, 반성 단계에서 LLM이 세 가지 중 하나를 고른다. 현재 규칙서-실행체 쌍 유지, 규칙서 자체의 수정, 규칙서는 두고 코드만 수리. 예측 불일치가 환경 규칙 오류에서 온 것인지 규칙을 코드로 옮기다 생긴 구현 오류에서 온 것인지 구분하기 위한 장치다. 이후 규칙 수정, 컴파일, 검증이 이어진다. 논문은 이 과정을 베이즈 적응 POMDP의 신념 갱신으로 형식화하되, 실제로는 채택된 단일 가설과 재생으로 복원한 상태에 확률 1을 주는 점 질량 근사로 계획에 사용한다. 계획기는 검증된 실행체에 질의해 남은 예산 안에 목표에 도달할 행동열을 탐색하고, 계획이 없으면 탐색 행동을 택한다. 실제 행동만 예산에 계산되고 모델 구축·시뮬레이션 롤아웃·재생은 계산되지 않는다.

어떻게 쓰나

논문은 여기에 모집단(population) 확장을 더한다. 서로 다른 규칙서-실행체 쌍 N개를 병렬로 유지하고 상호작용 증거를 공유하며, 계획 에피소드마다 하나를 샘플링해 그 예측으로 탐색을 유도한다. 모든 구성원은 공유된 전이 기록에 대해 검증된다. N=1이면 단일 모델 설정으로 되돌아간다. 저자들은 이를 버전 공간에 대한 계산적 근사로 규정하며, 보정된 베이즈 사후분포가 아니라고 명시한다.

전제와 한계

ARC-AGI-3에서 단일 모델 에이전트는 공개 25개 게임의 모든 레벨을 클리어했고, 평균 RHAE(Relative Human Action Efficiency) 100.0으로 상한에 도달했으며, 사람 행동 수의 44%인 7,518개 행동을 사용했다. ARC Prize 표준 하네스를 쓴 Claude Opus 5와 비교해 평균 RHAE가 59.3포인트 높다. 모집단 확장은 9개 레벨 비교에서 두 설정 모두 전 레벨을 클리어하고 RHAE 100을 기록했지만, 모집단이 총 점수 행동 수를 899에서 597로 줄였고 9개 중 8개 레벨에서 레벨별 행동 효율을 같거나 개선했다. 두 세계 모델은 서로 다른 가설로 시작해 공유 이력이 불일치를 해소하면서 수렴한다.

Atari Pong 사례 연구는 같은 메커니즘이 이산 계획을 넘어 피드백 제어를 지원하는지 확인한다. ALE를 프레임 스킵 4로 구동하고, 레벨 해결 계획기를 학습된 세계 모델로 후보 행동의 결과를 예측하는 피드백 정책으로 교체했다. 학습된 컨트롤러는 서로 다른 오프닝을 가진 세 에피소드에서 모두 21:0으로 이겼고, 각각 3,358·4,014·5,039개 행동이 필요했다. 평가 중에는 LLM 호출이 전혀 없으며 컨트롤러는 고정된다. 학습 비용은 9,504 에뮬레이터 프레임으로, 논문이 인용한 모델프리 베이스라인(GDI, LASER, IMPALA, Rainbow)의 약 2.1×10^4 프레임과 모델기반 베이스라인(EfficientZero, EfficientZero V2, 100,000 행동=400,000 프레임)의 약 42배에 해당한다. 규칙 수정의 구체적 예도 제시된다. 중앙 타격이 최초의 4밴드 반사 가설을 반박해 중앙 편향 공식이 도입되고, 추가 접촉이 비대칭 밴드 맵으로 이어진다.

개발자 관점에서 이 논문의 실용적 핵심은 학습 상태를 모델 가중치가 아니라 편집 가능한 외부 아티팩트로 두는 설계다. 자연어 규칙서는 사람이 읽고 고칠 수 있고, 컴파일된 코드는 계획기가 반복 질의할 수 있으며, 채택 게이트가 규칙서 충실성 판정과 정확 재생이라는 두 개의 명시적 검사로 고정되어 있다. 파인튜닝 파이프라인 없이 새 환경에 적응하는 에이전트를 만들 때, 그리고 모델이 왜 그런 예측을 했는지 감사 가능해야 할 때 참고할 만하다. 다만 검증을 통과한 모델이 곧 좋은 결정을 낸다는 보장은 없다는 점도 함께 봐야 한다.

한계는 저자들이 직접 밝힌다. 정확 재생을 통과해도 동일한 증거에 일관된 여러 가설이 남을 수 있고, LLM의 간결성 선호(최소 기술 길이 편향)는 불확실성을 제거하지 못한다. 하나의 가설에 확정적으로 커밋하면 그것을 반증할 증거로부터 탐색이 멀어질 수 있다. 모집단 확장도 보정된 사후분포가 아닌 근사다. 또한 ARC-AGI-3 공개 세트는 이미 포화 또는 근포화 상태에 가까워 공개 세트 완주만으로는 세계 모델 아키텍처의 기여를 분리할 수 없으며, 모델 선택과 추론 예산을 함께 통제하고 홀드아웃 평가·반복 실행 안정성·행동 효율을 봐야 한다고 논문 스스로 지적한다. 인용된 Tycho 연구는 전이 재생 성능이 좋아져도 목표를 잘못 식별하거나 모델을 부적절하게 쓰면 결정 성능이 나아지지 않을 수 있음을 보여준다.