AgentGarten이 코드 월드와 실시간 신경 렌더러로 에이전트 학습을 가속한다
AgentGarten: Code Worlds for Evolving Agents
무엇인가
이 논문은 에이전트가 학습할 수 있는 범위가 연습하는 환경에 의해 결정된다는 전제에서 출발한다. 좋은 환경은 상태·규칙·동역학이 일관된 충실한 환경이면서, 관측이 실제 세계의 시각 분포를 따르는 현실적인 환경이어야 한다. 기존 접근은 여기서 근본적 트레이드오프에 부딪힌다. 시뮬레이터와 게임 엔진은 명시적 상태와 프로그래밍 가능한 상호작용 규칙을 주지만, 시각적 다양성을 넓히려면 3D 에셋 제작과 복잡한 렌더링 파이프라인이 필요해 새 환경을 만드는 비용이 크다. 반대로 비디오 월드 모델은 데이터로부터 풍부한 시각 관측을 합성하지만, 과제에 중요한 상태와 물리 전이 규칙이 생성된 히스토리와 학습된 표현 안에 암묵적으로 남아 직접 검사·편집·테스트할 수 없다.
어떻게 동작하나
AgentGarten의 구조는 씬 프로그램 p, 이를 실행하는 엔진, 신경 렌더러 Rθ의 결합이다. 엔진은 물체 자세·관절·과제 변수를 담은 상태 s_t, 카메라 자세 π_t, 에이전트 행동 a_t를 받아 다음 상태를 계산하고(f_p), 카메라로부터 구조화된 조건 c_t를 뽑는다(h_p). 렌더러는 외형 참조 x_0, 텍스트 설명 y, 시각 히스토리 x_<t, 조건 c_≤t로부터 관측 x_t를 생성한다. 중요한 성질은 전이 함수 f_p가 렌더링된 관측을 입력으로 받지 않는다는 점이다. 렌더러는 에이전트가 고른 행동을 통해서만 상태에 영향을 주므로 렌더링 오류가 상태에 누적되지 않고, 기록된 상태 궤적은 다른 외형 참조나 카메라로 다시 렌더링해도 사건 자체가 바뀌지 않는다.
무엇과 다른가
조건 인터페이스로는 컬러화된 깊이 또는 표면 노멀을 쓴다. 3채널 표현이라 사전학습 비디오 인코더와 트랜스포머를 그대로 재사용할 수 있다. 실영상에서는 ViPE(깊이 백엔드는 Depth Anything 3)와 NormalCrafter로 추정하고, 시뮬레이션 장면은 지오메트리에서 직접 얻는다. 코딩 에이전트가 이미지 한 장 또는 텍스트로부터 실행 가능한 씬 프로그램과 외형 참조 x_0를 만든다. 외형은 렌더러가 담당하므로 씬 프로그램은 재질이나 잎 단위 에셋 없이 레이아웃·실루엣·가림·모션을 충실히 전달하는 거친 지오메트리만 있으면 된다. 이미지 입력에서는 인스턴스 마스크, 단안 깊이와 카메라 내부 파라미터, 3D 바운딩 박스, 추출된 메시를 활용하고, 텍스트 입력에서는 기하 프리미티브로 프로그램을 쓴 뒤 이미지 편집 모델로 x_0를 만든다. 이후 여러 프로브 카메라의 테스트 롤아웃과 엔진 검증 질의(접촉, 충돌 여유, 가림)를 통해 잘못된 자세·지지되지 않는 구조·모호한 모션을 반복 수정한다.
어떻게 쓰나
렌더러 학습은 세 단계다. Cosmos 3-Nano에서 초기화해 이해 타워(UND)와 생성 타워(GEN)를 분리하고, 동결된 UND가 캡션을 레이어별 키·값으로 인코딩해 GEN이 소비한다. 동결된 Wan 비디오 오토인코더는 RGB와 지오메트리 비디오를 잠재로 매핑한다. 1단계 지오메트리 조건화에서는 깊이/노멀 토큰과 RGB 토큰을 시퀀스 차원으로 이어 붙여 같은 트랜스포머 레이어로 처리하며, 채널 연결이나 컨트롤 브랜치는 쓰지 않는다. 추정 지오메트리의 텍스처 누출·정렬 오차·누락에 대비해 모달리티 무작위 선택과 드롭아웃, 다운·업샘플링, 공간 워프, 잠재 노이즈를 적용한다. 2단계 teacher-forcing 적응에서는 참조 이후 잠재를 고정 길이 블록으로 나누고, 한 트랜스포머 안에 깨끗한 복사본 P_j(히스토리)와 노이즈 복사본 Q_j(복원 대상)를 두는 병렬 teacher forcing으로 모든 블록을 동시에 학습한다. 3단계 Adversarial Forcing은 양방향 teacher에 대한 분포 매칭(DMD), 히스토리 그래디언트를 되살리는 exact replay, 실제 데이터 적대적 목적을 결합한다.
전제와 한계
exact replay는 표준 Self Forcing의 한계를 겨냥한다. 표준 방식은 완료된 블록을 분리된 KV 캐시로 인코딩하므로 이후 손실이 캐시를 만든 히스토리 prefill 계산을 감독하지 못한다. AgentGarten은 그래디언트 없는 롤아웃으로 각 블록의 입력 U와 출력 Z를 기록한 뒤, 미분 가능한 재실행에서 히스토리와 예측을 다시 계산한다. 이때 어텐션을 블록 단위 SDPA로, 키·값 순서와 호출 형태를 롤아웃과 동일하게 유지해 수치적 발산을 없앤다. 적대적 목적은 R3GAN식 상대론적 페어링을 쓰고, 판별기는 동결된 teacher 백본의 중간 특징을 모으는 학습 가능한 헤드다. R1/R2 정규화는 원래 입력 그래디언트를 다시 미분해야 해서 FlashAttention 같은 fused 커널이 지원하지 않는데, 백본이 동결되어 있다는 사실을 이용해 정확한 페널티 값과 헤드 파라미터 그래디언트를 이중 역전파 없이 계산한다.
실험은 H100 1장, BF16, 480×832 출력, 4 잠재 프레임 블록, 4스텝 샘플러 기준이다. 30초 롤아웃 비교에서 Self Forcing은 반복적인 표면 패턴이 생기고 장면 디테일이 사라지는 반면 Adversarial Forcing은 자연스러운 텍스처와 세부를 유지했다. 재실행 정확도는 전체 시퀀스 FlexAttention 재실행이 캐시 롤아웃 대비 상대 L2 오차 3.99%인데 반해 블록 단위 SDPA 재실행은 비트 단위로 동일했고, 순전파 시간은 5.4% 줄고 최대 메모리는 0.2% 변했다. 추론 처리량은 직접 작성한 Triton 커널, CUDA 그래프 캡처, 증류된 tiny 디코더(10ms 미만)를 조합해 480×832 영상을 H100 한 장에서 초당 35프레임 이상 생성한다(조건 인코딩, 4 디노이징 스텝, 디코딩, 호스트 전송 포함). 캐시는 sink 5프레임과 최근 44프레임을 유지해 각 4프레임 블록이 49프레임 히스토리를 참조한다.
에이전트 실험에서 hide-and-seek의 에이전트는 신경 렌더러가 합성한 카메라 프레임만 보고(좌표·지도·점수 없음), 라운드마다 시도·관측·의문·다음 검증 계획을 담은 플레이북을 써서 다음 라운드의 새 에이전트에게 넘긴다. 논문은 4라운드 만의 학습으로 기존 강화학습이 수백만 스텝을 필요로 한 것과 대비되는 학습 효율 향상을 보고한다. 대피소 건설은 4라운드, 경사로 통과는 10라운드에 등장했다. 같은 절차를 네 개 월드에 적용한 결과는 다음과 같다. companion-dog에서 참여 점수 13→19, 일차선 다리에서 양쪽 차량 도착 시간 71초→41초, herding은 1라운드에 네 마리 중 세 마리만 넣고 시간 초과했으나 이후 라운드마다 네 마리 모두를 넣었고, quarry의 휠 로더는 4라운드에 360초 중 329초로 암석 제거·전달·주차를 완료했다.
개발자에게 이 논문이 주는 것은 환경을 코드로 쓰고 렌더링은 학습된 모델에 맡긴다는 인터페이스 설계다. 상태와 규칙이 엔진에 남아 검사·리셋·재현이 가능하고, 시각 자산 제작 없이 새 월드를 추가할 수 있다. 실시간 서빙을 노린다면 블록 단위 캐시, Triton 커널, CUDA 그래프, tiny 디코더 조합과 재실행 정확도(비트 단위 일치)가 확인해야 할 지점이다. 한계도 저자들이 명시한다. 깊이/노멀 조건은 중복적이고 불완전해서, 회전 대칭 물체가 긴 축을 중심으로 돌아도 깊이·노멀은 변하지 않아 스핀을 구분할 수 없고 재질·색·물체 정체성은 지오메트리로 결정되지 않는다. 시각 히스토리가 이를 보존할 수 있지만 긴 가림이나 메모리 윈도우를 넘는 재방문 후에는 잃을 수 있다. 또한 이 보고서의 월드는 하나씩 손으로 만들었고, 월드 생성 자체보다 그 월드가 에이전트의 시간을 들일 가치가 있는지(관측만으로 풀 수 있는지, 부주의한 전략이 실패하는지, 다음 라운드로 이어질 학습이 있는지)를 자동으로 검사하는 일이 더 어렵다고 지적한다. 월드 수가 늘면 어떤 교훈을 남기고 병합하고 버릴지 결정하는 경험 관리 문제도 남는다.