VHD-Play는 해를 먼저 풀어 검증 가능한 에이전트 RL 환경을 생성한다
Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms
무엇인가
이 논문은 언어모델 에이전트가 긴 호흡의 작업에서 상태가 변하고, 결정이 서로 얽히고, 결과가 늦게 나타나는 상황을 다룬다. 기존 생성 파이프라인은 보통 환경을 먼저 만들고 보상 규칙이나 궤적 주석을 나중에 붙여 동역학과 평가를 사후 정렬한다. 그래서 다양한 에이전트 환경, 신뢰할 수 있는 결과 신호, 낮은 확장 비용을 동시에 얻기 어렵다. VHD-Play는 이 의존 순서를 뒤집어, 환경을 만들기 전에 수학 모델을 샘플링하고 먼저 푼다.
어떻게 동작하나
구체적으로 메커니즘 패밀리 f에서 파라미터 θ를 뽑고, 패밀리 솔버 S_f로 zθ=(u*(θ), u0(θ))를 계산한다. u*(θ)는 최적값, u0(θ)는 고정 기본 정책의 값이다. 이 해가 보상 규칙 Rθ를 고정하고, 같은 모델이 실행 동역학 D(θ)=(S, Λθ, Uθ)와 에이전트 환경 E(θ)=Wrap(D; Ωθ, A, T)로 이어진다. 보상은 r = clip[0,1]((u(π;θ)-u0(θ))/(u*(θ)-u0(θ)))로, 기본 정책을 0, 완전정보 최적을 1로 정규화한다. 언어모델이 평가 endpoint를 추정하거나 판정하지 않고, 산술적으로 점수를 낸다. 빌더 G는 θ와 코퍼스 시드를 받지만 플레이어 π는 인터페이스가 공개한 관측만 본다. 코퍼스에서 뽑은 실제 문서 구절이 시나리오, 관계형 DB, 도메인 도구 스키마와 본문, 플레이어 지시문을 만들고, M(θ)가 결정 과정을, zθ가 평가를 결정한다. 인터페이스에는 정보 획득용 probe와 상태를 바꾸는 decision action이 있고 둘은 같은 턴 예산 T를 쓴다. 생성 후에는 후보가 실행되는지, 실제 동작이 미리 계산된 구성과 일치하는지 입학 검사를 통과해야 한다. 이렇게 3,300개 환경을 만들었고 비용은 개당 몇 센트 수준이며, 28개 주제 도메인에서 정규화 엔트로피 0.997, 평균 59.7 어시스턴트 턴을 기록했다. 훈련은 GRPO로 같은 인스턴스의 롤아웃 그룹을 최적화한다.
무엇과 다른가
실험은 Qwen3.6-35B-A3B를 베이스로 GRPO를 적용해 진행했다. 다섯 개 최적화 패밀리 진단에서 평균 에이전트 점수는 0.204에서 0.815로 올랐다. 훈련에 쓴 세 패밀리의 held-out 인스턴스는 평균 +0.56, 가까운 OOD 패밀리는 +0.63, 먼 OOD 패밀리는 각각 +0.24와 +0.16의 이득을 보였고, 여덟 개의 보지 못한 메커니즘 패밀리에서도 향상됐다. 외부 벤치마크로도 전이됐다. BFCL V4의 Multi-Turn, Agentic, Hallucination 계열 10개 셀에서 2.84점 올랐고, 해당 하위 집합 비가중 평균은 61.25에서 64.08로 상승했다. TravelBench 계획 품질은 0.700에서 0.794로 올랐지만 Qwen3.7-Max 참조값 0.891에는 못 미쳤다. 가장 긴 호흡인 E-Commerce Bench 365일 상점 운영에서는 베이스가 5회 중 4회 완주하고 1회 파산했지만, 훈련된 35B-A3B 체크포인트는 1,147~1,825 어시스턴트 턴 동안 5회 모두 파산 없이 완주했다. 평균 종료 잔고는 54,294에서 182,844로 3.4배가 됐고, Qwen3.7-Max 참조값 165,224를 넘었다.
어떻게 쓰나
논문은 같은 문제를 written-out(F), informed-agentic(I), agentic(A) 세 형태로 비교해 학습 가능한 격차가 어디 있는지 분리한다. F에서는 전체 인스턴스를 보고 답을 쓰고, I와 A에서는 같은 다단계 환경에서 정책으로 행동해야 한다. I는 샘플링된 파라미터를 처음에 모두 보여주고, A는 상호작용을 통해서만 드러낸다. 베이스 체크포인트는 F에서 0.962였지만 I에서 0.231, A에서 0.204로 떨어졌다. 훈련은 (F, I, A)를 (+0.030, +0.644, +0.611)만큼 바꿔, 파라미터가 드러난 상태적 격차의 84%와 written-out에서 agentic까지의 전체 격차의 77%를 닫았다. 고정 층화 분석에서는 +0.443의 agentic 이득 중 +0.030만이 코드 도구 채택 증가로 설명되고, +0.413은 같은 층 안에서 발생했다. 훈련된 정책의 held-out 궤적 상태에서 베이스 대비 D_KL은 어시스턴트 토큰당 0.089 nats로 작았다. 대표 궤적에서 베이스는 7기간 할당 문제에서 29단위 예산 중 27을 처음 3기간에 쓰고 점수 0을 받았지만, 훈련된 정책은 7기간 전체를 계획해 점수 1을 받았다. 관측 사례에서도 베이스는 8개 중 4개만 probe하고 행동했지만, 훈련된 정책은 8개를 모두 확인한 뒤 계획했다.
전제와 한계
환경 생성과 정책 학습의 동시 확장도 실험했다. 6개 아이템 5기간에서 11개 아이템 11기간까지 네 단계로 복잡도를 올렸을 때, 같은 Qwen3.6-35B-A3B 복사본 하나는 고정 setter로 환경을 실현하고 다른 하나는 각 규모에 맞춰 훈련됐다. 6x5에서 베이스 0.432, 훈련 0.843이었고, 11x11에서는 베이스 0.085, 훈련 0.946이었다. 네 단계 이득은 +0.412, +0.551, +0.675, +0.861이었고, 큰 두 구성의 평균 이득 +0.768이 작은 두 구성의 +0.482보다 컸다. 고정된 35B setter가 더 큰 환경을 실현할 수 있었고, 메커니즘 규모와 지평이 커져도 같은 평가자 아래에서 학습 여지가 남았다. 논문은 이를 진화하는 훈련 기반, 즉 evolving training substrate의 가능성으로 해석한다.
개발자 관점에서 이 논문은 에이전트 RL 환경을 만들 때 보상 신호를 나중에 붙이는 대신, 먼저 풀 수 있는 수학적 메커니즘을 정하고 그 해에서 동역학과 평가를 함께 끌어내는 패턴을 제안한다. 장기 상태 변화, 도구 호출, 숨은 파라미터, 지연된 결과가 있는 훈련 데이터를 싸게 늘리고 싶을 때 참고할 수 있다. 특히 learned judge의 타당성을 별도로 검증해야 하는 부담을 줄이고, 파라미터 재샘플링만으로 같은 패밀리 안에서 새 인스턴스를 만들 수 있다는 점이 실용적이다. 다만 도입 전에 해당 도메인에 닫힌 형태, 열거, 동적 계획법, 수치 최적화 같은 솔버가 있는지, 기본 정책과 최적값으로 보상을 정규화할 수 있는지, 인터페이스가 어떤 정보를 숨기고 언제 probe를 허용하는지, 입학 검사가 실행과 참조 일치를 충분히 잡는지 확인해야 한다. 평가할 때는 written-out 성능과 agentic 성능을 나눠서 정책 격차를 보는 것이 좋다.
논문이 밝힌 전제와 한계도 분명하다. 이 구성은 수학적·운영연구 모델 패밀리와 그 솔버, 참조 해가 있는 문제에 의존하므로, 명시적 수학 모델로 환원하기 어려운 모든 실제 워크플로를 포괄한다고 주장하지 않는다. 부분 관측 아래에서 u*(θ)는 상한 참조일 뿐이며 온라인 정책이 반드시 달성할 수 있는 값은 아니다. setter는 고정된 35B 모델이고, 더 강한 setter는 주로 수율과 인터페이스 정교화를 개선한다. 외부 전이 결과 중 TravelBench는 Qwen3.7-Max 참조값보다 낮았고, E-Commerce Bench와 BFCL V4 결과도 해당 벤치마크의 네이티브 프로토콜과 선택된 지표에 근거한다. 점수 경로에는 학습된 평가자가 없지만, 환경을 렌더링하는 setter는 언어모델이므로 입학 검사와 참조 일치 감사가 중요한 안전장치로 남는다.
관련 논문
- SAGE는 장기 추론의 두 편향을 위상 구조로 완화하는 강화학습 프레임워크다.LLM의 장기 추론 실패를 탐색 편향과 누적 편향으로 진단하고, 대수적 희소화와 쌍곡 공간 유도로 이를 완화하는 SAGE를 제안한다. 12개 벤치마크에서 평균 정확도를 크게 올리고 Andrews-Curtis 문제에서 최대 8배 개선을 보고한다.
- 소스 코드만으로 코딩 에이전트 RL 환경을 자동 구축하는 CodeMidas오픈소스 코드베이스의 구현된 기능을 실행 가능한 RL 환경으로 바꾸는 에이전트 파이프라인 CodeMidas를 제안한다. 이슈·커밋 같은 개발 산출물에 의존하던 기존 방식의 한계를 넘어 RL 환경 규모를 키우는 것이 목표다.
- 다운스트림 태스크를 모른 채 환경을 미리 공부해 재사용 자원을 만드는 메타 에이전트다운스트림 과제를 모르는 상태에서 LLM 에이전트가 환경을 미리 탐색해 인덱스·스크립트 같은 재사용 자원을 만드는 '과제 무관 환경 전처리' 기법이 arXiv에 공개됐다. 6개 벤치마크 중 5개에서 메타 에이전트가 최고 성능을 냈고, 테스트 시점 샘플링을 줄이는 효과도 확인됐다.