Trace2Env는 원본 환경 없이 흔적만으로 상태를 보존하는 세계 모델을 만든다

From Traces to Agentic Worlds: Agentic Language World Models for Interactive Environment Simulation

HF Daily2610.06100

Quanyu Long, Xiao Chen, Jianda Chen2026-10-05

무엇인가

LLM 에이전트를 학습·평가하려면 실제 환경의 복제본이 필요하지만, 터미널·소프트웨어 워크스페이스·기업 내부 시스템 같은 원본은 코드·데이터·인프라가 없어 재현하기 어렵다. 이 논문은 원본 실행 시스템을 다시 만드는 대신, 과거 상호작용 흔적(trace)만으로 환경을 시뮬레이션하는 에이전트형 언어 세계 모델(agentic language world model)을 제안한다. 기존 언어 세계 모델(LWM)은 환경 설명, 상호작용 이력, 행동을 하나의 프롬프트에 넣고 다음 관찰을 예측하는 방식이었다. 하지만 충실한 시뮬레이션에는 장기 상태 연속성이 필요하다. 예를 들어 report.txt를 삭제하면 아무 출력이 없어도, 나중에 cat report.txt를 실행하면 파일 없음 오류가 나와야 한다. 단순 프롬프트는 이런 잠재적 상태 변화를 놓치기 쉽고, 여러 턴에 걸친 일관된 응답을 보장하기 어렵다.

어떻게 동작하나

Trace2Env는 환경 시뮬레이션 자체를 에이전트 작업으로 다룬다. 하나의 세계 모델 에이전트가 다른 과제 에이전트(task agent)를 위한 환경 역할을 한다. 과제 에이전트가 행동을 결정하면, 별도의 세계 모델 에이전트가 시뮬레이션된 환경의 응답을 결정한다. 세계 모델 에이전트는 원본 환경에 직접 접근할 수 없고, 대신 흔적에서 추출한 환경 지식을 능동적으로 찾아 현재 에피소드 상태·기억과 결합해 추론한다. 이 프레임워크는 학습이 필요 없는(learning-free) 방식으로, 오프라인에서 흔적을 구조화된 월드북(worldbook)으로 재구성하고, 온라인 롤아웃에서 고정된 지식과 가변적인 에피소드 상태를 함께 사용한다.

무엇과 다른가

오프라인 단계에서 Trace2Env는 기록된 흔적 D_build로부터 재사용 가능한 환경 월드북 K_E를 만든다. 월드북은 네 가지 구성요소를 갖는다. 스키마는 행동 인터페이스와 시뮬레이터가 유지할 수 있는 상태 변수를 정의한다. 근거 증거(grounded evidence)는 기록된 전이, 선택된 시연, 원본 관찰을 보존한다. 유도된 추상화(induced abstractions)는 조건부 효과, 상태 제약, 관찰 계약, 서술 관례처럼 흔적 전반에 반복되는 행동을 담는다. 출처(provenance)는 각 산출물이 어느 흔적과 턴에서 나왔는지 연결한다. 구성 과정에서 각 행동을 결과와 정렬해 관찰된 사실, 후보 상태 효과, 결과, 불확실성을 추출한다. 원본 관찰은 해석과 함께 보존하고, 귀속이 모호한 효과는 보류한다. 스키마 유도로 행동·상태의 공통 어휘를 세우고, 지지 사례와 대조 사례로 행동 규칙을 검토해 지지된 규칙만 유도된 추상화로 삼는다. 월드북은 불변 패키지로 저장되어 온라인 시뮬레이션 동안 고정되고 여러 롤아웃에서 재사용된다.

어떻게 쓰나

온라인 실행에서 Trace2Env는 지속적 에피소드 워크스페이스 W_t = (K_E, s_hat_t, M_t)를 유지한다. K_E는 에피소드 간 공유되는 불변 월드북으로 환경이 어떻게 행동하는지를 설명한다. s_hat_t는 현재 에피소드에만 해당하는 가변 상태 표현으로 지금 무엇이 참인지를 기록한다. M_t는 이전 행동-관찰 턴을 보존하는 에피소드 상호작용 기억으로 무엇이 일어났는지를 담는다. 상태 항목이 없으면 부재의 증거가 아니라 알 수 없음으로 취급한다. 각 단계에서 세계 모델 에이전트는 전이 제안 q_t = (Δ_t, o~_t+1)을 만든다. Δ_t는 선언된 상태 변수에 대한 선언적 갱신 목록이고, o~_t+1은 제안된 관찰이다. 검색된 월드북 항목은 적용 가능성 게이트를 거쳐 supporting, uncertain, format-only로 분류된다. 관련성이 곧 적용 가능성은 아니라는 구분이다. 하네스는 검증 게이트로 제안을 수용하거나 거부하며, 상태 복사본에 후보 효과를 적용해 스키마·규칙 지지·상태 제약과 대조한다. 수용된 제안만 커밋되고, 관찰은 렌더링 제약 아래 해석된다. 갱신된 상태와 기억은 다음 턴으로 이어진다.

전제와 한계

실험은 아홉 개 환경에서 두 가지 설정으로 이뤄졌다. 단일 단계 다음 관찰 예측에는 AgentWorldBench의 Terminal, SWE, Android, Web 분할과 EnvScaler의 Food(식이 관리 플랫폼), Shopping(온라인 소매), Benefits(직원 복지 포털)를 사용했다. 다중 턴 상호작용에는 텍스트 게임 환경인 ALFWorld와 SciWorld를 썼다. AgentWorldBench 프로토콜에 따라 gpt-5.2가 각 예측을 Format, Factuality, Consistency, Realism, Quality 다섯 차원에서 1~5점으로 채점하고, 각 차원을 0~100으로 재조정해 평균을 낸다. 다중 턴 평가에서는 과제 에이전트가 실제 환경과 세계 모델에서 각각 과제를 한 번씩 수행하고, 실제 환경 성공률(Real)과 세계 모델 성공률(WM)을 보고한다. 세계 모델 상호작용에서 생성된 행동 시퀀스를 실제 환경에서 재생한 성공률을 W2R이라 하고, 일관성 비율 CR = W2R / Real을 계산한다. CR이 1에 가까우면 세계 모델을 거친 결정이 실제 환경 성공률을 유지한다는 뜻이다. 월드북 구축용 흔적은 Terminal과 Web의 경우 gpt-5.6-sol 과제 에이전트로 Terminal-Bench 2.0에서 20개, WebArena에서 50개 궤적을 수집했다. Android와 SWE는 과제 그룹화 5겹 교차 적합으로, EnvScaler는 Food·Shopping·Benefits 각각 16·3·15개의 예약된 성공 궤적으로, ALFWorld는 40개, SciWorld는 30개 궤적으로 월드북을 만들었다. 모든 월드북은 gpt-5.6-sol로 한 번 재구성한 뒤 백본 간에 고정해 사용했다. 비교 방법은 Direct Prompting, Trace RAG Prompting, Worldbook Prompting, Harness only, Trace2Env 다섯 가지다.

결과에서 Trace2Env는 두 백본 모두에서 가장 높은 평균 점수를 냈다. gpt-5.6-sol로 75.94, deepseek-v4.1-flash로 75.75를 기록해 Direct Prompting보다 각각 6.43점, 7.04점 높았다. 14개 환경-백본 조합 중 11개에서 최고였고, Direct Prompting보다 낮은 경우는 없었다. AgentWorldBench에서 Direct Prompting 대비 향상은 두 백본 모두 모든 환경에서 궤적 군집 신뢰구간이 0을 배제했고, Factuality와 Consistency는 모든 환경-백본 조합에서 개선됐다. 구축 흔적에 없는 과제가 포함된 Terminal, Web, SWE 기록에서도 향상이 유의했다. 월드북과 런타임의 기여는 상보적이었다. Trace RAG Prompting은 Direct Prompting보다 나았고, Worldbook Prompting은 평균을 GPT에서 73.76에서 74.35로, DeepSeek에서 73.06에서 74.86으로 올렸다. Harness only는 각각 70.79, 70.35로 더 작은 이득이었다. 둘을 결합한 Trace2Env가 75.94, 75.75로 가장 강했고, Worldbook Prompting과 Harness only 중 더 나은 쪽을 14개 조합 중 11개에서 넘었다. 월드북 구성요소 절제 실험(Terminal, gpt-5.6-sol)에서 근거 증거는 스키마만 있는 변형보다 +2.45 ± 0.89로 더 큰 단독 이득을 냈고, 추상화 단독은 도움이 되지 않았다. 추상화를 근거 위에 더하면 +0.69 ± 0.63, 근거를 추상화된 월드북에 더하면 +4.26 ± 1.02였다. 전체 월드북이 가장 좋았다. 흔적 수를 늘리는 실험에서 5~15개는 불안정했고, 20개에서 64.89, 36개에서 66.42로 꾸준히 향상됐다. 36개에서도 곡선은 상승 중이었지만, 구축 비용이 흔적 양에 대략 비례해 늘어나 저자들은 Terminal 실험에서 20개를 실용적 타협으로 택했다.

장기 상호작용 일관성에서 Direct Prompting은 시뮬레이션 환경 안에서는 더 자주 성공했지만, 그렇게 유도된 행동 시퀀스가 실제 환경에서 재생될 때 성공하는 비율은 훨씬 낮았다. 프롬프트 기반 모델은 잘못된 전이를 환각해도 이후 내적으로 일관되게 이어갈 수 있어, 과제 에이전트가 허구의 상태에서 목표를 달성한 것처럼 보일 수 있다. Trace2Env는 W2R 일관성이 훨씬 높았다. 환경 제약을 재구성하고 상태 결과를 턴 사이에 보존해, 이후 상호작용을 실제 환경에 접지시킨다. 이를 위해 행동을 거부하고 겉보기 시뮬레이션 성공률을 낮추는 경우도 있다. Figure 4의 대표 사례에서 Direct Prompting은 지원되지 않는 put 명령을 성공으로 처리해 거짓 배치를 커밋하고 실제 ALFWorld가 도달하지 않은 상태에서 계속 진행한다. 롤아웃은 내적으로 일관되고 시뮬레이션에서는 성공처럼 보이지만 실제 환경에서 재생하면 행동이 실패한다. Trace2Env는 올바른 no-op을 예측하고 tissuebox 2가 인벤토리에 남아 있음을 보존한다. 이후 인벤토리와 help 응답이 바뀌지 않은 상태와 유효한 move 명령을 드러내 과제 에이전트가 복구하도록 돕는다. 따라서 장기 시뮬레이션의 핵심 기준은 세계 모델 내부 성공률이 아니라, 그 행동이 실제 환경으로 전이되는지다.

저자들이 밝힌 한계로, 충실도는 흔적이 드러내는 것에 의해 제한되고, 일부 백본은 재구성된 근거에 덜 일관되게 의존한다. 향후 과제로 월드북에 대한 능동적 검사와 추론을 강화하고, 관찰된 행동 너머로 재구성을 확장하며, 에이전트형 시뮬레이션 환경이 과제 에이전트 학습·평가를 어떻게 지원할 수 있는지 연구하는 것을 든다. 개발자 관점에서 이 논문은 원본 시스템에 접근할 수 없지만 과거 상호작용 기록은 남아 있는 상황에서, LLM 에이전트를 학습·평가할 시뮬레이터를 만들 때 참고할 만하다. 다만 시뮬레이션 내부 성공률만 보면 허구 상태에서의 성공을 실제 성공으로 오인할 수 있으므로, W2R 일관성 비율처럼 실제 환경 재생 성공률을 함께 확인해야 한다. 또한 월드북 구축 비용은 흔적 양에 따라 늘어나므로, 품질과 비용의 타협점을 정해야 한다.