도구 응답 예측 대신 에이전트의 추론-행동을 판정·수정해 장기 과제 오염을 막는 AEWM
Agent-Editing World Model: Rethinking World Modeling for LLM Agents
무엇인가
이 논문은 LLM 에이전트가 긴 호흡의 과제를 수행할 때 겪는 task-state contamination을 핵심 문제로 삼는다. 기존 언어 월드 모델은 환경 관찰이나 도구 응답을 예측하는 쪽에 집중했지만, 검색 결과·터미널 출력·테스트 결과 같은 관찰은 엔트로피가 높고 실행 상태에 의존하므로 실제 도구 피드백이 있을 때 재구성 가치가 제한적이라고 본다. 더 큰 문제는 에이전트가 부분 관찰만으로 세운 가설, 오래된 계획, 검증되지 않은 가정을 사실처럼 이력에 남겨 이후 결정을 오염시키는 것이다. 예를 들어 반박된 검색 후보를 계속 쫓거나, 검증되지 않은 코드 위에 쌓거나, 실행 확인 없이 터미널 출력만 해석하는 실패가 누적된다. 저자들은 따라서 언어 월드 모델이 예측해야 할 대상은 도구 응답이 아니라 추론과 행동이 이후 과제 진행을 어떻게 바꾸는지라고 주장한다.
어떻게 동작하나
제안 방법 AEWM은 하나의 모델로 Action Judge와 State Revision을 수행한다. 시점 t의 이력 h_t는 과제 x와 이전의 추론 r_i, 행동 a_i, 관찰 o_i로 구성되고, 에이전트가 제안한 (r_hat_t, a_hat_t)와 결합해 실행 전 상태 s_t = h_t ⊕ (r_hat_t, a_hat_t)를 만든다. Action Judge는 s_t를 보고 제안된 결정을 Critical, Exploratory, Noisy 중 하나로 분류한다. Critical은 핵심 격차를 닫거나 필요한 증거·상태 변경을 수행하는 결정, Exploratory는 불확실성을 의미 있게 줄이거나 그럴듯한 분기를 시험하는 결정, Noisy는 기대 진행이 거의 없거나 반복·무관·제약 위반·잘못된 방향을 조장하는 결정이다. Noisy로 판정되면 State Revision이 같은 이력에서 수정된 (r~_t, a~_t)를 생성해 s~_t = h_t ⊕ (r~_t, a~_t)로 상태를 바꾼다. 기존 월드 모델이 s_t에서 관찰 o_hat_t를 예측하는 것과 달리, AEWM은 s_t에서 수정된 에이전트 상태 자체를 만든다.
무엇과 다른가
EditAct는 이 판정과 수정을 실제 실행과 결합한다. 각 비종료 단계에서 에이전트가 제안한 쌍을 Action Judge가 평가하고, Critical이나 Exploratory면 원래 쌍을 유지하며, Noisy면 수정된 쌍으로 대체한다. 선택된 행동 a_t는 실제 환경 E에서 실행되고, 관찰 o_t ~ E(· | h_t, a_t)를 받아 h_{t+1} = h_t ⊕ (r_t, a_t, o_t)로 이력이 갱신된다. 핵심은 비평만 제공하는 것이 아니라 다음 추론의 기반이 되는 상태를 직접 바꾼다는 점이다. 수정된 추론은 충돌하는 정보를 조정하거나 검증되지 않은 가설을 고치고 계획을 갱신하며, 수정된 행동은 그 교정을 실제 다음 상호작용으로 옮긴다. 증거가 없으면 실제 환경과 상호작용해 증거를 찾는다.
어떻게 쓰나
학습 데이터는 성공이 검증된 에이전트 궤적을 턴 단위로 분해해 만든다. 강한 주석 에이전트가 전체 궤적을 보고 각 턴의 행동을 Critical, Exploratory, Noisy로 라벨링하되, 해당 턴에서 보이는 이력 h_t와 제안된 (r_hat_t, a_hat_t)만 입력으로 주고 출력은 미래지향적 추론 흔적 r_t^AJ와 행동 유형 y_t로 둔다. 즉 실행 후 정보를 쓰지 않고 실행 전 맥락에서 행동의 하류 기여를 예측하도록 감독한다. 라벨 일관성, 행동-관찰 정렬, 행동 유효성, 보이는 이력에 근거한 추론 여부를 필터링한다. Action Judge 벤치마크는 Search, Terminal, SWE에 균등 분배된 3,000개 결정으로 구성된다. State Revision 데이터는 제안 에이전트, 수정 에이전트, Action Judge 체크포인트를 써서 만든다. 제안이 Noisy로 판정되면 수정 에이전트가 같은 이력에서 새 추론-행동 쌍을 만들고 실제 환경에서 실행하며, 이후 궤적에서 실질적 진전이 확인된 샘플만 남긴다. 훈련은 Search, Terminal, SWE 세 도메인을 아우르는 단일 AEWM에 대해 두 단계로 진행된다. 중간 훈련은 약 52B 토큰 규모로 원래 에이전트 궤적과 합성된 Action Judge·State Revision 데이터를 결합해 상호작용 지식을 넓힌다. 이후 SFT는 엄격한 규칙과 루브릭으로 고른 120K 예시로 두 능력을 활성화·보정한다. SFT 세트는 Action Judge 60K와 State Revision 60K로 균등하며, Search·Terminal·SWE에서 각 40K 예시를 포함한다. AEWM-RFT는 EditAct가 만든 검증된 궤적, 즉 AEWM의 수정이 포함된 추론과 행동을 거부 샘플링 미세조정으로 에이전트에 되먹여 온라인 AEWM 없이도 상태 교정 패턴을 내재화하려는 방법이다.
전제와 한계
실험은 Search, Terminal, SWE 세 도메인과 여섯 벤치마크에서 이뤄진다. Search는 BrowseComp와 DeepSearchQA, Terminal은 Terminal-Bench 2.0, SWE는 SWE-Bench Pro, Doc2Repo, NL2Repo를 쓴다. DeepSearchQA와 SWE-Bench Pro는 분포 밖 벤치마크다. 베이스라인은 ReAct, Step-level Best@3, Trajectory-level Best@3이며 두 Best@3는 DeepSeek-V4-Pro를 검증자로 쓴다. 추론 에이전트는 Qwen3.5-4B, Qwen3.5-9B, Qwen3.5-35B-A3B이고, AEWM 훈련 백본과 AEWM-RFT 에이전트는 Qwen3.5-35B-A3B다. Action Judge 비교에서는 GLM-5.2, Qwen3.7-Max, Gemini-3-Pro, GPT-5.5, DeepSeek-V4-Pro와 비교해 AEWM이 전체 macro-F1 70.5%를 기록했고, 가장 강한 베이스라인인 DeepSeek-V4-Pro의 59.9%를 10.6점 앞섰다. 도메인별로는 Search 60.9%, Terminal 72.1%, SWE 77.8%로 각 도메인 최강 베이스라인을 10.3, 10.5, 13.4점 상회했다. SWE에서 가장 큰 향상이, Search에서 가장 어려운 결과가 나왔다.
EditAct의 본 실험에서는 여섯 벤치마크 모두에서 ReAct와 두 Best@3를 앞섰다. 가장 강한 베이스라인 대비 평균 점수 향상은 Qwen3.5-4B에서 6.7점, Qwen3.5-9B에서 5.2점, Qwen3.5-35B-A3B에서 3.2점이다. ReAct와 비교하면 각각 13.3점, 9.6점, 6.6점 향상이다. Qwen3.5-9B에 EditAct를 붙인 결과가 Qwen3.5-35B-A3B에 ReAct를 붙인 결과를 44.1 대 42.2로 앞서며 모델 규모 간 격차를 줄이는 모습도 보였다. 분포 내·외 벤치마크 모두에서 향상이 유지됐다. Qwen3.5-Plus에 EditAct를 적용하면 BrowseComp가 44.1%에서 52.7%로 오르지만 Terminal과 SWE 향상은 제한적인데, 저자들은 AEWM과 더 강한 에이전트 사이의 용량 격차 때문일 가능성을 언급한다. AEWM-RFT는 온라인 AEWM 안내 없이 BrowseComp, Terminal-Bench 2.0, Doc2Repo에서 기본 에이전트보다 각각 4.5점, 6.4점, 5.8점 향상했고, Self-RFT보다 각각 2.2점, 2.6점, 2.5점 앞섰다. 앞의 두 벤치마크에서는 평균 턴 수가 30.0%와 16.7% 줄었고, Doc2Repo는 Self-RFT보다 2.5점 높으면서 턴 수는 늘었다.
절제 실험은 Qwen3.5-35B-A3B를 고정 추론 에이전트로 두고 BrowseComp, Terminal-Bench 2.0, Doc2Repo에서 수행됐다. EditAct는 Random Gate, Agent Resampling, AEWM Hint, Reasoning-only Revision, Action-only Revision, Self-WM, DeepSeek-V4-Pro WM보다 세 벤치마크 모두에서 가장 좋았다. 이는 학습된 개입 선택이 무작위 개입보다 낫고, 직접 편집이 재샘플링이나 비평형 안내보다 효과적이며, 추론만 또는 행동만 고치는 것으로는 부족하고 둘을 함께 편집해야 함을 지지한다. 훈련 절제에서는 중간 훈련 후 SFT가 가장 좋았고, SFT 단독 대비 BC, TB2, Doc2Repo에서 0.8점, 6.4점, 4.3점, 중간 훈련 단독 대비 0.3점, 4.1점, 1.9점 더 높았다. 행동 유형 분포를 보면 Search는 Noisy가 60.0%로 많고, Terminal은 Exploratory가 43.2%, Noisy가 25.1%이며, SWE는 Critical이 42.1%, Noisy가 28.0%다. Search 사례에서는 최장 검색 전용 시퀀스가 16.9에서 13.2로 줄고 서로 다른 페이지 수가 7.7에서 10.1로 늘어 더 넓은 증거 수집을 보였다.
개발자 관점에서 이 논문은 도구 호출이 많은 장기 과제 에이전트를 만들 때 실행 전 게이트를 하나 더 두는 설계로 읽을 수 있다. 에이전트가 낸 추론-행동 쌍을 그대로 실행하지 않고, Action Judge로 Critical·Exploratory·Noisy를 판정한 뒤 Noisy만 State Revision으로 바꾸고 실제 도구는 그대로 실행해 관찰을 받는다. 검색, 터미널, SWE처럼 실제 피드백이 돌아오는 환경에서 특히 유효하다. 실무에서는 실제 피드백이 항상 있는지, 도메인별 Noisy 비율이 얼마인지, AEWM과 추론 에이전트의 용량 차이가 성능을 제한하지 않는지, 추가 판정·수정 모델의 지연과 비용을 감당할 수 있는지 확인해야 한다. AEWM-RFT는 온라인 개입 없이 검증된 수정 궤적으로 에이전트를 미세조정하는 선택지이므로, 운영 환경에서 별도 월드 모델 호출이 부담될 때 검토할 수 있다. 한계와 전제도 분명하다. 원문에 별도의 한계 절이 제시된 것은 아니지만, 방법은 실제 도구 피드백이 제공되는 상황을 전제로 하며 도구 응답 재구성의 가치가 제한적이라는 입장을 깐다. State Revision은 Action Judge가 Noisy라고 판정한 경우에만 호출되므로 판정 정확도에 의존하고, 훈련 데이터는 강한 모델의 주석과 루브릭 기반 필터링, 합성 궤적에 의존한다. Qwen3.5-Plus 실험에서 Terminal과 SWE 향상이 제한된 것은 AEWM과 더 강한 에이전트 사이의 용량 격차 가능성으로 설명되며, Search는 가장 어려운 도메인으로 남는다. AEWM-RFT도 온라인 AEWM 없이 동작하지만 검증된 EditAct 궤적이라는 오프라인 자원을 필요로 한다.
관련 논문
- 단일 모델을 기획자와 합성자로 나눠 딥서치의 역할 결합과 컨텍스트 누적을 푼 IterSynthReAct 방식 딥서치 에이전트의 역할 결합과 컨텍스트 누적 문제를 Planner와 Synthesizer 두 역할 분리로 해결한 IterSynth를 제안한다. 8B 모델로 5개 벤치마크 평균 50.7%를 기록해 동급 최강 대비 4.2%p 향상했고, 역할별 어드밴티지 정규화 RDPO가 핵심이다.
- 계획 생성·수정·검증을 컨텍스트 격리로 분리해 LLM 플래너의 복잡도 붕괴를 막는 GRASPLLM 플래너가 복잡한 작업에서 무너지는 문제를 계획 생성·수정·검증의 컨텍스트 격리 모듈로 분리해 푼 GRASP를 제안한다. 캘린더 스케줄링과 ZebraLogic에서 최대 30.8% 정확도 향상을 냈고, 멀티태스크 확장에서 성능 저하를 사실상 제거했다.
- SAGE는 장기 추론의 두 편향을 위상 구조로 완화하는 강화학습 프레임워크다.LLM의 장기 추론 실패를 탐색 편향과 누적 편향으로 진단하고, 대수적 희소화와 쌍곡 공간 유도로 이를 완화하는 SAGE를 제안한다. 12개 벤치마크에서 평균 정확도를 크게 올리고 Andrews-Curtis 문제에서 최대 8배 개선을 보고한다.
- 다자 대화 기억의 발화자 귀속과 상태 재구성을 위한 이중 트랙 메모리다자간 대화의 장기 메모리를 발화자 귀속과 관계 이해, 상태 재구성 문제로 정의하고, 발화자 라벨 원문과 인물·그룹 상태를 이중 트랙으로 저장하는 SpeakerMem-R1을 제안한다. 벤치마크에서 최고 수준 결과를 보고하며, RL이 구조화 메모리 작성 정확도를 높인다.
- 읽기 시점에 과제별로 기억을 조립하는 LLM 에이전트 메모리, JitMemLLM 에이전트의 기억을 쓰기 시점이 아니라 읽기 시점에 현재 과제에 맞게 압축하는 JitMem을 제안한다. ALFWorld, WebShop, τ²-bench에서 기존 write-time 메모리보다 최대 16.3%p 높은 성공률을 보고했다.