LLM 에이전트의 상태 요약 손실은 예산이 아니라 쓰기 시점 후회에서 온다
Decision-Sufficient State Representations: Measuring and Reducing Write-Time Regret
무엇인가
긴 작업을 수행하는 LLM 에이전트는 관찰 이력이 컨텍스트를 넘어선다. 이 논문이 다루는 것은 상수 컨텍스트(constant-context) 에이전트다. 매 스텝 writer가 목표 g, 이전 상태 z_{t-1}, 직전 행동, 새 관찰을 받아 B 토큰 이하의 텍스트 상태 z_t로 다시 쓰고 원본 이력은 버린다. reader는 (g, z_t, o_t)만 보고 행동을 고른다. 스텝 비용은 일정하지만 되돌릴 수 없다. writer가 버린 사실은 나중에 필요해질 때 이미 사라져 있다. 논문은 이 손실을 정량화하고 훈련으로 줄일 수 있는지 묻는다.
어떻게 동작하나
저자들은 reader의 결정 손실 δ_t를 두 항으로 쪼갠다. 예산 손실 β_t는 같은 B 토큰으로 hindsight로 쓴 최선의 상태 z^rt_t(전체 이력을 한 번에 압축, N=8 샘플 중 NLL 최소)와 전체 이력 h_t의 차이고, write-time regret κ_t는 실제 writer가 쓴 상태와 z^rt_t의 차이다. β는 그 크기의 상태라면 어차피 잃을 몫, κ는 미래를 모르고 선택한 대가다. 관련성 지연(relevance lag) ℓ_t는 h_t에서 청크를 제거했을 때 NLL이 가장 크게 오르는 과거 스텝까지의 거리로 측정한다. 지연을 만들기 위해 프로토콜 F'를 쓴다. Phase A에서 스크립트 탐험가가 모든 방과 컨테이너를 열고 레시피를 읽은 뒤, Phase B 전에 방문한 방들 사이를 F' ∈ {0,10,20,40} 스텝 무작위로 걷는다.
무엇과 다른가
DSSR은 writer를 reader의 손실로 직접 훈련한다. 에피소드 결과로 다중 턴 강화학습을 하는 대신, 쓰기 시점 t에서 현재 writer로부터 후보 상태 n개를 샘플링하고 동결된 reader가 각 후보를 얼마나 잘 이끄는지 점수화한다. 점수 S_K(z)는 t 이후 40스텝 이내의 Phase B 결정 지점 u들(최대 K=12개로 균등 서브샘플)에서 참조 행동 a*_u에 대한 reader 로그우도 평균이다. 핵심은 문맥 c_u(z)의 형태다. window 형태는 후보 z 뒤에 원본 스텝 t+1..u-1을 붙이는데, 이는 hindsight 기법들이 보통 쓰는 방식이다. recursive 형태는 writer를 z에서 온도 0으로 로그된 스텝들에 대해 앞으로 굴려 z_u를 만들고 reader는 z_u만 본다. DSSR은 recursive 형태를 쓴다. 최적화는 라운드 0에서 S_12 기준 최선 후보로 지도 미세조정(best-of-n 증류), 라운드 1~3에서 점수 차 0.3 nats 이상인 best-vs-worst 쌍에 DPO(β=0.1)와 선택 샘플에 0.5 가중 우도항을 적용한다. writer는 LoRA 어댑터이고 프롬프트는 summary 프롬프트 그대로라 베이스라인과 어댑터만 다르다. A4 변형은 레시피 지시문이 아직 남아 있는 쓰기 시점만 남기고 후보 12개를 온도 1.1로 써서 '유지 대 폐기'가 실제 선택이 되게 한다.
어떻게 쓰나
실험은 TextWorld 요리 게임, 3재료 레시피, 6/9/12방, 240 학습·45 검증·90 테스트 게임이다. 전체 이력은 2.2k(6방, F'=0)에서 9.1k 토큰(12방, F'=40)이다. writer와 reader R1은 Qwen3-4B-Instruct + LoRA로 전체 이력에서 검증 게임 97.8%를 이기고, R2는 Phi-4-mini(77.8%)다. 결과는 분명하다. 전체 이력 reader는 모든 지연에서 97.8%를 이기고, 약 47토큰짜리 oracle-b 상태는 모든 예산에서 98~100%를 이긴다. 반면 LLM이 쓴 상태는 B=128에서 0~11%, B=64에서는 아무도 이기지 못했고, B=256에서 최고인 guide도 F'가 커지면 40%에서 22%로 떨어진다. 손실 분해에서 κ는 예산이 있는 모든 LLM 셀에서 0.4~2.0 nats(구간이 0을 배제)인데 |β| ≤ 0.40이었다. 병목은 예산이 아니라 writer의 선택이다. 76개 (포맷, 예산, 지연) 셀에서 평균 δ는 온라인 승률과 ρ=-0.84로 예측한다. 측정된 지연 ℓ은 F'=0/10/20/40에서 4에서 16, 30, 48로 오르고, B=128의 κ도 0.5~0.9에서 1.1~1.8 nats로 오른다. κ(ℓ≥5) - κ(ℓ<5) = +1.08 [0.24, 1.97]이다. 점수 형태도 검증됐다. 200개 쓰기 시점 × 8개 후보를 게임 끝까지 굴린 1,600 에피소드에서 window 점수는 모든 지평에서 실제 리턴과 상관이 없었고(ρ ≤ 0.07), recursive 점수는 K=12에서 ρ=0.48 [0.39, 0.56](K=4에서 0.44, K=1에서 0.05), F' 프로토콜에서 0.26 [0.13, 0.43]이었다.
전제와 한계
라운드 0 지도 미세조정만으로 F'=0 검증 승률이 2.2%에서 13.3%로 올랐고, 지평이 중요해서 S_1/S_4/S_12 증류는 각각 4.4/6.7/13.3%였다. A4 변형이 가장 강해서 두 라운드 후 F'=0/10/20/40에서 26.7/11.1/4.4/2.2%(미훈련 2.2/2.2/0/2.2)를 기록했고, 검증 승률로 선택된 것이 이 A4 라운드 2 writer다. 사전 등록된 단일 사용 테스트 분할에서 훈련된 writer는 지연 0에서 10.4%를 이겨 프롬프트만 쓴 summary의 3.3%보다 +7.0 [+1.9, +12.2] 포인트 높았고, 훈련 없는 belief 11.1%, slots 10.0%와 같은 대역에 올랐다. R2에서도 순서가 재현됐다(guide 11.1 > DSSR 5.6 > summary 2.2). 그러나 지연이 커지면 훈련 효과가 사라진다. F'∈{20,40}에서 summary 대비 +1.5 [-0.4, +3.3] 포인트, guide 대비 +0.9 [-0.9, +2.8]이고 지연 κ는 1.47 대 미훈련 1.50(-2% [-16, +16])이다. 지연 이득에 대한 사전 등록 게이트는 모두 실패했다. 재작성 횟수로 나눠 보면 검증에서 1~2회 재작성 구간의 κ를 81% 줄이고 3~5회에서 52%, 6~9회에서 44%(유의하지 않음), 10~29회에서 약 20%, 40회 이상에서는 오히려 나빠진다. 반면 손으로 쓴 guide 규칙은 테스트에서 40~59회 재작성 구간까지 모든 구간에서 κ를 20~50% 줄인다.
왜 그런지는 라운드 0 학습 후보 2,818개 쓰기 시점 분석으로 설명된다. 첫째, 후보는 입력을 물려받는다. 6개 후보는 같은 이전 상태의 재작성이므로 평균 커버리지(0.24)가 입력 상태와 같다. 지연 후 쓰기 시점의 51%(F'=40에서는 67%)에서 어떤 후보도 레시피 지시문을 담고 있지 않다. 한 번 재작성이 레시피를 버리면 best-of-n이 없는 것을 고를 수 없다. 둘째, 점수가 망각하는 이어짐 위에서 매겨진다. 후보가 실제로 갈리는 9% 지점에서 S_12는 더 완전한 후보를 우연 수준(28% 대 29%)으로만 선호한다. 후보를 넘겨받은 현재 writer가 몇 번의 재작성 안에 레시피를 버리는데, 유지에 보상할 결정은 10~40스텝 뒤에 있기 때문이다. 두 효과 모두 지연과 함께 커지고, 최선-최악 점수 격차 중앙값은 Phase A에서 0.6~0.8 nats인데 F'≥10에서는 0.23~0.27 nats로 얇아진다. t에서 사실을 유지하는 것은 t+1부터 t+40에서도 유지될 때만 값을 갖는데, 스텝별 점수는 그것을 볼 수 없다.
실무적으로 이 논문이 주는 지시는 두 가지다. 첫째, 요약 재작성·슬롯·belief 같은 상수 컨텍스트 메모리를 쓸 때 '컨텍스트가 부족해서 진다'는 가정은 대개 틀렸다. 128토큰이면 충분한데도 프롬프트만 쓴 writer는 0~11%밖에 못 이겼다. 병목은 무엇을 남길지 고르는 쓰기 시점의 결정이다. 둘째, 후보 상태를 '후보 + 원본 스텝' 형태로 평가하면 실제 결과와 상관이 없다(ρ ≤ 0.07). 상태의 가치는 그 뒤에 writer가 무엇을 또 버릴지에 달려 있으므로 writer를 앞으로 굴려서 평가해야 한다(ρ=0.48). 다만 학습된 writer의 이득은 사실이 곧 필요할 때만 유의하고, 긴 지연에서는 '음식·도구·기기 위치, 열린 컨테이너와 문, 방 그래프를 항상 유지하라' 같은 손으로 쓴 규칙이 모든 지연에서 더 낫다. 태스크 지식이 있다면 학습보다 규칙이 낫다는 뜻이다.
저자들이 밝힌 한계도 분명하다. 환경이 통제된 진단용이라 Phase A가 스크립트이고, F' 프로토콜에서는 writer가 레시피가 중요하다는 것을 알고 있으므로 '앞으로 무엇이 중요할지 전향적으로 고르는 능력'이 아니라 '중요하다고 알려진 사실의 유지'를 시험한다. guide는 태스크 지식을 쓰므로 여전히 가장 강한 예산 상태이고 DSSR은 짧고 중간 정도의 지연에서만 돕는다. κ는 best-of-8 hindsight 압축과 행동 복제된 reader에 상대적인 값이고, 두 번째 reader는 사전 등록 기준을 한 게임 차이로 놓쳤다. 4B 모델만 연구했고, 검증 선택이 가장 약한 테스트 시드를 골랐으며, 두 번째 GPU에서의 반복은 최대 14포인트 차이가 나서 각 표는 한 GPU에서만 나온 값이다.