PoS는 명시적 신념 상태로 장기 LLM 에이전트의 신뢰성을 높인다

Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States

HF Daily2610.01415

Yu Luo, Jiamin Jiang, Yimin Zuo2026-10-01조회 3

무엇인가

LLM 에이전트가 수행하는 작업의 지평이 길어지면서, 상호작용 이력을 메모리로 조직하는 방식만으로는 현재 세계에 대한 일관된 이해를 보장할 수 없다는 것이 이 논문의 출발점이다. 행동이 환경을 바꾸고 새 관찰이 이전 추론을 무효화하기 때문에 누적된 컨텍스트에는 과거 상태의 증거와 중간 판단이 뒤섞여, 어떤 사실이 아직 유효한지, 어떤 추론이 지지되는지, 무엇이 미해결인지 식별하기 어려워진다. 원시 궤적은 증거를 시간순으로 보존하고 메모리 기법은 이를 선택·압축·재조직하지만, 저자들은 증거에 접근할 수 있다는 것만으로는 단계를 넘나들며 수정·검증 가능한 현재 세계의 명시적 추정이 확보되지 않는다고 주장한다. 형식적 근거는 POMDP의 신념 상태 b_t(s)=P(s_t=s|h_t)이며, 이는 의사결정의 충분통계량이지만 LLM이 생성하는 신념은 일관성과 진전이라는 두 가지 추가 요건을 만족해야 한다.

어떻게 동작하나

PoS(Progression of States)는 추론 시점(inference-time) 프레임워크로, 신념 B_t=(W_t, G, Δ^E_t, Δ^A_t)를 명시적 의사결정 컨텍스트로 유지한다. W_t는 과제 관련 세계 상태를 Entity–State–Relation 구조로 표현한 것으로, 각 State와 Relation에 출처와 신뢰도, 가능하면 지지 증거를 주석으로 붙인다. 엔티티의 조건 변화가 어떤 행동이 가능한지, 목표가 충족됐는지를 직접 좌우하기 때문에 단순한 개체 식별과 연결만으로는 부족하다는 것이 이 구조를 택한 이유다. G는 과제 목표, Δ^E_t는 아직 알지 못하거나 충분히 지지되지 않은 정보(인식적 격차), Δ^A_t는 현재 신념과 목표 상태 사이의 불일치(성취 격차)를 담는다. 즉 무엇을 더 배워야 하는지와 무엇을 해내야 하는지를 분리해 표현한다. 에이전트는 모든 격차에 동등한 우선순위를 주는 대신 현재 세계 상태와 목표에 비추어 가장 가치 있는 활성 격차 Δ_t를 골라 행동 a_t ~ π(·|B_t, Δ_t, C_t)를 선택한다. 여기서 C_t는 복구 제약으로 평상시에는 비어 있고 트래핑이 감지될 때만 추가된다.

무엇과 다른가

새 관찰 o_{t+1}이 들어오면 과제 에이전트가 후보 신념 B̃_{t+1}=U(B_t, a_t, o_{t+1})를 만들지만, 이는 자기 자신이 생성한 것이어서 잘못된 가정이나 추론 오류, 환각을 물려받을 수 있다. PoS는 Belief Sentinel로 이를 감사한다. 같은 엔티티에 양립 불가능한 상태가 동시에 부여되는 내적 불일치와, 최신 관찰이나 다른 상호작용 증거와 모순되는 외적 불일치를 검사하고, 과제 에이전트가 증거에 비추어 후보를 수정한 뒤에야 B_{t+1}로 커밋한다. 다음은 Belief Trapping, 즉 목표를 향한 의미 있는 진전 없이 행동을 계속하는 실패 모드의 탐지와 복구다. PoS는 최근 K개 검증 전이 창에서 세 신호를 측정한다. 격차 지속성 P_X는 창 전체에서 미해결로 남은 X형 격차의 비율, 진전 정체 S_t는 진전이 기록되지 않은 전이의 비율, 신념 재발 R_t는 활성 격차에 관련된 세계 상태가 후보 시차들 중 최대 재발률로 반복되는 정도를 Jaccard 거리로 잰 값이다. 건강도는 H_t = 1 - max_X[P_X · max(S_t, R_t)]로 계산하고 H_t ≤ θ_H이면 트래핑으로 판정한다. 진단 태스크에서는 연속 신념 간 신뢰도 변화 d^diag_t = ½Σ|c_t(x)-c_{t-1}(x)|가 임계값 ε을 넘을 때 u_t=1로 표시하고, 실행 태스크에서는 활성 격차를 줄이거나 필요한 정보를 얻거나 목표로 가는 경로를 전진시킨 경우 Sentinel이 u_t=1을 부여한다. 트래핑이 감지되면 에이전트 역학(Static/Cycle/Drift)과 막힌 격차 유형(E 또는 A, 지속성이 더 큰 쪽)의 두 축으로 원인을 분해 진단하고, 패턴별 탈출 제약과 격차별 진전 제약을 합쳐 C_t로 적용한다. Static이면 비효율적 상태–행동 전이를 억제하고, Cycle이면 우세 재발 시차 k*_t가 가리키는 반복 전이를 끊고, Drift면 활성 격차로 행동 선택을 재고정한다. 격차 제약은 X=E일 때 새롭게 판별력 있는 증거를, X=A일 때 과제 관련 상태 변화를 요구한다. 복구 중에도 활성 격차는 유지되며, H_t > θ_H가 되면 제약이 해제된다.

어떻게 쓰나

실험은 실행 과제인 ALFWorld·LOCA-Bench와 진단 과제인 RCA-100·ClinDiag 네 벤치마크에서 Qwen3.7-Plus, Kimi-K3, GLM-5.3 세 백본으로 수행했다. 베이스라인은 ReAct 하네스를 공통으로 쓰는 Raw Trajectory, ACON, PACE, HiAgent와 자체 제어 구조를 유지하는 LongHorizon-Harness다. PoS는 세 백본 모두에서 네 벤치마크 전부 최고 종합 성능을 냈고, 같은 백본의 최강 베이스라인 대비 상대 개선폭은 ALFWorld 22.68%, LOCA-Bench 7.53%, RCA-100 joint accuracy 37.89%, ClinDiag 11.31%였다. 반면 기존 컨텍스트 관리는 원시 궤적을 일관되게 능가하지 못했다. PACE는 ALFWorld와 RCA-100에서는 경쟁력이 있었지만 LOCA-Bench에서 Raw Trajectory보다 24.57~28.19점 낮았고, LongHorizon-Harness는 중간 산출물 검증이 가능한 LOCA-Bench에서는 좋았으나 불확실한 진단 가설을 다듬어야 하는 RCA-100·ClinDiag에서는 이득이 일관되지 않았으며, GLM-5.3의 ClinDiag에서는 어떤 컨텍스트 관리 베이스라인도 Raw Trajectory를 앞서지 못했다. 어블레이션에서 일관성 검증을 제거하면 ALFWorld 최대 14.93점, LOCA-Bench 11.81점 하락했고 ClinDiag에서는 0.33~0.66점에 그쳤으며, 트래핑 진단과 복구를 제거하면 RCA-100에서 4.85~6.79점, ClinDiag에서 2.65~3.97점 떨어졌다.

전제와 한계

트래핑 분석에서 트래핑은 모든 설정에서 흔했고 강한 백본일수록 발생률이 낮았지만, 낮은 발생률이 높은 최종 정확도를 뜻하지는 않았다. RCA-100에서 Kimi-K3는 GLM-5.3보다 트래핑이 많았지만(74% 대 53%) joint accuracy는 더 높았다. 우세 패턴은 벤치마크마다 달랐는데 ALFWorld는 순환, LOCA-Bench와 RCA-100은 드리프트(55.93%), ClinDiag는 정적 정체(78.25%)가 가장 흔했다. 분해 복구 대신 일반적인 복구 프롬프트를 주는 변형과 비교했을 때 PoS의 복구 전략이 네 벤치마크 모두에서 우세했다. 비용 측면에서 RCA-100·Qwen3.7-Plus 기준 PoS는 joint accuracy를 24.27%에서 38.83%로 올리면서 Task Agent 토큰 소비를 20.9% 줄였지만, 신념 구축과 유지에 추가 연산이 들어가 총 소비는 5.06배가 됐다. 일관성 검증을 제거하면 Sentinel 오버헤드가 줄어 총 토큰이 35.6% 절약되지만 joint accuracy가 7.76점 손실되고, 트래핑 진단과 복구를 제거하면 총 토큰 9.2%만 절약되면서 Task Agent 소비는 늘고 정확도는 4.85점 떨어진다. 컨텍스트 확장 실험에서 LOCA-Bench 환경 설명이 8K에서 256K로 커질 때 PoS는 96K~256K 구간에서 성능이 대체로 안정적이었고 256K에서 최강 베이스라인을 10.67~16.00점 앞섰다.

실무 관점에서 이 논문은 장기 실행 에이전트의 컨텍스트 관리를 이력 보존과 압축의 문제로만 보는 관점에 반례를 제시한다. 도구 호출이 환경을 바꾸고 관찰이 이전 추론을 무효화하는 워크플로, 예컨대 브라우저 자동화나 인시던트 진단, 다단계 리팩터링에서 대화 이력을 요약하는 대신 현재 세계 상태와 미해결 요구사항을 구조화된 신념으로 유지하는 설계가 성능과 컨텍스트 확장성 모두에 도움이 될 수 있다는 근거를 준다. 다만 도입 전에 총 토큰이 5배 수준으로 늘어난다는 점과, 신념 갱신을 별도 검증기로 감사하는 추가 호출 비용을 감수할지를 따져야 한다. 정적·순환·드리프트 같은 정체 패턴을 구분해 복구 제약을 다르게 주는 부분은 단순히 다시 시도하라는 프롬프트보다 효과적이었다는 실험 결과가 있으므로 자체 에이전트 루프 설계에 참고할 만하다. 임계값 θ_H, ε, K, L, θ_R 같은 하이퍼파라미터는 부록 D에 정리되어 있다.

저자들이 밝힌 한계는 분명하다. PoS는 더 많은 토큰을 쓰며, 이 오버헤드를 성능 이득을 유지한 채 줄이는 것이 향후 과제라고 결론에서 밝힌다. 또한 LongHorizon-Harness 같은 감사 기반 접근은 독립적으로 검증 가능한 중간 결과가 있을 때 적합하고, 진전이 관찰 가능한 산출물이 아니라 불확실한 추론의 개선으로 이루어지는 경우에는 덜 적합하다는 전제가 깔려 있다. 신념 갱신의 일관성 검증과 트래핑 복구는 모두 LLM 호출에 의존하므로 백본의 추론 능력에 효과가 좌우될 수 있는데, ClinDiag에서 일관성 검증 제거 시 손실이 0.33~0.66점에 그친 것을 저자들은 복잡한 상호작용에서 상태와 관찰을 조정해야 할 때 불일치 위험이 더 커진다는 패턴으로 해석한다.