세계 모델을 언제 믿을지 결정 단위 신뢰 인증 이론은 Dual-Frontier다
Dual-Frontier: When Can an Agent Trust Its World Model?
무엇인가
이 논문이 다루는 문제는 세계 모델(world model) 기반 에이전트의 실패 귀속(failure attribution)이다. 행동 결과를 예측하는 학습된 세계 모델에 의존해 계획을 세우다 실패하면, 그 궤적만으로는 손실의 원인이 에이전트의 의사결정 규칙인지 세계 모델인지 알 수 없다. 저자들은 이를 수익 손실의 반사실적 분해로 형식화한다. 고정된 연산자 A_φ가 주어진 세계를 정책으로 사상할 때 π̂ = A_φ(M̂), π° = A_φ(M)이라 두고, A = J* − J(π°)를 에이전트 결핍, W = J(π°) − J(π̂)를 세계 모델 효과, R = A + W를 전체 손실로 정의한다. W는 부호가 있는 값인데, 모델 오차가 제한된 에이전트를 우연히 도울 수도 있기 때문이다. 정리 1은 수동적 비식별성을 증명한다. 임의의 c ∈ (0, R_b]에 대해 (A, W) = (λ, c − λ)를 만족하면서 배포된 에피소드의 법칙이 완전히 동일한 2단계 참 세계들의 가족이 존재하며, 어떤 추정기도 최소최대 오차 c/2 이상, 양 끝점 분류는 1/2의 오차를 갖는다. 결정적으로, 공급된 세계 모델이 배포 점유 상태에서는 정확할 수 있고 모호성은 시도되지 않은 행동에만 존재할 수 있다. 즉 이 장애물은 수동적이며, 개입을 통한 검증은 정보를 복원할 수 있다.
어떻게 동작하나
제안 방법 Dual-Frontier는 이 진단 위에 세워진다. 요청 x = (z, M̂, π0, π1)는 학습된 세계 모델, 참조 행동 π0, 후보 행동 π1을 지정하고, Γ_M(x) = J_M(π1) − J_M(π0)로 두 세계 사이의 수익 대비를 정의한다. 핵심은 정리 2의 벨만 잔차 항등식이다. J(π) − Ĵ(π) = Σ_t E_{μ_t^π} Δ_t^π, 여기서 Δ_t^π = r − r̂ + (P − P̂)V̂_{t+1}^π이며, 이로부터 |J(π) − Ĵ(π)| ≤ ε_I(π) = Σ_t E[|r − r̂| + span(V̂_{t+1}^π)·TV(P, P̂)]가 나온다. 결과적으로 J(π1) − J(π0) ≥ Ĵ(π1) − Ĵ(π0) − ε_I(π1) − ε_I(π0)이 성립한다. 즉 예측된 이득이 행동 조건부 세계 모델 오차의 인증된 상한을 넘을 때만 세계 모델 기반 결정을 승인한다. 정리 3은 폐루프 확장으로, T_t = S_t − B_t − ξ_t, g_t = 1{T_t > 0}, ν_t = g_t·κ_t + (1 − g_t)·π0,t로 게이팅하면 J(ν) − J(π0) ≥ 0이 보장되고, 양의 마진 개입이 양의 확률로 도달되면 엄격한 개선이 성립한다. 보상 오차 ε_r과 전이 오차 ε_p 하에서 b_t = (H − t)ε_r + ½(H − t)(H − t − 1)R_b·ε_p라는 구체적 상한도 제시된다. 부호 2는 예측 정확도만으로는 결정을 인증할 수 없음을 보인다. 임의로 작은 균일 전이 오차가 세계 모델 탐욕 행동 순위를 뒤집을 수 있고, 총변동 거리 1이 모든 정책에 대해 정확한 가치와 공존할 수 있다.
무엇과 다른가
Dual-Frontier 학습 원리는 두 개의 경계를 유지한다. S(x)는 Γ̂(x)의 추정, B(x)는 세계 모델 왜곡 상한, ξ(x)는 추정 오차 상한일 때 T(x) = S(x) − B(x) − ξ(x)로 두고, 검증 경계 F_W = {x : S(x) > ξ(x), B(x) ≥ S(x) − ξ(x)}는 유망하지만 미인증된 비교를 검증으로 보내고, 에이전트 경계 F_A = {x : T(x) > 0}는 인증된 개선을 담는다. S ≤ ξ인 요청은 보류된다. 불확실성은 분할 등각 보정으로 처리한다. 점수 u를 교환 가능한 n개의 보정 요청에 대해 적합하고 q_j = e_j − u(x_j), k = ⌈(n+1)(1−α)⌉, B(x) = [u(x) + q_(k)]_+로 두면 P{e(x) > B(x)} ≤ α이며, 이로부터 P{T(x) > 0, Γ_M(x) ≤ 0} ≤ α + δ가 유도된다. 정리 4는 적응적 증거 재사용을 다룬다. D개 상태, m개 상태-행동 행, 행당 n개 표본에서 a_n = sqrt((D log 2 + log(4m/α))/(2n))로 신뢰 집합 C를 만들고, K = R_b·H(H−1), u_i = max_{s,a} min{1, TV(P̄, P̂_i) + a_n}이라 할 때 T_i = S_i − K·u_i − ξ_i > 0인 경우만 수용하면 잘못된 승격 확률이 α + Σδ_i 이하로 억제된다. 감사 비용은 mn 쿼리로 이후 비교 횟수와 무관하다. 통계적 가격도 명시된다. 충분 조건은 n > (2/s²)[D log 2 + log(4m/α)]이고, ±cγ(γ ∈ (0, 1/4])를 승격 확률 1−δ 이상과 δ 이하로 구분하려면 n ≥ kl(1−δ, δ)/(16γ²)가 필요하다. 즉 신뢰할 수 있는 승격의 역제곱 비용이 정리된다. 또한 누적 마진 J(π_n) − J(π0) ≥ Σ T_i이고 T_i ≥ τ인 승인 개수는 (H·R_b − J(π0))/τ 이하이므로, 유계 목표는 고정된 양의 인증 마진을 무한히 유지할 수 없다.
어떻게 쓰나
실험은 두 단계다. 먼저 통제된 유한 세계 실험에서 희소·체인·그리드 환경(각 16개 상태, 4개 행동, 지평 H ∈ {4, 8, 12})에 행동 조건부 세계 모델을 학습시켰다. 40개 개발 세계로 프로토콜을 고정하고, 80개 독립 세계로 감사, 240개 분리된 홀드아웃 세계로 최종 평가했다. 세계 모델은 베타 스무딩 경험적 전이 커널이고, 별도로 수집한 행당 32쿼리 모델이 고정 참조 행동을 결정한다. 400개의 짝지은 구성이 같은 학습 모델과 수동 기록을 공유하되 관측되지 않은 한 행동에서만 달라진다. 결과적으로 표적 증거 수집은 귀속 정확도를 50.25%에서 100%로 끌어올리고 효과 오차를 0.0900에서 0.0189로 약 5분의 1로 줄였다. 11,520개 요청에서 자격 판정은 유해한 사용을 5.10%에서 0.30%로 낮췄다. 참 결정 마진만 변화시킨 로그-로그 실험에서 지수 2.014가 나와 n = Θ(γ^−2) 스케일링과 일치했고, 공유 인증서는 200개의 적응적 요청을 664개 대 350,400개의 실제 쿼리로 처리해 527.7배 절감하면서도 패밀리와이즈 거짓 승격 위험을 5% 미만으로 유지했다.
전제와 한계
두 번째 단계는 실제 도구 사용 파이프라인이다. Qwen-AgentWorld를 학습된 세계 모델로 쓰고 Llama-3.1-8B-Instruct와 Qwen3-8B를 평가했으며, 벤치마크는 함수 호출의 BFCL v4, API 사용의 API-Bank, 이종 도구 스키마의 NexusRaven이다. 각 요청에서 에이전트가 기본 행동을 내고 Qwen-AgentWorld가 예측된 결과와 함께 후보 수정안을 제안하는데, 모든 라우팅 규칙이 동일한 후보·프롬프트·스키마·추론 예산을 공유하고 승인 방식만 다르다. 표 1에서 Dual-Frontier는 두 백본 모두 모든 벤치마크-지표 쌍에서 1위다. Llama-3.1-8B-Instruct에서 평균 성공률 91.62, 파라미터 정확도 95.71로, 가장 강한 경쟁 규칙(Consistency 80.05/89.78) 대비 성공률 11.57점, 정확도 5.93점 높다. Qwen3-8B에서는 92.03/96.27로 경쟁 규칙(80.96/90.44) 대비 11.07점, 5.83점 높다. Always-WM은 각각 평균 50.81/73.44, 50.66/73.91로 무너지는데, Dual-Frontier는 이를 31.10~58.12점 앞선다. 참고로 프런티어 모델인 GPT-6 Astra는 84.61/88.68, Claude Opus 5는 72.27/94.72, GLM-5.3-Flash는 77.44/82.13이다. 세 개의 생성 시드에서 변동이 제한적이었고, 유해 수정 비율도 두 백본 모두 낮아졌다.
개발자 관점에서 이 논문의 실용적 메시지는 명확하다. 세계 모델을 붙일 때 물어야 할 질문은 '이 모델이 전반적으로 정확한가'가 아니라 '지금 이 행동을 정당화할 만큼 증거가 충분한가'다. 같은 제안이 어떤 요청에서는 도움이 되고 다른 요청에서는 해가 될 수 있으므로, 모델을 전역적으로 신뢰하거나 불신하는 대신 요청 단위로 승격 여부를 결정해야 한다. 구현 관점에서는 참조 행동 π0를 명시적으로 두고, 후보의 예측 이득 S에서 세계 모델 왜곡 상한 B와 추정 오차 ξ를 뺀 T가 양수일 때만 후보를 채택하며, 그렇지 않으면 기본 행동을 유지하는 구조가 핵심이다. B는 등각 보정으로, ξ는 표본 수 기반 신뢰열로 관리하고, 감사 비용 mn을 한 번 지불하면 이후 비교들에 인증서를 재사용할 수 있다는 점이 실무적으로 중요하다. 또한 승격 임계값을 낮추면 개선은 빨라지지만 유해 수정도 함께 늘어난다는 트레이드오프가 표 2의 단조 회복 결과로 확인된다.
저자들이 밝힌 전제와 한계는 다음과 같다. 분해 자체가 하나의 고정된 예측 의사결정 절차에 상대적이며, 모델 오차가 제한된 에이전트를 우연히 도울 수 있어 W는 부호를 갖는다. 인증 실패는 해악의 증명이 아니고, 승격 거부도 세계 모델 실패의 증거로 해석되어서는 안 된다. 비식별성은 수동적 상호작용에 한정된 장애물이며, 개입을 통한 검증은 빠진 정보를 복원할 수 있다. 폐루프 보장은 결정 특정적이어서, 게이팅된 정책이 유도하는 상태 분포 하에서 국소 예측 이득과 연속 가치 불확실성을 비교하는 것이지 전역 보장이 아니다. 검증된 점유 상태를 벗어난 분포 이동은 별도 부록에서 다루며, 불안정한 연산자는 작은 예측 오차를 증폭시킬 수 있다. 실험도 유한 지평의 통제된 세계와 특정 도구 사용 벤치마크에 국한되며, 보상은 공유되고 유계라는 가정이 깔려 있다.