내재적 보상이 탐험으로 이어지지 않는 조건을 형식화한다

When Do Intrinsic Rewards Lead to Exploration?

arXiv2610.02159v1

Scott W. Viteri2026-10-01조회 2

무엇인가

강화학습에서 내재적 보상은 예측 오차나 학습 진전 같은 신호로 에이전트의 경험에 가치를 부여해 탐험을 유도한다. 그런데 이 보상을 최대화하는 것이 반드시 가장 정보량이 많은 경험을 만들어내지는 않는다. 이 논문은 정책이 획득하는 반사실적 정보, 즉 한 정책이 쌓은 히스토리가 다른 정책의 경험을 얼마나 잘 대체할 수 있는지를 기준으로 정책을 비교하는 형식적 기준을 제안한다. 기반은 Blackwell(1953)과 Le Cam(1964)의 통계적 실험 비교, 그리고 실험 간 재현 오차를 재는 deficiency 개념이다.

어떻게 동작하나

방법의 골격은 이렇다. 세계 Q는 각 히스토리에 대한 관측 확률 p_Q(h)로 표현되고, 정책 π가 t스텝 동안 만드는 히스토리 분포는 K_{π,t}(Q,h) = p_Q(h) ∏ π(a_r|h_{r-1})다. 이는 히스토리를 신호로 갖는 통계적 실험이 된다. 랜덤화된 디코더 G가 소스 실험의 신호를 변환해 타깃 실험의 신호 분포를 재현할 때, 최선의 디코더로도 남는 최악 세계에서의 total variation 오차가 deficiency δ(E,T)다. 정책 비교는 유한 목표 접두사를 임의 정확도로 재현할 수 있는지를 묻는 finitary process preorder π ⪰_fin ρ로 정의되고, 모든 정책을 지배하는 정책을 natively sufficient 또는 completely exploring이라 부른다. 목적함수 J가 이 순서에 대해 단조라면 지배당하는 정책이 최적해가 될 수 없고, 엄격 단조라면 지배 관계가 있는 모든 경우에 그런 배제가 보장된다.

무엇과 다른가

논문은 알람 환경 하나를 구성해 여러 내재적 보상이 열등한 정책을 최적으로 고른다는 것을 보인다. 세계는 θ ∈ ℕ ∪ {∞}이고, 시작 시 INSPECT를 고르면 알람이 영원히 울리지 않을지 여부를 알려주는 대신 디스플레이가 꺼지고, PLAY를 고르면 디스플레이가 켜진 채 그 답을 알 수 없다. 사전확률은 α(∞)=1/2, α(k)=2^{-(k+2)}다. 검사 정책은 s=1일 때 다른 모든 정책을 엄격히 지배한다. 그런데 의사카운트 기반 카운트 보너스(보상 1/√(N+1))는 H≥64인 모든 유한 지평에서 최대화 정책이 전부 검사를 건너뛰게 만들고, 완전 리턴은 모든 정책이 +∞, 장기 평균 리턴은 0으로 모두 동점이 된다. Shannon·Square 예측 보상은 모든 0<γ<1에서 검사를 건너뛰는 정책만 선택하며, 이 선호는 할인율이 1에 가까워져도 유지된다. Empowerment는 장기 평균 (1-s)/2 비트를 주어 s=0을 최적으로 만든다. 별도 MDP에서 최대 점유 원리는 최적해가 미지 비트를 확률 1/3로만 읽게 하고, 상태 방문 엔트로피는 정보가 없는 무작위 상태에 머무는 것을 최적으로 하며, DIAYN은 미지 비트를 최대 1/2 확률로 읽는다.

어떻게 쓰나

후방분포 기반 보상에서는 학습 경로가 획득한 증거를 앞지를 수 있다는 점이 드러난다. 정보 이득, Brier, Hellinger, Absolute 네 가지는 알람 환경에서 모두 검사를 선호하지만, 4개의 독립적인 공정 비트를 한 번에 공개하는 FULL과 3개를 순차적으로 공개하고 네 번째는 끝까지 공개하지 않는 PARTIAL을 비교하는 16세계 예에서 Hellinger와 Absolute는 완전 리턴과 9/10 ≤ γ < 1 구간에서 PARTIAL을 선호하고, 그 최적해의 FULL deficiency는 1/2다. 정보와 Brier는 FULL을 선호한다. 더구나 알람에서 모든 정책의 완전 정보 리턴은 2비트, 완전 Brier 리턴은 2/3로 같아서, 극한 목적함수를 최적화하면 D(π)=1/2인 정책까지 모두 최대화 정책이 된다. 유한 지평이나 할인 최적화와 그 극한 최적화가 다르다는 뜻이다.

전제와 한계

이론적 보장도 제시된다. 세계 클래스가 유한하고 사전이 모든 세계에 양의 질량을 주며 Ψ가 연속이고 엄격 볼록이면, 극한 기대 후방 점수 이득 J_Ψ는 finitary preorder에 대해 엄격 단조이고, 충분 정책이 실현 가능한 정책군에 있으면 그 최대화 정책은 정확히 충분 정책들이다. 무한 세계 클래스에서는 사전 평균 오차와 최악 세계 오차가 갈라져서, 알람의 사전 평균 불확실성이 사라져도 검사 없이는 최악 오차 1/2가 남는다. 모든 유한 접두사 질량이 수렴하는 컴팩트성과 유한 엔트로피 사전 같은 추가 조건이 있어야 두 비교가 일치한다. 임의의 세계 클래스에 대해서는 유한 native 실험들의 rich countable family를 잡아 native score J_w(π) = 1 - Σ w_j ℓ_j(π)를 만들면 [0,1] 유계이면서 엄격 단조가 된다. 다만 완전 탐험이 항상 가능하지는 않다. 두 미지 비트를 가진 4세계 예에서는 모든 정책이 undominated인데 어느 정책도 두 오차를 동시에 0으로 만들지 못한다. 또한 두 결정적 계산가능 세계에서 어떤 알고리즘도 모든 계산가능 정책의 실수 점수를 임의 정밀도로 평가할 수 없다는 결과가 부록에 있다.

계획 실험은 4개 또는 8개 세계로 이루어진 22개 클래스에서 3스텝 정책을 최적화하고, 128개 결정적 3스텝 타깃으로 학습한 뒤 최적화에서 제외한 32,768개 4스텝 타깃 중 가장 어려운 것으로 평가한다. native mean은 22개 클래스 중 18개에서 일반 Brier보다 4스텝 평가 오차가 낮았고 2개는 동점, 2개는 패배였다. native maximum을 최소화하면서 고정된 native-mean 정책의 Brier 리턴을 유지하는 다른 native 목적함수는 15승 1 동점 6패를 기록했다. 22개 reward-matched 쌍 중 21개에서 두 실험이 서로를 정확히 시뮬레이션하지 못했다. 사전에 지정된 16-타깃 벤치마크는 Brier 대비 승리를 하나도 내지 못했다.

실무적으로 이 논문은 내재적 보상 shaping을 쓸 때 보상 최대화가 정보 수집을 보장하지 않는다는 점을 확인하라는 신호다. 특히 관측의 무작위성 자체가 보상을 주는 구조(예측 오차, 엔트로피, 카운트 보너스)에서는 학습할 미지 메커니즘이 없어도 노이즈를 선호하는 정책이 최적이 될 수 있으므로, 보상 곡선과 실제로 얻는 세계에 대한 정보량을 분리해 점검해야 한다. 저자들이 밝힌 한계도 분명하다. 이 논문은 정확한 최적화를 분석하며 학습 알고리즘의 성능은 별개 문제다. native score는 인터페이스와 가중치 선택에 의존하고 일반적으로 계산 가능한 평가자가 없으며, 22개 클래스 실험은 보편적 우월성이나 극한 탐험을 입증하지 못한다. 관측된 상호작용과 수행되지 않은 상호작용을 연결하는 세계 클래스 가정의 검증, 그리고 다루기 쉬운 목적함수 개발이 열린 문제로 남는다.