RLVR에서 탐색을 별도 정책으로 분리해 성능 저하 없이 확장한다
Decoupling Exploration from Optimization in RLVR
무엇인가
RLVR(검증 가능한 보상 기반 강화학습)은 이미 훈련된 체크포인트 위에서 정답/오답을 프로그램 검증기로 채점하고 통과한 해를 강화하는 방식으로 추론 능력을 끌어올린다. 문제는 검증 보상이 모델 지식과 행동의 아주 좁은 조각만 감독한다는 점이다. 위키백과 수준의 지식을 대부분 잊어도 수학 보상은 여전히 높게 나올 수 있고, 따라서 탐색 과정에서 생긴 그 바깥의 손상을 보상은 감지하지도 복구하지도 못한다. 논문은 novelty(새로움) 보너스를 보상에 직접 더하는 관행이 실패하는 이유가 새로움 자체가 아니라 그 보너스를 어디에 적용하느냐에 있다고 본다.
어떻게 동작하나
제안 프레임워크 ExpDis(Exploration-Distillation)는 탐색과 최적화를 서로 다른 모델 인스턴스에 맡긴다. 같은 베이스 체크포인트에서 탐색자(explorer) 정책과 학생(student) 정책을 각각 출발시킨다. 탐색자는 novelty 보너스를 받으며 공격적으로 탐색하고, 학생은 novelty 보상을 절대 보지 않는다. 두 모델은 파라미터를 공유하지 않고 필터링된 궤적을 통해서만 정보를 주고받는다. 그래서 학생은 탐색자의 발견은 흡수하되 탐색이 유발한 성능 훼손은 물려받지 않는다.
무엇과 다른가
탐색자 보상은 r_correct + λ·r_novelty·1[r_correct=+1] + r_overlong 형태다. 핵심은 novelty 항이 정답 궤적에만 곱해진다는 점으로, 모든 롤아웃에 보너스를 주면 새롭기만 한 쓰레기 출력으로 보상을 올릴 수 있어 학습이 불안정해진다. novelty 신호로는 Random Network Distillation(RND)을 쓴다. 언어모델의 중간 레이어 은닉 상태에서 특징을 뽑아, 레이어마다 작은 predictor MLP가 동결된 랜덤 타깃 MLP를 맞추도록 훈련하고 그 예측 오차를 새로움으로 삼는다. 완성 토큰에 대해 평균 풀링하고 레이어별 RMSE를 평균낸다. 가중치 λ는 0.5에서 성능이 대략 정점을 찍었고, λ를 아주 크게 잡아도 학생은 베이스 모델을 앞섰다.
어떻게 쓰나
수집 단계는 정답성만이 아니라 품질로 거른다. 최종 박스 답이 맞고, 정해진 토큰 예산 안에 끝나고, 반복 루프가 없는 궤적만 통과시킨다. 그다음 문제당 가장 짧은 궤적 하나만 남겨, 탐색자가 어떤 문제를 여러 번 맞혀도 학생 데이터를 지배하지 못하게 한다. 라운드당 최대 500개로 상한을 둔다. 학생은 이 궤적에 표준 크로스엔트로피로 SFT를 하고, 이어서 novelty 보너스 없는 정답 전용 보상으로 DAPO를 돌려 최종 학생 정책을 얻는다.
전제와 한계
확장은 두 축이다. 하나는 한 라운드 안에서 K개의 독립 탐색자를 병렬로 돌려 궤적을 모아 필터링하는 것(탐색자들은 같은 λ를 쓰고, 계산량을 나눠 쓰므로 wall-clock은 늘지 않는다). 다른 하나는 라운드를 반복하는 것으로, 훈련 프롬프트를 겹치지 않는 R개 샤드로 쪼개 라운드 r이 샤드 D_r만 쓰게 한다. 즉 매 라운드가 더 강한 초기값과 아직 안 쓴 프롬프트를 짝지으며, novelty 가중치는 4라운드에 걸쳐 0.75에서 0.25로 어닐링한다.
실험은 Qwen3-1.7B, Qwen3-4B, Ministral-3-3B-Instruct-2512를 베이스로 한다. 평가는 AIME24/25/26, MATH500, AMC23, Minerva-Math, GSM8K 일곱 개 수학 벤치마크에서 문제당 64개 샘플(AMC23은 32, GSM8K는 8)로 pass@k를 측정했고, GSM8K와 AMC23는 포화 상태라 나머지 다섯 개 평균에 초점을 맞췄다. 베이스라인은 GRPO, Dr.GRPO, DAPO이며 DAPO가 가장 강했다. 예산은 300 RL 스텝, 스텝당 프롬프트 4개, 그룹 크기 16, 최대 생성 32,768 토큰이고 ExpDis는 이를 탐색자 200 + 학생 100으로 나눈다. 결과적으로 세 모델 모두 평균 정확도에서 DAPO를 앞섰고, 단일 라운드만으로도 4배 스텝을 돌린 DAPO보다 좋았으며 pass@k도 64 생성까지 우세했다. 다만 본문에는 구체적인 정확도 수치가 숫자로 제시되지 않고 그림에만 담겨 있다.
절제 실험과 다양성 분석도 분명하다. DAPO에 novelty 보너스를 직접 더하면 어휘 다양성과 정답 다양성은 늘지만 수학 성능은 소폭 떨어지고, MMLU-Pro·MMLU-Redux·GPQA-Diamond·ZebraLogic·IFEval 같은 일반 능력 벤치마크에서는 베이스 모델 아래로 내려간다. ExpDis는 이런 저하 없이 탐색 이득만 가져간다. 필터 없이 증류하고 RL을 돌리거나, 필터링된 궤적만 증류하고 RL을 생략하면 둘 다 AIME24에서 DAPO보다 약간 낮았고 전체 절차는 그 위였다. 문제당 최단 유효 궤적만 남기는 것이 모든 정답 궤적을 남기는 것보다 좋았다. RND를 kNN 기반이나 elliptical 보너스로 바꿔도 평균 정확도 하락은 최대 1.6점이었고 둘 다 DAPO는 앞섰다. 확장에서는 깊이(라운드)가 pass@1에 더 기여하고, 깊이와 너비를 조합하면 pass@k가 더 좋아졌다. 이 예산에서는 탐색자 3개, 라운드 4회 이후 이득이 포화되고 퇴행 조짐이 나타났다.
저자들이 밝힌 전제와 한계는 이렇다. 이득의 포화와 퇴행은 그들이 쓴 예산 규모에서 관찰된 것이고, 예산이 커지면 최적 라운드 수와 탐색자 수가 함께 늘어날 것으로 예상한다. 실험은 단일 novelty 보너스와 학생과 같은 아키텍처의 탐색자에 국한됐다. 일반 능력 저하는 이 규모에서 미미했지만, 더 큰 RLVR 런에서 탐색 보너스를 배포 모델에 직접 적용하면 손상이 누적될 위험이 있다고 추측한다. 실무적으로 얻을 교훈은 명확하다. novelty 보너스를 배포 모델에 직접 넣지 말고 별도 탐색 정책에 격리한 뒤, 정답·길이·반복 여부로 걸러낸 궤적만 증류하라. wall-clock 예산이 고정이라면 탐색자를 병렬로 늘리는 쪽이 시간 비용 없이 다양성을 확보하는 길이다.