되돌아본 판단이 바뀌는 지점에서 분기해 RLVR 롤아웃 비용을 줄인다

Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards

HF Daily2609.36864

Fanchao Chen, Hengyu Fu, Shivaram Venkataraman2026-09-29조회 5

무엇인가

그룹 상대(group-relative) 기법으로 검증 가능한 보상 기반 강화학습(RLVR)을 할 때 가장 큰 비용은 롤아웃 생성이다. 같은 문제에 대해 G개의 완전한 궤적을 독립적으로 샘플링하기 때문에 긴 추론 트레이스나 에이전트 과제에서는 비용이 더 커진다. 저자들은 궤적 안의 토큰이 학습에 똑같이 기여하지 않는다는 선행 결과(상위 20% 엔트로피 토큰만 업데이트해도 동등 이상)를 출발점으로 삼는다. 토큰을 골라 업데이트하는 방식은 최적화 비용을 줄일 뿐 생성 비용은 줄이지 못한다는 것이 문제의식이다. TreeRL·BPO 같은 분기 기법은 엔트로피로 중간 결정에 롤아웃을 배분하지만 관측된 결과를 반영해 이전 결정을 재평가하지 않고, PivoARL·R3L 같은 성찰 기반 기법은 재시도 지점을 찾는 별도 학습 목표를 도입한다.

어떻게 동작하나

HDL은 완료된 루트 궤적 y와 검증기 피드백 f가 주어지면 롤아웃 정책이 결과를 해석하는 성찰 r을 생성하고 h=[f;r]을 hindsight 문맥으로 만든다. 이어 루트의 기록된 토큰을 다시 입력으로 넣는 teacher-forcing 방식으로 두 분포를 계산한다. 원래 문맥 p_i^0 = π(x, y_<i)와 hindsight 문맥 p_i^H = π(x, h, y_<i)다. 각 샘플 토큰의 점수는 두 로그확률 차의 절댓값 s_i = |log p_i^H(y_i) − log p_i^0(y_i)|이며 이를 hindsight-divergence 점수라 부른다. 절댓값을 쓰는 이유는 성공 궤적에서는 hindsight가 핵심 토큰의 확률을 높일 수 있고 실패 궤적에서는 오류 지점의 확률을 낮출 수 있기 때문이다. 점수가 높은 위치를 분기점으로 선택한다. 학습 그룹은 G개 중 M개만 완전한 루트로 샘플링하고 나머지 G−M개는 선택된 분기점에서 원래 과제 문맥 π(x, y_<i)로 새 접미사만 샘플링해 채운다. hindsight 정보는 분기점 선택에만 쓰이고 접미사 생성에는 쓰이지 않는다. 손실은 새로 생성된 접미사 토큰에만 적용해 공유 접두사를 중복 계산하지 않으며, 목적함수는 GRPO와 동일하다.

무엇과 다른가

실험은 수학·코드·에이전트 세 영역이다. 수학은 DeepMath-103K에서 초기 정책으로 너무 쉽거나 어려운 문제를 걸러 4,555개를 남겼고, 코드는 DeepCoder의 TACO·PrimeIntellect 부분집합과 rStar-Coder의 seed_testcase를 합쳐 4,063개를 썼다. 에이전트는 ScienceWorld 텍스트 환경으로 30개 과제 유형에 걸쳐 1,856개 과제-변형 쌍, 에피소드당 30행동 제한이다. 모델은 Qwen3-4B, Qwen3-8B, Llama-3.1-Nemotron-Nano-8B-v1 세 가지다. slime 프레임워크, GB200 GPU 4개씩 4노드, 스텝당 128문제, 그룹 크기 G=16, 200 스텝, 학습률 1e-6, 샘플링 온도 1.0으로 통일했다. HDL 기본 설정은 문제당 루트 M=2개, 루트마다 분기점 2개, 각 분기점에 3개·4개 연속 궤적을 배분해 2×(1+3+4)=16개를 만든다.

어떻게 쓰나

GRPO 대비 생성 토큰 35~61%, 롤아웃 벽시계 시간 18~45%를 줄였다. 롤아웃 속도는 GRPO 대비 1.22~1.83배, DAPO 대비 1.52~3.18배다. Qwen3-8B 수학에서 스텝당 평균 생성량이 27.28M에서 10.59M 토큰으로 줄었다. DAPO와 비교하면 세 영역에서 생성 토큰이 43~75% 적다. 성능도 함께 올랐다. Qwen3-8B 수학 평균 점수는 HDL 54.16%로 GRPO 53.17%, DAPO 53.47%를 앞섰다. Qwen3-4B 수학은 51.86%로 DAPO에 0.62점 뒤졌지만 DAPO가 약 4배 토큰을 쓴다는 점을 감안해야 한다. 코드에서는 Qwen3-4B 54.15%, Qwen3-8B 55.56%로 두 모델 모두 최고 정확도다. 가장 큰 폭은 에이전트(ScienceWorld)에서 나왔다. Qwen3-4B는 GRPO 57.76%에서 67.44%로 9.68점, Qwen3-8B는 59.50%에서 71.96%로 12.46점 올랐고 DAPO도 각각 6.60점, 11.16점 앞선다. 저자들은 초기 잘못된 행동이 되돌릴 수 없는 실패로 이어지는 장기 상호작용 환경에서 hindsight로 결정적 전환점을 찾아 여러 접미사를 분기시키면 실패 직전 에피소드를 구제해 보상 분산이 큰 그룹을 만든다고 해석한다.

전제와 한계

분기점 선택 신호 자체를 비교한 통제 실험(Qwen3-8B)에서 HDL이 세 영역 모두 최고였고, 에이전트에서 엔트로피 기반보다 5.67점, 성찰 기반보다 6.54점 높았다. ScienceWorld 분석에서 엔트로피는 성공 루트 80.8%, 실패 루트 83.7%의 분기점을 동사(행동 개시어)에 두는 반면, HDL은 실패 루트에서 인자(목적어·목적지)에 더 많이 분기한다(52.4% 대 32.7%). 또 학습이 진행되며 엔트로피 기반이 고르는 위치의 평균 엔트로피는 1.03에서 0.57로 떨어져 전체 동사 분포에 가까워지지만, HDL의 hindsight-divergence 점수는 6.85에서 7.78로 오르고 선택 동사는 루트 분포와 더 구분된다. 성찰 기반은 위치 식별자를 파싱하지 못하거나 너무 가까운 지점을 내놓아 그룹당 평균 3.22개(최대 4개) 분기점만 확보했고 HDL은 3.95개였다. 분기 구성 비교에서는 기본 2×2가 71.96%로 가장 좋았고, 2×1은 롤아웃 시간을 15% 줄이지만 0.87점 낮아졌으며, 4×2는 토큰을 더 쓰면서 4.09점 낮았다.

실무적으로 이 논문은 검증기가 붙어 있는 RL 파이프라인, 즉 정답 채점이 가능한 수학·코드·툴 사용 에이전트 학습에서 롤아웃 GPU 비용을 줄이는 방법으로 읽힌다. 핵심 구현 요소는 세 가지다. 완료된 궤적에 피드백과 성찰을 붙여 한 번 더 스코어링하는 패스, 그 점수로 분기 위치를 고르는 로직, 접두사를 재사용하고 접미사에만 손실을 거는 그룹 구성이다. 도입 전에 확인할 것은 검증 피드백의 품질(피드백이 부실하면 hindsight 문맥도 부실해진다), 성찰 생성과 스코어링 오버헤드가 절감분 안에 들어오는지, 그리고 접두사 재사용을 지원하도록 롤아웃 엔진을 고쳐야 한다는 점이다. 논문은 벽시계 시간에 성찰 생성과 hindsight 스코어링 비용을 포함해 측정했다고 밝힌다.

논문은 별도의 한계 절을 두지 않는다. 다만 본문에서 드러나는 전제는 분명하다. 방법 자체가 검증 가능한 보상과 검증기 피드백을 요구하므로 보상이 검증 불가능한 과제에는 그대로 옮기기 어렵다. 성찰은 모든 모델에서 non-thinking 모드로 생성했고, 평가는 세 모델과 세 영역에 한정되며 에이전트는 ScienceWorld 하나만 쓴다. 분기점 수와 루트 수 같은 하이퍼파라미터는 Qwen3-8B 에이전트에서만 비교했고 다른 영역·모델에서의 민감도는 제시되지 않았다. 또한 성찰 기반 베이스라인이 유효한 위치를 내놓지 못하는 경우가 있었는데, HDL도 성찰 생성 품질에 의존하는 만큼 이 실패 모드에서 자유롭지 않다.