RLVR 데이터 정책 13종을 같은 GRPO 레시피에서 재검증한 결과, 균일 샘플링을 이기는 재현 가능한 개선은 없었다

DataFlex-RL: An Evaluation Platform for RLVR Data Policies

HF Daily2609.06107

Hao Liang, Mingrui Chen, Hengyi Feng2026-09-05조회 3

무엇인가

강화학습 기반 추론 모델 학습(RLVR)에서는 어떤 프롬프트에 롤아웃 연산을 배분하고, 어떤 응답을 학습에서 버리거나 더 세게 가중하고, 다음 배치에 어느 도메인을 얼마나 넣을지를 정하는 데이터 정책이 성능을 좌우한다는 믿음이 널리 퍼져 있다. DAPO의 solve-rate 필터링, PODS의 고분산 다운샘플링, Advantage Reweighting, GFPO의 토큰당 보상 기준, DUMP나 teacher-student 커리큘럼 같은 기법이 모두 이 믿음 위에 서 있다. 문제는 이런 기법들이 대개 베이스 모델, 프롬프트 템플릿, 검증기, 롤아웃 예산, 최적화 설정을 동시에 바꾼 하나의 큰 레시피 안에서 소개된다는 점이다. 게다가 온폴리시 평가에서는 프롬프트의 유용성 신호가 학습이 진행되면서 계속 변하고, 작은 추론 벤치마크의 시드 분산과 측정 잡음이 기법 간 차이만큼 클 수 있다. 이 논문은 그 주장을 통제된 조건에서 다시 검증한다.

어떻게 동작하나

제안하는 것은 새로운 학습 알고리즘이 아니라 평가 플랫폼 DataFlex-RL이다. 핵심은 데이터 정책이 건드리는 지점을 세 가지로 분리하는 것이다. 선택(selection)은 롤아웃과 보상이 생성된 뒤 응답별 마스크 m_gk ∈ {0,1}를 곱해 해당 응답을 업데이트에서 제거하며, 손실은 L_sel = (1/GK) Σ_g Σ_k (m_gk / L_gk) Σ_ℓ ℓ^GRPO_gkℓ 로 쓴다. 재가중(reweighting)은 응답을 남겨두되 토큰별 가중치 w_gkℓ ≥ 0을 곱해 손실 기여도를 연속적으로 바꾸고, 배치 단위에서 평균 가중치가 1이 되도록 정규화한다. 혼합 적응(mixture adaptation)은 롤아웃 이전 단계에서 도메인 샘플링 확률 p_t(d)를 시간에 따라 바꾸며, 응답별 GRPO 손실 자체는 건드리지 않는다. 이 분리가 중요한 이유는 같은 신호를 쓰면서도 서로 다른 것을 바꾸는 기법들을 구분할 수 있기 때문이다. 예를 들어 per, softmax, topk는 모두 평균 절대 advantage a_gk로 응답을 정렬하지만, 앞의 둘은 연속 가중치로, topk는 선택 마스크로 사용한다. 선택과 재가중은 롤아웃 이후에 일어나므로 생성 비용을 줄이지 않으며, 선택은 업데이트에 쓰이는 토큰 수를 줄일 수 있지만 재가중은 평균 가중치 1을 유지한다. 플랫폼은 롤아웃·검증·GRPO 최적화를 하나의 공유 드라이버로 묶고, 방법을 신호·연산자·하이퍼파라미터로 등록하며, 12개 벤치마크 점수를 동일한 레코드 포맷으로 기록한다.

무엇과 다른가

실험 규모는 총 591회 실행이다. 학습 코퍼스는 수학·논리·과학 프롬프트 15,000개를 균등 분할한 것이고, 수학은 math_dapo·DeepScaler·GSM8K를 boxed-answer 검증으로, 논리는 절차적으로 생성한 Knights&Knaves 퍼즐을, 과학은 SciQ 객관식 문제를 정확한 문자 매칭으로 채점한다. 모든 캠페인은 verl v0.5+와 GRPO를 쓰고 프롬프트당 롤아웃 5개, KL 계수 10^-3, 프롬프트 1024토큰·응답 8192토큰 제한, 300 옵티마이저 스텝(100스텝마다 체크포인트)을 공통으로 둔다. 평가는 12개 벤치마크로 구성되는데 수학 5종(MATH-500, AIME-2024, OlympiadBench, MinervaMath, GSM8K), 논리 4종(Knights&Knaves, BBH Logical Deduction, BBH Object Tracking, ZebraLogic), 과학 3종(MMLU-Pro Chemistry, MMLU-Pro Physics, GPQA-Diamond)이다. Overall 점수는 도메인 내부를 먼저 평균한 뒤 세 도메인을 다시 균등 평균하므로 각 도메인이 같은 무게를 갖는다. 학습과 평가 포맷 불일치를 잡기 위해 캠페인마다 기준 체크포인트로 파싱을 확인하는 캘리브레이션 스모크 테스트를 돌리고, 15,000개 학습 프롬프트를 모든 평가 항목과 대조 감사해 정확 일치·정규화 일치가 없고 13-gram Jaccard 유사도가 0.5를 넘는 항목도 없음을 확인한다.

어떻게 쓰나

주 실험은 Qwen2.5-7B-base에서 13개 구성 전부를 12개 매칭 시드로 돌린 것이다. 먼저 학습 여지를 측정하면 미학습 체크포인트 42.01점에서 균일 GRPO가 49.77점으로 7.76점 올랐고 95% 신뢰구간은 [7.28, 8.25]였다. 이 7.76점 위에 데이터 정책이 더 얹는 것이 있는지가 질문이다. 선택 4종의 균일 대비 짝지은 차이는 difffilter +0.08 [-0.67, 0.82], maxvar -0.58 [-1.39, 0.23], gfpo -0.90 [-1.87, 0.08], topk -0.38 [-1.14, 0.38]이었고, 재가중 4종은 ar -0.28 [-1.15, 0.60], per -0.86 [-3.28, 1.57], softmax -0.23 [-1.44, 0.98], diffband -0.02 [-0.61, 0.57]이었다. 8개 구간 중 0을 배제하는 것은 하나도 없고, 베이스라인을 포함한 9개 정책 평균의 전체 폭은 0.97점으로 GRPO 자체 이득의 약 8분의 1에 불과하다. 시드를 3개에서 12개로 늘리자 순위도 뒤집혀서, 원래 3시드 부분집합에서 앞서던 topk는 12시드 평균에서 베이스라인 아래로 내려가고 difffilter가 가장 높아졌다.

전제와 한계

혼합 적응도 같은 결론이다. 같은 캠페인 안에서 고정 균등 혼합(49.00점)과 비교했을 때 reward_gap +0.45 [-0.09, 1.00], dump_ucb +0.61 [-0.02, 1.25], tscl +0.16 [-0.61, 0.93]으로 점추정치는 모두 양수지만 세 구간 모두 0을 포함하고 평균 폭은 0.61점이다. 학습 로그상 도메인 비율은 실제로 바뀌었지만 최종 정확도의 재현 가능한 개선으로 이어지지 않았다. Llama-3.1-8B-base로 확장하면 미학습 10.87점에서 균일 GRPO 21.12점으로 10.25점([7.75, 12.33])이 올라 GRPO 레시피 자체는 여기서도 유효했다. 원래 선택 3종의 짝지은 차이는 difffilter -1.09 [-2.84, 0.65], maxvar -0.71 [-2.18, 0.76], topk -0.26 [-1.76, 1.24]로 모두 0을 포함하고, 추가된 9개 방법의 평균은 softmax 18.66점에서 diffband 21.98점까지 퍼지지만 재사용 베이스라인이 21.12점이어서 일관된 승자가 없다. 논문은 이전에 보고된 Llama의 14~16점대 값이 지원되지 않는 수학 과제를 조용히 0점 처리한 평가기에서 나온 것이라며 제외한다고 명시한다. Qwen2.5 1.5B·3B·7B·14B와 Llama-3.2-3B를 3시드로 훑은 스케일 스윕에서도 부호가 모델마다 뒤집혀, difffilter는 1.5B·3B에서 베이스라인 아래지만 7B·14B에서는 약간 위이고 maxvar는 모든 행에서 아래다.

논문의 세 번째 축은 평가 자체의 민감도다. 같은 Qwen2.5-7B-Instruct 9개 구성의 실행을 두 가지 요약으로 다시 채점했는데, 논리 벤치마크를 빼고 수학 5종에 GPQA-Diamond만 더한 Math-Heavy-6과 도메인 균형 DB-12의 순위 상관계수는 -0.33으로 음의 상관을 보였다. Math-Heavy-6는 topk와 diffband를 1위로 올리지만 DB-12는 gfpo와 difffilter를 1위로 올리고, 방법 간 점수 폭도 0.90점에서 3.31점으로 커진다. 반면 12개 벤치마크를 모두 유지하는 Macro-12와 Item-12는 DB-12와 각각 ρ=0.88로 강하게 일치하고, 하나씩 빼보는 leave-one-out 검사도 0.78~0.98 범위다. 원인은 방법들이 도메인 간 트레이드오프를 보이기 때문이다. 예를 들어 diffband는 LOGIC 평균이 59.0으로 가장 높지만 SCIENCE 평균은 44.2로 가장 낮다. 즉 논리를 빼면 단순히 벤치마크 수가 줄어드는 것이 아니라 완전히 다른 프로파일을 측정하게 된다.

개발자 입장에서 이 논문의 실용적 메시지는 두 가지다. 첫째, RLVR 파이프라인에 선택·재가중·혼합 기법을 추가하기 전에 균일 샘플링 베이스라인을 충분한 시드로 먼저 재야 한다. 여기서는 GRPO 자체가 7~10점을 올리는 반면 정책 변경의 효과 크기는 1점 안팎이고 시드 잡음에 묻힌다. 둘째, 평가 요약을 도메인 균형으로 고정해야 한다. 논리 도메인을 빼는 순간 순위가 뒤집히므로, 특정 벤치마크 묶음에서 이긴 방법을 그대로 채택하면 잘못된 선택을 할 수 있다. 또한 학습 포맷과 평가 포맷의 정합성을 스모크 테스트로 확인해야 한다. 이 논문이 이전 Llama 수치를 폐기한 이유가 바로 평가기가 지원하지 않는 과제를 0점으로 처리한 포맷 불일치였다.

저자들이 밝힌 한계는 분명하다. 이 결론은 여기서 테스트한 통제된 레시피, 즉 특정 코퍼스·검증기·GRPO 설정·300스텝 학습 범위 안에서 달성한 정밀도에 한정된다. 논문은 데이터 정책들이 균일 학습과 동등하다는 것을 입증하지 않으며, 더 긴 학습, 다른 하이퍼파라미터, 다른 정책 계열에서 이득이 나타날 가능성을 배제하지도 않는다고 스스로 명시한다. 보조 모델 크기 행들은 3시드만 쓰므로 독립적인 유의성 검정이 아니라 커버리지와 방향을 설명하는 용도이고, Llama 표의 구간들은 각 방법의 시드 수준 평균을 나타낼 뿐 짝지은 방법 비교가 아니어서 구간이 겹친다고 해서 보편적 승자를 특정할 수 없다. 최종적으로 남는 것은 범위가 제한된 결론이다. 통제된 조건에서 데이터 정책은 학습 과정을 측정 가능하게 바꾸지만, 균일 학습을 넘어서는 재현 가능한 개선은 만들지 못했다.

관련 논문