실패만 나온 롤아웃 그룹을 이웃 모델 궤적으로 바꾸는 GRAFT

Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR

HF Daily2609.37868

Doohyuk Jang, Yoonsik Park, Gyouk Chu2026-09-29조회 4

무엇인가

RLVR(검증 가능 보상 강화학습)은 GRPO 계열 방법으로 LLM의 추론 능력을 끌어올리는 핵심 후처리 패러다임이 됐다. 문제는 학습이 모델이 스스로 생성한 궤적에 전적으로 의존한다는 점이다. 한 프롬프트에 대해 n개의 롤아웃을 뽑았을 때 전부 실패하면 그룹 내 보상 분산이 0이 되어 그룹 상대 어드밴티지가 모두 0이 되고, 정책 경사 신호가 사라진다. 그룹을 버리거나, 프롬프트를 교체하거나, 보상을 재구성하는 우회책이 있지만 모두 학습자 자신의 탐색에 묶여 있다. 롤아웃을 늘리면 성공 확률은 오르지만 비용이 함께 오른다.

어떻게 동작하나

논문은 여기서 관찰 하나를 출발점으로 삼는다. 이종 모델들은 서로 다른 프롬프트에서 성공하는 상보적 관계를 보인다는 것이다. 독립적으로 GRPO를 돌린 SmolLM3-3B-Base와 Qwen3-1.7B-Base의 경우, SmolLM3-3B-Base는 Qwen3-1.7B-Base가 8개 롤아웃 전부 실패한 프롬프트의 47.9%를 풀어냈고, 반대 방향으로는 Qwen3-1.7B-Base가 SmolLM3의 전부 실패 프롬프트의 18.7%를 풀었다. 더 강한 교사 모델을 지정하지 않고도 맞교환할 거리가 있다는 뜻이다. 제안 방법 GRAFT(Gated Replacement of Answer-Failed groups with peer Trajectories)는 수신 모델의 롤아웃 그룹이 전부 실패했고(k_B(q)=0) 상대 모델의 그룹에는 성공과 실패가 섞여 있는(1 ≤ k_A(q) < n) 프롬프트만 골라, 수신 모델의 실패 그룹을 상대의 롤아웃 그룹 전체로 교체한다. 성공 응답만 넘기는 게 아니라 실패 응답까지 함께 넘겨 상대 그룹 내부의 보상 대비를 보존하고, 어드밴티지는 상대 모델이 계산한 값을 그대로 쓴다. 방향별 후보 수가 크게 다를 수 있으므로 더 작은 쪽 후보 수 m을 공통 목표로 삼고, 상대 모델의 성공 개수 내림차순으로 정렬해 상위 m개와 경계 동점을 유지하는 균형 교환 절차를 둔다.

무엇과 다른가

'어떻게 학습할 것인가'는 오프폴리시 불일치 통제 문제다. 논문은 우도비를 수신 모델 내부의 변화와 교차 모델 불일치의 곱으로 분해하고, 전자는 토큰 단위 PPO 서로게이트로, 후자는 시퀀스 단위 호환성 가중치로 다룬다. 호환성 점수는 수신 모델과 상대 모델 각각의 토크나이저로 계산한 평균 토큰 로그우도의 차이에 지수를 취한 값이며, 임계값 δ(실험 전반에서 0.8)보다 낮으면 정답 여부와 무관하게 탈락시키고, 통과한 응답도 가중치를 최대 1로 제한한다. 토큰 단위 중요도 비율은 상대 응답을 수신 모델의 토크나이저로 다시 토큰화한 표현 위에서 계산하며, 분모는 생성 정책이 아니라 수신 모델의 행동 정책이다. 즉 토큰 비율은 수신 모델 내부 변화만 추적하고 교차 모델 불일치는 시퀀스 가중치가 전담한다. 여기에 더해 교체된 그룹이 담긴 미니배치를 수신 모델 자신의 온폴리시 미니배치 뒤에 배치하는 'peer-last' 순서를 쓴다. 첫 스텝에서는 비율이 1이라 클리핑이 작동하지 않기 때문에, 뒤로 미뤄야 비율이 클리핑 구간을 벗어난 토큰이 실제로 감쇠된다.

어떻게 쓰나

실험은 세 개의 이종 모델 쌍(SmolLM3-3B-Base ↔ Qwen3-1.7B-Base, OctoThinker-3B-Hybrid-Base ↔ Qwen3-1.7B-Base, SmolLM3-3B-Base ↔ OctoThinker-3B-Hybrid-Base)과 다섯 개 수학 벤치마크(MATH500, AIME2024, AIME2025, AMC23, Minerva)에서 이뤄졌다. 모델당 롤아웃은 n=8로 고정하고 학습 데이터·학습률·스텝 수를 모든 방법에서 동일하게 유지했다. GRAFT는 6개 모델 블록 전부에서 단일 모델 GRPO를 앞섰고, 평균 점수 개선폭은 +0.66에서 +4.46, 모델 수준 평균으로는 평균 2.1점, 최대 4.5점이다. Pair 1에서는 두 모델 모두 4배 롤아웃(n=32) GRPO를 능가했고 Pair 2에서는 비슷한 수준이었다. 동시 학습 베이스라인과 비교하면 HACPO는 6개 블록 중 5개에서 예산 동일 GRPO보다 낮았고 최대 -4.17점까지 떨어졌으며, SGT는 -0.53에서 +2.28로 일관성이 없었다. GRAFT는 평균적으로 HACPO를 4.0점, SGT를 1.5점 앞선다.

전제와 한계

계산 비용 관점의 결과도 제시된다. Pair 1에서 GRAFT는 40.9 GPU-시간에 쌍 평균 35.25점에 도달해, GRPO(n=32)를 0.45배 비용으로 1.18점 앞서고 GRPO(n=16)를 비슷한 비용에서 2.48점 앞선다. 또한 동시 공동학습 대신 상대 모델의 독립 GRPO(n=8) 실행에서 저장해 둔 궤적을 불러와 같은 선택·가중·업데이트 규칙을 적용하는 방식도 검증했다. 이 경우 6개 블록 전부에서 GRPO(n=8) 대비 이득이 남았고 평균 +1.78점으로 온라인 교환의 +2.11점에 근접한다(온라인 이득의 약 84%). 계산량은 27~76% 줄었고, Pair 1에서 두 수신 체크포인트를 얻는 데 23.2 GPU-시간이 들었다(궤적 수집용 사전 GRPO 실행 비용은 제외).

절제 실험은 설계 선택의 기여를 분리한다. Pair 1에서 호환성 가중치를 제거하면 SmolLM3가 -8.36점으로 가장 크게 무너지고, 하한(floor)을 제거하면 Qwen3가 -3.56점 떨어진다. 균형 교환 제거, 토큰 단위 비율을 시퀀스 단위 비율로 교체, 동일 개수의 무작위 프롬프트 선택, 무작위 수용도 모두 성능을 낮춘다. peer-last 순서는 peer-first와 균등 배치를 이기며, 부록에서 상대 토큰에 대한 클리핑 비율이 가장 높다는 점도 확인된다. 상대 그룹과 자기 그룹을 합쳐 보상을 풀링하거나 성공 응답만 전이하는 변형도 전체 GRAFT에 못 미친다. 프롬프트 선택을 GRAFT 방식으로 고정해도 HACPO·SGT·LUFFY 스타일 업데이트는 모두 뒤처졌고, GRAFT의 업데이트에 SGT의 불균형 선택을 붙이면 2.00/0.48점 격차가 남았다.

개발자 입장에서 이 논문이 유용한 지점은 두 가지다. 첫째, 롤아웃이 전부 실패한 그룹을 '버리는 데이터'가 아니라 다른 모델이 이미 찾아둔 해를 끌어오는 트리거로 쓸 수 있다. 둘째, 그 이득이 동시 공동학습을 전제하지 않는다. 이미 돌려둔 다른 모델의 GRPO 로그(응답, 로그확률, 보상)를 저장해 두고 재검증만 거치면 상당 부분 재현되므로, 두 모델을 동시에 메모리에 올리는 인프라 부담 없이 적용할 수 있다. 다만 도입 시에는 토크나이저가 다른 모델 간 호환성 점수가 정확한 밀도비가 아니라 근사 프록시라는 점, δ 임계값과 클리핑 구간이 성능을 좌우한다는 점, 그리고 상대 궤적을 수신 모델 토크나이저로 재토큰화하는 비용을 함께 따져야 한다.

저자들이 명시한 한계는 분명하다. GRAFT의 이득은 두 모델이 얼마나 상보적인지에 달려 있고 세 쌍 중 Pair 3에서 가장 작았다. 토크나이저가 다를 때 호환성 점수는 밀도비가 아닌 프록시다. 실험 범위도 두 모델 쌍, 수학 도메인, 3B 이하 베이스 모델로 제한되며, 검증 가능한 보상이 없는 도메인과 3개 이상의 피어 간 교환은 향후 과제로 남겨두었다.