SFT 추론 경로를 다양하게 고르면 RL 이후 일반화가 좋아진다
Selecting Diverse SFT Traces Improves Post-RL Generalization
무엇인가
이 논문이 푸는 문제는 SFT 다음에 오는 강화학습 단계를 어떤 감독 데이터가 가장 잘 준비시키느냐다. 일반적인 후처리 레시피는 검증된 해답으로 SFT를 한 뒤 모델 자신의 시도에 검증 가능 보상으로 RLVR을 적용한다. RL은 SFT가 만들어낸 정책에서 샘플링하므로, 시작 분포가 유한한 롤아웃 예산 안에서 어떤 성공 시도를 발견할 수 있는지를 좌우한다. 최근 시스템들이 pre-RL SFT를 가볍게 유지하는 것도, SFT를 너무 많이 하면 이후 학습과 일반화가 제한된다는 연구 결과들도 같은 맥락이다. 그래서 질문은 감독 데이터를 얼마나 쓸지뿐 아니라 어떤 검증 해답을 남길지가 된다. 기존 선택 기준은 가독성, 길이, 보상 점수, 문제별 할당량, 교사·응답 수 비교, 지시 커버리지, 개별 트레이스 품질, 학생 적합도 등인데, 이 기준들은 남긴 해답들이 서로 다른 추론 방식을 제공하는지 아니면 같은 방식을 반복해서 보여주는지를 직접 특성화하지 않는다.
어떻게 동작하나
저자들이 주목하는 구분은 경로 다양성(route diversity)이다. 경로는 검증된 해답이 문제에서 답까지 밟는 추론 단계의 순서를 말한다. 수학에서는 경우 나누기, Sokoban에서는 보드 위 이동, 프로그램 시뮬레이션에서는 프로그램 상태의 재작성이 경로가 된다. 그 위상(topology)은 표현, 포맷, 교사 정체성을 걷어낸 뒤 남는 경로의 구조이며, 같은 문제에 대한 두 정답도 위상은 크게 다를 수 있다. 추론을 단계 시퀀스에 대한 탐색으로 보면 다양한 체인을 샘플링하는 것이 추론 성능을 높이고, 다양한 탐색 트레이스로 학습하는 것이 모델의 추론을 개선한다. 논문의 가설은 더 다양한 경로를 연습시키면 더 많은 문제에서 정답 시도가 샘플링 사정권 안에 들어오고, 후속 RL이 학습할 기회가 늘어난다는 것이다.
무엇과 다른가
제안 방법의 핵심은 규칙 기반 지문(fingerprint)이다. 각 검증 해답 y의 위상을 고정 길이 벡터 φ(y)로 파싱한다. 도메인이 단계 주석을 제공하면 그것에서, 아니면 트레이스 텍스트에서 읽는다. 텍스트에서 읽을 때 필요한 것은 단계를 라벨링하는 고정 규칙과 벡터를 줄이는 고정 랜덤 투영뿐이며, 모델 호출도 추가 생성도 그래디언트도 쓰지 않는다. 지문 생성과 선택은 CPU에서 200만 개가 넘는 해답 풀에 대해서도 돌아간다. 선택 절차는 하나의 후보 풀에서 같은 목표 크기의 두 데이터셋을 만드는 것이다. 다양 집합은 지문을 클러스터링하고 클러스터마다 크기에 비례한 예산을 준 뒤, 각 클러스터 안에서 이미 고른 것과 가장 먼 후보를 반복해서 추가하는 코어셋 구성으로 만든다. 유사 집합은 하나의 밀집 영역에서 최근접 중심(nearest-centroid) 방식으로 뽑는다. 모든 비교에서 두 조건은 학생 모델, 프롬프트 풀, SFT 궤적 예산, 그룹 상대 RL 레시피, 평가를 공유하고 SFT 데이터에 어떤 해답이 들어가는지만 다르다.
어떻게 쓰나
첫 번째 실험 축은 교사 수를 경로 다양성의 거친 대리 지표로 쓰는 것이다. 고정된 SFT 궤적 예산에서 교사를 12개로 늘리면 Qwen3-4B-Base가 SFT에서 제외된 Enigmata 퍼즐에서 pass@64 기준 약 18점을 더 얻었다. 환경 풀을 16개에서 399개로 늘리는 효과는 교사 수가 고정일 때 최대 6.4점이지만 교사가 12명일 때는 0.5점 미만이었다. RL을 퍼즐에서 수학으로 옮긴 뒤에도 12 교사가 앞서서, 16환경 풀의 MATH-500에서 pass@1이 34.14%에서 65.08%로 올랐다. pass@1부터 pass@64까지 7개 샘플링 예산, 벤치마크, 풀 조합 56개 셀 중 54개에서 12 교사가 우세했고, Qwen3-1.7B에서는 pass@1 32개 비교 전부와 pass@64 32개 중 27개에서 다중 교사 조건이 단일 교사를 이겼다. 직접 경로 선택 실험은 RLVE에서 이뤄졌다. SFT는 난이도 1~5를 덮고 RL은 10까지, 평가는 15까지 확장된다. OLMo3-7B에서 다양 선택은 SFT에서 제외된 환경의 pass@8을 16.9%포인트 올렸고, 이 우위는 SFT가 본 환경과 보지 못한 환경 양쪽에서, 그리고 모든 난이도 구간에서 양수였다. 해결 집합도 단순한 성공의 맞교환이 아니다. 다양 모델은 유사 모델이 푼 문제의 95.67%를 유지하면서 유사 모델이 놓친 1,133개를 추가로 풀었고, 반대 방향은 53개뿐이었다.
전제와 한계
이득은 여러 교사를 섞을 때만 나오지 않는다. 단일 모델 조건에서 Qwen3-4B-Thinking-2507이 모든 후보 해답을 작성한 하나의 풀에서도, 경로 다양 선택이 10개 경시 수학 벤치마크 평균 pass@8 기준으로 세 가지 SFT 크기에서 3.39~6.17점 앞섰다. 이유에 대한 진단도 제시된다. 이진 보상에서는 한 프롬프트의 롤아웃 그룹이 전부 성공하거나 전부 실패하면 그룹 상대 어드밴티지가 0이 되어 학습 신호가 없다. RL 전에 측정한 결과, 경로 다양 OLMo3-7B 체크포인트는 64개 수학 프롬프트 중 54.7%에서 혼합 보상을 만들었고 유사 체크포인트는 46.9%, SFT 이전 베이스는 51.6%였다. 다양 체크포인트의 평균 정답률이 오히려 약간 낮은데도 그렇다. RL 이후 정답 완성문의 표현 다양성도 커져서, 평균 bigram Jaccard 거리가 Qwen3-4B에서 16.68%, Qwen3-1.7B에서 15.13% 더 높았다. 커버리지 격차는 샘플링 예산이 늘수록 벌어지다 포화에 가까워지면 좁아지고, 난이도별로는 각 모델이 안정적으로 푸는 경계 근처에서 최대가 된다.
공개 코퍼스에서의 검증도 있다. OpenThoughts3, INTELLECT-3, Nemotron-Cascade 2에 같은 선택을 적용해 OLMo3-7B 학생에게 동일한 SFT와 동일한 RL(수학, 코드, 지시 따르기, 과학 혼합)을 주었다. 제안 선택기는 무작위 선택, 같은 지문을 쓰는 단순 규칙인 위상 베이스라인, 그래디언트 다양성, 임베딩, 어휘 기반 선택을 평균 post-RL 성능의 모든 비교에서 앞섰고, 평균 점수 상대 이득은 pass@1과 pass@8에서 1.2%에서 10.8%였다. 같은 풀에서 뽑은 유사 선택과 비교하면 세 코퍼스 모두 모든 수학 벤치마크에서 평균 정확도 4.9~18.5점 앞서고, OMEGA의 세 split과 GPQA-Diamond에서도 앞선다. 비용 차이도 크다. 약 210만 개 해답 풀에서 CPU 노드 1대로 약 3시간, GPU 시간은 0이다. 그래디언트 다양성과 임베딩 베이스라인은 후보마다 7B 또는 8B 모델을 통과시켜야 해서 64~232 GPU-시간이 필요하다.
개발자 입장에서 이 논문이 주는 실무적 시사점은 SFT 데이터 선별 기준의 추가다. 검증을 통과한 해답이 예산보다 훨씬 많아 일부만 남겨야 하는 파이프라인이라면, 정답률·길이·문제 커버리지에 더해 경로 다양성을 기준으로 삼을 수 있다. 모델 호출이나 추가 생성 없이 CPU에서 돌기 때문에 대규모 풀에서도 비용 부담이 거의 없고, RL 레시피를 바꾸지 않고도 적용된다. 함께 기억할 점은 SFT 정확도 자체가 RL 준비도의 신뢰할 지표가 아니라는 것이다. 다양 선택은 평균 정확도가 약간 낮은데도 post-RL 커버리지가 더 높았다. 한계와 전제도 분명하다. 지문 거리는 절차적 차이를 근사할 뿐 표현 차이도 반영할 수 있다. 저자들은 Appendix H에서 한계와 향후 작업을 논의한다고 밝혔지만 제공된 본문에는 그 내용이 실려 있지 않아 구체적인 한계 목록은 확인할 수 없다. 실험 범위도 Qwen3 base와 OLMo3-7B 학생, 합성 퍼즐과 수학 도메인, 공개 코퍼스 3종에 한정되며, 교사 수 실험은 다양성의 거친 대리 지표라는 전제 위에 서 있다.