전략의 다양성은 자기학습 데이터 샘플링에서 정답보다 더 중요하다.

Strategically Diverse Sampling for Self-Training

arXiv2609.31571v1

Alexander Gurung2026-09-25조회 3

무엇인가

자기학습(self-training)은 모델이 뽑은 응답 중 정답만 걸러 파인튜닝하는 방식이 사실상 표준이다. 그런데 이 논문은 그 전제를 정면으로 문제 삼는다. 같은 조건에서 독립적으로 뽑은(IID) 응답들은 서로 다른 풀이가 아니라 같은 전략의 표면적 변형인 경우가 많고, 정답 필터링은 모델이 이미 선호하는 전략을 더 강하게 강화한다. RL의 롤아웃 그룹은 보상이 같아져 그래디언트가 사라지고, 테스트타임 스케일링은 결합할 것이 거의 없는 비슷한 후보들만 받는다. 저자들은 정답성이나 표면적 표현의 다양성과 구분되는 개념으로 전략적 다양성(strategic diversity), 즉 문제를 푸는 접근법 자체의 실질적 차이를 제안한다.

어떻게 동작하나

방법은 두 가지다. GROOT는 모델에게 문제를 풀 수 있는 접근법들의 추론 트리를 만들게 하고, 그 트리에서 서로 다른 n개의 루트-리프 경로를 고른다. 두 경로는 어느 지점에서 반드시 갈라지므로, 모델이 중요하다고 표시한 결정 지점에서 접근법이 달라진다. Verbalized Sampling(VS)은 원래 여러 답변을 확률과 함께 나열하게 하는 학습 불필요 기법인데, 이를 전체 답변이 아니라 접근법 수준에 적용해 비구조적인 접근법 목록을 얻는다. 두 방법 모두 접근법 도출과 실행을 분리한다. 먼저 n개의 접근법을 뽑고, 각 접근법을 원래 질문과 함께 숨겨진 지시(hidden instruction)로 넣어 모델이 스스로 그 접근법에 도달한 것처럼 추론하게 만든다. 접근법을 명시적으로 언급한 응답은 자동으로 버린다. Tree-of-Thoughts 같은 추론 시점 트리 탐색과 달리, 트리는 데이터셋 생성 때 한 번만 만들고 테스트 시에는 표준 생성 방식을 그대로 쓴다.

무엇과 다른가

실험은 Qwen3-4B-Instruct로 수행하고 Nemotron3 Nano-4B에서 주요 결과를 반복한다. 데이터 생성·학습·평가 모두 같은 모델로 한다. 경쟁 프로그래밍은 Cobalt로 학습하고 Cobalt 테스트셋과 LiveCodeBench, OJBench에서 평가하며, 64번 IID 시도 중 2번 이하로만 풀리는 문제를 '프런티어'로 정의해 이 부분에 집중한다. Next-Chapter Prediction(NCP)은 이야기의 다음 약 200단어 분량 계획을 세우는 과제로, 정답이 이진값이 아니라 실제 구간의 퍼플렉서티 개선율로 평가한다. 비교 대상은 예산 4·8의 IID, 16배 큰 예산의 IID-64, 온도를 1.5로 올린 IID, 그리고 235B 교사 모델의 IID 증류다. 정답만 남긴 RFT 외에, 정답을 전부 걸러낸 ANTI 설정도 돌려 다양성과 정답성의 효과를 분리한다.

어떻게 쓰나

결과는 일관되게 전략적 샘플링 쪽이다. 프런티어 Cobalt 학습셋에서 예산 4로 GROOT는 155문제를 풀어 IID의 42문제, 고온 IID의 60문제를 크게 앞섰다. 저자들 추정으로 IID가 GROOT-4를 따라잡으려면 약 26개 샘플이 필요하다. NCP에서도 15% 개선 기준으로 GROOT는 286개 구간에서 고품질 계획을 찾은 반면 IID는 156개였다. 학습 후 성능은 더 벌어진다. held-out 프런티어 벤치마크에서 pass@64가 GROOT-4 15.5, VS-4 17.5인데 IID-4는 5.2, 16배 예산의 IID-64도 6.5에 그쳤다. 가장 눈에 띄는 것은 정답을 모두 버린 ANTI 설정이다. 전략적으로 다양하지만 틀린 응답으로 학습한 ANTI GROOT-4와 VS-4가 각각 12.8, 14.8을 기록해, 고온 IID-64의 7.9를 앞섰다. 같은 전략적 데이터 안에서는 정답 필터링이 여전히 도움이 된다(RFT GROOT-4 15.5 대 ANTI 12.8). 235B 교사도 마찬가지다. 교사 IID 증류는 IID-4를 5.8에서 13.4로 올렸지만, 자기 생성 전략적 다양성을 쓴 GROOT-4와 VS-4는 20.1과 22.8에 도달했다.

전제와 한계

학습된 모델은 테스트타임 스케일링과 RL의 출발점으로도 더 좋다. Recursive Self-Aggregation을 코드에 적용하면 IID-4는 pass@1이 0.9에서 3.8로 오르는 데 그친 반면 VS-4는 4.2에서 10.6으로 뛰었고, IID-64도 최종 7.4에 머물렀다. NCP에서 5% 기준으로 GROOT는 15.7에서 24.6으로 개선됐지만 IID는 10.7에서 18.1로 개선됐다. RL에서는 GROOT-4와 VS-4가 시작하는 pass@8을 베이스 모델에서 출발한 RL이 6에폭 동안 도달하지 못했고, IID-4에서 출발한 RL은 그 지점까지 64스텝이 걸렸다. RL 이후 Cobalt 프런티어 pass@64는 GROOT-4 39.0, VS-4 37.8, IID-4 36.6, 베이스 29.3이었고, held-out 프런티어 평균 pass@64는 18.0과 16.0 대 IID-4의 10.9였다.

실무적으로 이 논문이 주는 메시지는 명확하다. 자기학습 파이프라인을 돌릴 때 샘플 수를 늘리거나 온도를 올리는 대신, 한 번의 추가 생성 호출로 접근법을 먼저 뽑고 그것을 조건으로 응답을 만드는 편이 훨씬 효율적일 수 있다. 특히 어려운 문제, 즉 모델이 몇 번 시도해도 거의 못 푸는 문제에서 효과가 집중되며, 정답률이 낮아 RFT 데이터가 거의 안 모이는 상황에서도 쓸 수 있는 데이터를 만들어 준다. 또 하나 실용적인 관찰은 용도에 따라 방법을 고르라는 것이다. 코드 과제에서 RL 이전에는 VS가, RL 초기화에는 GROOT가 더 좋았다. 다만 이득이 medium/hard 난이도에 집중되고 최난도 구간에서는 학습 방식과 무관하게 성능이 비슷했다는 점, 그리고 학습 데이터를 더 늘려도 하류 성능이 거의 변하지 않았다는 점은 기대치를 조정할 필요가 있다.

저자들이 밝힌 한계도 분명하다. GROOT와 VS 모두 문제(또는 계획 목록)마다 생성 호출이 한 번씩 추가되는데, 이 비용은 예산 비교에 포함하지 않았다. 대신 최대 16배 큰 예산의 IID 베이스라인과 비교하는 방식으로 보완했다. 온도 상승과 접근법 수준 다양화는 서로 대체가 아니라 보완적이라는 관찰도 함께 기억할 필요가 있다. Nemotron 실험에서는 초기화 방식과 무관하게 RL이 비슷한 성능으로 수렴했지만, 전략적 샘플링 모델이 그 지점에 더 빨리 도달했다. 교사 모델과 전략적 샘플링을 결합하면 교사 IID보다는 낫지만 자기학습보다는 낮았는데, 저자들은 교사-학생 분포 불일치를 원인으로 추정한다. 향후 과제로는 파인튜닝 대신 추론 시점에 전략적 다양성을 유도하는 방법과, 초기화에서 물려받는 대신 온라인 RL에서 직접 최적화하는 방법을 제안한다.