ROSS가 과거 자기 롤아웃을 선별 재학습해 성능을 끌어올린다

ROSS: Relearning from Self-Generated Rollouts through Selective Supervision

HF Daily2609.35954

Zhiwei Zhang, Huayu Deng, Fei Zhao2026-09-28조회 5

무엇인가

대규모 언어모델의 후처리 학습은 강화학습과 온폴리시 증류를 통해 자기 생성 롤아웃을 끊임없이 만들어낸다. 문제는 정책이 전진할수록 이 경험이 낡은 것으로 취급돼 버려진다는 점이다. 그런데 논문은 과거 체크포인트가 만든 롤아웃이 나중 정책과 여전히 호환되면서도, 현재 정책이 안정적으로 재현하지 못하는 행동을 담고 있을 수 있다고 주장한다. 동시에 성공한 궤적 안에도 실수, 포기한 시도, 불필요한 우회가 섞여 있어 통째로 모방하면 안 된다. 저자들은 100개의 수학 문제로 호환성을 측정해, 과거 롤아웃의 토큰 단위 NLL이 외부 교사 모델(GLM-5.2) 응답보다 훨씬 낮고 현재 정책 롤아웃에 근접함을 보였다. 보완성은 가장 어려운 학습 문제 100개에 현재 정책 롤아웃 32개씩을 뽑아 확인했는데, 과거 성공이 있던 98개 문제에서 현재 정책은 97개를 풀고 pass@32가 99.0%였지만 pass@1은 37.7%에 그쳤고 98개 중 74개가 문제별 성공률 50% 이하였다. 행동 자체는 정책의 지지 집합 안에 있으나 안정적으로 발현되지 않는다는 뜻이다.

어떻게 동작하나

ROSS의 절차는 두 단계 선별로 이뤄진다. 먼저 원래 학습을 마친 최종 체크포인트에서 출발해, 결과 검증기 v(τ)가 성공으로 판정한 궤적만 남긴다(g(τ)=1[v(τ)=1]). 다음으로 LLM 리뷰어가 과제, 전체 궤적, 검증기 증거를 검토해 감사 상태 q_τ와 함께 국소적으로 정확하고 자기완결적이며 행동적으로 유용한 모델 출력 구간들의 목록 K_τ를 돌려준다. 이 구간들은 토큰 마스크 m_t(τ)=a_t·1[t∈∪[b,e)]로 변환되는데, a_t는 프롬프트나 환경 관측 같은 외생 토큰을 배제하는 자격 플래그다. 최종 학습 집합은 감사 승인, 비어 있지 않은 구간, 결정론적 검증(Validate)을 모두 통과한 궤적으로 구성된다. 핵심은 마스크가 0인 토큰도 시퀀스에서 지우지 않는다는 점이다. 손실에서만 빠지고, 선택된 토큰은 앞선 실수와 포기한 시도, 환경 피드백을 포함한 원래 접두 문맥 전체로부터 예측된다. 목적함수는 선택된 토큰에 대해서만 계산한 마스크드 teacher-forcing 손실을 감독 토큰 수로 정규화한 형태다. 단일 턴 응답에는 양성 구간 추출을, 에이전트 이력에는 결함 위치 특정을 적용하되 최종적으로 같은 토큰 마스크로 컴파일한다.

무엇과 다른가

실험은 Qwen3.6-35B-A3B로 도메인 특화 RL, 다중 교사 온폴리시 증류(MOPD), 에이전트 RL 세 축에서 이뤄졌다. 비교 대상은 원본 학습을 시작한 Base 체크포인트, 원래 학습의 최종 체크포인트인 Upstream, 원래 절차를 추가로 돌린 Continued RL/MOPD, 검증기 양성 롤아웃 전체에 SFT를 건 Positive-Rollout SFT다. 도메인 특화 RL 후 ROSS는 수학 평균을 75.19에서 76.98로, 코드 평균을 42.09에서 44.21로 올렸다. MOPD 후에는 6개 벤치마크 평균이 58.40에서 62.20으로 올라 Continued MOPD와 Positive-Rollout SFT를 앞섰다. 에이전트 설정에서는 OpenSWE 과제로 학습한 뒤 SWE-bench Verified 해결률이 64.20에서 68.40으로 4.20포인트 상승했다. 도메인 밖 성능도 유지되거나 개선됐는데, 수학 RL 후 코드 평균이 41.21에서 44.24로, IFBench가 33.30에서 34.60으로 올랐고, 코드 RL 후 수학 평균이 74.19에서 75.03으로 올랐다. BFCL 점수도 44.12에서 45.62로, 46.25에서 49.38로 상승했다.

어떻게 쓰나

무엇이 이득을 만드는지도 분리해 측정했다. 궤적 수준 필터링만으로도 효과가 있어, 마스크 없이 같은 롤아웃 집합 전체를 감독한 ROSS w/o mask는 Positive-Rollout SFT의 코드 성능 하락을 뒤집어 Upstream 대비 LCB Gen에서 0.19포인트, OJBench에서 1.72포인트를 올리고 MOPD 평균을 57.70에서 58.49로 끌어올렸다. 여기에 토큰 수준 선별 감독을 더하면 MOPD에서 3.71포인트, LCB Gen 1.91, OJBench 0.43, 수학 0.66포인트가 추가로 올랐다. 초기화 의존성도 확인했는데, 원래 RL/MOPD 파라미터 업데이트를 전혀 물려받지 않은 Base에서 시작한 ROSS가 Upstream에서 시작한 ROSS와 비슷한 성능을 냈다. 배제된 감독의 성격도 분석했다. 1,185개 궤적을 분류한 결과 수학에서는 실수 후 눈에 보이는 교정이 초기 72.7%, 후기 68.3%로 우세했고, 코드에서는 중복 탐색이 67.9%에서 76.6%로 늘었다. 토큰 가중 배제율(TER)은 수학에서 11.60%에서 9.27%로 소폭 줄었을 뿐이고 코드에서는 22.65%에서 28.07%로 오히려 증가해, 정책이 확신을 높여도 성공 롤아웃이 균일하게 모방 가능해지지는 않는다는 것을 보였다. 별도의 4B 수학 RL 실행에서는 Upstream이 반복 답변 모드를 보였는데 ROSS가 이를 억제하면서 수학 평균을 52.05%에서 63.65%로 올렸다.

전제와 한계

개발자 관점에서 이 논문이 주는 실무적 시사점은 명확하다. RL이나 온폴리시 증류 파이프라인을 돌리면서 체크포인트와 롤아웃을 저장해 두면, 추가 롤아웃 생성 없이 오프라인 SFT 한 단계를 더 얹어 성능을 끌어올릴 수 있다. 다만 그대로 재사용하는 것이 아니라 결과 검증기로 성공 궤적을 거르고, LLM 리뷰어로 유용한 구간만 골라 마스킹하는 절차가 필수다. 논문의 수치가 보여주듯 궤적 수준 필터링만으로도 이득이 있지만, 토큰 수준 선별이 추가 이득의 상당 부분을 담당한다. 도입을 검토한다면 결과 검증기(정답 검사, 단위 테스트, 환경 성공 신호)를 갖추고 있는지, 리뷰어 모델의 감사 비용을 감당할 수 있는지, 그리고 마스크가 0인 토큰도 문맥으로 남겨 원래 상태를 보존하는 구현인지를 먼저 확인해야 한다.

논문은 별도의 한계 절을 두지 않았지만 전제는 곳곳에 드러난다. ROSS는 원래 학습 절차를 바꾸지 않고 최종 체크포인트와 저장된 롤아웃만 있으면 동작한다고 명시하는데, 이는 곧 롤아웃을 저장해 두지 않았다면 적용할 수 없다는 뜻이다. 또한 결과 검증기가 존재하는 과제를 전제하며, 구간 주석은 GLM-5.2를 고사고 모드의 LLM 판정자로 사용해 대체 목표를 생성하지 않고 저장된 롤아웃을 검토하는 방식이다. 검증기가 양성 판정을 내려도 유효한 모방 대상이 보장되지 않아, 확정된 오류를 남기거나 빠진 추론을 도입하지 않고는 유효 구간을 복구할 수 없으면 후보를 거부한다. 즉 성능 향상은 검증기 품질과 리뷰어 감사 품질에 의존하며, 논문이 제시한 수치는 특정 모델(Qwen3.6-35B-A3B)과 특정 벤치마크 조합에서 얻은 결과라는 점을 감안해 읽어야 한다.