8단계 직렬 파이프라인으로 공개된 LLM 포스트트레이닝 레시피 Rufus-Air

Rufus-Air: An Open LLM Post-Training Recipe

HF Daily2609.29421

Chia-Yuan Chang, Renyuan Cheng, Rui Feng2026-09-24조회 10

무엇인가

오픈웨이트 베이스 체크포인트 덕분에 포스트트레이닝 연구의 진입장벽은 낮아졌지만, 정작 레시피 자체는 Tülu 3 같은 예외를 빼면 얇게 보고된다. 논문은 포스트트레이닝 섹션이 재현 가능한 레시피라기보다 시스템 카드처럼 읽히고, 팀이 실제로 필요한 세부사항이 가장 덜 공개된다고 지적한다. Rufus-Air는 이 간극을 줄이기 위한 하나의 완전한 레시피 기록이다. GLM-4.5-Air-Base(총 106B, 활성 12B MoE)를 아키텍처·토크나이저·네이티브 thinking 채팅 포맷까지 그대로 고정한 채 출발하며, 전적으로 오픈소스 구성요소 위에 세워졌고 컴퓨트 규모도 프런티어 랩 밖 팀이 감당할 수준이라고 밝힌다. 새 인간 주석도, 사내 distillation teacher도 쓰지 않았다.

어떻게 동작하나

파이프라인은 SFT → Reasoning RL → Coding RL → Instruction-Following RL → General Agent → Coding Agent → Search Agent → RLHF의 8단계 직렬 구조이며, 각 단계는 직전 단계가 만든 체크포인트 위에서 학습한다. 순서를 정하는 축은 두 가지다. 능력 기준으로는 기초에서 고급으로, 보상 유형 기준으로는 하드하고 검증 가능한 보상에서 소프트한 judge·환경 매개 신호로 나아간다. 저자들이 강조하는 원리는 보상 해킹 노출도다. Reasoning RL과 Coding RL은 보상이 가장 게임되기 어려워 먼저 돌리고, 게임 가능한 보상이 최적화 압력을 받는 시간을 줄이기 위해 검증이 어려운 단계를 뒤로 미룬다. 다만 순서가 보상 강도만 따르지는 않는다. IF RL은 rubric 기반 LLM judge를 쓰면서도 General Agent·Coding Agent보다 앞에 오는데, 지시 따르기는 정책이 이미 잘하는 일에 가까워 judge가 게임될 여지가 적고 실제로 이 단계에서 심각한 해킹이 관찰되지 않았기 때문이다. 진짜 위험이 있는 개방형 선호 보상(RLHF)이 마지막에 온다.

무엇과 다른가

SFT는 워밍업이 아니라 능력 구축 단계다. 최종 SFT 믹스는 9.01M 샘플, 44.5B raw 토큰, 66.7M 대화 턴(그중 23.5M이 supervised)으로 구성되고, 시스템 메시지·사용자 턴·툴 관찰을 마스킹한 뒤 27.0B 토큰(60.8%)이 학습 손실에 기여한다. General Agent, General Chat, STEM, Math, Code, Coding Agent 여섯 범주로 나뉘는데 샘플 수와 학습 토큰 분포가 크게 다르다. Math와 Coding Agent는 샘플의 18.8%에 불과하지만 학습 토큰의 49.1%를 차지한다. 모든 프롬프트와 응답은 부록에 나열된 17개 공개 데이터셋에서 오며, Rufus-Air가 재생성한 비율은 0%다. 오염 제거는 단어 단위 8-gram 겹침 검사로 10개 벤치마크를 순차 스크리닝해 3,529개를 제거하고, 수학·지식 벤치마크에는 전수 8-gram 검사와 임베딩 기반 검색을 추가 적용해 658개를 더 걸러 총 4,187개 인스턴스를 뺐다. 학습은 Slime + Megatron 백엔드로 H200 512장(64노드×8)에서 배치 4096, 3 에폭, lr은 100스텝 선형 워밍업으로 5e-5까지 올린 뒤 5e-6으로 코사인 감쇠, 컨텍스트 128K다. 손실은 0.84에서 1에폭 끝 0.42, 최종 0.34까지 내려가지만 held-out 점수는 첫 에폭 안에서 평탄해지고 이후 변화는 평가 노이즈 수준이어서, 최종 스텝이 아니라 그 평탄 구간 안의 체크포인트 3799를 RL 단계로 넘긴다.

어떻게 쓰나

RL 단계들의 공통 교훈은 SFT 모델이 충분히 강하면 새 RL 목적함수보다 데이터 큐레이션이 성패를 가른다는 것이다. Reasoning RL은 GSPO를 정책경사 백본으로 쓰고(시퀀스 수준 중요도 비율·클리핑이 긴 MoE 롤아웃에서 더 안정적이며 Rollout Routing Replay와 함께 FP8 롤아웃과 BF16 학습의 불일치를 흡수한다), 롤아웃당 256개 프롬프트×16샘플, 온도 1.0, 30,000토큰 응답 예산, 옵티마이저 스텝 2회(전역 배치 2,048)를 8노드에서 동기 실행한다. 가장 중요한 선택은 두 필터다. 강한 teacher(GPT-OSS-120B)가 양의 보상을 하나도 못 얻는 프롬프트를 지우는 정답성 필터와, 풀이율 0.8 초과는 너무 쉬워서 0 성공은 아직 배울 수 없어서 버리는 학습가능성 필터다. 학습 중에는 그룹 평균 보상이 (0, 0.8]에 드는 그룹만 남기는 온라인 필터링(DAPO의 dynamic sampling)을 돌려 난이도 프런티어가 스스로 전진하게 한다. 또 그룹 내 가장 짧은 정답 롤아웃 대비 길이 페널티를 준다. 결과적으로 GPQA는 68.2에서 73.5로 +5.3 오르고, AIME는 2.6~2.8점 내려가는데 저자들은 이를 타깃이 아닌 가드레일로 취급했다(연도당 30문제라 3점 미만은 한 문제 분량에도 못 미친다). Coding RL은 EvolveCoder·Nemotron·Dolci·ADR 네 소스를 쓰고 Codeforces가 약 8,700문제로 30%를 차지하며, 마지막 python 코드 블록을 샌드박스에서 실행해 assert 단위 테스트 또는 stdin/stdout 비교로 보상한다. LiveCodeBench v6에 대해 400자 프리픽스 해시 일치나 문자 단위 60-gram 5개 이상 공유가 하나도 없음을 확인했다. 이후 단계의 최대 변화폭은 IF RL의 Multi-challenge +24.7, General Agent의 Tau2-Retail +9.8, RLHF의 Arena-Hard v2 Creative Writing +14.4다. Coding Agent는 컴퓨트 예산이 끝나면서 +1.4, +2.2로 가장 적게 움직였다.

전제와 한계

최종 체크포인트는 같은 베이스에서 나온 공개 GLM-4.5-Air 릴리스와 INTELLECT-3, 그리고 다른 베이스의 Nemotron-3-Super와 비교된다. Rufus-Air는 Arena-Hard v2 Creative Writing 한 줄을 빼고 보고된 모든 벤치마크에서 GLM-4.5-Air를 앞선다. Nemotron-3-Super에 대해서는 IFBench·IFEval·Multi-challenge·Arena-Hard v2 Hard Prompt, LiveCodeBench, Tau2-Telecom, MCP-Atlas, Search Agent 세 줄, SWE-bench Verified에서 앞서고, AIME 25/26·GPQA·FrontierScience 두 트랙·Tau2-Retail·Terminal-Bench 2.1에서는 2점 이내 차이고, Creative Writing과 Tau2-Airline(2점 차)에서 뒤진다. 격차가 벌어지는 곳은 레시피가 대부분의 단계를 투자한 지시 따르기와 에이전트 행동이고, 수학·과학은 Reasoning RL 한 단계가 담당해 비슷한 수준에 머문다. RL 파이프라인 전체에서 GPQA pass@1은 68.18에서 75.6으로, IFEval은 88.33에서 95.4로 오른다.

실무자에게 이 논문의 핵심 주장 중 하나는 인프라가 구현 세부사항이 아니라 레시피의 일부라는 점이다. 온폴리시 멀티턴 RL을 위한 token-in/token-out 롤아웃, SFT부터 에이전트 단계까지 일관되게 유지한 채팅 템플릿 처리, 긴 코딩 궤적 동안 상태를 유지하는 샌드박스, CPU 부하가 큰 툴 실행과 보상 계산이 GPU와 경쟁하지 않도록 노드에 분산한 환경 액터, 안정적 RL을 위한 대형 배치와 Rollout Routing Replay가 그것이다. 비용도 단계별로 다르게 잡아야 한다. Coding Agent는 궤적 전체 길이 동안 샌드박스를 붙잡고 테스트 스위트를 돌리며, 약 1만 개 동시 샌드박스를 감당하는 서비스 유지에 월 1만 달러 규모가 든다. Search Agent는 질문당 약 100회 툴 호출로 BrowseComp 1,266문제를 한 번 도는 데 10^5 규모의 검색·페이지 추출 호출이 발생하고, 리스트 가격(Serper 1K 검색당 2달러, Jina Reader 100만 토큰당 0.05달러) 기준 몇백 달러가 나간다. 8~32노드 팀이라면 에이전트 단계 예산을 평균이 아니라 별도 항목으로 잡아야 한다.

저자들이 명시한 한계도 분명하다. 이 순서는 이전 실험과 컴퓨트 예산에 의해 형성된 '통한 하나의 순서'일 뿐 최적으로 입증된 것이 아니며, 도메인별 전문가를 따로 학습해 multi-teacher on-policy distillation으로 합치는 대안은 탐색하지 않았다. Coding Agent는 수렴까지가 아니라 가용 컴퓨트까지 학습됐다. 단일 벤치마크 스위트를 모든 단계에서 추적하지 않아서, 중간 단계 사이의 점수 이동을 특정 단계 하나에 귀속시킬 수 없다. n-gram과 임베딩 필터는 대규모 오염을 사실상 배제하지만 모든 누출을 배제하지는 못하며, 같은 잔여 위험이 SFT 믹스뿐 아니라 각 RL 프롬프트 세트에도 적용된다. 일부 결론은 완전한 ablation이 아니라 학습 경험이며, 논문은 이를 그렇게 표시한다.

관련 논문