OnePO는 SFT 없이 RL만으로 의료 LLM을 전문가로 만든다
HuatuoGPT-3: RL-Only Domain Adaptation from Base Models
무엇인가
일반 목적 LLM을 특정 도메인 전문가로 바꾸는 도메인 적응은 실무에서 흔한 요구다. 지금까지의 표준 경로는 지도 미세조정(SFT)으로 콜드 스타트를 만든 뒤 강화학습(RL)을 얹는 2단계 파이프라인이었다. 이 논문은 그 경로가 출력 다양성을 줄여 이후 RL의 탐색 공간을 좁히고, 단계마다 목적함수와 데이터 분포가 바뀌면서 최적화 복잡도와 기존 능력 망각을 키운다고 지적한다. 그래서 SFT를 아예 건너뛰고 RL만으로 적응하는 길을 다룬다. 문제는 순수 온폴리시 RL이 콜드 스타트에 걸린다는 점이고, 교사 모델 출력을 롤아웃 그룹에 섞는 혼합 정책 RL도 두 가지 실패 모드를 보인다는 것이 이 논문의 진단이다.
어떻게 동작하나
첫 번째 실패 모드는 그래디언트 기아(Gradient Starvation)다. 혼합 정책 목적함수에서 양의 어드밴티지를 가진 토큰의 그래디언트는 A·π_θ(i,t)·∇log π_θ(i,t)에 비례하는데, SFT 그래디언트가 ∇log π_θ인 것에 비해 π_θ(i,t)라는 인자가 하나 더 붙는다. 교사 출력에서 정작 배워야 할 저확률 토큰일수록 이 인자가 0에 가까워져 학습 신호가 사라진다. 두 번째는 교사 분포 고정(Teacher-Distribution Anchoring)이다. 정책이 교사 출력보다 나은 답을 스스로 만들 수 있게 된 뒤에도 정적 교사 출력이 목적함수에 남아 정책을 교사 분포 쪽으로 계속 끌어당긴다. 저자들은 이를 확인하려 파일럿 실험을 했다. 사전학습에 없는 가상의 지식 'AHA-Medicine'을 교사 출력으로만 주입하는 과제에서 순수 RL은 그 사실을 아예 관찰하지 못해 실패했고, 혼합 정책 RL도 거의 0에 머물렀다. SFT+RL은 모방 보상 0.5까지 도달한 뒤 정체됐고, OnePO만 1.0 상한에 더 적은 스텝으로 도달했다. 두 번째 파일럿에서는 2K 교사 출력으로 콜드 스타트한 동일 모델에서 교사 출력을 계속 유지하는 혼합 정책 RL이 후반에 포화됐지만, 교사 출력을 조건부로 퇴역시키는 변형은 더 높은 성능을 냈다.
무엇과 다른가
OnePO는 교사 출력을 영구적 학습 대상이 아니라 일시적 안내로 취급한다. 온폴리시 목적함수는 GRPO 그대로 두고, 교사 출력을 학습하는 방식만 바꾼다. 첫째, 적응적 목적함수 진화(Adaptive Objective Evolution). 교사 출력의 비율 계산에서 분모를 max{π_θold(i,t), c}로 바꿔 확률 하한 c를 둔다(실험에서 c=0.1). 이러면 π_θ가 c(1+ε)까지 클리핑 없이 자랄 여지가 생긴다. 여기에 그래디언트 재조정 항 g=c/stopgrad(π_θ)를 곱하는데, 어드밴티지가 양수이고 π_θold가 c보다 작을 때만 적용된다. 두 보정은 서로 상쇄되어 토큰별 목적함수가 π_θ/stopgrad(π_θ)로 정리되고, 그래디언트는 근사적으로 A·∇log π_θ, 즉 SFT 수준의 크기를 회복한다. 다만 교사 출력의 모든 토큰이 아니라 양의 어드밴티지를 가진 저확률 토큰에 선택적으로 작용한다. 학습이 진행되어 π_θold가 c 이상이 되면 보정이 자동으로 꺼지고 목적함수는 표준 GRPO로 매끄럽게 되돌아간다. 별도 스케줄이 필요 없다는 점을 저자들은 강조한다. 둘째, 교사 퇴역(Teacher Retirement). 프롬프트마다 온폴리시 출력 G개와 교사 출력 1개를 뽑아 보상을 매기고, 교사 출력의 보상이 같은 그룹의 온폴리시 최고 보상을 엄격히 초과할 때만 그 출력을 남긴다. 남을 때는 온폴리시 출력 하나를 무작위로 대체해 GRPO 그룹 크기 G를 유지한다. 정책이 교사를 따라잡으면 교사 신호가 자연히 사라지고 훈련은 온폴리시 RL로 환원된다.
어떻게 쓰나
검증 도메인은 의료다. 학습 데이터는 20K로, MedQA·MedMCQA에서 뽑은 고난도 객관식 10K(정답 exact match로 검증 가능한 보상)와 PMC-OA 케이스 리포트를 바탕으로 GPT-5 Chat이 생성한 개방형 프롬프트·채점 루브릭 10K(LLM 심사 기반 루브릭 보상)로 구성했다. API 비용을 줄이려고 GPT-4.1 주석 샘플로 8B 채점기를 따로 학습시켰다. OnePO와 GRPO 베이스라인은 롤아웃 8, 배치 128, 미니배치 16, 학습률 2e-6, DAPO의 클리핑 구간 [0.2, 0.28] 등 하이퍼파라미터를 공유하고 KL 페널티는 쓰지 않는다. Qwen3-8B-Base를 8×H200 한 노드에서 돌렸다. 결과는 HealthBench Total 67.2, Hard 44.5로, 같은 교사(DeepSeek-V3.2 thinking)를 쓴 SFT+RL의 64.5/40.7을 각각 2.7점, 3.8점 앞선다. 순수 RL은 HealthBench Total 59.8, Medbullets 48.1에 그쳤다. 교사 선택도 영향을 준다. GPT-5 Chat보다 명시적 추론 궤적을 담은 DeepSeek-V3.2(thinking)를 교사로 쓸 때 성능이 더 좋았다. 같은 패러다임을 키운 HuatuoGPT-3는 Qwen3.5-9B 기반 9B와 Qwen3.8-27B 기반 27B 두 가지로 공개됐고, 27B가 HealthBench Total 70.1, HealthBench Professional 71.4를 기록해 GPT-6 Astra 같은 프런티어 모델을 앞선다고 저자들은 보고한다. 9B는 Professional에서 68.3이다.
전제와 한계
어블레이션은 세 구성 요소가 모두 필수임을 보여준다. HealthBench 기준 전체 OnePO가 65.4일 때, 확률 하한을 빼면 49.1로 가장 크게 떨어지고, 그래디언트 재조정을 빼면 57.3, 교사 퇴역을 빼면 52.7이 된다. 특히 교사 퇴역을 제거한 경우는 순수 RL(59.8)보다도 낮고 교사 모델인 GPT-5 Chat 자신(51.9)에 가까워, 교사 신호를 계속 섞으면 모델이 교사를 넘어서지 못한다는 진단을 뒷받침한다. 퇴역 임계값 비교에서는 Max > Mean > Min > None 순서가 뚜렷했고, 느슨한 임계값일수록 더 일찍 심하게 정체됐다. 보상 구성 실험에서는 검증 가능 보상만 쓰면 객관식이 강하고 루브릭 보상만 쓰면 개방형이 강했는데, 둘을 섞으면 양쪽이 균형을 이루면서 개방형에서는 루브릭 단독보다도 나았다. 교사 품질에 대한 강건성도 확인된다. 강한 교사에서 67.2/65.2(HealthBench/Medbullets), 약한 교사(Qwen3-8B thinking)에서 66.0/64.2로 차이가 크지 않고, 베이스 모델 22.1/30.7 대비로는 두 경우 모두 큰 향상이다. 쓰기·법률 도메인 예비 실험(Qwen3-4B-Base)에서도 OnePO가 SFT+RL을 앞섰다(쓰기 WB 74.6 대 71.2, 법률 LawBench 67.4 대 64.5). 일반 능력 유지도 나쁘지 않다. IFEval 54.2, GSM8K 92.3으로 SFT+RL의 48.8/89.7을 웃돌았고, GSM8K는 비교한 모든 학습 패러다임 가운데 가장 높았다.
실무 관점에서 이 논문이 주는 시사점은, 교사 모델 출력과 보상 함수(검증 가능 보상 + 루브릭 심사)만 확보되면 SFT 단계를 별도로 운영하지 않고 단일 RL 루프로 도메인 적응을 돌릴 수 있다는 주장이다. 파이프라인 단계가 줄면 단계 간 목적함수·데이터 분포 전환을 관리할 부담도 줄어든다. 다만 그대로 재현하려면 교사 출력을 미리 생성해 두는 비용, 루브릭 채점을 위한 LLM 심사 비용(논문은 8B 채점기를 별도 학습), 그리고 확률 하한 c와 퇴역 임계값 같은 새 하이퍼파라미터를 감수해야 한다. 논문의 수치는 의료 벤치마크 중심이므로, 자기 도메인에서 순수 RL·SFT+RL과 동일 조건으로 비교해 보는 편이 안전하다.
원문에 별도의 한계 절은 없지만 본문에서 확인되는 전제는 분명하다. 검증은 의료 도메인에 집중되어 있고, 쓰기·법률 실험은 저자 스스로 '예비(preliminary)'라고 부른다. 방법 자체가 외부 교사 모델의 출력과 신뢰할 수 있는 보상(객관식 정답 또는 루브릭 심사)을 전제로 하므로, 교사도 보상도 없는 도메인에는 그대로 적용하기 어렵다. 교사 퇴역 규칙은 교사 보상이 온폴리시 최고 보상을 엄격히 초과할 때만 유지하는데, 보상 함수가 부정확하면 이 판정 자체가 흔들린다. 파일럿 실험에 쓰인 AHA-Medicine은 저자들이 명시한 대로 가상의 과제 전용 개념이며, 실제 도메인 지식 습득 난이도를 그대로 대표하지는 않는다.