온폴리시 업데이트 방향만 맞춰도 SFT 일반화가 살아난다

On-Policy Parameter Update Direction Underlies Generalization in LLM Post-Training

HF Daily2609.36659

Shufan Shen, Zhongni Hou, Junshu Sun2026-09-29조회 3

무엇인가

이 논문은 온폴리시 후학습(GRPO, OPD)이 SFT보다 일반화가 좋은 이유를 파라미터 업데이트의 방향에서 찾고, 그 방향을 SFT에 이식하는 방법을 제안한다. 기존 연구들은 온폴리시 업데이트의 특징(희소한 업데이트 위치, 작은 스펙트럼 변화)을 온폴리시 학습의 부산물로만 취급했고, 이를 다른 학습 방식의 일반화를 끌어올리는 최적화 원리로 쓸 수 있는지는 다루지 않았다. 저자들은 업데이트 위치를 넘어 각 파라미터의 부호까지 포함하는 방향을 조사 대상으로 확장한다.

어떻게 동작하나

이론 분석에서 SFT의 그래디언트는 고정된 teacher 분포에서 뽑은 궤적의 로그확률 그래디언트 s_θ(x,τ) 방향으로 파라미터를 민다. 반면 온폴리시 정책 그래디언트는 advantage A_θ(x,τ)와 s_θ(x,τ)의 공분산 방향으로 업데이트하며, 궤적이 학습 중 변하는 현재 정책 π_θ에서 샘플링되므로 advantage 분포 자체가 계속 움직인다. 그래서 온폴리시 업데이트 방향은 훈련 내내 조정된다. 실험도 이를 뒷받침한다. 구간 업데이트의 코사인 유사도는 SFT가 양의 상관을 보이는 반면 온폴리시는 단계마다 거의 직교하고, 누적 업데이트 유사도는 SFT가 1.0에 가까운 반면 온폴리시는 0.5 정도에 머문다.

무엇과 다른가

제안 방법 OPSFT(On-Policy direction-constrained SFT)는 이 누적 방향을 제약으로 건다. 온폴리시 학습 전후 파라미터 θ_base, θ_on에서 부호 벡터 v = sign(θ_on − θ_base) ∈ {−1,0,1}^d를 계산하고, SFT 그래디언트 g에 대해 g_s = I(sign(−g) = v) ⊙ g로 부호가 v와 일치하는 원소만 남기고 나머지를 버린다. 경사하강은 이 제약된 그래디언트로 수행되며, 옵티마이저 내부 정규화 항이 제약을 흔들 수 있어 옵티마이저 스텝 이후에도 방향을 다시 제약한다(부록 A).

어떻게 쓰나

실험은 Qwen3-1.7B/4B/8B와 DeepSeek-R1-Distill-Llama-3-8B를 DeepMath, DAPO, Eurus-RL-Code 데이터셋에서 Qwen3-30B-A3B가 생성한 궤적으로 학습한다. 비교 대상은 vanilla SFT, OPD, GRPO, 그리고 업데이트 위치만 온폴리시와 공유한 OPSFT다. OPSFT는 vanilla SFT를 일관되게 크게 앞서고 방향을 제공한 GRPO와 비슷한 성능에 도달한다. 특히 위치만 공유한 변형은 vanilla SFT보다도 나빠서, 위치 {0,1}^d 제약만으로는 일반화 이점이 전달되지 않고 방향 {−1,0,1}^d까지 확장해야 효과가 난다는 점을 보여준다. 수학 데이터로 학습해 다른 도메인에서 평가한 표 1에서도 OPSFT는 vanilla SFT를 앞서고 GRPO를 약간 상회한다.

전제와 한계

방향의 재사용성도 실험했다. 업데이트 위치의 겹침은 같은 도메인과 다른 도메인 데이터셋 사이에서 비슷하게 약 0.4인 반면, 업데이트 방향의 유사도는 같은 도메인 안에서 훨씬 높다. 같은 도메인이라도 DAPO와 DeepMath가 식별한 방향의 코사인 유사도는 0.2 정도로 낮지만, DeepMath로 학습한 OPSFT가 DAPO가 준 방향을 쓰면 DeepMath 자체 방향을 쓴 경우보다 오히려 약간 더 좋다. 반대로 코드 도메인(Eurus)이 준 방향으로 수학 도메인을 학습하면 성능이 약하다. 즉 같은 도메인 내 데이터셋 간 재사용은 되지만 도메인 간 재사용은 되지 않는다.

응용 결과도 구체적이다. 효율 측면에서 50스텝 GRPO로 방향만 식별하고 100스텝 OPSFT를 돌리면, DeepSeek-R1-Distill-LLaMA-8B에서 평균 정확도 26.56을 8.1시간에 얻어 19.90을 14.1시간에 얻는 DFT를 크게 앞선다. Qwen3-8B에서는 8.9시간 대 GRPO 19.3시간으로 학습 시간을 절반 이상 줄이면서 평균 정확도 41.67 대 40.31로 더 높다. 사후 개선 측면에서는 GRPO 100스텝 뒤 고품질 궤적으로 SFT를 이어 붙이면 Qwen3-4B 평균 정확도가 38.96에서 36.25로 떨어지지만, 같은 궤적을 OPSFT로 학습하면 38.96에서 41.36으로 올라간다.

정밀도와 절제 실험도 있다. BF16에서 vanilla SFT는 파라미터의 2.702%를 업데이트하는 데 그치는데 OPSFT는 0.408%만 업데이트하고도 정확도 40.94 대 38.33으로 앞서며 베이스 모델 대비 24.59% 향상을 낸다. FP32에서는 vanilla SFT가 약 90%를 업데이트하는 반면 OPSFT는 9.45%로 GRPO와 비슷하고, 정확도는 42.81 대 GRPO 42.01로 GRPO를 앞선다. 방향은 GRPO 후반 스텝에서 식별할수록 성능이 좋지만 한계 효용은 줄어든다(50→100스텝 개선폭이 100→150스텝 개선폭보다 크다). 추론 행동에서는 응답 길이는 비슷하지만 정확도의 표준편차가 GRPO에 가까워지고, case-splitting 및 논리적 단서 표현 빈도가 온폴리시 쪽에 더 닮아간다.

개발자 입장에서 이 논문이 주는 실무적 시사점은 명확하다. RLHF/GRPO 파이프라인을 끝까지 돌릴 예산이 없어도, 소량의 온폴리시 스텝으로 방향 벡터만 뽑아 두면 이후 SFT를 그 방향으로 제약해 일반화를 확보할 수 있다. 또한 이미 온폴리시로 후학습한 모델에 새 고품질 궤적을 먹일 때, 그냥 SFT를 걸면 기존 능력이 깨지지만 방향 제약을 걸면 성능이 오히려 올라간다. 다만 방향은 도메인에 묶여 있으므로 코드·수학·에이전트 등 도메인이 다르면 각각 방향을 새로 식별해야 하고, 방향을 얻기 위한 최소한의 롤아웃 비용은 여전히 필요하다.

한계와 전제는 다음과 같다. 저자들은 한계 논의를 부록 C.2로 미뤘고 제공된 본문에는 그 내용이 실려 있지 않다. 본문에서 확인되는 전제는 첫째, 방향을 식별하려면 최소한의 온폴리시 학습(예: 50 GRPO 스텝)이 선행되어야 한다는 점, 둘째, 재사용성은 같은 도메인 안에서만 성립하고 도메인을 넘으면 약해진다는 점, 셋째, 제약은 파라미터별 부호만 다루므로 업데이트 위치나 크기는 별개 문제라는 점, 넷째, BF16에서는 작은 그래디언트가 수치 정밀도 아래로 반올림되어 업데이트가 희소해지므로 정밀도 선택이 결과에 영향을 준다는 점이다.