FIRE가 자기증류 학습의 불안정성을 피셔 정보로 잡는다
Fisher-Informed Recalibration for Feedback-Based On-Policy Self-Distillation of LLMs
무엇인가
피드백 기반 온폴리시 자기증류는 하나의 LLM이 교사와 학생을 겸하면서, 자기 출력에 대한 외부 피드백을 조건으로 다시 만든 분포를 따라가도록 학습하는 방식이다. 문제는 최적화가 불안정해 학습 도중 성능이 붕괴하기 쉽다는 점이다. 저자들은 원인을 세 가지로 본다. 이미 정답인 응답에까지 피드백 조건 교사 감독을 걸면 불필요한 이탈이 생기고, 오답일 때는 교사가 제시한 수정 자체가 틀렸을 수 있는데도 그대로 따라가면 방향이 나쁜 큰 업데이트가 들어온다. 또 표준 KL 증류는 피드백 전체를 무오류 감독으로 취급해 어떤 피드백 요소가 업데이트를 과도하게 끌고 가는지 구분할 방법이 없다.
어떻게 동작하나
FIRE는 응답을 정답과 오답으로 갈라 서로 다른 감독을 주는 이중 분기 구조다. 먼저 학생이 응답을 샘플링하고 검증기 ω(y)가 정답 여부를 판정한다. 교사는 학생을 초기값으로 삼아 역전파 없이 지수이동평균으로만 갱신되는 EMA 교사이며, 피드백은 학습 중에만 교사에게 주어진다. 교사는 학생이 이미 만든 궤적을 인과 마스크 아래 한 번의 순전파로 채점하므로 추가 자기회귀 롤아웃이 필요 없다.
무엇과 다른가
두 분기를 묶는 것이 토큰 단위 반경 ρ다. ρ는 소프트맥스 피셔 흔적의 제곱근을 현재 학습률과 명목 학습률의 비로 나눈 값으로, 학생 예측이 소수 토큰에 몰려 있으면 반경이 작아지고 확률이 넓게 퍼져 있으면 커진다. 학습률이 높을수록 분모가 반경을 더 줄여 큰 스텝이 과도한 업데이트를 만들지 않게 한다. 정답 분기에서는 표준 온폴리시 SFT 그래디언트 p−e_y의 크기 대비 반경 비율로 손실을 재가중한다. 오답 분기에서는 피드백을 여러 필드로 나누고 필드 하나씩 뺀 반사실 교사 q_{-j}를 만들어, 각 필드가 그래디언트 공간에서 유도하는 업데이트에 얼마나 기여하는지를 에너지 차이로 측정한다. 전체 교사가 이미 반경 안에 있으면 게이트 값이 0이 되어 원래 피드백 감독을 그대로 유지하고, 반경을 넘을 때만 초과분 비율만큼 필드 가중치를 깎는다. 이 가중치로 전체 교사와 반사실 교사들을 기하평균으로 결합해 속성 인지 교사 q_A를 만들고, 그 그래디언트가 반경을 넘으면 계수 η로 정확히 반경 경계까지 축소한 뒤 학생 분포와 다시 기하 보간해 최종 목표 q_FIRE를 얻는다. 결과적으로 어떤 방향으로 갈지는 피드백 기여도가 정하고, 얼마나 멀리 갈지는 피셔 기반 반경이 정하는 셈이다.
어떻게 쓰나
실험은 Qwen2.5-Instruct 1.5B(GSM8K, AQuA-RAT, ASDiv)와 3B(ARC-Challenge, SuperGLUE WiC, WinoGrande)에서 LoRA와 AdamW로 수행했고, 14B 결과는 부록에 있다. 비교 대상은 Full-Context, SRPO, TOP-D, TrOPD, DemoPSD, SCOPE, Veto, On-Policy SFT 등 8개다. 저자들이 보고한 핵심은 두 모델 크기 모두에서 FIRE가 데이터셋 평균 성능이 가장 높았다는 점, 그리고 그래디언트 클리핑 이전의 그래디언트 노름이 6개 데이터셋 중 5개에서 거의 일정하게 유지됐다는 점이다. 유일하게 진동이 나타난 ARC-Challenge도 학습 후반에 나타나고 진폭이 로그 스케일에서 다른 베이스라인보다 작았다. 생성 토큰 수 측면에서도 FIRE는 응답 길이가 완만하게 줄 뿐 급격히 무너지지 않았고, TOP-D·TrOPD·Full Context 등은 학습 중 응답 길이가 급락했다. On-Policy SFT는 유사하게 안정적이지만 더 많은 토큰을 생성해 비효율적이고, SRPO는 안정적이지만 학습 비용이 훨씬 크다고 저자들은 밝힌다. 다만 표 1의 데이터셋별 정확도 수치는 제공된 본문에 숫자로 제시되지 않아, 구체적 개선폭은 확인할 수 없다.
전제와 한계
실무적으로 이 논문은 자기 출력 기반 파인튜닝 루프를 운영하는 팀에 두 가지를 시사한다. 첫째, 정답과 오답을 같은 증류 손실로 섞어 학습시키지 말고 분기해서 다뤄야 하며, 정답에는 검증된 토큰에 대한 재가중 SFT만으로 충분하다. 둘째, 학습 붕괴는 손실 값보다 클리핑 이전 그래디언트 노름과 생성 길이 추이에서 먼저 보이므로, 이 두 지표를 모니터링 항목으로 두는 것이 좋다. FIRE는 명목 학습률 외에 새 하이퍼파라미터를 도입하지 않는다는 점도 튜닝 비용 측면에서 실용적이다.
한계로 저자들은 피드백 필드 수가 많아질 때 필드 하나씩 뺀 반사실 교사를 계산하는 비용을 더 효율적으로 처리하는 방법을 향후 과제로 남긴다. 또한 실험은 테스트 데이터의 일부 부분집합에서 수행되었고, 모델 크기별로 데이터셋을 서로 다르게 구성했는데 이는 일부 벤치마크가 큰 모델에서 포화되어 파인튜닝 이득이 거의 나타나지 않기 때문이라고 설명한다. 안정성 분석은 그래디언트 클리핑을 1.0으로 모든 방법에 동일 적용한 상태에서 클리핑 이전 값을 측정한 결과라는 전제도 함께 밝히고 있다.