SFT 학습 델타를 부호 있는 게이트로 억제·역전·외삽하는 SCALE

Rethinking Token Reweighting for SFT: Suppress, Reverse, and Extrapolate Learned Features

HF Daily2609.33463

Cunchun Li, Haonan He, Yifan Gao2026-09-27조회 3

무엇인가

SFT는 모델이 가장 낮은 확률을 부여한 토큰에서 가장 공격적으로 학습한다. 덕분에 새로운 행동을 빠르게 습득하지만, 동시에 잡음 섞인 지도나 상충하는 지도를 증폭시키고 사전학습 지식을 덮어쓸 수 있다. 자연어 지도는 본질적으로 일대다이기 때문에, 낮은 확률의 정답 토큰은 두 가지 성격이 전혀 다른 경우를 나타낸다. 모델이 불확실해서 참조가 유용한 새 정보일 수도 있고, 모델이 일관된 대안을 확신하는데 참조가 잡음일 수도 있다. 표준 SFT는 두 경우를 동일하게 취급하며, 정확히 신뢰도가 가장 모호한 토큰에 가장 강한 교정을 가한다.

어떻게 동작하나

논문은 기존 토큰 재가중 기법들을 통합 정책 손실(policy-loss) 관점에서 다시 본다. DFT, ProFit, EAFT, TALR, EKSFT 같은 대표 기법은 모두 시연 토큰의 손실에 음이 아닌 계수 w_t를 부여하는 구조를 공유한다. 표준 SFT는 w_t=1, 데이터 필터링은 w_t∈{0,1}인 특수한 경우다. 저자들은 이 구조가 공통된 한계를 갖는다고 주장한다. 음이 아닌 토큰 가중치는 시연 토큰의 지도 그래디언트 크기를 조절할 뿐이며, 이 직접적인 교차엔트로피 성분을 억제하거나 증폭할 수는 있어도 부호를 뒤집을 수는 없다. 또한 토큰 가중치는 과제 업데이트가 아직 학습되는 도중에 작동하므로, w_t를 바꾸는 것은 고정된 SFT 방향을 스케일하는 것이 아니라 최적화 궤적 자체를 바꾸는 일이다. 역전과 외삽은 SFT가 끝나 사전학습 모델과 학습된 델타가 고정되어 안정적인 기준 좌표계를 이룬 뒤에야 잘 정의된다.

무엇과 다른가

제안 방법 SCALE(Selective Control of Adaptation via Local Entropy)은 델타 획득과 델타 보정을 분리한다. 1단계에서는 표준 SFT 목적함수로 LoRA 어댑터를 학습한다(실험 설정은 rank 16, 스케일링 계수 16, 드롭아웃 0, 전체 선형 계층, 1 에폭, 배치 128, AdamW, 수학 5×10⁻⁴·코드 5×10⁻⁵ 피크 학습률, 코사인 감쇠, 10% 워밍업). 2단계에서는 사전학습 모델과 출력 헤드, 학습된 LoRA 델타를 모두 동결하고, 은닉 상태에 대한 선형 투영을 tanh로 눌러 만든 토큰·모듈별 스칼라 게이트 λ만 학습한다. 각 모듈의 출력은 W·h + λ·ΔW·h가 되며, λ=1은 원래 SFT 델타를 보존하고, 0≤λ<1은 억제, λ<0은 역전, λ>1은 원래 세기 너머로의 외삽을 뜻한다. 게이트는 예측 엔트로피만을 최소화해 학습되며, 어휘 전체가 아니라 상위 k=100 로짓에 대한 조건부 엔트로피를 응답 위치에서 계산한다. 2단계에는 교차엔트로피도, KL도, 예산 항도 없다. 게이트가 추가하는 파라미터는 모듈당 d_m+1개뿐이다.

어떻게 쓰나

이론적 근거도 제시된다. 엔트로피의 그래디언트는 A^ent(a)=log π(a)+H 형태의 부호 있는 어드밴티지로 표현되며(보조정리 1), 이는 정답을 알려주는 오라클이 아니라 이미 학습된 동결 델타를 스케일하는 제한된 가족에 대한 비지도 국소 선택 신호로 쓰인다. 게이트 부분공간에서 엔트로피 어드밴티지와 과제 가치의 불일치 항이 ‖e_ψ‖ ≤ ρβ‖∇V‖를 만족한다는 가정 1 아래에서, 엔트로피 하강은 국소적으로 과제 가치를 증가시킨다(정리 1). 또한 [0,1]^M 구간의 국소 최소점에서 그래디언트가 0이 아니라면 L<0<1<U인 더 넓은 구간에 더 작은 값을 주는 점이 존재한다(명제 2). 저자들은 이것이 억제 경계에 갇히는 문제를 없앤다고 설명한다.

전제와 한계

실험은 Qwen2.5-Math-1.5B, Qwen2.5-Math-7B, Qwen3-4B-Base 세 백본에서 수행됐다. 수학 추론은 NuminaMath-CoT로 파인튜닝하고 Math500, Minerva, OlympiadBench, AIME24, AMC23으로 평가했으며, 일반 능력 유지는 MMLU-Pro, BBH, OpenBookQA로 확인했다. 코드 생성은 Magicoder-OSS 코퍼스로 학습해 HumanEval, HumanEval+, MBPP로 평가했다. SCALE은 세 백본 모두에서 수학 추론 Avg@16 평균 37.84%, 43.60%, 36.57%를 기록해 DFT를 각각 5.03, 6.08, 1.91 포인트 앞섰고, 모든 벤치마크에서 최고 성능을 냈다. 일반 능력 유지에서는 Qwen2.5-Math 두 백본에서 최고 평균, Qwen3-4B-Base에서 두 번째로 높은 평균을 기록했다. 코드 생성에서도 세 백본 모두 HumanEval·HumanEval+·MBPP 평균 최고점(34.72%, 47.35%, 47.34%)을 얻었다.

게이트 범위 실험은 하한 L∈{-6,…,0}과 상한 U∈{1,…,6}의 42개 조합을 각각 따로 학습해 비교했다. 결과는 과제 의존적이다. 수학에서는 높은 점수를 내는 설정이 음의 L 영역에 몰렸고, Qwen2.5-Math 두 모델은 U가 1보다 큰 쪽을 선호한 반면 Qwen3-4B-Base는 더 작은 상한에서 수학 최고점에 도달했다. 코드에서는 L=0 근처에 큰 양의 상한을 둔 영역이 고득점이었다. U=1로 고정했을 때 음의 하한은 세 백본 모두 수학을 개선했고, [0,1]을 [0,6]으로 넓히면 세 백본 모두 코드 pass@1이 향상됐다. 저자들은 이를 수학에는 역전이, 코드에는 외삽이 유효하다는 패턴으로 해석한다.

개발자 관점에서 이 논문이 주는 실무적 시사점은 보정 단계의 위치다. 기존 토큰 재가중은 학습 중간에 개입해 궤적을 바꾸지만, SCALE은 SFT를 끝낸 뒤 델타를 고정하고 그 사용 방식만 조절한다. 따라서 이미 돌려놓은 SFT 체크포인트가 있고, 특정 과제에서 성능이 나쁘거나 일반 능력이 망가진 상황에서 전체 재학습 없이 소수의 게이트 파라미터만 다시 학습하는 선택지가 된다. 다만 게이트 범위 [L,U]를 과제와 백본에 맞춰 정해야 하며, 논문의 결과 자체가 수학과 코드에서 선호 구간이 다르다는 것을 보여준다.

한계와 전제도 분명하다. 예측 엔트로피는 정답 판정기가 아니며, 정리 1의 보장은 게이트 부분공간에서 엔트로피 방향과 과제 가치가 일치한다는 가정과 국소적 프록시 가치 개선에 한정된다. 게이트 범위는 모듈 수준 개입 크기를 제한할 뿐 출력 발산을 보장하지 않는다. 명제 2는 독립적인 개입 좌표를 전제로 하며, 공유 게이트가 유용한 방향을 실제로 표현해야 하고, 최적점이 L이나 U에 놓인다거나 최적화가 그것을 찾는다는 보장은 없다. 저자들 스스로 실질적 효과는 경험적으로 평가된다고 밝힌다.