LLM 미세조정에서 1차 방향은 두고 0차 평가로 걸음 크기를 정한다

Trust the Direction, Search the Step: Zero-and-First-Order Methods for LLM Fine-Tuning

arXiv2610.02190v1

Cristian McGee2026-10-01

무엇인가

대규모 신경망 학습에서 방향은 1차 경사가 잘 알려주지만, 그 방향으로 얼마나 갈지는 여전히 스케줄·휴리스틱·하이퍼파라미터 튜닝에 의존한다. 너무 보수적인 걸음은 수렴을 늦추고, 공격적인 걸음은 학습을 불안정하게 만든다. LLM 파인튜닝에서는 이 스칼라 하나가 특히 민감해서, 배치가 담고 있는 정보를 다 쓰지 못하거나 반대로 학습이 무너지기 쉽다. 이 논문은 그 지점, 즉 방향 선택과 걸음 크기 결정을 분리하는 문제를 다룬다.

어떻게 동작하나

제안하는 ZFO(Zero-and-First-Order)는 1차 옵티마이저가 만든 방향을 신뢰하고, 그 방향을 따라가는 1차원 문제로 걸음 크기만 다시 푼다. 먼저 업데이트 방향을 정규화해 z_t = g_t/‖g_t‖로 두고, 현재 미니배치가 정의하는 대리 목적함수를 이 방향의 직선 위로 제한해 φ_t(s) = F_t(θ_t + s·z_t)로 쓴다. 탐색 구간은 I_t = [0, β·α·‖g_t‖]이며, β=1이면 구간의 끝이 기존 1차 업데이트와 정확히 일치한다. 즉 학습률 α를 고르는 일은 이 직선 위의 스칼라 변위 s를 고르는 일로 바뀐다.

무엇과 다른가

절차는 이렇다. 순전파·역전파에서 이미 얻는 φ(0)과 방향도함수 φ'(0) = ⟨∇F_t(θ_t), z_t⟩에 더해, 같은 고정 미니배치 위에서 대칭 섭동 두 점 φ(ε) = F_t(θ_t + ε·z_t)와 φ(-ε) = F_t(θ_t - ε·z_t)를 순전파로 평가한다. 이 네 값으로 중심 유한차분을 통해 2차 방향도함수와 3차 방향도함수를 추정하고, 그 계수로 국소 모델을 만든다. 모델은 테일러 2차·3차(T2, T3)와 파데 2차·3차(P2, P3) 네 가지이며, 각 모델을 탐색 구간 I_t 위에서 최대화한 s_t로 θ_{t+1} = θ_t + s_t·z_t를 적용한다. 파데 모델의 분모가 구간 안에 극점을 가지면 그 단계를 버리고 2차 테일러로 되돌아가는 안전장치가 있다. 같은 두 번의 탐색을 재사용해 2차·3차 정보를 모두 뽑는다는 점이, 곡률 기반 걸음 하나만 만드는 기존 GeN과의 차이다.

어떻게 쓰나

이론은 세 갈래다. 첫째, 공통난수(CRN)로 같은 표본을 재사용하면 유한차분 곡률 추정이 모집단 값 주위로 집중되며, 오차 한계는 유한차분 편향 Bε²/12(3차는 Lε²/20)와 표본항 σ√(2log(4/δ)/n)의 합으로 주어진다. 둘째, 표본을 고정한 뒤에는 2차 테일러 모델의 최대화 걸음이 구간 내 최적 걸음보다 φ(s_M) ≥ φ(s_φ) - MR³/3 - Bε²R²/12만큼만 나쁘다. 셋째, 전역 정상성 보장은 통상적인 1/T 항에 더해 평균 걸음 선택 오차 Δ̄_T에 비례하는 항을 갖는다. 즉 ZFO는 정확한 정지점이 아니라, 걸음 선택 오차가 지배하는 정상성 근방으로 수렴한다.

전제와 한계

실험은 GRPO 정책 경사와 AdamW를 쓴 RLVR 구성에서 Qwen-2.5-MATH-1.5B, Phi-2, Gemma-2-2B, Llama-3.2-1B를 GSM8K, SVAMP, AsDiv, OpenBookQA, MATH(학습 512/평가 256 부분집합)에 파인튜닝해 진행했다. 학습률 α는 1차 베이스라인에 가장 좋은 값을 {10⁻⁶, 5×10⁻⁶, 10⁻⁵}에서 고정하고 β는 {3, 5, 10}에서 골랐다. 결과적으로 모든 모델-데이터셋 조합에서 최소 하나의 ZFO 변형이 1차 파인튜닝(FO FT)을 앞섰고, 파데 3는 표 9에 정리된 16개 LLM 설정 중 14개에서 FO를 개선했다. Qwen 부분 연구에서는 ARC-Challenge에서 FO FT 대비 8.81, CODAH에서 4.92 향상됐다. 고전 최적화 6문제에서도 최소 하나의 ZFO 변형이 100회 업데이트 후 중앙값 목적값을 크게 낮췄으며, 비선형 최소제곱과 Beale에서는 테일러 3-AdamW, Rosenbrock에서는 파데 3-AdamW가 가장 좋았다. 어떤 국소 모델이 최적인지는 과제마다 달랐다.

비용은 작은 편이다. 롤아웃, 보상 평가, 순전파, 역전파라는 기존 4단계는 그대로 두고 순전파 탐색 두 번만 추가한다. Qwen-2.5-MATH-1.5B 기준 벽시계 시간 오버헤드는 약 5.2%였고, 최대 GPU 메모리 오버헤드는 Qwen/GSM8K 11.0%에서 Phi-2/OpenBookQA 19.1%까지 늘었다. 저자들은 ZFO가 새로운 메모리 피크를 만드는 것이 아니라 기존 피크를 넓히는 것이라고 설명하며, MeZO가 쓰는 메모리 절약 기법은 업데이트 방향이 무작위 방향이 아니라 1차 경사라서 그대로 옮겨오지 않는다고 밝힌다.

한계도 분명하다. 두 번의 탐색으로 얻는 것은 곡률과 그 변화 정도뿐이고, 탐색 구간을 넓히면 더 큰 업데이트가 가능해지는 대신 근사 오차가 커진다. 구간 제한과 파데 폴백은 외삽과 극점을 막아줄 뿐, 모든 걸음이 대리 목적함수를 개선한다는 보장은 없다. 전역 수렴 정리는 q_t/L_J가 탐색 구간 안에 있다는 조건을 전제로 하며, 걸음 선택 오차가 0으로 가지 않으면 정확한 정지점이 아니라 근방에 머문다. 선택된 걸음의 품질은 국소 모델, 탐색 반경, 1차 방향의 정렬 정도에 의존한다. 저자들 스스로 테일러 2·3, 파데 2·3을 최종형이 아니라 초기 인스턴스로 규정하고, 더 나은 함수 근사기를 이 프레임워크에 얹기를 권한다.

실무자 입장에서 이 논문의 값어치는 학습률 스케줄을 갈아엎지 않고도 기존 1차 옵티마이저 위에 얇은 래퍼로 얹을 수 있다는 점이다. 다만 미니배치를 고정한 채 파라미터만 섭동해 재평가할 수 있는 구조, 즉 같은 프롬프트-응답 쌍을 다시 스코어링할 수 있는 파이프라인이 전제다. 도입 전에는 β와 α의 상호작용(작은 학습률에서는 β를 키우는 게 이롭지만 α가 크면 불안정해진다), 파데 2가 사실상 FO와 비슷하게 구간 끝을 고르는 보수적 기준점이라는 점, 그리고 11~19% 수준의 메모리 증가를 함께 확인해야 한다.