LSD가 이미 푼 문제의 불필요한 응답 길이를 줄인다
Mitigating the Length-Scaling Tax with Online Distillation
무엇인가
이 논문은 RL 후처리에서 응답 길이가 늘어나는 현상을 무조건 추론 능력 향상으로 보지 않는다. 이미 맞힌 문제에서 정확도 이득 없이 응답만 길어지는 비용을 길이 스케일링 세금(LST)으로 정의한다. 저자들은 앵커 체크포인트 b에서 정답률이 임계값 τ 이상인 문제를 쉬운 문제 집합으로 고정하고, 이후 체크포인트에서 같은 집합의 정확도와 길이를 측정한다. 기준 길이 L_b*는 정확도 조건을 만족하는 RL 체크포인트 중 평균 응답 길이가 가장 짧은 값이며, LST_b(k) = (L_b(k) - L_b*) / L_b*로 정규화한다. 양수 LST는 정확도가 같거나 충분한데도 기준보다 토큰을 더 쓴다는 뜻이다. 원인은 그룹 상대 RLVR의 구조에 있다. 한 프롬프트의 모든 롤아웃이 정답이면 그룹 내 상대 어드밴티지가 0에 가까워져, 쉬운 문제는 간결한 답변을 유지하라는 그래디언트를 주지 않는다. 그런데 정책 파라미터는 모든 프롬프트가 공유하므로, 어려운 문제에서 나온 업데이트가 쉬운 문제의 접두사에서 토큰 확률을 바꿀 수 있다. 동적 샘플링이 전부 정답인 그룹을 버리거나 난이도 커리큘럼이 쉬운 문제를 낮게 가중하면 이 문제는 더 심해진다.
어떻게 동작하나
제안 방법인 길이 자기 증류(LSD)는 매 학습 스텝에서 현재 정책이 프롬프트당 G개의 응답을 생성하고, 그 롤아웃 정답률이 τ 이상이면 쉬운 그룹으로, 아니면 어려운 그룹으로 라우팅한다. 어려운 그룹은 원래 RLVR 목적함수를 그대로 쓰고, 쉬운 그룹은 온폴리시 증류(OPD) 목적함수로 보낸다. 교사는 외부 모델이 아니라 온라인 정책의 지수 이동 평균(EMA)이다. EMA 파라미터는 θ̄_k ← β θ̄_{k-1} + (1-β) θ_k로 갱신하고, β = 2^{-1/H}로 두어 반감기 H가 교사의 시간 지연을 조절한다. 라우팅은 교사 롤아웃을 추가로 돌리지 않기 위해 학생의 온폴리시 정답률을 프록시로 쓴다. 저자들은 500스텝에서 쉬운 문제로 분류된 프롬프트의 87% 이상이 250스텝에서도 쉬운 문제로 분류됐다고 보고한다. 고정된 초기 정책 π0를 교사로 쓰면 새로 푼 문제와 교사가 못 푸는 문제 사이의 불일치가 커져 성능 향상을 막을 수 있어 EMA 교사를 쓴다.
무엇과 다른가
OPD 목적함수는 세 가지로 구현된다. SG-FKL은 교사 상위 K개 토큰과 정지 토큰으로 지지집합을 만든 뒤 교사에서 학생으로 가는 순방향 KL을 최소화한다. SG-RKL은 같은 지지집합에서 학생에서 교사로 가는 역방향 KL을 최소화한다. 둘 다 교사 분포를 고정하고 학생 로짓을 통해 직접 미분한다. PG-RKL은 샘플된 토큰에서 교사와 롤아웃 정책의 로그 확률 차이를 분리된 어드밴티지로 사용해 PPO 스타일로 업데이트한다. 최종 목적함수는 쉬운 경로와 어려운 경로의 시퀀스 수 비율로 두 손실을 가중한다. 즉 L_LSD = n_H/(n_H+n_E) * RL 손실 + n_E/(n_H+n_E) * OPD 손실이다. 기본 라우팅 임계값은 τ=1이며, 완전히 푼 그룹에만 보존 신호를 주는 것이 실험적으로 더 낫다고 한다.
어떻게 쓰나
단일턴 수학 추론 실험은 Qwen3-4B-Base를 중복 제거한 DAPO-Math-17K로 후처리하고 AMC 2023과 AIME 2025-2026에서 평가했다. 쿼리당 32개 응답, 4k 응답 예산을 썼다. 비교 대상은 RL, LSD 세 변형, CRISP, Fixed SG-FKL이다. LST1000은 RL의 19.0%에서 SG-FKL -3.7%, SG-RKL -10.9%, PG-RKL 1.4%로 줄었다. 음수 LST는 정확도 기준을 만족하는 RL 기준 길이보다 오히려 짧아졌다는 뜻이다. 어려운 문제의 평균 길이는 RL 2329토큰에서 SG-FKL 2511, SG-RKL 2395, PG-RKL 2393토큰으로 늘어, 쉬운 문제는 짧게, 어려운 문제는 길게 가는 패턴이 나타났다. 500스텝 이후 쉬운 경로는 SG-FKL 12.17%, SG-RKL 10.58%, PG-RKL 10.94%의 토큰만 차지했고, 어려운 경로가 87.83~89.42%를 유지했다. CRISP는 Pass@1 40.56%, Fixed SG-FKL은 Pass@1 30.44%와 LST1000 -10.8%를 기록했다. 세 변형 중 SG-FKL이 단일턴 평균 Pass@1이 가장 높았고, SG-RKL은 LST는 가장 낮지만 Pass@1이 더 낮았다. 평균 액터 엔트로피는 SG-RKL 0.0367, SG-FKL 0.0743, PG-RKL 0.0542였다.
전제와 한계
멀티턴 에이전트 실험은 Qwen3-8B-Base를 CutTheBill 학습 분할로 후처리하고 BrowseComp-Plus에서 평가했다. 20,000토큰 응답 예산, 최대 48턴, 별도의 Qwen3-8B 정제 에이전트를 사용했다. LST50은 RL 31.4%에서 SG-FKL 13.7%, SG-RKL 9.2%, PG-RKL 16.1%로 감소했다. RL에 길이 페널티를 더한 베이스라인은 LST50을 1.2%까지 낮추고 평균 턴을 4.66으로 줄였지만 Pass@1이 22.58%로 떨어졌다. 에이전트 설정에서 응답 길이는 턴 전체의 정책 생성 토큰 합이며, 도구 관찰과 정제 모델 생성은 별도 비용으로 계산된다.
하이퍼파라미터 실험에서 EMA 반감기 H는 2, 4, 8을 비교했고 τ=1을 썼다. H=4가 1750스텝에서 평균 Pass@1 41.85%로 가장 높았다. 반감기를 길게 하면 LST는 더 억제되지만 능력 습득이 느려진다. 라우팅 임계값을 낮춰 τ=0.85, 0.75로 두면 평균 Pass@1이 40.91%, 39.31%로 떨어지고 증류 토큰 비중은 10.31%에서 19.00%로 늘었다. 저자들은 부분적으로 푼 그룹은 아직 보상 변화가 있어 RL 학습을 계속할 가치가 있으므로, 보존 신호를 완전히 푼 그룹으로 제한하는 것이 낫다고 해석한다. 또한 Hard-4k 설정이 모든 쉬운 집합에서 가장 높은 LST를 보였고, All-8k는 학습 초반 LST를 키웠지만 후반에 8k로 전환한 All-4k-8k는 400스텝에서 LST가 더 낮고 Pass@1 개선이 더 컸다.
개발자 관점에서 LSD는 기존 RLVR 트레이너 위에 난이도 라우터와 EMA 자기교사를 얹는 방식이라 외부 교사 모델이나 별도 간결 프롬프트 모델이 필요 없다. 이미 잘 푸는 문제가 RL 후처리 후 길어지는지, 전부 정답인 그룹을 버리는 데이터 선택을 쓰는지, 어려운 문제에만 학습을 몰아넣는지를 확인할 때 유용하다. 다만 평균 응답 길이 하나만 보지 말고 고정된 쉬운 문제 집합과 어려운 문제 집합을 나눠 정확도와 길이를 함께 봐야 한다. 라우팅 임계값, EMA 반감기, 증류 토큰 비중이 성능과 길이 보존 사이의 트레이드오프를 바꾸므로 이 값들을 로그로 남기는 것이 좋다. 에이전트에서는 턴별 정책 생성 토큰과 도구·정제 비용을 분리해 계산해야 LST를 오해하지 않는다.
한계도 분명하다. 저자들은 LST를 τ<1로 보고할 때는 정확도 임계값 아래에서의 초과 길이를 측정할 뿐, 동일 정확도에서의 낭비를 입증하는 것은 아니라고 명시한다. 실험은 Qwen3-4B-Base와 Qwen3-8B-Base, 특정 수학·에이전트 데이터셋에 한정됐고, 더 큰 모델에서의 평가는 미래 작업으로 남겼다. 코드는 논문 수락 후 공개할 예정이라고 밝혔다. 또한 고정된 초기 정책을 교사로 쓰는 방식은 새로 푼 문제와의 불일치로 성능 향상을 제한할 수 있어, EMA 교사의 반감기와 라우팅 범위를 데이터에 맞게 조정해야 한다.