When2Think는 쉬운 문제엔 짧게, 어려운 문제엔 길게 추론 길이를 제어한다
When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models
무엇인가
대형 추론 모델(LRM)은 복잡한 과제에서 강한 성능을 내지만 체계적인 비효율을 보인다. 쉬운 문제에서는 정확도 이득 없이 불필요한 추론 토큰을 쏟아내는 과잉 사고(overthink)를 하고, 어려운 문제에서는 추론을 너무 일찍 끝내거나 조각난 사슬을 내놓는 과소 사고(underthink)를 한다. 기존의 균일한 길이 페널티나 경직된 라우팅은 이 문제를 '효율성 세금(efficiency tax)'으로 악화시킨다. 쉬운 인스턴스의 계산을 줄인 대가로 어려운 인스턴스의 정확도를 잃는 것이다. 이 논문은 효율적 추론을 압축 문제가 아니라 인스턴스 적응적 계산 할당 문제로 재정식화한다.
어떻게 동작하나
제안 방법 When2Think는 하이브리드 추론을 위한 포스트트레이닝 프레임워크다. 각 입력에 대해 명시적 추론을 켤지(Think) 끌지(NoThink)를 결정하는 동시에, Think를 켠 경우 얼마나 깊이 사고할지까지 하나의 정책 안에서 학습한다. 개념적 렌즈는 이중 과정 이론으로, 쉬운 문제는 System 1식 즉답, 어려운 문제는 System 2식 숙고에 대응시킨다. 모드 토큰(Think 또는 NoThink)을 궤적 앞에 붙여 제어하고, Think일 때는 지정된 end-of-thinking 토큰까지 추론을 진행한다.
무엇과 다른가
핵심 구성 요소는 인스턴스 수준 난이도 인지 제어(IDAC)다. 학습 전 오프라인에서 참조 정책으로 인스턴스당 K개 궤적을 샘플링해 두 통계를 미리 계산해 캐시한다. 하나는 참조 정책의 경험적 정확도에 스케일을 곱한 α_i로 난이도의 대리 지표이고, 다른 하나는 평균 참조 궤적 길이 τ_i로 인스턴스별 토큰 예산이다. IDAC 계수는 λ̃ = exp(−T(o)·α_i/τ_i)로 정의되며, 참조 길이를 초과하는 궤적에 더 강한 감쇠를 걸어 쉬운 문제의 과잉 사고를 억제하고 어려운 문제에는 긴 숙고를 허용한다. 최종 보상은 r = V(x,o)·(1 + λ·δ) − α_i로, 검증기 기반 정답 신호 V에 정답일 때만 발동하는 효율 보너스를 곱하고 인스턴스별 기준선 α_i로 정규화한다. 토큰 단위가 아니라 궤적 단위로 작동하기 때문에 제어가 안정적이고 해석 가능하다.
어떻게 쓰나
안정적 최적화를 위해 배치 단위 표준화 어드밴티지(BWS)를 쓴다. 미니배치 M개 인스턴스에 대해 각 궤적 인덱스 k별로 보상의 평균과 표준편차를 구하고 A = (r − μ_k)/(σ_k + ε)로 표준화한다. 궤적 내 모든 토큰이 같은 어드밴티지를 공유하므로 분산이 낮고, 학습된 critic 없이 PPO 스타일 클리핑 목적함수를 돌릴 수 있다. 탐색은 AdaptThink의 중요도 샘플링(IS)을 차용해 초기 모드 토큰만 균일하게 뽑고 나머지 토큰은 현재 정책이 생성하며, 중요도 비율로 재가중해 목표 정책에 대한 편향 없는 그래디언트를 얻는다. 학습된 보상 모델도, 학습된 critic도, 정책 업데이트 중 온라인 참조 모델 질의도 필요 없다.
전제와 한계
실험은 DeepSeek-R1에서 증류된 R1-distill-1.5B(Qwen2.5-Math-1.5B 기반)를 베이스로, 약 4만 개 경시대회 수준 수학 문제를 담은 DeepScaleR 데이터셋에서 학습했다. 평가는 GSM-Plus, OlympiadBench, AIME I/II(2024~2025), Minerva, MATH-500에서 pass@k 정확도와 인스턴스당 평균 생성 토큰으로 이뤄졌고, Math-Verify와 MARIO Eval 두 검증기 중 하나라도 통과하면 정답으로 처리했다. 비교 대상은 Qwen2.5-Instruct 계열, R1-Distill-Qwen, DeepScaleR-Preview, 그리고 길이 압축 계열(LC-R1, ThinkPrune, LASER)과 하이브리드 라우팅 계열(AdaptThink, ThinkLess)이다.
결과 수치는 뚜렷하다. AIME24에서 베이스 대비 Pass@3가 46.0%에서 56.0%로 10.0%p 오르는 동시에 토큰 사용이 3,959개(−27.9%) 줄었다. AIME25에서는 Pass@3 40.0%를 기록했다. 같은 AIME24에서 LC-R1은 정확도가 10.0%p, AdaptThink는 1.3%p 하락했고, AdaptThink는 토큰을 5,806개로 줄였지만 Pass@3 44.7%로 백본보다 낮았다. 난이도별 할당도 확인된다. MATH-500 Level 1에서 R1-Distill이 1,199토큰을 쓰던 것을 619토큰(−580)으로 줄이면서 정확도 95.8%를 유지했고, Level 5에서는 정확도를 지키면서 2,276토큰을 감축했다. 반대로 적대적으로 변형된 GSM-Plus에서는 오히려 462토큰을 더 쓰며 정확도를 6.3%p 끌어올렸다. Think 궤적 비율은 Level 1의 약 0.2에서 Level 5의 0.7 이상으로 난이도에 따라 단조 증가했다. 절제 실험에서는 BWS가 있을 때 think 비율이 약 0.9로 안정된 반면 없으면 0.6으로 흔들렸고, IS를 제거하면 GSM-Plus 토큰이 1,052개에서 1,652개로 늘어 IS가 정확도보다 효율 쪽에 기여함을 보였다.
개발자 관점에서 이 논문의 실무적 메시지는 추론 비용 최적화의 목표를 '길이 최소화'에서 '난이도별 배분'으로 바꾸라는 것이다. 고정 토큰 예산이나 일괄 길이 페널티를 걸면 쉬운 문제에서 아낀 토큰이 어려운 문제의 정확도 손실로 되돌아오는 효율성 세금을 피하기 어렵다. When2Think는 검증 가능한 정답이 있는 과제라면 오프라인 참조 통계만 미리 계산해 두고 critic이나 보상 모델 없이 학습할 수 있다는 점에서 구현 부담이 낮다. 다만 참조 통계 품질이 난이도 추정의 정확도를 좌우하므로, 배포 도메인과 유사한 데이터로 α_i와 τ_i를 다시 계산해야 하는지, 그리고 학습된 정책이 실제 서빙 트래픽에서도 Think/NoThink 비율을 난이도에 맞게 유지하는지를 확인해야 한다.
저자들이 밝힌 한계는 두 가지다. 첫째, 검증 가능한 보상에 의존하기 때문에 수학적 추론처럼 정답 검증이 명확한 도메인에 가장 직접적으로 적용되며, 개방형 과제로 확장하려면 추가적인 보상 모델링이나 인간 평가가 필요하다. 둘째, 난이도 추정을 오프라인 참조 통계에 의존하므로 문제 난이도가 모호한 경우 추정이 덜 신뢰할 만해질 수 있다. 또한 저자들은 규모의 역설을 언급하며, 작은 모델일수록 과잉 사고가 두드러져 효율성 세금이 잘 보이지만 큰 모델은 자체 추론 효율이 높아 이런 효과가 훨씬 약하게 나타난다고 밝혔다. 그래서 분석은 비효율이 가장 진단적으로 드러나는 1.5B 규모에 집중되어 있다.