FlyBy는 생각해도 안 풀릴 때만 작은 추론 모델이 외부에 질의하도록 학습한다

Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge

HF Daily2609.34327

Chanuk Lee, Minki Kang, Sangwoo Park2026-09-28조회 3

무엇인가

작은 추론 모델(sRM)은 서빙 비용이 싸지만 큰 모델에 뒤처진다. 테스트 시점 연산을 늘리면 이 격차를 좁힐 수 있다는 기대가 있지만, 저자들은 그 전제 자체를 의심한다. Qwen3 0.6B~14B와 Gemma4 E2B~12B 두 패밀리의 중간 추론 상태에 개입한 실험에서 자기 수정(self-refinement)은 현재 상태에서 이미 도달 가능한 해답 쪽으로 확률 질량을 모을 뿐, 새로 도달 가능한 해답을 만들어내지 못했다. 그래서 실패는 두 종류로 나뉜다. 실행 병목은 정답 경로가 내부적으로 도달 가능하지만 모델이 그것을 안정적으로 실현하지 못하는 상태이고, 지식 병목은 같은 상태에서 더 추론해도 부족하며 외부 정보가 있어야 정답 경로가 도달 가능해지는 상태다.

어떻게 동작하나

저자들은 상태 s=(x, z<t)에 단서 q를 덧붙이고 N=8개의 연속 생성을 샘플링해 정답 비율 V_q(s)와 답 엔트로피 H_q(s)를 측정한다. 관측된 성공 연속이 하나라도 있으면(V>0) 실행 유사, 전혀 없으면(V=0) 지식 유사로 조작적으로 구분한다. 자기 수정 지점을 찾기 위해 wait, hmm, alternatively 같은 9개 epistemic verbalization(EV) 어휘를 쓰고, 내생적 EV는 EV를 금지한 반사실 조건과, 외생적 단서는 널 단서와 비교해 ΔV를 계산한다. AIME25/26와 HMMT-Feb2026의 경쟁 문제 93개, GPQA-Diamond에서 16개 롤아웃과 32K 토큰 예산으로 실험해 13.4K개의 내생적 EV를 수집하고, 215K 반사실 연속 생성과 57K 정보 조건 연속 생성, 총 272K 연속 생성을 분석했다. 결과적으로 작은 모델도 불확실성을 자주 표현하지만 그 표현을 진전으로 바꾸지 못했고, 관련 정보를 주면 값 상승이 훨씬 컸다. 다만 정보 활용 능력 자체도 모델 규모에 따라 좋아져서, 작은 모델은 지식 병목에 더 자주 빠지고 도움을 받고도 덜 활용한다.

무엇과 다른가

FlyBy는 sRM을 인지 코어로 두고 먼저 추론한 뒤 남은 것이 실행 문제인지 지식 문제인지 진단하고, 지식 병목일 때만 외부 모델에 질의하는 선택적 질의 프레임워크다. 외부 모델은 추론 궤적 안의 다중 깊이 질의 도구로 노출되며, 모델은 깊이 d∈{1,2,3}을 골라 더 강하고 비싼 백엔드와 더 긴 응답을 선택한다. 외부 모델은 원래 문제를 보지 못하고 질의만 보며, 문제와 n-gram 중복이 과도한 질의는 학습과 평가 모두에서 거부된다. 학습은 2단계다. 먼저 단일 질의가 실패한 궤적을 성공으로 바꾼 소수의 rescue 궤적, 질의 생성과 관찰 통합 감독, OpenThoughts3-1.2M의 일반 추론 궤적을 섞어 SFT로 질의 행동 공간을 부트스트랩한다. 그다음 DAPO-17K, ArXivMath-Training, GooseReason-0.7M의 STEM 부분집합, SuperGPQA 문제로 80스텝의 비용 인식 RL을 수행한다. 보상은 r(x,y)=I[y=y*](1−λĈ(y))로, 성공한 궤적에만 비용을 페널티해 싸게 실패하기를 보상하지 않는다. DAPO식 분리 클리핑을 쓰고 표준편차 정규화는 생략하며, 학습 중 도구 관찰에서 정답 스팬을 제거해 직접적인 답 유출을 막는다.

어떻게 쓰나

평가는 수학, 과학, 일반지식, 의학을 아우르는 6개 벤치마크(ArXivMath, GPQA-Diamond, SuperGPQA, ChemBench, MMLU-Pro, MedXpertQA)에서 vanilla Qwen3-4B의 pass@1이 0.25 이하인 어려운 문제 1,158개로 구성되며, 주 지표는 pass@8이다. FlyBy-4B는 SFT만으로 36.39%, 비용 인식 RL 후 45.96%를 기록해 Qwen3-14B(41.64%)를 2.7배 낮은 서빙 비용으로 앞섰고, pass@1에서도 16.85%로 Qwen3-8B(15.31%)를 넘었다. 베이스 Qwen3-4B의 pass@8은 21.2%에서 46.0%로 두 배 이상 올랐다. Qwen3-4B가 16회 롤아웃에서 한 번도 못 푼 문제에서도 FlyBy-4B는 28.7% pass@8을 달성해 베이스 모델의 관측된 도달 범위를 확장했다. FlyBy-8B는 pass@8 51.81%로 FlyBy-4B보다 5.85%p, Qwen3-14B보다 10.17%p 높으면서 더 저렴하다. 베이스라인 비교에서 ForkingRL은 베이스 대비 개선이 거의 없었고, Search-R1은 호출당 평균 2,015자를 반환했지만 FlyBy보다 크게 낮았다. FlyBy-4B는 평균 105 출력 토큰의 짧은 응답을 여러 번 질의하는 방식으로 더 나은 성능을 냈다. 추론 전에 한 번 크게 질의하는 Query Opening은 강한 베이스라인이지만 문제가 어려워질수록 FlyBy와의 격차가 벌어졌다.

전제와 한계

SuperGPQA 50문제에 8롤아웃을 생성해 질의 상태마다 질의 실행과 억제(예산 강제) 두 반사실로 분기한 실험에서, 질의는 상태 값을 평균 5.30%p 올린 반면 추가 추론은 거의 개선을 주지 못했다. 즉 학습된 정책은 내부 추론이 무효한 지점에서 질의한다. RL은 SFT가 보여준 단일 질의 행동을 넘어 후반 턴에서도 질의 확률을 유지하며 반복적 정보 획득을 만들어냈고, 고정 깊이 3의 커버리지를 고정 깊이 1의 비용으로 달성했다. GPU와 API 가격을 크게 흔들어도 FlyBy-4B가 pass@8/USD 기준 최적으로 남는 구간이 넓었다.

실무적으로 이 논문은 추론 예산을 늘리는 것과 외부 정보를 가져오는 것을 구분해 라우팅해야 한다는 근거를 준다. 작은 모델을 에이전트의 코어로 쓰면서 강한 모델이나 검색, 코드 실행을 붙이는 구조에서, 항상 도구를 호출하거나 항상 더 오래 생각하게 하는 대신 현재 상태가 내부적으로 복구 가능한지 진단하고 그때만 질의하는 정책이 비용 대비 이득이 크다는 것이다. 외부 모델에 원래 문제를 노출하지 않고 질의만 보내며 n-gram 중복 질의를 거부하는 설계는 답 위임을 막는 실무적 장치로 참고할 만하다. 도입 시에는 질의 깊이별 비용과 지연, 외부 백엔드 가용성, 그리고 자기 도메인에서 실행 병목과 지식 병목의 비율(과학이나 의학처럼 사실 지식 의존도가 높은 과목에서 지식 병목이 더 흔하다)을 먼저 측정해야 한다.

저자들이 명시한 한계는 FlyBy가 외부 모델에 의존한다는 점이다. 따라서 외부 모델의 가용성, 프라이버시, 신뢰성 문제가 따라온다. 또한 실행 병목과 지식 병목의 구분은 유한 샘플링으로 추정한 상태 값 V(s)에 기반한 조작적 정의로, 절대적 도달 가능성이 아니라 제한된 추론 하의 실용적 접근성을 잡는다는 전제를 둔다. 비용은 측정된 모델 처리량과 OpenRouter, Hyperbolic의 GPU/API 가격을 USD로 환산해 계산했으므로 실제 서빙 환경의 가격 구조에 따라 결과가 달라질 수 있다.