베이스 모델의 첫 두 토큰만 고정해도 추론 성능이 RL 수준에 도달한다
Base Models Can Reason By Taking a Cue From Training Data
무엇인가
강화학습(RL)이 정말 새로운 추론 능력을 가르치는지, 아니면 베이스 모델에 이미 있던 능력을 끌어올리는 것인지는 오래된 논쟁이다. 이 논문은 파블로프의 조건화 실험에 착안해, 베이스 모델 응답의 맨 앞 토큰들과 그 뒤에 이어지는 추론 행동 사이에 학습 데이터가 만들어 놓은 연관을 연구한다. 올모-3-7B의 MATH-500 응답 중 정답의 50%가 '.
어떻게 동작하나
'(마침표와 줄바꿈 두 번)로 시작한 반면 오답에서는 14%만 그랬다는 관찰이 출발점이다.
무엇과 다른가
방법은 가중치를 건드리지 않고 응답 시작 토큰을 미리 채워 넣는 프리필이다. 생성 확률을 p(c,y|x) = p(c|x)·p(y|x,c)로 분해해, 시작 토큰 c가 나올 확률과 c가 주어졌을 때의 이어질 내용 분포를 분리해 본다. 먼저 MATH 학습 문제 30개에 대해 빔 서치(빔 폭 20, 깊이 2)로 확률이 높은 시작 후보 20개를 뽑는다. 다음으로 정답 없이 후보를 고르기 위해, 각 후보·문제마다 이어질 응답 16개를 샘플링해 답 분포를 만들고, 답을 못 낸 비율이 단서 없을 때보다 10%포인트 이상 높은 후보는 버린 뒤, 문제 전체 평균 섀넌 엔트로피가 가장 낮은 후보를 최종 단서로 선택한다. 올모-3-7B에서 이 기준은 테스트한 500개 시작 후보 중 최고 MATH-500 pass@1과 1.1%포인트 차이 안에 드는 후보를 골랐다.
어떻게 쓰나
결과는 놀랍다. 선택된 단서 '.
전제와 한계
Okay'를 프리필하면 올모-3-7B의 MATH-500 pass@1이 42%에서 78%로 오르고, 이는 RL로 학습한 같은 모델의 75%를 웃돈다. Qwen3-14B는 ' Alright,' 단서로 72%에서 87%로 올라 RL 대응 모델과 동일해진다. 같은 단서를 그대로 GSM8K, AMC 23, AIME 2024, HumanEval에 적용해도 대부분 RL과 대등하거나 앞선다. RL은 이 단서들의 확률 자체를 높인다. '.
Okay'는 0.14에서 0.65로, ' Alright,'는 0.04에서 0.58로 올라가며, 베이스와 RL 모델의 다음 토큰 분포 차이(KL 발산)는 첫 두 위치에서 최대로 치솟고 이후에는 작아진다. 단서를 고정한 채 GRPO를 돌리면 더 적은 업데이트로 비슷한 정확도에 도달한다. 응답 길이가 4.8k에서 6.7k 토큰으로 늘어나지만 길이만으로 설명되지는 않는다. 더 길게 생성하면서도 단서 없음보다 못한 시작 토큰이 있는가 하면, 추론 단서는 1k 토큰 예산부터 우위를 보이고 RL 수준 정확도를 약 절반 예산에서 달성한다.
논문은 단서 효과가 학습 데이터에서 온다는 것을 인과적으로 확인한다. 올모-3B 중간학습 10B 토큰 혼합 데이터에서 'okay'를 'chicken'으로 전부 바꿔 재학습하자 '.
Chicken' 단서의 MATH-500 정확도가 2.4%에서 37.2%로 뛰었고(같은 데이터에서 '.
Okay'는 38.3%), GSM8K에서는 2.2%에서 60.6%로 올랐다. 반대로 짧은 질의응답 문서의 문단 첫 'Question:'을 'Okay,'로 바꾼 리다이렉트 데이터에서는 '.
Okay'가 문제를 풀지 않고 질문을 생성해 정확도가 0.2%로 떨어진다. 'step by step'을 'duck duck goose'로 바꿔 학습시키면 'Think duck duck goose' 지시문의 MATH-500 정확도가 6%에서 17%로 올라 'Think step by step'(12%→15%)과 비슷해진다. 24번째 층 은닉 상태를 학습 문서 상태와 코사인 유사도로 비교하면, 단서마다 유사도가 쏠리는 학습 데이터 유형이 다르다. '.
Okay'는 합성 추론 트레이스 쪽으로 쏠리며 'Wait, let me double-check' 같은 검산 표현이 응답의 97%에 나타나지만 ' To' 단서에서는 5%에 그친다. 단서를 문단 1~2에 삽입하면 정확도가 거의 두 배가 되지만 문단 3~6에 넣으면 단서 없음보다 낮아진다.
안전 영역에서도 같은 현상이 나타난다. XSTest의 안전 250개·위험 200개 프롬프트와 CoCoNot 100개, WildChat 100개로 빔 서치해 찾은 단서 중 ' I'm sorry'는 안전한 요청까지 거부하는 반면, ' Okay,'는 위험 요청에 유해 응답을 42.4% 생성한다. 구두점과 공백만 다른 추론 단서 '.
Okay'는 유해 응답률이 0.2%로, Instruct·Think-SFT 변형에 가까운 선택적 거부 행동을 보인다. 응답 분류는 WildGuard를 사용했다.
개발자 입장에서 이 논문은 평가와 파인튜닝 설계를 다시 보게 만든다. 채팅 템플릿이나 프리필, 첫 토큰 처리 방식이 바뀌면 같은 모델의 정확도가 수십 퍼센트포인트 흔들릴 수 있으므로, 벤치마크 비교 시 시작 토큰 조건을 명시하고 고정해야 한다. 또한 RL로 얻은 성능 향상의 상당 부분이 이미 존재하는 행동의 확률을 올린 것일 수 있다는 점은, RL을 돌리기 전에 프롬프트·디코딩 수준에서 베이스 모델의 상한을 먼저 측정해 보라는 신호다. 합성 데이터를 대량으로 섞는 파이프라인이라면 의도치 않게 특정 시작 토큰과 행동을 묶는 연관을 심고 있을 수 있으니 데이터 감사도 필요하다.
저자들이 밝힌 한계는 분명하다. 분석은 명시적 사전 post-training 없이 베이스 모델에 RL을 바로 적용하는 R1-Zero 스타일 설정에 한정되며, 여러 단계를 거치는 복잡한 post-training 파이프라인은 단서로 끌어낼 수 없는 능력을 추가할 수 있다. 단서 효과는 모델 의존적이어서 Llama-3.1-8B에서는 테스트한 시작 후보 중 효과적인 단서를 찾지 못했다. 반사실 실험은 합성 추론 트레이스를 포함한 학습 혼합을 쓰는 Olmo와 SmolLM3에서 수행했기 때문에, 관찰된 효과가 이 설정에서 특히 강하게 나타났을 가능성도 인정한다.