자기대국 탐색 기록을 사고 사슬로 바꿔 LLM 추론을 학습시킨다
Self-Play Search Distillation for Large Language Model Reasoning
무엇인가
LLM의 추론 능력을 끌어올리려면 어려운 결정, 서로 경쟁하는 대안, 그리고 그 결과를 드러내는 고품질 데이터가 필요하다. 그런데 이런 데이터는 합성 데이터의 품질이 낮고 사람이 라벨을 붙이는 비용이 크다는 두 가지 이유로 늘 부족하다. 이 논문이 다루는 문제는 바로 이 데이터 부족이다.
어떻게 동작하나
제안하는 방법은 Self-Play Search Distillation, 줄여서 SPSD다. 보드게임에서 학습된 MuZero류 네트워크의 자기대국을 활용해 초인적 수준의 합성 데이터를 만들어내는 프레임워크다. 핵심 발상은 실행 가능한 환경을 써서 탐색 과정 자체를 구조화된 추론 문제로 바꾸는 것이다. 탐색이 곧 추론이 되도록 환경을 설계하는 셈이다.
무엇과 다른가
각 상태에서 전문가 역할을 하는 네트워크는 네 가지를 식별한다. 선호하는 결정, 그럴듯한 대안, 그럴듯한 상대의 응수, 그리고 가치 추정치다. 이렇게 자기대국 탐색 기록을 초인적 사고 사슬로 변환한 뒤, 환경에 근거한 지도학습 방식으로 LLM을 훈련한다. 모델은 정답 하나가 아니라 선택지와 그 귀결까지 함께 배운다.
어떻게 쓰나
실험 결과는 전이의 폭을 보여준다. 자기대국 탐색 기록만으로 학습했는데도 보지 못한 수학 문제로 성능이 옮겨갔다. Qwen3-4B-Base에서 여섯 개 수학 벤치마크 평균이 24.1에서 36.6으로 올랐고, 학습에 쓰이지 않은 게임의 승률은 15%에서 45%로 상승했다. 논문은 이를 두고 주석 효율적으로 고품질 합성 데이터를 만들어 추론 성능을 높이는 방법이라고 정리한다.
전제와 한계
개발자 입장에서 이 논문이 쓸모 있는 지점은 데이터 생성 파이프라인이다. 사람이 라벨을 달지 않아도 되고, 탐색 기록이 이미 대안과 결과를 담고 있으므로 강화학습용 보상 설계 없이도 지도학습 데이터를 확보할 수 있다. 시뮬레이터나 검증 가능한 실행 환경이 있는 도메인, 예컨대 코드 실행이나 툴 호출이 있는 에이전트 작업이라면 같은 구조를 시도해볼 만하다.
다만 도입 전에 확인할 것은 환경의 존재 여부다. SPSD는 실행 가능한 환경을 전제로 하며, 실험 자체도 보드게임 자기대국에서 출발했다. 환경을 만들거나 시뮬레이션하는 비용이 데이터 라벨링 비용보다 싼지, 그리고 학습된 전이가 어떤 종류의 과제까지 미치는지를 먼저 따져야 한다.