약한 모델이 강한 모델의 추론을 이끄는 교대 사고 사슬 학습법
Allspark: Weak to Strong Transfer via Alternating Chain of Thought
무엇인가
대형 프런티어 모델의 강화학습(RL) 연구는 롤아웃 생성 비용 때문에 병목에 걸린다. 긴 추론 트레이스를 반복 샘플링하고 최적화하는 과정 자체가 커서, 레시피 하나를 예비 실험하는 데도 큰 비용이 든다. 온폴리시 증류(OPD)처럼 교사 능력을 학생에게 합치는 방법도 학생 모델에서 샘플링하고 학생을 업데이트하는 한, 학생이 클 때는 같은 비용을 그대로 안는다. 이 논문이 던지는 질문은 명확하다. 강한 학생의 롤아웃을 학습 중에 단 하나도 쓰지 않고, 약한 교사가 RL로 익힌 추론 개선을 강한 학생에게 옮길 수 있는가.
어떻게 동작하나
Allspark의 구조는 교대 추론(alternating chain of thought)이다. 약한 교사 π와 학생 ρ가 같은 추론 프리픽스 h를 공유하며 번갈아 추론 청크 z를 생성한다. 학생이 먼저 시작하고, 각 청크는 다음 턴 전에 h에 덧붙는다. 추론이 끝나면 학생이 최종 답 y를 낸다. 학습 중에는 ρ가 교사 초기 모델의 동결 복사본이고, π만 최적화된다. 목표는 J(π)=E[R(x,y)]로, 정답 여부 R(x,y)∈{0,1}의 기대값을 최대화하되 ρ는 고정이다. 손실은 교사가 생성한 추론 토큰에만 걸리고, 학생 토큰과 경계 표시자는 마스킹된다.
무엇과 다른가
저자들은 교사 청크의 유용성을 후속 가치 Q(h,z)=E[R(x,y)|h,z]로 설명한다. 교사가 프리픽스 h 뒤에 z를 내보냈을 때, 남은 롤아웃 전체의 정답 기대값이라는 뜻이다. 즉 교사 청크는 그 자체로 문제를 풀 필요가 없다. 가치는 학생이 이어서 만들어내는 연속 추론에서 나온다. 교사는 더 나은 단독 문제 해결자가 아니어도 되고, 학생이 더 나은 답에 도달하도록 돕는 추론을 보태는 역할만 하면 된다.
어떻게 쓰나
전이 단계에서는 학습된 교사를 동결하고, 동결 파트너를 더 강한 학생으로 교체한다. 두 모델 모두 고정된 채 같은 교대 절차를 수행하고, 학생이 최종 답을 낸다. 전이 인터페이스가 공유 텍스트이기 때문에 각 모델이 자기 인터페이스로 텍스트를 토크나이즈하며, 어휘가 다른 모델끼리도 전이가 가능하다. 학생의 가중치는 전혀 업데이트되지 않는다.
전제와 한계
통제 실험은 Qwen3-1.7B와 4B로 수학·추론 두 도메인에서 진행됐다. 도메인당 128문항, 문항당 1개 샘플링 답으로 최종 정답 정확도를 측정했다. 4B 학생 조건에서 학습되지 않은 약한 교사나 일반 RL 교사로 이끌면 두 도메인 모두 정확도가 떨어졌다. 반면 Allspark 교사(체크포인트 94)는 수학에서 대략 중립, 추론에서 양의 전이를 보였다. 본문 발췌에는 이 표의 구체적 수치가 제시되지 않고 방향성만 보고된다. 사례 연구로는 4B 학생이 단독으로 1053/2에 머문 팔각형 문제에서 교사가 모서리 뺄셈으로 되돌리자 학생이 567을 계산해낸 경우 등이 소개된다.
더 큰 규모 실험은 ARC-AGI-2 공개 학습 1,000문항(904 학습 풀, 96 개발)에서 이뤄졌다. 교사는 Inkling-Small(총 276B, 토큰당 활성 12B), 학생은 Inkling(총 975B, 활성 41B)이다. 사고 노력도 0.40·0.55·0.70·0.85에서 과제당 3회 시도, 총 288회 시도의 평균 pass@1을 측정한 결과 Allspark가 81.6%로 단독 78.1%를 넘었다. 토큰 효율도 개선돼 10.8k 잔여 토큰으로 79.2%를 기록, 강한 학생이 12.3k 토큰에서 낸 최고 78.1%를 앞섰다. 계열 간 전이도 확인된다. Kimi-K2.6(총 1T, 활성 32B, 128K 컨텍스트)에서는 정확도 11.5%포인트 향상과 함께 잔여 토큰이 7.7% 줄었고, Nemotron-3-Ultra(총 550B, 활성 55B)는 미디엄 사고에서 17.7%포인트, 풀 사고에서 5.2%포인트 올랐지만 토큰 사용량은 늘었다. 교사는 Nemotron 미디엄에 0.40, Nemotron 풀과 Kimi에 0.85 노력도를 썼고 추론 상한은 각각 24,576과 49,152 토큰이다.
개발자 입장에서 이 방법의 실무적 가치는 강한 모델의 롤아웃을 학습 루프에서 제거한다는 점이다. 작은 모델 하나로 교사를 RL 학습해 두고, 여러 강한 모델에 재사용할 수 있으며, 텍스트로만 통신하므로 토크나이저와 추론 형식이 다른 모델에도 붙일 수 있다. 다만 정확도 이득과 토큰 이득은 대상 학생의 추론 설정에 따라 달라지므로, 도입 전에는 자기 태스크와 사고 노력도 구간에서 정확도-토큰 트레이드오프를 직접 측정해야 한다.
저자들이 밝힌 한계도 분명하다. 학습 중 강한 모델 롤아웃은 피했지만 추론 시점에는 교사와 학생을 동시에 서빙해야 하므로 추가 모델 호출과 핸드오프로 지연과 비용이 늘 수 있고, 잔여 토큰 감소가 곧 배포 비용 감소로 이어지지는 않는다. 실험은 제한된 컴퓨팅 자원 아래 소수의 모델·태스크·학습 런에 대한 초기 증거이며, 관찰된 이득의 견고성과 일반성은 더 넓은 연구가 필요하다. 또한 구현이 공유 추론 스트림을 중단하고 재개하는 능력에 의존하기 때문에, 사고 과정을 노출하지 않는 비추론 모델이나 그런 스트림을 제공하지 않는 인터페이스에 적용 가능한지는 검증되지 않았다.