OLIVE는 학생이 지나간 상태에서 교사의 이어쓰기로 배우게 한다

Learning from Teacher Continuations at Student States

HF Daily2609.36246

Haojin Wang, Dylan Zhang, Huaibo Chen2026-09-28조회 2

무엇인가

지식 증류는 강한 교사 모델의 능력을 약한 학생 모델로 옮기는 작업이다. 논문이 겨냥하는 문제는 세 가지다. 첫째, 고정된 교사 궤적에 학습하는 오프라인 SFT는 추론 시 학생이 자기 출력에 조건을 두게 되면서 순차적 공변량 이동(sequential covariate shift)이 생기고 긴 호흡에서 오류가 누적되며, 학습 중 정책이 변해도 데이터셋이 현재 학생이 방문하는 상태를 따라가지 못하고 기존 능력까지 훼손할 수 있다. 둘째, 학생 롤아웃에 교사 분포로 역KL을 거는 토큰 단위 OPD는 밀도 있는 감독을 주지만, 교사가 앞 토큰을 고치라고 해도 이후 타깃은 학생의 원래 이어쓰기에 조건이 걸려 있어 교정 이후 어떻게 이어가야 하는지를 보여주지 못한다. 셋째, 분포 정합 방식은 교사의 토큰 확률 접근을 요구해 텍스트만 내놓는 교사에는 쓸 수 없다. 논문은 교사가 학생이 도달한 상태에 유의미한 확률 질량을 둔다는 가정도 지적하는데, 능력 격차가 크거나 다중 턴 에이전트에서 학생의 되돌릴 수 없는 행동이 궤적을 교사 지원 밖으로 밀어내면 이 가정이 깨진다.

어떻게 동작하나

제안 방법 OLIVE(OnLine InterVEntion)의 절차는 단순하다. 매 반복마다 현재 학습 중인 학생 정책이 프롬프트 x에 대해 k개 토큰의 접두사 y1:k를 생성하고, 교사 정책이 그 프롬프트와 접두사를 입력받아 자기 토크나이저로 최대 M개 토큰의 이어쓰기를 만든다. 학생은 교사가 생성한 토큰에만 교차엔트로피를 적용해 갱신되며, 프롬프트와 학생 접두사는 조건 컨텍스트에 남되 손실에서 마스킹된다. 교사 이어쓰기는 학생 토크나이저로 다시 토큰화하므로 교사와 학생의 토크나이저가 달라도 되고, 교사 로짓이 전혀 필요 없어 블랙박스 교사에도 적용된다. 접두사는 학생이 갱신될 때마다 새로 생성되어 DAgger식 학습자 상태 감독 원리를 따르며, 샘플링한 접두사는 필터링 없이 모두 사용한다. 교사 이어쓰기는 완성된 정답이 아니라 비용을 묶기 위한 부분 이어쓰기라는 점이 전제다.

무엇과 다른가

다중 턴 상호작용으로의 확장은 같은 접두사-이어쓰기 분할을 턴 단위로 옮긴 것이다. 학생이 k턴 동안 환경과 상호작용해 행동과 관측 이력을 만들면, 교사가 최대 M턴을 이어받아 전체 이력에 조건을 두고 행동하고 그 행동을 환경에서 실행해 다음 관측을 얻는다. 학생 갱신 시에는 학생의 턴과 모든 환경 관측을 마스킹하고 교사의 행동에만 교차엔트로피를 건다. 실험에서는 환경에 따라 학생 접두사 5턴 또는 10턴, 교사 이어쓰기 5턴이 잘 동작했다. 학습 효율을 위해 학생 접두사 샘플링과 교사 생성을 겹치는 비동기 구현도 제시한다. 한 배치의 교사 생성이 다음 배치의 학생 접두사 생성과 겹쳐지며, 접두사가 갱신 대상 정책보다 이전 정책에서 나올 수 있는 지연은 비동기 깊이 d로 제한한다(추론 실험에서 d=3). 이 비동기 구현은 동기 OLIVE 대비 총 학습 시간을 23.8%, OPD 대비 28% 줄인다.

어떻게 쓰나

실험은 두 축이다. 단일 턴 추론에는 RLVE의 합성 추론 환경 18종에서 각 500문제씩 뽑은 9K 난제 풀을 쓰고, 학생은 Qwen3-1.7B와 Qwen3-4B, 교사는 Qwen3-4B-Thinking-2507을 쓴다. 오프라인 증류와 OPD를 같은 토큰 예산(롤아웃당 7168토큰)으로 맞추고 OLIVE는 접두사 4096, 이어쓰기 1024로 설정했을 때, OLIVE가 두 학생 모두에서 증류 기법 중 가장 큰 avg@8 향상(+4.42, +5.35점)을 냈다. OPD 학습 중 학생과 교사의 top-K 중첩 비율은 거의 평평하게 유지됐는데, 논문은 이를 두 정책의 사고 방식 차이 때문에 OPD가 개선을 못 내는 근거로 든다. 다중 턴 에이전트에는 AgentGym의 ALFWorld, ScienceWorld, SearchQA, TextCraft, BabyAI 5개 환경을 쓰고 학생 Qwen3-1.7B, 교사 Qwen3-32B로 OPD, TCoD 두 변형, Guided OPD와 비교했다. OLIVE는 모든 환경에서 우세했고 더 적은 턴으로 더 높은 성공률을 냈다. 가장 복잡한 ScienceWorld에서는 OPD가 거의 0에 가까운 학생을 개선하지 못한 반면 OLIVE는 성공률 7.5%까지 올렸다. 전체적으로 추론 과제 pass@8 6~8%p 향상, 에이전트 벤치마크 avg@4 7~22% 향상, 일반 벤치마크 평균 성능 하락은 0.9%였다.

전제와 한계

분석 파트는 온라인 접두사의 효과를 분리해 보인다. GPT-5.4-mini 교사의 텍스트만 사용한 ScienceWorld 실험에서 오프라인 증류는 2에폭 후 정체했지만 OLIVE는 계속 개선해 5에폭 뒤 오프라인 SFT를 13% 앞섰다. 일반 능력 망각은 AIME25, LiveCoding Bench v6, IF-Eval, GPQA Diamond 네 벤치마크로 측정했고 OLIVE가 더 적게 잊었다. 5개 에이전트 환경을 순차 학습시켰을 때는 마지막 환경인 SciWorld에서 OLIVE가 오프라인 증류보다 13.0점 높았는데, 앞선 단계로 정책이 이미 이동한 상태에서 고정 오프라인 궤적이 방문 상태와 어긋나기 때문이라고 해석한다.

실무 관점에서 이 논문이 유용한 지점은 교사 접근성이 제한된 상황이다. 교사 API가 텍스트만 돌려주고 로짓을 주지 않아도, 또 교사와 학생의 토크나이저가 달라도 온라인 증류를 구성할 수 있다. 다만 도입 전에 확인할 것은 온라인 교사 호스팅 비용과 지연, 접두사 길이 k와 이어쓰기 길이 M, 턴 수 같은 하이퍼파라미터 민감도, 그리고 비동기 깊이 d가 만드는 정책 불일치다. 저자들이 밝힌 전제와 한계도 분명하다. 교사 이어쓰기는 검증된 완전 해가 아닌 부분 이어쓰기이고, 접두사를 필터링하지 않으며, 비동기 구현은 접두사를 만든 정책과 학습 대상 정책 사이의 불일치를 허용한다. 논문 자체가 진행 중인 연구(Ongoing work)로 표기되어 있고, 제시된 수치는 특정 모델 조합과 벤치마크에 한정된다.