DuoOPD가 교사와 학생의 성공 조합으로 다중 과제 증류를 개선한다
DuoOPD: Learning from Joint Teacher-Student Outcomes for Multi-Task On-Policy Distillation
무엇인가
다중 과제 온폴리시 증류(OPD)는 하나의 강한 교사 모델이 여러 과제를 하나의 학생 모델에 증류하는 방식인데, 교사가 학생이 이미 맞히는 문제에서 틀리는 경우가 과제마다 다른 비율로 나타난다. 논문은 Qwen3와 Llama 쌍에서 네 가지 정오 조합이 과제별로 다른 비율로 나타난다고 보고한다. Llama 학생은 교사가 틀린 문제를 생물학 응답의 5.9%, 물리학 응답의 9.8%에서 맞혔고, 두 모델이 모두 틀리는 비율은 화학 이해 훈련 응답에서 1%, 물리 계산에서는 34%였다. 기존 OPD는 이런 결과를 무시하고 교사-학생 로그비를 그대로 토큰 가중치로 쓰기 때문에 학생이 이미 맞힌 응답까지 평균적으로 억제한다. 학생 정답 여부로 피드백 방향만 막는 OPDVR도 교사가 성공했는지와 무관하게 교사를 같은 방식으로 사용한다.
어떻게 동작하나
DuoOPD의 원칙은 두 결정을 분리하는 것이다. 학생의 검증 결과가 피드백의 방향(강화냐 억제냐)을 정하고, 교사와 학생의 결합 결과가 그 피드백을 어떻게 배분할지를 정한다. 가중치는 A(i,t) = σ_i · m(i,t)로, σ_i = 2r_S,i − 1은 학생이 맞히면 +1, 틀리면 −1이 된다. 크기 m은 항상 양수이므로 모든 유효 토큰의 부호는 학생의 검증 결과가 결정한다. 크기 계산에는 Softplus sp(x) = log(1+exp(x))를 써서 A+(d) = sp(d), A−(d) = −sp(−d)로 정의한다. 이는 OPDVR의 게이팅 항을 그대로 보존하면서 게이트가 0을 반환하는 지점에도 0이 아닌 잔여 피드백을 공급한다. 실제로 교사-학생 로그비는 검증된 성공에서도 평균이 음수라서, 정답 응답에 대한 게이트 가중치는 Qwen3와 Llama 모두 0.08~0.09에 그치지만 Softplus를 쓰면 0.57~0.65로 올라간다.
무엇과 다른가
네 가지 정오 조합은 하나의 규칙으로 처리되며 과제별 설정이 필요 없다. 둘 다 성공하면 원래 교사 문맥에서 A+(d0)로 응답 전체를 강화하고, 교사 선호가 강화 강도를 조절한다. 둘 다 실패하면 정답 참조가 없으므로 A−(d0)로 억제하되 방향은 검증이 고정한다. 교사만 성공한 경우에는 교사의 검증된 정답을 교사 문맥에 추가해 d_T를 계산하고 A−(d_T)를 적용한다. 학생의 잘못된 접두사가 교사 채점을 왜곡할 수 있기 때문인데, 참조를 보는 것은 교사뿐이고 학생 문맥은 바뀌지 않는다. 학생만 성공한 경우에는 실패한 교사가 특정 토큰에 약한 피드백을 줄 수 있으므로, 해당 과제 안에서 롤아웃 배치의 성공 응답들에 대해 sp(d0) 평균을 정지 기울기로 계산한 하나의 양수 가중치 m̄_k를 모든 유효 토큰에 똑같이 적용한다. 과제마다 로그비 규모가 다르기 때문에 공유 범위를 과제 안으로 제한한다.
어떻게 쓰나
실험은 Qwen3-4B에서 Qwen3-0.6B로, Llama-3.1-8B-Instruct에서 Llama-3.2-3B-Instruct로 증류하며 세 가지 과제 묶음을 쓴다. 첫째는 생물·화학·물리 지식, 둘째는 재료 지식·화학 이해·물리 계산, 셋째는 물리 지식·지시 따르기·코드 생성이며 각각 SciKnowEval V2, RLVR-IFeval(학습)과 공식 IFEval(평가), MBPP를 사용한다. 검증은 정답 매칭, 지시 제약 검사, 단위 테스트의 이진 판정이다. 60회 학생 업데이트, 업데이트당 48문항(과제당 16개), 응답 길이 1,024토큰, avg@8, 과제 동일 가중 평균인 매크로, 3회 학습 평균으로 평가한다. 결과적으로 DuoOPD는 다섯 개 베이스라인(OPD, OPDVR, EOPD, ExOPD, FiRe-OPD)을 두 모델 계열 모두에서 앞서며, 평균 매크로 정확도를 OPD 대비 Qwen3에서 2.58%p, Llama에서 5.98%p 개선했다. 가장 강한 베이스라인인 Qwen3의 EOPD와 Llama의 OPDVR도 각각 1.16%p, 4.58%p 차로 앞선다. 물리에서 OPD 대비 개선폭이 가장 컸다(3.73%p, 7.27%p). 두 번째 묶음에서는 63.48%로 ExOPD를 0.86%p 앞섰고, 세 번째 묶음에서는 49.24%로 OPDVR을 1.41%p 앞서며 모든 과제에서 최고점을 냈다. 최악 과제 목표를 쓰지 않고도 모든 설정의 가장 어려운 과제에서 최고 정확도를 기록했다(물리 62.10과 69.02, 물리 계산 43.33, MBPP 32.69).
전제와 한계
절제 실험은 이득의 출처를 분명히 한다. 네 조합 중 하나라도 OPD의 d0로 되돌리면 평균 매크로가 0.76~1.53%p 떨어져 모든 규칙이 기여한다. 교사 참조를 빼면 1.49%p, 과제 내 가중치 공유를 빼면 0.71%p, 둘 다 빼면 2.41%p 떨어져 64.56%가 되는데 이는 OPDVR의 64.83%에 근접한다. 즉 학생 정오로 방향만 정하는 것은 OPD 대비 2.58%p 이득의 대부분을 설명하지 못하고, 두 불일치 설계가 이득의 대부분을 공급한다. 과제 내 공유는 세 묶음 모두에서 전체 공유보다 우수했고 과제 규모 차가 큰 묶음에서 격차가 더 컸다. 분석에 따르면 OPD가 쓸 로그비는 학생이 맞힌 경우에도 평균이 음수이며(둘 다 성공 시 Qwen3 −1.31, Llama −0.22), 정답 응답이 훈련 응답의 64~69%를 차지한다. DuoOPD의 이득은 교사가 성공한 문항(+1.90, +3.86%p)과 교사가 실패한 문항(+0.67, +2.12%p) 양쪽에서 나온다.
실무 관점에서 이 논문은 검증 가능한 과제가 섞인 다중 과제 증류 파이프라인에 바로 적용할 수 있는 규칙을 제시한다. 핵심은 교사 피드백을 신뢰도와 무관하게 균일하게 쓰지 말고, 학생과 교사의 정오 조합에 따라 채점 문맥과 가중치 배분을 바꾸라는 것이다. 비용도 함께 보고한다. 교사 응답을 문항당 하나씩 캐시하는 데 Qwen은 OPD 학습 루프의 30%, Llama는 23%의 GPU 시간이 한 번 들지만 학생·시드·하이퍼파라미터에 재사용할 수 있고, 학습 중 참조로 채점되는 응답은 교사만 성공한 13~23%뿐이다. 채점·검증 단계는 OPD 루프의 5.9%와 4.7%를 차지하며, 학습 루프 변화는 Qwen −0.7%, Llama +7.3%로 측정됐다. 다만 과제별 검증기와 이진 판정이 전제이므로, 검증기를 붙일 수 있는 과제에만 이 규칙이 성립한다.
저자들이 밝힌 한계는 분명하다. DuoOPD는 이진 검증기에 의존하므로 글쓰기처럼 등급이 있거나 판단이 불확실한 개방형 과제에는 다른 피드백 규칙이 필요하다. 교사 연산 비용은 공유 캐시, 압축된 참조, 선택적 참조 사용으로 더 줄일 여지가 있고, 긴 추론 궤적에서의 탐색과 자기 수정도 추가 연구 대상이다. 또한 각 과제 묶음을 같은 과제로 학습하고 평가했기 때문에, 결합 결과 기반 지도가 학습에 없던 과제로 전이되는지와 과제 수준 정오 통계 ρ_k를 과제 스케줄링에 쓸 수 있는지는 열린 문제로 남는다.