Sherpa가 학생 성과 향상을 보상으로 LLM 교사의 적응력을 학습시킨다

Sherpa: Teaching LLMs to Teach Adaptively

arXiv2610.08778v1

Weixian Xu2026-10-06

무엇인가

대형 언어모델은 수학 문제를 잘 풀지만, 잘 푸는 것과 잘 가르치는 것은 다르다. 논문은 Srinivasa 등(2025)의 결과를 인용해 16개 프런티어 모델 중 어느 것도 전문가가 작성한 튜터링 루브릭 대비 56%를 넘지 못했고, Macina 등(2025)은 강한 문제 해결 능력이 효과적인 교수로 직결되지 않음을 보였다고 정리한다. 기존의 LLM 교사 학습은 시연 데이터, 선호 데이터, 또는 '좋은 수업이란 무엇인가'를 미리 규정한 교수학적 기준에 의존해 왔다. 저자들은 이런 신호가 개별 학생의 학습 성과에 근거하지 않으며, 효과적인 전략이 학습자마다 크게 달라진다는 점을 문제로 지적한다.

어떻게 동작하나

Sherpa는 다중 턴 강화학습 프레임워크다. 하나의 교수 에피소드는 준비, 튜터링, 테스트의 세 단계로 구성된다. 준비 단계에서 교사는 주어진 문제를 비공개로 풀어 풀이 초안을 만들고, 튜터링 단계에서 학생 아키타입과 여러 턴 대화하며, 테스트 단계에서 학생이 문제를 완전히 풀도록 요구한다. 최적화 목표는 학생이 H턴의 상호작용 문맥을 가진 상태에서 문제를 맞힐 확률과, 아무 상호작용 없이 맞힐 확률의 차이를 최대화하는 것이다. 학생 백본은 동결되어 있으므로 이 차이는 곧 튜터링으로 얻은 향상이며, 교사는 결과 기반 보상만 받는다.

무엇과 다른가

학생 쪽 설계가 이 논문의 핵심 장치다. 저자들은 교육학 문헌에서 여섯 가지 학습 선호를 뽑아 아키타입으로 만들고, 선호가 없는 유형 하나를 더해 총 일곱 개를 구성한다. 선호는 시도 진단, 인과적 정당화, 하위 목표 분해, 단계 시연, 독립적 검증, 대비 비교다. 학생 백본으로는 스스로 문제를 풀지 못하는 약한 모델(Qwen3-1.7B)을 쓴다. 그래야 학습 이득을 튜터링 덕분으로 돌릴 수 있기 때문이다. 다만 약한 모델은 프롬프트만으로 뚜렷한 행동 차이를 보이지 않아서, 저자들은 두 개의 게이트를 둔다. 가이던스 게이트는 LLM 검사기로 교사의 발화가 정답을 노출하는지 판정해 차단하고, 중간 추론이나 부분 풀이는 허용한다. 적응 게이트는 발화가 해당 학생의 선호 전략에 맞는지 판정한다. 둘 중 하나라도 통과하지 못하면 학생은 '답을 바로 보여주지 마세요' 같은 정해진 불만 응답을 돌려보내고, 그 교환은 학생 문맥에 추가되지 않는다. 교사는 학생 유형 z를 직접 볼 수 없고 대화에서 추론해야 한다.

어떻게 쓰나

학습 알고리즘은 비평자 없는(critic-free) RL 계열을 따른다. 문제마다 같은 학생 아키타입과 준비 문맥을 공유하는 G개의 궤적을 샘플링하고, 궤적 보상 R은 상호작용 문맥 유무에 따른 학생 정답률 추정치의 차이로 계산한다. 게이트에서 거부된 턴은 학생 문맥에 들어가지 않아 향상에 기여하지 않으므로, 저자들은 턴별 리턴에 마스크를 적용해 U=m·R로 정의하고 그 품질에 대해 아무 가정도 하지 않는다. 같은 턴 안에서 리턴을 비교하는 leave-one-out 중심화와 턴 단위 정규화를 거쳐 어드밴티지를 만들고, 형식·반복 페널티를 정규화 이후에 더한 뒤 비동기 PPO로 교사를 최적화한다.

전제와 한계

실험은 MATH 데이터셋에서 교사가 풀 수 있고 학생은 아직 못 푸는 문제만 걸러 759개 학습, 528개 평가 문제를 썼다. 교사 백본은 Qwen3-8B, 학생 백본은 Qwen3-1.7B다. 학습에 쓴 네 아키타입과 평가에만 쓴 세 아키타입을 나눠 일반화도 확인한다. 다양한 선호로 학습한 Sherpa DP는 전체 테스트 정확도 69.0%로, 미학습 백본 48.6%, PedagogicalRL 52.7%, 선호 없이 학습한 Sherpa NP 52.0%를 모든 아키타입에서 앞섰다. 아키타입별 향상 폭은 균일하지 않아 인과적 정당화는 55.1%에서 77.1%로, 단계 시연은 40.6%에서 51.8%로 올랐다. 외부 벤치마크인 MathTutorBench에서는 교수학 평균 점수가 52.5%에서 79.2%로 상승해 PedagogicalRL의 63.2%를 넘었고, 네 개 세부 지표 모두 개선했다. 지시 따르기는 표준 설정에서 74.0%에서 90.3%로, 어려운 설정에서 70.6%에서 87.2%로 올랐고, 스캐폴딩은 33.1%에서 72.0%, 32.4%에서 67.3%로 상승했다. 반면 실수 위치 찾기 정확도는 학습된 교사 모두에서 하락했고 소크라테스식 질문도 대부분 퇴보했는데, Sherpa DP의 실수 위치 정확도 30.3%는 PedagogicalRL의 18.7%보다는 높다.

인간 교사와의 정렬은 CoMTA 대화 80개에서 'Answer Not Accepted'로 표시된 문맥 320개를 뽑아 평가했다. 각 문맥에 학습에 쓰인 두 선호와 쓰이지 않은 두 선호를 주입하고, Qwen3-8B와 Sherpa DP가 각각 짧은 튜터 응답을 생성하게 했다. Prolific으로 모집한 고등학교 교사 96명이 '어느 응답이 더 잘 가르치는가'를 판단했고, 응답 쌍마다 무작위로 3번씩 총 960개의 판단을 얻었다. 무승부를 제외하면 Sherpa DP가 728표 대 187표로 79.6%의 승률을 기록했고, 네 가지 선호 모두에서 우세했다. 교사 96명 중 87명이 Sherpa DP를 더 자주 선택했고, 다수결로도 320쌍 중 270쌍에서 앞섰다. 참가자들은 학생이 요청한 접근에 맞춘 안내를 주된 이유로 들었고, 일부는 설명이 부담스러울 수 있다며 기저 모델을 선호했다.

설계 검증 실험도 있다. 프롬프트로만 여섯 선호를 부여한 학생은 교사 전략과 짝이 맞을 때 향상이 커지는 대각선 이점도, 불만률이 낮아지는 효과도 보이지 않았다. 반면 Sherpa의 아키타입은 향상이 대각선에 집중되고 짝이 맞는 쌍에서 불만률이 낮아 두 원칙을 모두 만족했다. 게이트 실패에 페널티를 주는 실험에서는 페널티가 0.25일 때 교수학 평균이 79.2%에서 70.6%로, 0.5일 때 66.0%로 떨어졌다. 미리 정의한 기준에 기반한 페널티가 일반화를 해친다는 것이 저자들의 해석이다.

저자들이 밝힌 전제와 한계는 분명하다. 학습과 평가 모두 실제 학생이 아니라 LLM 학생 아키타입을 대상으로 했고, 도메인은 수학, 백본은 Qwen3-8B 교사와 Qwen3-1.7B 학생 한 쌍으로 제한된다. 학생이 자기 선호를 모르는 경우나 아키타입의 조합은 향후 과제로 남긴다. 실무 관점에서 이 논문이 주는 패턴은 두 가지다. 첫째, 교사 모델의 보상을 '좋은 수업의 기준'이 아니라 학생의 결과 향상으로 정의하면 미리 규정한 기준에 묶이지 않고 일반화가 좋아진다는 것. 둘째, 학습 환경에서 게이트 같은 제약으로 행동 다양성을 강제하면 약한 시뮬레이터로도 적응 행동을 끌어낼 수 있다는 것이다. 다만 실수 위치 찾기와 소크라테스식 질문에서의 퇴보처럼, 특정 목표에 맞춘 학습이 다른 교수 능력을 깎을 수 있다는 점은 자체 파인튜닝을 고려할 때 반드시 확인해야 할 부분이다.