사후학습이 남긴 행동 그림자로 코드 능력이 전이된다
Post-Training Leaves Behavioral Shadows on Unrelated Decisions
무엇인가
사후학습(post-training)은 보통 목표 과제 행동의 변화로 이해된다. 코드 업데이트는 코드를 더 잘 쓰게 만들고, 수학 업데이트는 문제 해결력을 높인다는 식이다. 이 논문은 업데이트의 영향이 훈련 과제에 갇히지 않는다고 주장한다. 코드나 수학이 전혀 등장하지 않는 짧은 이야기에서 모델이 어떤 평범한 단어를 고르는지가 바뀔 수 있고, 저자들은 이를 사후학습의 '행동 그림자(behavioral shadow)'라 부른다. 문제는 이 그림자가 업데이트로 향상된 능력에 대한 정보를 담고 있는가다. 저자들은 두 가지를 묻는다. 업데이트된 파라미터나 목표 과제 응답에 접근하지 않고도 무관한 입력에 대한 개별 결정을 통해 비공개 업데이트를 관측할 수 있는가(관측 가능성), 그리고 그 결정들로부터 학습해 교사의 목표 과제 향상 일부를 다른 모델로 옮길 수 있는가(능력 전이)다.
어떻게 동작하나
제안 방법은 Active Taskless Distillation(ATD)이다. 공개 모델 M0(파라미터 θ0)가 있고, 비공개 교사 MT는 θ0에 알 수 없는 업데이트 δ를 더한 θT = θ0 + δ이며, 학생도 같은 θ0에서 초기화한다. 교사는 질의당 전체 어휘에 대한 greedy 최고 확률 토큰 하나만 돌려주는 블랙박스로만 접근한다. 핵심은 질의를 어디에 놓느냐다. ATD는 목표 능력과 무관한 맥락에서 두 개의 평범한 단일 토큰 단어 a_i, b_i 중 하나를 고르게 하는 캐리어 프롬프트를 만들고, 공개 조상 M0만 써서 두 단어에 대해 쌍으로 정규화한 확률 q_i를 계산해 |q_i − 0.5| ≤ 0.02인, 즉 거의 동점인 프롬프트만 남긴다. 추가로 전체 어휘에서 M0의 최고 확률 토큰이 두 후보 중 하나일 것을 요구해, 동점이 실제 출력 선택에 걸리도록 한다. 프롬프트와 후보 쌍은 교사 응답을 보기 전에 고정되고, 교사는 프롬프트당 한 번만 질의된다. 응답이 {a_i, b_i}에 속하면 유지하고, 아니면 재샘플링 없이 버린다. 학생은 이 (프롬프트, 단어) 쌍들에 대해 전체 어휘 cross-entropy로 응답 토큰만 학습한다. 목표 과제 예시, 교사 logit, 교사 파라미터는 전혀 쓰지 않는다.
무엇과 다른가
왜 동점 근처 질의가 유용한지에 대한 설명은 1차 근사에 기댄다. 두 후보의 로짓 차이를 m_i(θ) = z_θ(a_i|x_i) − z_θ(b_i|x_i)라 하면 m_i(θ0+δ) ≈ m_i(θ0) + g_i^T δ이고, g_i는 θ0에서의 그래디언트다. 동점 근처에서는 |m_i(θ0)|가 작아서 작은 선호 변화만으로도 선택 단어가 뒤집힌다. 즉 무관한 프롬프트 하나가 업데이트의 효과를 드러낼 수 있고, 유지된 응답 하나는 업데이트에 대한 1비트 관측이 된다. 논문의 예시에서 공개 조상은 tie를 q_i = 0.5044로 아주 약간 선호했지만, 코드로 학습된 교사는 jacket을 골랐고, 이 (프롬프트, jacket) 쌍이 학습 데이터가 된다.
어떻게 쓰나
주 실험은 Qwen2.5-1.5B-Instruct를 공개 조상 겸 학생 초기화로 쓰고, 교사는 고정된 rank-16 code-DPO LoRA, 학생은 rank-16 LoRA다. 128개 단어에 걸쳐 5,664개의 (프롬프트, 단어) 행을 얻었고, 각 행은 응답 토큰 하나만 기여한다. HumanEval+를 실행 기반 greedy pass@1로 채점한 결과 학생은 51.22%에 도달해 교사의 집계 코드 점수와 맞먹었고, 모든 대조군을 앞섰다. 정확한 nuisance-matched 순열 대비 +5.34pp, 라벨 셔플 대비 +5.03pp, 교사 없는 arm 대비 +4.57pp다. 정확 대조군은 완성 토큰 멀티셋과 구간별 불일치 개수가 신호와 동일하기 때문에, 단어 빈도나 교사 라벨의 주변분포로는 이 격차를 설명할 수 없다. 학생이 회복한 것은 프롬프트와 토큰의 대응 관계다.
전제와 한계
견고성과 일반화도 보고된다. 캐리어 시드, 비공개 교사, 정확 대조군을 각각 새로 구성한 5개 acquisition과 3개 학습 시드를 교차한 factorial에서 집계 효과 +4.80pp, 15개 신호-대조 쌍과 5개 acquisition이 모두 양수였고 acquisition 간 표준편차는 0.83pp에 불과했다. rank-32, rank-64 LoRA와 full-parameter 적응 체제에서도 각각 같은 rank의 대조군을 HumanEval+에서 앞섰다. 과제별로 별도의 교사를 둔 7개 설정에서 이득은 0.81pp에서 5.03pp 사이다. 코드 생성뿐 아니라 과학 지식, 상식 추론, 독해를 덮는 객관식 과제가 포함된다. Qwen3-1.7B, Qwen3-4B, Llama-3.2-1B에서도 셔플 대조군보다 높은 평균 HumanEval+ pass@1을 기록했다.
분석은 효과의 출처를 좁힌다. 근접 동점 필터를 빼고 같은 질의 예산을 평범한 프롬프트에 쓴 수동(passive) 기준선과 비교하면, 동일 질의 예산에서 +4.27pp, 동일 학습 행 수에서 +5.03pp로 능동 선택이 앞선다. 즉 효과는 질의 수나 데이터 양이 아니라 조상의 결정 경계에 질의를 집중한 데서 나온다. 출처 특이성도 확인된다. 3개 출처와 3개 목표의 교차에서 각 그림자는 자신과 맞는 목표에서 가장 큰 양의 효과를 냈고, 비대각선 효과는 거의 0이거나 음수였다. 교사가 조상 대비 고친 19개 HumanEval+ 과제(76개 시드-과제 셀)에서 ATD 학생은 64.47%(49/76)를 풀어 대조군 21.05%(16/76)를 크게 앞섰고, 과제 수준 변화 벡터의 코사인 유사도도 .701 대 .398로 교사에 더 가까웠다. HumanEval/158에서는 신호 시드가 베이스의 단어 길이 규칙 대신 교사의 고유 문자 수 규칙을 채택했는데, 이 규칙은 캐리어에 전혀 등장하지 않는다.
큰 교사 이득이 전이를 보장하지는 않는다. HumanEval+ 정답을 암기한 Qwen3-1.7B 교사(+39.02pp 격차)를 쓰면 학생은 베이스보다 낮은 점수를 냈고, 치환 암호를 주입한 Qwen2.5-1.5B 교사(약 97pp exact-match 격차)에서는 어떤 arm과 시드에서도 이득이 없었다. 저자들은 이를 채널을 통해 이동하는 것이 교사의 원시적 우위가 아니라 학생이 발현하도록 유도될 수 있는 능력이라는 증거로 읽는다. 개발자 관점에서 이 논문은 두 방향의 함의를 갖는다. 비공개 파인튜닝 모델을 블랙박스로만 접할 때 단어 하나짜리 응답만 모아도 같은 공개 조상에서 시작한 모델로 능력 일부를 옮길 수 있다는 것, 그리고 반대로 서비스 제공자가 목표 과제만 바뀐다고 설명해도 그 업데이트가 무관한 단어 선택에서 관측될 수 있다는 것이다. 다만 전이가 과제 선택적이고, 교사 격차의 크기가 전이를 예측하지 않으며, 알려진 공개 조상이 전제라는 점을 함께 봐야 한다.
확장 실험도 있다. 참조 상대 쌍 마진(RPM) 목적함수는 공개 모델의 기존 마진을 빼고 δ가 만든 잔여 선호를 학습하는데, HumanEval+에서 셔플 대비 격차가 +5.03pp에서 +6.30pp로 커졌고 PIQA에서도 양수였지만 ScienceQA에서는 CE와 사실상 같은 학생 정확도를 냈다. 다중 토큰 관측(K=20, Qwen2.5-0.5B)은 GSM8K에서 +6.37pp의 큰 효과를 냈고 HumanEval+와 ScienceQA에서는 약 +1pp에 그쳤지만 6개 시드가 모두 양수였다(부호 검정 p = 1/64). 한계는 저자들도 명시한다. 현재 접근은 능동적으로 구성한 캐리어와 알려진 공개 조상에 의존하며, 테스트한 모든 설정에서 신뢰할 만한 전이가 나오지는 않는다. 관측이 능력 관련 정보를 너무 적게 드러내는 것인지, 학습 절차가 그 정보를 충분히 활용하지 못하는 것인지는 미해결로 남는다.