HAD는 하네스 정보 유무를 대비해 소형 에이전트의 하네스 활용 능력을 증류한다
Harness-Aware Distillation for Small Language Model Agents
무엇인가
이 논문은 언어모델 에이전트가 배포될 때 모델 주변에서 문맥, 도구, 피드백을 관리하는 소프트웨어인 하네스와 함께 동작한다는 점에 주목한다. 큰 모델을 작은 모델로 증류할 때 하네스는 그대로 남으므로, 학생 모델에게 필요한 것은 하네스가 제공하지 못하는 교사 고유의 능력, 특히 하네스 정보를 보고 올바르게 행동하는 능력이다. 그런데 기존 on-policy 증류는 교사의 전체 출력을 모방하고 하네스를 입력의 일부로 취급한다. 저자들은 같은 하네스를 붙인 on-policy 증류가 이 능력을 안정적으로 전달하지 못한다고 보고, 그 원인을 교사의 하네스 사용이 암묵적으로 남는 점, 하네스가 주는 정보와 교사가 더하는 능력을 분리하지 않는 점, 하네스 기록과 모순되는 교사 목표를 걸러내지 않는 점으로 정리한다.
어떻게 동작하나
제안 방법인 HAD는 하네스를 켠 교사의 전체 응답을 증류하는 response distillation에 두 가지를 더한다. 첫째, 하네스 인식 행동 선호 학습은 학생이 방문한 상태에서 같은 교사를 하네스 정보가 있는 경우와 없는 경우로 각각 질의하고, 하네스와 함께 선택한 행동을 더 선호하도록 학생을 학습시킨다. 두 행동은 학생 자신의 추론 뒤에 점수화되며, 추론 전체가 아니라 행동 토큰만 평균 로그확률로 비교한다. 이 비교는 하네스가 교사의 행동을 바꾸는 상태에서만 활성화된다. 둘째, 하네스 인식 행동 유효성 필터링은 선호된 행동이 하네스 기록과 모순되면 그 선호 쌍을 버리고, response distillation은 그대로 둔다. 최종 목적함수는 response distillation 손실과 유효성 마스크가 곱해진 선호 손실의 합이며, 람다는 두 손실의 미니배치 그래디언트 노름 균형으로 조정된다. HAD는 과제 보상, 성공 라벨, 미래 정보를 쓰지 않는다.
무엇과 다른가
저자들은 이 선호 항이 단순히 교사가 하네스와 함께 자주 내는 행동을 강화하는 것이 아니라, 하네스가 있을 때와 없을 때의 행동 확률 비율 P+ 나누기 P-를 반영한다고 분석한다. response distillation만으로는 이 상대적 변화를 알 수 없다는 것이다. 유효성 필터링은 하네스 접근이 항상 올바른 행동을 보장하지 않기 때문에, 하네스가 관측한 사실과 명백히 충돌하는 양성 행동을 제거한다. 다만 양성 행동이 유효하지만 틀린 경우는 걸러낼 수 없고, 이는 불완전한 교사를 따르는 증류의 한계로 남는다. 행동만 비교하는 이유는 전체 응답을 비교하면 하네스 유무에 따른 추론 스타일 차이가 신호를 차지하고 긴 추론이 짧은 행동 신호를 희석하기 때문이며, 학생 추론 뒤에 점수화하는 이유는 배포 시 학생이 자기 추론 뒤에 행동을 고르기 때문이다.
어떻게 쓰나
실험은 ALFWorld, WebShop, ScienceWorld에서 진행됐다. Qwen3 계열로 ALFWorld에서는 8B 교사에서 1.7B 학생을, WebShop과 ScienceWorld에서는 30B-A3B 교사에서 0.6B 학생을 증류했고, 모델 계열 일반화를 보기 위해 ALFWorld에서 Gemma-4-12B 교사에서 Gemma-4-E2B 학생도 증류했다. 베이스라인은 OPD, SAGE-OPD, Guided-OPD, SOPD이며 모두 같은 하네스로 학습과 평가를 했다. HAD는 모든 환경에서 가장 좋은 성능을 냈다. 하네스를 쓴 ALFWorld에서 보지 못한 과제 63.4%, 본 과제 51.4%로, 가장 좋은 베이스라인의 47.0%, 41.4%를 앞섰고 8B 교사도 넘었다. 평가에서 하네스를 제거하면 HAD는 63.4%에서 40.3%로 떨어져 모든 방법 중 낙폭이 가장 컸지만, 그래도 대부분 베이스라인보다 높았다. Gemma-4 실험에서도 HAD가 보지 못한 과제 37.3%, 본 과제 36.4%로 가장 강한 베이스라인의 32.1%, 34.3%를 앞섰고 하네스 활용도는 교사보다 높았다.
전제와 한계
분석 결과 HAD는 비생산적 루프에 덜 빠지고 오류에서 더 자주 회복했다. 정체 예방은 75.9%로 다른 모델의 최대 64.6%를 앞섰고, 정체 탈출은 59.7%로 학습 전 학생의 46.8%보다 높았으며 베이스라인은 뚜렷한 개선을 보이지 않았다. 하네스 내면화 측면에서 HAD는 하네스 없이도 보지 못한 과제 40.3%, 본 과제 37.9%를 기록해 하네스 없는 모든 베이스라인보다 높았고, 하네스 없는 교사와 비슷하거나 앞섰다. 상태 추적을 숨기면 성공률이 보지 못한 과제 63.4%에서 37.3%, 본 과제 51.4%에서 40.7%로 떨어졌고, 행동 모니터링을 숨기면 56.0%와 45.0%로 떨어졌다. 하네스가 거부한 행동을 막아도 성공률이 낮아졌다. 이는 HAD가 행동 모니터링 피드백의 일부를 가중치에 내면화하면서 상태 정보는 하네스에서 읽는 쪽에 가깝다는 해석을 뒷받침한다. 절제 실험에서 유효성 검사를 제거하면 성공률이 57.4%에서 50.8%로, 음성 행동을 제거하면 52.4%로 떨어졌고 하네스 활용도는 81.0%에서 74.4%로 낮아져 response distillation만의 73.1%에 가까워졌다. 선호 항을 제거한 경우 성공률은 43.5%였다. 교사 예산을 두 배로 준 OPD와 SOPD도 평균 성공률이 43.5%에서 각각 46.7%, 46.8%로 오르는 데 그쳐 HAD의 57.4%에 못 미쳤다.
개발자 관점에서 이 논문은 하네스가 고정된 소형 에이전트를 만들 때 교사의 전체 출력을 그대로 모방하는 것만으로는 부족하다는 신호를 준다. 배포 환경과 같은 하네스를 학습에도 쓰고, 하네스 정보가 실제로 행동을 바꾸는 지점을 대비해 가르치며, 하네스 기록과 모순되는 교사 행동을 걸러내는 절차가 실무적으로 중요하다. 과제 보상이나 성공 라벨 없이도 학습할 수 있다는 점은 보상 설계가 어려운 장기 호흡 에이전트에 유용하다. 다만 하네스 구성 요소별로 학생이 무엇을 내면화하고 무엇을 계속 읽어야 하는지 확인해야 하며, 이 논문에서는 상태 추적을 숨길 때 성능 하락이 가장 컸다.
저자들이 밝힌 한계는 분명하다. 학생은 최대 2B, 교사는 최대 30B 규모의 텍스트 기반 환경에서만 평가했고, 더 큰 모델이나 도구 호출, 소프트웨어 에이전트로의 확장은 향후 과제다. 하네스는 사람이 설계한 것이며, 학습되거나 자동 최적화된 하네스는 HAD와 다르게 상호작용할 수 있다. 또한 유효성 필터링은 하네스 기록과 명백히 모순되는 양성 행동만 제거할 뿐, 유효하지만 틀린 교사 행동은 걸러내지 못한다. 저자들은 고정된 구성 요소를 가진 시스템으로의 증류는 그 구성 요소가 제공하지 못하는 것에 집중해야 한다는 원칙이 검색이나 외부 도구를 쓰는 에이전트에도 적용될 수 있다고 본다.