하네스 성능을 모델 가중치로 옮기는 agent-as-harness 증류

Harness-Zero: Harness Distillation via Agent-as-Harness

HF Daily2609.24974

Haoran Ye, Yuxing Lu, Haonan Dong2026-09-21조회 5

무엇인가

LLM 에이전트의 성능은 모델 자체뿐 아니라 도구 사용, 컨텍스트와 상태 관리, 환경 상호작용을 조직하는 외부 시스템인 하네스(harness)에 크게 좌우된다. 문제는 하네스 최적화가 모델이 아니라 외부 스캐폴딩을 개선한다는 점이다. 최적 하네스는 도메인, 인스턴스, 베이스 모델마다 달라서 범용 에이전트는 차선의 공용 하네스를 감수하거나 계속 늘어나는 전용 하네스 사이를 라우팅해야 하는데, 전자는 전용 이득을 포기하고 후자는 컨텍스트, 모델 호출, 도구 호출, 오케스트레이션 비용을 반복적으로 지불한다. 어느 선택도 하네스 탐색으로 얻은 개선을 모델 안으로 옮기지 못한다. 이 논문은 이 지점에서 에이전트 하네스 증류(agent harness distillation)를 정식화한다. 도메인이나 인스턴스에 최적화된 하네스를 학습 시점의 지도로 쓰고, 그것이 유발하는 행동을 모델 가중치로 옮겨, 배포 시에는 하나의 고정된 타깃 하네스만으로 그 이득이 살아남게 하려는 것이다.

어떻게 동작하나

핵심 난점은 두 하네스가 행동 공간과 가용 정보에서 다르다는 것이다. 최적화된 하네스에서 수집한 궤적은 타깃 하네스에서의 직접 모방 감독으로 쓸 수 없다. Harness-Zero는 이를 agent-as-harness로 푼다. 표기는 다음과 같다. 학생이 실제로 동작하는 고정 타깃 하네스가 h, 학습 과제로 진화시킨 학생측 하네스가 h*(h* = Evolve(D_train)), h*를 하네싱 에이전트에 맞게 적응시킨 사설 참조 하네스가 K(K = Adapt(h*; h))다. h*는 DeepAgents 추상화를 따라 도구, 미들웨어, 스킬, 메모리로 구성되며, 적응 과정에서 도구는 학생 네이티브 등가물을 만들기 위한 명세로, 학생측 미들웨어는 해당 조건이 충족될 때 하네싱 에이전트에게 사적으로 경고하는 리뷰 미들웨어로, 스킬과 메모리는 진단 기준과 개입 지침으로 바뀐다. 예를 들어 h*에서 위험한 행동을 차단하던 미들웨어 규칙은 학생이 그런 행동을 제안할 때 활성화되는 리뷰 시점 경고가 된다. 적응은 h를 기준으로 이뤄지는데, 하네싱 에이전트가 K로부터 만드는 교정은 결국 학생이 타깃 하네스의 행동 공간에서 실행해야 하기 때문이다.

무엇과 다른가

학습 궤적 수집 동안 하네싱 에이전트는 학생의 응답 경계를 감싼다. 학생 정책 π_S는 컨텍스트 c_t에서 응답 y_t를 제안하고, 하네싱 정책 π_H는 c_t, y_t, K, 그리고 자신의 사설 이력 r_<t를 보고 (d_t, z_t)를 낸다. d_t가 pass면 y_t를 그대로, replace면 h에서 유효한 완전한 대체 응답 z_t를 쓴다. 수용된 응답만 h를 통해 실행되어 다음 컨텍스트 c_{t+1} = T_h(c_t, ỹ_t)를 만든다. 거부된 제안과 사설 리뷰는 학생 가시 궤적 밖에 남는다. 하네싱 에이전트의 특권은 K 읽기로 제한되며 숨은 정답이나 검증기 피드백, c_t 밖의 환경 상태를 볼 수 없다. 그래서 추가 증거가 필요하면 h에서 가능한 행동을 제안해 학생이 관찰 가능한 근거를 궤적에 남긴다. 예컨대 성급한 완료를 학생 작업을 검사하는 코드로 대체하면, 그 검사와 결과가 실행을 통해 학생 가시 궤적에 추가된다. 개입은 최소 원칙을 따른다. 건전한 제안은 그대로 통과시키고, 개입이 필요할 때는 K의 지침을 따르는 데 필요한 최소한의 일관된 수정만 하고 나머지 제안은 가능한 한 보존한다. 마지막으로 수용된 응답들에 지도 미세조정을 적용한다. 목적 함수는 θ̂ = argmin_θ -Σ_{τ∈D_review} Σ_{t=1}^{T_τ} log π_θ^h(ỹ_t | c_t)이며, 대체 응답이 사설 리뷰 맥락에서 생성되면서 섞여 들어갈 수 있는 리뷰어 관점의 추론은 손실에서 마스킹한다. 배포되는 시스템은 (π_θ̂, h)이고, h*, K, 하네싱 에이전트는 모두 제거된다.

어떻게 쓰나

실험은 세 도메인에서 이뤄진다. SpreadsheetBench Verified는 실제 스프레드시트 조작 과제 400개 중 300개를 하네스 진화와 학습 데이터 수집에 쓰고 100개를 평가에 남긴다. AppWorld는 공식 train과 development를 합친 147개 학습 분할과 168개 test_normal 과제를 56개 3과제 시나리오로 묶어 쓴다. USPTO Retrosynthesis는 10개 반응 클래스에 걸쳐 균형 잡힌 500개 학습 분할과 겹치지 않는 100개 테스트 분할을 쓴다. 타깃 하네스 h는 고정 시스템 프롬프트와 Bash 실행 도구 하나만 가진 최소 mini-SWE-agent 스타일이다. 학습 없는 추론 비교에는 GPT-5.6 Sol과 DeepSeek-V4-Pro를, 증류에는 Qwen3.5-9B를 베이스 모델로, GPT-5.6 Sol을 하네싱 에이전트로, 하네스 진화에는 Kimi K3를 쓴다. 필터링 후 학습 데이터는 SpreadsheetBench 487개, AppWorld 282개, USPTO 500개 롤아웃이며, Qwen3.5-9B에 LoRA SFT를 2 에폭 수행한다.

전제와 한계

추론 시점 비교에서 진화된 하네스를 적응시킨 K를 쓰는 agent-as-harness는 6개 벤치마크-모델 설정 평균 81.1%로, 코드로 하네스를 씌우는 meta-harness의 78.1%와 mini-SWE-agent 단독의 68.6%를 앞선다. K를 비워둔 agent-as-harness는 69.2%에 그쳐, 리뷰 행위 자체만으로는 이득이 거의 나지 않는다. 증류 결과는 더 크다. 배포 시 h*, K, 하네싱 에이전트를 모두 제거한 상태에서 Harness-Zero는 베이스 모델의 매크로 평균 과제 성공률을 23.3%에서 44.3%로 올려 21.0포인트 절대 향상, 90.1% 상대 향상을 기록했고, h*를 그대로 붙인 41.7%까지 넘어선다. 참고로 DeepAgents와 Claude Code 같은 범용 하네스는 이 9B 베이스 모델에 도움이 되지 않았다. 도메인별로는 SpreadsheetBench와 AppWorld에서 h* 단독을 능가하지만, USPTO에서는 30.0%로 베이스 12.0%보다는 낫지만 h*의 38.0%에는 못 미친다. 저자들은 그 이유로 USPTO의 h*가 반응 사전 지식, 후보 생성 로직, 실행 가능한 SMILES 검증까지 제공한다는 점을 든다.

대안 감독 신호와의 비교는 이 방법의 성격을 더 분명히 한다. USPTO에서 GPT-5.6 Sol의 궤적을 직접 미세조정하면 수집 과제 성공률이 52.0%인 교사임에도 학생은 베이스와 같은 12%에 머물고, 베이스 학생이 h* 아래에서 만든 궤적도 12%를 준다. K 없이 리뷰만 하면 11%, 정답(oracle)을 주면 수집 성공률이 98.6%까지 오르지만 증류된 모델은 15%에 그친다. 반면 정답이 전혀 없는 K는 수집 성공률 59.4%로 더 낮은데도 그 궤적에서 증류한 학생은 30% pass@1을 낸다. 즉 수집 성공률은 증류 가치를 예측하지 못하며, 정답 접근은 일반화되지 않는 지름길 교정을 유도하는 반면 K는 재사용 가능한 절차적 행동을 심는다. h*를 수집 중에 장착하면 GPT-5.6 Sol의 수집 성공률은 52.0%에서 62.0%로 오르지만 증류 학생은 12%에서 3%로 떨어진다. h* 아래의 교사 궤적에서 증류된 모델이 사용할 수 없는 하네스 도구 호출을 반복하다 턴 한도를 소진하는 행동 공간 불일치가 원인으로 지목된다.

행동 내재화는 더 세밀하게 측정된다. h*의 도구, 미들웨어, 메모리, 스킬 패턴을 궤적 탐지기로 옮기고, 같은 테스트 과제에서 베이스 모델이 h* 아래에서만 그 패턴을 보이는 과제를 골라 패턴당 최소 10개 과제를 확보했다. SpreadsheetBench 18개, USPTO 6개, AppWorld 4개로 총 28개 패턴이 남았고, Harness-Zero는 이 하네스 전용 행동을 평균 82.3% 회복한다. 베이스 모델은 구성상 모든 패턴에서 0%이므로, 이 수치는 증류가 새로 더한 행동을 직접 측정한 값이다.

실무적으로 이 논문은 하네스를 배포 자산이 아니라 학습 신호로 다루는 경로를 제시한다. 도메인별 하네스를 계속 유지하고 라우팅하는 대신, 최적화된 하네스로 궤적을 수집해 모델에 흡수시키고 배포는 최소 하네스 하나로 끝낼 수 있다는 주장이다. 다만 도입 전에 확인할 전제가 있다. 저자들이 밝힌 첫 번째 한계는 충분히 강한 하네싱 모델이 필요하다는 점으로, 모델이 약하면 리뷰가 오히려 해로워져 agent-as-harness의 우위가 사라진다. 두 번째는 비용이다. 모든 제안을 리뷰하므로 궤적과 K를 처리하는 추가 모델 호출이 매 단계 발생해 USPTO 기준 평균 지연이 2.4배로 늘어난다. 이 오버헤드는 수집 단계에만 있고 증류 후에는 없다. 세 번째로 SFT가 h*에 인코딩된 깊은 도메인 지식을 완전히 내재화하지 못할 수 있고, 컨텍스트 관리처럼 학생 응답으로 표현할 수 없는 하네스 메커니즘도 있다. 저자들은 따라서 Harness-Zero가 하네스의 필요를 없애지는 않지만 하네스가 제공해야 할 것을 좁혀주며, 증류가 발전하면 최소 하네스로 충분해질 것이라고 본다. 향후 과제로는 개입의 결과를 예측하는 에이전트 세계 모델, 프록시 신호를 이용한 선택적 리뷰, 토큰 삽입이나 잠재 공간 조향 같은 세밀한 개입, 그리고 거부된 응답과 선호된 응답이 같은 상태에 짝지어져 있다는 점을 활용한 선호 학습이 제시된다.