터미널 에이전트의 행동 신뢰성을 모델과 하네스 사이 검증으로 높인다

Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

HF Daily2609.39982

Minki Kang, Ryo Hachiuma, Shaokun Zhang2026-09-30

무엇인가

터미널 에이전트는 소프트웨어 엔지니어링, 데이터 과학, 과학적 발견 작업을 셸 명령으로 수행한다. 문제는 모델이 쓸 만한 행동을 생성할 수 있다는 사실이 그 행동의 안정적인 실행을 보장하지 않는다는 점이다. 같은 모델과 하네스도 실행마다 성공과 실패가 갈리는데, 각 실행이 확률적으로 생성된 장기 행동 시퀀스에 커밋되기 때문이다. 실행된 명령은 환경을 바꾸고 이후 결정은 그 바뀐 환경에 의존한다. 잘못된 패키지 설치나 코드 수정 하나가 이후 진행을 막을 수 있고, 모델이 더 나은 대안을 생성할 수 있었더라도 이미 늦는다. 이 논문은 모델과 하네스의 경계에서 테스트 시점 컴퓨트를 행동 수준에 배분하면 행동 신뢰성과 궤적 성공률이 올라가는지, 그리고 그 배분이 언제 효과적인지를 묻는다.

어떻게 동작하나

제안 방법인 Mid-Harness는 모델 가중치와 서빙 구조, 하네스를 그대로 둔 채 모델 호출 래퍼 안에 후보 샘플링과 검증을 끼워 넣는다. 하네스 루프는 기존처럼 generate를 호출해 응답을 파싱하고 환경에 실행하지만, 래퍼는 같은 상호작용 이력 h_t에 조건화해 N개의 후보 행동을 샘플링하고 검증기 ψ가 그중 하나를 골라 하네스로 넘긴다. 수식으로는 A_t = (a_t^1, ..., a_t^N), a_t^i ~ π(·|h_t), a_t* = Verify_ψ(h_t, A_t) ∈ A_t 이며, 실행된 행동의 관측 o_t로 이력이 h_{t+1} = (h_t, a_t*, o_t)로 갱신되고 나머지 후보는 버려진다. 검증기는 후보의 추론은 받지 않고 과제, 관측 이력, 후보 행동만 본다. 궤적 수준 검증이 완료된 실행 전체를 비교하는 것과 달리, Mid-Harness는 실행 전에 행동을 비교하므로 환경 인스턴스 하나만 필요하다.

무엇과 다른가

검증 방식은 세 가지를 비교한다. 리스트와이즈는 후보 집합 전체를 한 프롬프트에 넣고 하나를 고르게 하며 호출 1회로 끝나지만, 후보가 늘면 한 응답 안에서 모든 후보를 구분하고 순위를 정해야 한다. 포인트와이즈는 각 후보에 스칼라 점수를 매겨 최고점을 고르며 N번의 독립 평가를 병렬화할 수 있지만, 목적이 다른 행동들을 같은 척도에 올려야 한다. 페어와이즈는 같은 이력 아래 두 후보를 비교해 선호를 얻고, 평가된 쌍들에 대해 마진 가중 승률로 순위를 매겨 최상위 행동을 반환한다. 비교에 집중할 수 있는 대신 호출이 많아, 후보 8개 기준 리스트와이즈 1회, 포인트와이즈 8회, 페어와이즈 28회가 필요하다.

어떻게 쓰나

주 실험은 TerminalBench-Lite에서 TMAX-9B 생성기와 Vanillux2 하네스를 고정하고 진행한다. 생성기는 온도 0.8, 최대 64스텝, 65,536 토큰 컨텍스트, 스텝당 16,384 토큰 출력 제한을 쓰고, 과제당 3회 실행으로 Pass@1과 Pass@3을 측정한다. 베이스 에이전트의 Pass@1은 50.00%다. GPT-5.6 Sol을 검증기로 붙이면 N=4에서 64.63%, N=8에서 68.03%로 올라 생성기가 이미 쓸 만한 대안을 품고 있음을 보여준다. 반면 같은 TMAX-9B를 제로샷 리스트와이즈 검증기로 쓰면 N=4 49.32%에서 N=8 51.02%로 거의 오르지 않고 Pass@3도 66.33%에서 67.35%에 그친다. 후보를 늘리는 것만으로는 약한 검증을 보상하지 못한다는 뜻이다. N=8 고정에서 포인트와이즈는 리스트와이즈보다 조금 나은 수준이고 Pass@3은 그대로인 반면, 페어와이즈는 Pass@1 54.76%, Pass@3 71.43%로 가장 좋다.

전제와 한계

저자들은 244개 어려운 TMAX-15k 과제의 732개 궤적에서 모은 117k 페어와이즈 응답으로 LoRA를 학습해 GPT-5.6 Sol 교사의 추론·점수·선호 라벨을 모방하는 검증기를 만든다. LoRA는 검증기에만 활성화되고 생성기는 건드리지 않는다. N=8 페어와이즈에서 Pass@1은 54.76%에서 57.14%, Pass@3은 71.43%에서 75.51%로 오르고, N=4에서도 54.42%에서 55.44%, 68.37%에서 70.41%로 개선된다. 오프라인 분석에서 증류는 페어와이즈 점수 MAE를 2.59에서 1.05로 낮추고 교사와의 페어와이즈 일치율을 59.01%에서 74.58%, 검증 일치율을 38.52%에서 57.79%로 끌어올린다. 다만 턴 구간별 일치율은 1~4턴 68.13%, 17~32턴 54.07%로 후반부에 여전히 낮고, 교사와 불일치하는 사례는 3,328건에서 1,810건으로 줄었지만 그중 67.4%가 명령 의미론과 실행 가능성 판단에 집중된다.

비용 측면에서 페어와이즈는 비싸다. N=8에서 제로샷 페어와이즈는 약 26.6k 병렬화 출력 토큰(POT)을 추가하는데 리스트와이즈와 포인트와이즈는 최대 1.3k 수준이고, 검증기 총 출력 토큰은 리스트와이즈 0.6k, 포인트와이즈 7.0k, 페어와이즈 125.7k다. 추론 없이 A/B 선호만 내는 decision-only 검증기는 N=8에서 TMAX-9B 기준 Pass@1을 추론 버전보다 높이면서 참조 가격 기준 토큰 비용을 제로샷 20.9%, 증류 24.1% 줄인다(4B·27B에서는 비용은 낮지만 Pass@1도 낮다). 궤적 수준 기법과의 결합도 보고된다. Best-of-T(T=3)의 55.10%가 Mid-Harness를 쓰면 제로샷 61.22%, 증류 66.33%가 되고, 이는 같은 3회 환경 실행으로 11.23%p 이득이다. Sequential Refine은 55.10%에서 60.20%로 오르고 Pass@3은 71.43%에서 75.51%가 된다. 증류 Mid-Harness N=8은 Best-of-T T=5의 57.14%를 약 3분의 1 토큰 비용으로 맞추고, SR 또는 Best-of-T T=3과 결합하면 60.20%·66.33%로 T=7의 59.18%를 더 낮은 비용에 넘는다. 전이 실험에서 4B는 38.78%에서 41.50%, 43.88%로, 27B는 71.09%에서 73.13%, 76.19%로 오르고, Terminal-Bench 2.1은 21.72%에서 27.34%, FeatureBench-Mini는 베이스 1.45%에서 제로샷 5.80%, 증류 7.25%가 된다. Nemotron3.5 Lightning(30B), Nemotron3 Ultra(550B), Terminus-2 하네스를 쓴 Qwen3.5-9B까지 7개 설정 모두에서 제로샷 Mid-Harness가 Pass@3을 올리고 Pass@1을 같거나 높였다.

실무적으로 이 논문이 주는 신호는 명확하다. 에이전트 성능을 올리려고 모델을 다시 학습시키거나 하네스를 뜯어고치기 전에, 모델 호출 지점에서 후보를 여러 개 뽑고 하나를 검증해 넘기는 래퍼만 추가해도 성공률이 오른다. 다만 후보 수를 늘리는 것 자체는 검증기가 약하면 무의미하고, 검증 방식 선택이 성능을 가른다. 페어와이즈가 가장 좋은 결과를 냈지만 호출 수와 토큰 비용이 크게 늘어나므로, 지연과 비용 예산에 따라 decision-only나 포인트와이즈를 섞는 판단이 필요하다. 또한 궤적 수준 스케일링과 배타적이지 않아, 같은 환경 실행 횟수로 더 좋은 결과를 얻거나 더 적은 토큰으로 같은 성공률을 얻는 조합을 설계할 수 있다.

저자들이 밝힌 한계는 다음과 같다. 증류를 해도 프런티어 검증기와의 격차가 상당히 남아 있어 검증기용 강화학습 같은 더 나은 학습 알고리즘이 필요하다. 평가에 행동 정답 라벨이 없어 검증 정확도와 후보 커버리지를 직접 측정하지 못하고, 궤적 성공률과 오프라인 교사 일치율 같은 간접 지표에 의존한다. 또한 이 연구가 다루는 행동 신뢰성은 과제 완수 여부에 관한 것이지 생성된 명령의 안전성이나 보안성을 보장하지 않는다. 배포 시에는 권한 제한, 환경 격리, 민감하거나 되돌릴 수 없는 작업에 대한 사람 승인 같은 안전장치를 유지해야 하며, 행동 검증은 그 안전장치를 대체하는 것이 아니라 보완하는 것으로 봐야 한다.