에이전트 하네스 최적화에서 학습 시나리오 선택도 함께 진화시킨다

ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization

HF Daily2610.00906

Sungho Park, Wonjoong Kim, Jue Zhang2026-10-01조회 2

무엇인가

LLM 에이전트의 다단계·장기 과제 성능은 모델 자체보다 주변 하네스(harness), 즉 어떻게 프롬프트를 주고 어떤 도구를 쓰게 하며 실행을 어떻게 제어·감시·교정하는지에 크게 좌우된다. 최근의 자동 하네스 최적화(AHO) 연구는 실행 피드백으로 프롬프트·도구 인터페이스·런타임 제어 로직을 고치는 '업데이트 방법'에 집중해 왔고, 그 피드백을 만들어내는 학습 시나리오는 최적화 시작 전에 전체 학습셋이나 미니배치 스케줄로 고정하는 경우가 대부분이었다. 문제는 하네스가 변하면 어떤 시나리오가 유용한지도 변한다는 점이다. 고정 스케줄은 아직 해결되지 않은 실패를 너무 일찍 지나치거나, 남은 가치가 거의 없는 시나리오에 rollout을 낭비한다. 저자들은 이 빠진 차원을 자동 커리큘럼 학습 문제로 정식화하고, 예산이 제한된 오프라인 하네스 최적화에서 시나리오 선택을 적응적으로 다루는 ActiveSaddler를 제안한다.

어떻게 동작하나

핵심 착상은 커리큘럼 선택을 non-stationary bandit으로 모델링하되, arm을 개별 실패 실행이 아니라 하네스의 결함 단위로 정의하는 것이다. 하나의 패치는 여러 시나리오와 트레이스에 걸쳐 재발하는 근본 결함을 고치므로, 실패 진단을 통해 같은 결함에 귀속되는 실패들을 하나의 failure-pattern arm으로 묶는다. arm 집합은 미리 알 수 없고 하네스가 진화하며 실행이 확률적으로 달라지므로 최적화 도중 동적으로 생성·확장된다. 이를 위해 세 구성요소가 반복 루프를 이룬다. Failure-Pattern Extractor는 실패 증상을 먼저 독립적으로 추출한 뒤(symptom extraction) 현재 arm 집합과 정규화하여(pattern normalization) 기존 패턴에 연결하거나, 필요하면 여러 패턴을 합성하거나, 처음 보는 패턴이면 새 arm을 만든다. 각 arm은 패턴 설명, 그 패턴이 관측된 지원 시나리오 집합, 관련 하네스·실행·진단 증거를 유지한다.

무엇과 다른가

매 반복 t에서 Exploration Controller가 먼저 이진 결정을 내린다. 미관측 시나리오 풀에서 새 결함을 찾는 unseen(Draw)인지, 이미 발견한 결함 arm을 다시 파고드는 arm(Pull)인지다. Draw면 미관측 풀에서 배치를 비복원 추출해 제거하고, Pull이면 Arm Prioritizer가 arm을 골라 그 arm의 지원 시나리오에서 배치를 구성한다. 선택된 시나리오를 현재 하네스로 실행한 기록은 하네스 옵티마이저에 전달되어 다음 하네스를 만든다. Arm Prioritizer는 LLM으로 학습진행 점수 φ(a)∈[0,1]을 추정하는데, 네 요소를 함께 본다. 현재 하네스에서 그 실패 패턴이 여전히 활성인지(severity), 하네스 개입으로 고칠 수 있는지(fixability), 수리가 얼마나 넓게 일반화될지(breadth), 개입이 회귀를 유발할 위험(side-effect risk)이다. 이 점수에 softmax(온도 τ_sel)를 적용해 선택 분포를 만들고 categorical 샘플링하며, 점수는 매 선택 시점에 최신 이력으로부터 재계산되어 하네스가 변함에 따라 우선순위가 이동한다. 모든 학습 시나리오를 소진하고 모든 arm을 방문한 뒤에는, arm을 만들지 않았던 과거 성공 시나리오도 다시 탐색 대상이 되어 회귀를 재발견할 수 있다.

어떻게 쓰나

실험은 GAIA2(스마트폰 시뮬레이션 환경, 기본 ReAct 기반 에이전트를 base harness로 사용)와 Terminal-Bench 2.0(시스템 관리·머신러닝·사이버보안 등 89개 태스크, Terminus 2를 base harness로 채택)에서 수행됐다. ActiveSaddler는 AutoSaddler에 세 커리큘럼 컴포넌트를 얹어 구현했고 GitHub Copilot SDK를 사용했다. 태스크 에이전트와 옵티마이저 모두 gpt-5.5를 쓰되 reasoning effort는 태스크 에이전트 medium, 옵티마이저 세션 xhigh로 설정했다. 비교 대상은 GEPA, Meta-Harness, AutoSaddler, 그리고 학습셋에 대한 base harness 5회 평가 정확도로 순위를 매긴 easy-to-hard 고정 커리큘럼(category 수준, scenario 수준)이며, 수작업 TB2 하네스 Terminus-KIRA도 참고로 보고했다. 결과적으로 ActiveSaddler는 테스트 Pass@1 59.8%(GAIA2), 80.0%(TB2)로 두 벤치마크 모두에서 가장 높았고, 같은 AutoSaddler 옵티마이저에서 최적화 전에 고정한 무작위 셔플 순서 대비 각각 +4.4pp, +7.5pp를 기록했다. 난이도 기반 고정 커리큘럼과 비교하면 GAIA2에서 category/scenario 순서 대비 +3.9pp/+4.1pp, TB2에서 +9.2pp/+6.7pp다. GEPA에 ActiveSaddler를 적용하면 평균 Pass@1이 54.2%에서 57.2%로(+3.0pp) 올라, 이득이 특정 옵티마이저에 국한되지 않음을 보였다. LLM을 쓰지 않는 대안인 EMA 기반 failure-persistence scoring과 count 기반 UCB-AIR은 각각 3.1pp, 4.2pp 낮았다.

전제와 한계

비용 측면도 보고된다. GAIA2에서 개발 정확도 58.5%에 도달하는 비용이 ActiveSaddler는 298달러인 반면 AutoSaddler는 1,360달러, category ordering은 673달러가 필요했고, scenario ordering은 1,698달러를 쓰고도 56.9%에 그쳤다. TB2에서는 78.9%에 128달러로 도달했고 AutoSaddler 220달러, scenario ordering 363달러가 같은 정확도에 필요했으며, category ordering은 548달러를 쓰고 73.7%에 머물렀다. 커리큘럼 적응에 드는 옵티마이저 측 LLM 오버헤드가 비싼 태스크 에이전트 rollout의 더 나은 배분으로 상쇄된다는 주장이다.

Ablation은 세 설계 원칙을 뒷받침한다. 첫째, arm 표현이 결정적이다. failure-pattern arm을 category나 scenario 수준 arm으로 바꾸면 테스트 Pass@1이 GAIA2에서 3.0pp/3.6pp, TB2에서 10.8pp/6.7pp 떨어진다. failure-pattern arm은 현재 하네스가 여전히 실패하는 시나리오를 샘플링하는 비율이 category/scenario arm보다 GAIA2에서 16.5pp/35.3pp, TB2에서 29.9pp/23.8pp 높았다. category arm은 서로 다른 결함을 뭉쳐 일부 시나리오의 성공이 다른 미해결 결함을 가리게 하고, scenario arm은 같은 결함을 시나리오마다 쪼개 재방문을 어렵게 만든다. 둘째, 모든 arm에 같은 점수를 주는 w/o Arm Prioritizer 변형은 GAIA2 4.5pp, TB2 7.5pp 성능이 낮았고, 최적화 중 관측된 실패가 이후 성공으로 전환되는 비율도 ActiveSaddler가 가장 높았다. 셋째, 5회마다 무조건 미관측 시나리오를 탐색하는 고정 스케줄로 Exploration Controller를 대체하면 GAIA2 4.5pp, TB2 8.3pp 하락했다. 실제로 Draw 비율은 arm이 적은 전반부 44%에서 arm 풀이 커진 후반부 20%로 줄었고, Pull 시점에 미해결로 남은 arm 수가 Draw 시점보다 GAIA2 2.0배, TB2 6.9배 많았다(고정 스케줄은 각각 0.8배, 1.3배로 거의 무감각).

실무 관점에서 이 논문이 주는 메시지는 명확하다. 에이전트 하네스를 자동으로 개선하는 파이프라인을 이미 돌리고 있다면, 옵티마이저 알고리즘을 바꾸지 않고도 '어떤 학습 시나리오를 언제 태울지'만 적응적으로 바꿔 같은 rollout 예산에서 더 좋은 하네스를 얻을 수 있다는 것이다. 특히 실패를 카테고리나 개별 시나리오 단위로 관리하고 있다면, 재발하는 결함 패턴을 하나의 최적화 타깃으로 묶는 표현 방식이 성능 차이를 크게 만든다는 점을 확인해야 한다. 다만 이득의 상당 부분이 LLM 기반 스코어링과 탐색 판단에 의존하므로, 자체 환경에서 옵티마이저 측 토큰 비용과 태스크 실행 비용을 합친 end-to-end 비용-정확도 곡선을 직접 측정해 볼 필요가 있다.

저자들이 명시한 전제와 한계는 다음과 같다. 이 연구는 학습 기반 오프라인 AHO, 즉 고정되고 상호 배타적인 train/dev/test 분할과 표준 프로토콜을 전제로 하며, 하네스 업데이트 메커니즘인 옵티마이저 O와 후보 평가 절차는 고정해 두고 커리큘럼 정책만 연구한다. 따라서 옵티마이저 자체를 바꾸는 접근이나 모델 가중치를 함께 최적화하는 설정과의 상호작용은 다루지 않는다. 또한 arm 우선순위 추정과 탐색 시점 결정이 모두 LLM 판단에 의존하고, rollout 예산이 제한된 상황을 주요 동기로 삼는다. 논문에는 별도의 한계 절이 없고, 결론에서 자동 커리큘럼 학습을 하네스 최적화의 보완적 차원으로 제시하며 마무리한다.