WEFT가 도구 사용 후학습을 에이전트 상호작용 시스템 전체로 확장한다

WEFT: Scaling Tool-Use Post-Training for General-Purpose Agents

HF Daily2609.36887

Bo Mao, Hang He, Linting Wang2026-09-29

무엇인가

도구 사용(tool-use) 후학습을 확장하는 최근 연구는 대부분 실행 가능한 환경을 합성하는 쪽에 집중해 왔다. 그런데 논문이 보는 에이전트 상호작용 시스템은 환경 하나가 아니라 환경, 과제, 에이전트 하네스, 평가자 네 요소가 맞물린 구조다. 환경만 단독으로 늘려도 모델 성능이 비례해 오르지 않는 이유는, 신뢰할 수 있는 학습 신호가 이 네 요소의 일관된 상호작용에서 나오기 때문이다. 이 논문이 푸는 문제는 바로 그 불일치다.

어떻게 동작하나

WEFT(Whole-system Evolution For Tool-use Post-training)는 이 문제를 세 축으로 나눠 다룬다. 첫째는 확장 가능한 에이전트 상호작용 시스템 구축, 둘째는 실행 기반 자기진화(execution-driven self-evolution), 셋째는 대규모에서도 무너지지 않는 안정적 후학습이다. 세 축을 따로 최적화하는 대신 하나의 루프로 묶는 것이 핵심 주장이다.

무엇과 다른가

시스템 구축은 세 방향으로 확장된다. 환경의 폭(environment breadth), 과제의 복잡도(task complexity), 상호작용의 다양성(interaction diversity)이다. 즉 도구 종류를 늘리는 것만이 아니라, 얼마나 어려운 과제를 얼마나 다양한 상호작용 경로로 풀게 할 것인지까지 함께 스케일한다.

어떻게 쓰나

자기진화 단계는 실행 트레이스와 상태 증거(state evidence)를 재료로 쓴다. 롤아웃에서 나온 흔적을 보고 실패를 어느 구성요소 탓으로 돌릴지 귀속(attribution)시키고, 그 책임이 있는 구성요소를 수정한다. 수정 사항은 새 롤아웃으로 다시 평가되며, 그 결과가 다음 진화 라운드의 증거가 된다. 환경·과제·하네스·평가자를 반복적으로 손보는 닫힌 루프다.

전제와 한계

안정적 후학습은 최적화 신뢰성과 실행 신뢰성을 동시에 건드린다. prefix-preserving sampling은 이미 검증된 진행 구간을 보존해 샘플링이 성과를 되돌리지 않게 하고, atomic-turn credit assignment는 학습 신호를 원자적 턴 단위로 국소화한다. MegaMCP는 공유 도구 서비스를 쓰는 동시 롤아웃들 사이에서 상태를 격리하고 복구 가능하게 유지하는 계층이다. 여러 롤아웃이 같은 도구를 두고 서로의 상태를 오염시키는 문제를 인프라 수준에서 막는 셈이다.

실험은 여러 모델과 벤치마크에서 수행됐다. WEFT-8B와 WEFT-14B는 BFCL V4, τ²-Bench, Claw-Eval에서 평가된 동일 크기 환경 확장(environment-scaling) 베이스라인을 모두 앞섰다. 특히 WEFT-14B는 Agent-World-14B 대비 세 벤치마크에서 각각 6.41, 2.23, 12.27 퍼센트 포인트를 개선했다. WEFT-35B-A3B는 이 이득을 더 어려운 장기 호라이즌 워크플로 벤치마크인 Toolathlon-Verified와 AutomationBench까지 확장한다. 다만 벤치마크별 절대 점수, 학습 데이터 규모, 스텝 수, 하이퍼파라미터 같은 세부 수치는 제공된 원문 범위에 제시되지 않았다.

개발자 입장에서 이 논문은 에이전트를 파인튜닝하거나 평가 파이프라인을 만들 때 확인할 지점을 알려준다. 도구 호출 성능이 정체될 때 환경 개수만 늘리는 대신, 과제 난이도와 상호작용 경로의 다양성, 하네스와 평가자의 정합성을 함께 점검해야 한다는 것이다. 또한 동시 롤아웃을 돌리는 학습 인프라라면 상태 격리와 복구 가능성, 그리고 검증된 진행을 날리지 않는 샘플링 설계를 먼저 갖춰야 한다.

저자가 명시한 한계는 제공된 원문 범위에서 별도로 제시되지 않았다. 다만 방법 자체가 전제하는 조건은 분명하다. 공유 도구 서비스 위에서 동시 롤아웃을 안정적으로 운영할 수 있는 실행 인프라가 필요하고, 실패 귀속과 수정이 의미를 가지려면 평가자가 신뢰할 만해야 한다. 즉 WEFT의 이득은 모델 학습 알고리즘만이 아니라 시스템 구축·실행·평가 전반의 품질에 의존한다.