SHIFT가 쿼리마다 멀티에이전트 하네스를 검색으로 조립한다
Dynamic Harness Search: Building Multi-Agent Systems Per-Query via Prediction
무엇인가
이 논문이 푸는 문제는 에이전트 하네스 선택이다. 하네스란 어떤 역할의 에이전트를 몇 개 두고, 각자 어떤 지시문을 따르며, 어떤 도구를 쓸 수 있고, 결과를 누구에게 넘기는지를 규정한 명세다. 예를 들어 보고서에 적힌 숫자 하나를 묻는 요청은 조회 한 번이면 되지만, 예산 워크북을 읽고 계산해 셀을 고쳐 파일로 돌려주는 요청은 계획자·해결자·검증자로 나눠야 한다. 문제는 워크북에 도움이 된 검증자가 단순 조회에는 불필요한 모델 호출과 지연만 더한다는 점이다. 게다가 검증자의 유용성은 해결자의 출력과 검증 지시문에, 도구의 유용성은 그 도구를 제대로 쓰는지에 달려 있어 컴포넌트 가치가 서로 얽힌다. 기존 접근은 재사용 가능한 워크플로를 오프라인에서 탐색하거나, 고정된 프로그램 안에서 프롬프트만 최적화하거나, 미리 정의된 모델·워크플로 중에서 라우팅하는 쪽이었다.
어떻게 동작하나
SHIFT는 하네스를 실행 가능한 방향 그래프로 표현한다. 각 에이전트는 역할, 순서 있는 지시문 목록, 허용된 도구 집합으로 규정되고, 간선은 한 에이전트의 출력을 다음 에이전트로 넘기며, 피드백 간선은 하위 에이전트가 결과를 되돌려 수정하게 한다. 하네스 구축 행동은 구조·지시문·도구 권한을 바꾸는 것, 즉 에이전트와 그 간선 삽입, 피드백 간선 추가, 특정 에이전트에 지시문 덧붙이기, 도구 집합 확장이다. 최대 H개 행동으로 구성되는 유한 지평 의사결정 과정이며, 모든 중간 상태가 실행 가능하기 때문에 탐색이 완성된 설계뿐 아니라 부분 설계도 비교할 수 있다. 단일 Coder에 도구도 없는 최소 하네스에서 출발해, 금융 문서 질문처럼 구조가 중요한 과제에서는 에이전트 4개 이상 하네스가 단일 에이전트보다 정확도가 약 50%포인트 높지만, 산술 문장제에서는 토큰을 약 19배 쓰고도 정확도 차이가 거의 없다는 관찰이 이 설계의 동기다.
무엇과 다른가
핵심 구성 요소는 작은 로컬 모델인 아키텍트다. Gemma 4 E2B 백본이 쿼리, 사용 가능한 도구, 실행 가능한 행동, 현재 그래프의 텍스트 렌더링을 읽고, 마지막 토큰 은닉 상태를 두 개의 선형 헤드에 통과시켜 행동 로짓과 가치 로짓을 낸다. 학습되는 것은 LoRA 어댑터와 두 헤드뿐이고 백본 가중치는 고정된다. 정책은 실행 가능한 행동 집합 위에서만 정규화되고, 가치는 시그모이드를 거쳐 0과 1 사이의 유틸리티가 되며 정확도와 실행 비용을 함께 저울질한다. 추론 시에는 몬테카를로 트리 탐색이 이 예측을 사용해 하네스를 만든다. 노드에 처음 도달하면 아키텍트가 정책과 유틸리티를 예측하고, 확률이 가장 높은 K_exp개 행동과 정지 행동이 확장 집합이 되며, PUCT 규칙으로 방문 횟수와 평균 가치, 사전 확률을 절충하며 내려간다. 이 루프 안에서 실행기는 한 번도 호출되지 않는다. 예산을 다 쓰면 SHIFT-search는 가장 많이 방문된 경로 끝의 하네스를 실행하고, SHIFT-value는 가장 많이 방문된 분기 중 예측 유틸리티가 가장 높은 후보를 실행하되 그 값이 낮으면 예산을 늘려 다시 탐색한다.
어떻게 쓰나
학습은 실행 결과에서 이루어진다. 실행된 하네스는 과제 성공을 크레딧으로 받고 실행 토큰, 지연, 타임아웃, 추가 도구와 에이전트에 대한 페널티를 차감받으며, 이 보상은 클립되어 0과 1 사이의 목표값 z로 재조정되고 가치 헤드가 이 값을 예측하도록 학습된다. 정책 목표는 탐색이 각 확장 행동에 부여한 방문 비율이고, 가치 목표는 실제 측정된 유틸리티다. 중간 상태는 다른 하네스의 결과를 물려받지 않는다. 온라인 목적함수는 방문 분포를 따르는 교차엔트로피에 탐색 장려용 엔트로피 항을 더하고, 측정 유틸리티에 대한 이진 교차엔트로피를 가중 합한 형태다. 여기에 에폭마다 같은 쿼리에서 실행된 두 하네스의 유틸리티 순서를 보존하도록 마진 m을 둔 랭킹 손실이 더해진다. 탐색은 같은 쿼리 안에서 더 나은 하네스를 구별해야 하므로 이 순위 정보가 필요하다.
전제와 한계
실험은 수학(GSM8K), 다중 홉 질의응답(HotpotQA), 코드 생성(MBPP), 스프레드시트 조작(SpreadsheetBench), 문서 기반 질의응답(OfficeQA Pro), 범용 어시스턴트(GAIA) 여섯 벤치마크의 총 9,193개 과제에서 수행됐고, 실행기는 Gemini 3.5 Flash로 통일했다. 비교 대상은 프롬프팅, 프롬프트 최적화, 워크플로 탐색을 아우르는 17개 베이스라인이다. SHIFT-search는 6개 벤치마크 평균 정확도 79.9%로 가장 높았고, 최강 베이스라인인 Trace의 72.7%를 7.2%포인트 앞섰다. 짝지은 과제 부트스트랩 95% 신뢰구간은 4.42%에서 9.88%다. 이득은 장기·도구 집약 벤치마크에 집중된다. OfficeQA에서는 모든 베이스라인이 30% 아래에 머문 반면 SHIFT-search는 59.3%로 Trace보다 30.0%포인트 높았고, GAIA에서는 68.6%로 15.0%포인트 높았다. 저비용 변형인 SHIFT-value도 OfficeQA 39.0%, GAIA 64.7%로 두 벤치마크 모두에서 모든 베이스라인을 앞섰다. SHIFT-value는 평균 정확도 74.5%로 모든 베이스라인을 넘으면서 Trace보다 실행 토큰을 32% 적게 썼고, SHIFT-search의 3분의 1 수준이었다.
절제 실험은 행동 공간의 필요성을 보여준다. HotpotQA 500문항을 3회씩 실행했을 때 전체 탐색은 69.4%, 도구만 위임하는 경우 67.9%, 지시문만 추가하는 경우 60.3%였다. 지시문은 무엇을 하라고 알려주고, 도구는 무엇을 할 수 있는지 정하며, 추가 에이전트는 누가 하는지를 정하는데, 이 셋을 함께 고르는 것이 어느 하나만 고르는 것보다 최대 9.1%포인트 낫다는 것이다. 탐색 자체의 효과도 분리했다. 같은 아키텍트에서 그리디 구성은 평균 정확도 79.8%로 탐색의 79.9%와 사실상 같으면서 실행 토큰을 약 30% 적게 썼고, policy-veto보다 27% 적게 썼다. 다만 가치만 쓰는 value-greedy는 가장 저렴하지만 60.2%로 떨어졌는데, 한 단계 앞만 보는 방식으로는 이후 행동이 있어야 이득이 드러나는 에이전트를 인정할 수 없기 때문이다. 가치 선택의 품질도 따로 측정됐다. Gemma 3 27B 실행기에서 동일한 후보 풀에 대해 최대 가치 선택은 HotpotQA 정확도를 10.5%, GSM8K를 2.9% 올리면서 실행 토큰은 각각 절반, 5분의 1로 줄였고, 최상위 선택은 2순위 후보보다 HotpotQA에서 11.9% 높았다. GSM8K만으로 학습한 아키텍트는 재학습 없이 MATH-500 500문항(Llama 4 실행기)에서 83.6%를 기록해 고정 단일 Coder의 81.2%를 앞섰고, 난도 4~5 구간에서는 75.6% 대 71.0%로 격차가 더 벌어졌다.
개발자 관점에서 이 논문이 유용한 지점은 하네스 설계를 사람이 손으로 고정하는 대신 쿼리별로 조립하는 비용 구조를 명확히 제시한다는 것이다. 실행기를 호출하지 않고 로컬 추론만으로 후보를 비교하므로, 하네스 하나를 구성하는 데 1개 GPU에서 1초 미만이 걸린다. 다만 이득이 나오는 조건이 분명하다. 하네스 구조가 성공을 좌우하고 기존 설계가 아직 정답을 찾지 못한 곳, 즉 OfficeQA나 GAIA 같은 장기·도구 집약 과제에서 효과가 크다. 반대로 GSM8K, HotpotQA, MBPP처럼 단일 에이전트가 이미 최고 방법과 비슷한(17개 베이스라인 중 각각 16개, 13개, 6개가 2% 이내) 과제에서는 실행기 자체가 상한을 정하므로 SHIFT-search도 최고 성능의 1.2% 이내에 머문다. 도입을 검토한다면 역할·지시문·도구로 이루어진 사용자 정의 라이브러리를 직접 준비해야 하고, 도메인별로 토큰·지연·타임아웃·추가 도구에 대한 보상 스케일을 정해야 한다는 점을 확인해야 한다. OfficeQA에서 토큰은 46% 줄었지만 도구 호출 수는 거의 변하지 않았고, 60~98%의 질문에서 탐색이 더 저렴했다는 점은 절감이 단순히 도구를 덜 부르는 데서 오는 것이 아님을 시사한다.
저자들이 밝힌 한계는 분명하다. 벤치마크마다 별도의 아키텍트를 학습해야 하므로 선행 컴퓨팅 비용이 발생하며, 이 비용은 이후 쿼리들에 걸쳐 분할 상환된다는 전제가 깔려 있다. 향후 과제로는 데이터셋과 실행기를 가로질러 일반화되는 아키텍트를 만들어 반복 학습을 줄이는 것, 그리고 여러 번의 실행에서 평균낸 결과를 활용해 가치 추정을 개선하는 것을 제시한다. 또한 이득이 구조가 중요하고 기존 설계가 미치지 못하는 영역에 집중된다는 점, 즉 방법의 우위가 보편적이지 않고 과제 특성에 조건부라는 것도 결과 자체가 보여주는 한계다.