라벨 없이 실행 중에 멀티에이전트 워크플로를 고치는 InFlowOp
Pay for the Fault, Not the Flow: Label-Free In-Flow Multi-Agent Workflow Optimization
무엇인가
복잡한 작업을 여러 전문 에이전트에게 나눠 맡기는 멀티에이전트 워크플로는 LLM이 직접 구성하는 방향으로 가고 있다. 문제는 구성 단계에서 내려야 할 결정이 미리 고정된다는 점이다. 작업을 얼마나 잘게 쪼갤지, 각 하위 작업을 어느 에이전트에게 맡길지, 풀에 맞는 에이전트가 없을 때 새 전문가를 만들지 아니면 어중간한 에이전트에 밀어 넣을지가 모두 사전에 정해지고, 각 하위 작업이 실제로 성공했는지는 워크플로가 돌아간 뒤에야 드러난다. 게다가 고칠 때의 단위가 워크플로 전체다. 실패 지점을 찾으려면 참조 정답이나 채점된 결과, 학습된 평가자가 필요하고, 수정은 전체 재실행·재탐색·재학습으로 이뤄진다. 이미 성공한 단계까지 두 번 값을 치르는 구조다.
어떻게 동작하나
논문이 제안하는 InFlowOp은 이 두 문제를 라벨이 필요 없는 단일 비용으로 묶는다. 비용은 '에이전트의 역량이 하위 작업이 요구하는 바를 얼마나 충족하는가'와 '그 에이전트를 돌리는 데 얼마나 드는가'를 함께 저울질한다. 1단계인 Coalesce는 먼저 작업을 가장 잘게 원자 단위로 분해한 뒤, 비용 행렬을 따라 원자들을 다시 합쳐 적정 입도를 찾는다. 비용 행렬의 각 칸은 에이전트 카드(선언된 역량과 실행을 통해 축적된 자기 진화 프로파일)를 원자의 요구사항과 대조해 0과 1 사이의 일치도로 계산한다. 어떤 원자에 대해 풀의 모든 에이전트가 역량 기준선을 넘지 못하면 커버리지 잔여가 1로 표시되고, 이때 페널티를 감수하고 새 에이전트를 만든다. 최종 목적식은 신뢰성 비용 R, 지연 비용 L, 생성 비용을 가중 합한 Cost(W) = R(W) + βL(W) + γ|A+(W)|를 최소화하는 분해·배정·의존 그래프를 찾는 것이며, Coalesce는 정해진 확장 예산 안에서 최소 비용 조합을 반환한다. 입도는 고정 템플릿이 아니라 비용이 결정하는 결과물이 된다.
무엇과 다른가
2단계는 실행 중 최적화다. Coalesce는 하위 작업을 만들 때 입력 조건과 출력 조건으로 이뤄진 계약도 함께 세워두는데, 실행 중에는 이 계약을 실제 관측된 입력·출력과 대조해 정답 없이도 고장을 감지한다. 출력 조건이 깨지면 배정 문제로 보고, 입력 조건이 깨지면 분해 문제로 본다. 수정은 비용 순서 사다리를 따른다. 더 싼 Re-assign(다른 에이전트로 교체)을 먼저 시도하고, 후보가 소진되면 Re-decompose(해당 하위 작업을 더 잘게 쪼갬)로 올라간다. 교체는 조건이 실제로 해소된 경우에만 확정되고 아니면 롤백되며, 각 이동에는 예산이 걸려 있어 원래 구성보다 나빠지지 않는다. 실행은 문제가 난 하위 작업에서 멈추고, 그 하위 작업과 그에 의존하는 후손들만 다시 돌린다. 나머지 결과는 캐시에서 재사용하므로 최적화 비용은 워크플로 크기가 아니라 고장 크기에 비례한다.
어떻게 쓰나
평가를 위해 논문은 Braid라는 벤치마크를 함께 제안한다. 단일 에이전트로는 잘 풀지 못하는, 즉 워크플로가 존재할 이유가 있는 작업만 모은 것으로, 10개 공개 데이터셋에서 8개 도메인에 걸친 19개 평가 arm을 구성했다. 각 작업은 여러 복잡도 수준으로 만들어지고, 정답 출처를 문항마다 따로 두는 분산 구성과 하나를 공유하는 앵커 구성 두 방식을 쓴다. 실험은 같은 에이전트 풀 아래 6개 시스템을 비교한다. 단일 LLM, 도구와 스킬을 모두 준 단일 에이전트, 탐욕적 탐색으로 워크플로를 만드는 구성, Coalesce, Coalesce에 실행 중 조정을 더한 것, 그리고 자기 진화 프로파일까지 반영한 전체 방법이다. 백본은 Qwen3.5 4B·9B와 GPT-5-mini, GPT-5.4-mini, GPT-5.4, GPT-5.6-luna다.
전제와 한계
결과는 모든 백본에서 두 단일 베이스라인을 앞선다. 단일 LLM 대비 최대 +21.90%p, 동일 연산 예산을 맞춘 단일 에이전트 대비 최대 +11.97%p다. 단일 에이전트가 단일 LLM보다 얻는 이득이 백본에 따라 +6.90%p에서 +14.15%p로 크게 흔들리는 반면, InFlowOp의 이득은 6개 백본에서 3.74%p 이내로 변동폭이 작다. 백본 크기 효과도 뒤집는다. InFlowOp를 붙인 Qwen3.5-4B가 20.81%로, 단일 에이전트 기준의 Qwen3.5-9B와 GPT-5-mini, GPT-5.4-mini보다 높다. 가장 강한 백본인 GPT-5.6-luna도 41.99%에서 49.37%로 오른다. 도메인별로는 차트, 수학, 금융에서 이득이 가장 크고 물리에서 가장 작아 모든 방법이 17.34% 이하다.
중요한 것은 이득이 '나누기' 자체에서 오지 않는다는 점이다. 같은 Braid arm에서 탐욕적으로 구성한 워크플로는 15.49%로 단일 에이전트의 17.38%보다 오히려 낮다. 비용으로 분할을 결정하는 Coalesce는 22.21%로 탐욕 탐색보다 +6.72%p, 단일 에이전트보다 +4.83%p 높다. 여기에 실행 중 조정이 +1.59%p, 자기 진화 프로파일 채점이 +1.33%p를 더한다. 절제 실험도 설계 선택을 뒷받침한다. 비용 행렬을 LLM 판단으로 매기면 루브릭 추정기보다 Qwen3.5-4B에서 -3.27%p, 9B에서 -3.85%p 나빠진다. 비용 행렬을 새로 만든 에이전트까지 반영해 동적으로 갱신하면 정적 행렬보다 +3.15%p, +2.55%p 좋고, 풀을 동적으로 키우면 정적 풀보다 +4.49%p, +3.29%p 좋다. 프로파일은 성공 기록만 남길 때 도움이 되고 실패까지 모두 반영하면 세 백본 모두에서 카드만 쓰는 것보다 나빠진다(17.34%, 21.52%, 26.53%). 국소 최적화에 전역 패스를 추가하면 오히려 -1.63%p, -1.41%p로 떨어진다.
실무 관점에서 이 논문이 주는 시사점은 세 가지다. 첫째, 워크플로 품질은 분해 입도를 사람이 정하는 템플릿이 아니라 에이전트 역량과 실행 비용의 함수로 두는 편이 낫다는 근거가 된다. 둘째, 실패를 만났을 때 전체를 재실행하지 말고 계약 위반이 관측된 하위 작업과 그 후손만 다시 돌리는 스코프 재개가 실질적인 비용 절감 지점이다. 셋째, 에이전트 프로파일에는 실패가 아니라 성공만 기록해야 한다는 실험 결과는 운영 로그 설계에 바로 적용할 수 있다. 다만 도입 전에 확인할 것은, 이 방법이 참조 정답 없이 계약 조건의 의미적 일치도만으로 고장을 판정한다는 점이다. 계약을 얼마나 촘촘히 써두느냐가 감지 품질을 좌우하므로, 하위 작업마다 입력·출력 조건을 명시적으로 정의하는 작업이 선행되어야 한다.
저자들이 밝힌 전제와 한계도 분명하다. 단일 LLM 베이스라인은 여러 도메인에서 거의 0점에 가까운데, 입력이 파일로 주어지기 때문에 도구와 스킬 없이는 접근할 수 없어 이미 아는 것만 답하기 때문이다. 즉 베이스라인 격차의 일부는 워크플로 능력이 아니라 도구 접근성에서 나온다. API 비용 때문에 GPT-5.4-mini, GPT-5.4, GPT-5.6-luna는 Braid의 5개 도메인 부분집합에서만 평가했다. 또한 전역 국소화는 거의 발동하지 않고 발동할 때 정확도를 떨어뜨리며, 실패를 포함한 프로파일은 해롭다는 것도 저자들이 확인한 한계다.