DAGent가 노드 증거를 보고 DAG를 키워 딥리서치 계획을 점진적으로 세운다

DAGent: Evaluate-then-Grow Planning for Deep Research Agents

HF Daily2609.39154

Hanwen Liu, Yuanfu Sun, Qiaoyu Tan2026-09-30

무엇인가

딥리서치 과제는 넓은 지식 공간을 탐색하고 여러 출처의 증거를 종합하며, 중간 발견에 따라 계획을 바꿔야 한다. DAG 기반 멀티에이전트 시스템은 병렬 실행과 하위 과제별 의존성 격리라는 점에서 이에 잘 맞지만, 기존 시스템은 대부분 실행 전에 과제 전체를 덮는 계획을 먼저 확정하고 실패나 증거 부족이 관측된 뒤에야 그래프를 수리한다. 논문은 이를 Plan-then-Patch라고 부르며, 시스템이 문제를 가장 얕게 이해하는 시점에 가장 강하게 커밋하고, 이후 수정이 애초에 계획하지 말았어야 할 분기에 연산을 낭비한다고 지적한다.

어떻게 동작하나

제안하는 DAGent는 이를 Evaluate-then-Grow 증분 계획으로 대체한다. Orchestrator가 과제 DAG를 한 번에 한 배치씩 키우면서, 완료된 노드의 신뢰도·불확실성 신호에 따라 다음 확장을 조건화한다. 각 노드는 하위 과제 설명, 실행 프롬프트, 의존 노드 집합, 상태를 담고, 실행 후에는 답변·설명·핵심 실행 단계·신뢰도·불확실성을 담은 압축 요약 QueryDoc을 낸다. Orchestrator는 직전 배치의 각 노드에 Success, Uncertain, Not Found 중 하나를 부여하고, Uncertain이나 Not Found인 노드는 refine 노드로 확장한다. 이 시도는 노드당 최초 실행 1회와 refine 2회, 총 3회로 제한된다. 같은 배치 안에서 의존 관계가 없는 노드는 병렬 실행되고, Orchestrator가 answer 타입 노드를 배치에 넣으면 종료된다. 이 노드는 반드시 단독 배치여야 최종 종합이 의도한 상위 증거에 접근할 수 있다.

무엇과 다른가

컨텍스트는 계층적으로 다룬다. 기본 정책인 Selective Propagation에서는 노드가 직접 의존 노드의 QueryDoc만 받으므로, 각 노드의 컨텍스트가 그래프 깊이나 전체 노드 수가 아니라 자신의 fan-in으로 제한된다. 압축 요약으로 부족할 때, 예컨대 인용문의 정확한 표현이나 이전에 기각된 후보가 필요할 때는 Executor가 RecallTool로 직접 의존 노드의 전체 InteractionTranscript에서 목표에 맞는 증거 조각만 추출한다. RecallTool은 기본이 아니라 예외 경로로, Qwen3-32B 실행에서 BrowseComp-Plus·GAIA·xbench-DeepSearch 각각 22.0%, 13.6%, 11.0%의 과제에서만 호출됐다.

어떻게 쓰나

DAGRPO는 이렇게 턴 단위로 기록된 DAG 위상을 RL 신호로 바꾼 GRPO 변형이다. 결과만 보는 GRPO는 궤적 수준 보상을 모든 롤아웃에 균일하게 주지만, DAG에서는 위치마다 최종 답에 기여하는 정도가 다르다. DAGRPO는 answer 노드와 그 모든 조상을 합집합으로 묶은 answer-inclusive closure를 정의하고, 이 안에 있는 Executor 롤아웃은 보상 R(τ)을 그대로 받되 바깥 롤아웃은 계수 α로 감쇠한다. 실험에서는 α=0.5를 썼고, α=0이면 오프체인 학습이 붕괴해 GRPO 베이스라인 아래로 떨어지며 α=0.25는 개선분의 75/62/37%만 남긴다. 여기에 Orchestrator 계획이 상태 부여 누락, refine 노드 미생성, answer 노드의 단독 배치 위반, 중복 프롬프트, 파싱 불가 JSON 같은 구조 규칙을 어긴 횟수 N(τ)에 대해 r_proc(τ) = -λ_proc·min(N(τ), K_proc) 벌점을 더한다.

전제와 한계

실험은 BrowseComp-Plus(680/150 학습·평가 분할, Qwen3-Embedding-8B 로컬 검색), GAIA(텍스트 전용 103과제 검증 부분집합), xbench-DeepSearch 2505 릴리스(중국어 100과제)에서 이뤄졌다. Qwen3-32B에서 DAGent는 47.3/55.3/65.0 Pass@1로, 해당 스케일 최강 베이스라인인 FlowSearch를 4.0/3.8/2.0점 앞서고 나머지 베이스라인 최강 대비 6.0/10.6/7.0점 앞선다. 이 우위는 8B(+5.3/+7.8/+5.0)와 235B-A22B(+5.3/+5.8/+2.0)에서도 유지되며, Qwen3-32B·Seed-OSS-36B·GLM-4-32B·Nemotron-3-Nano-30B 네 벤더 백본에서 재현되고 327K 컨텍스트의 GPT-5에서도 최강 보고 베이스라인을 5.7/2.5/2.0점 앞선다. Qwen3-8B에서 DAGRPO는 학습 없는 DAGent의 40.0/46.6/60.0을 세 시드 평균 49.6/53.4/65.7로 끌어올려, 동일 예산의 결과 전용 GRPO 베이스라인을 3.6/2.6/2.7점(평균 3.0점) 앞선다.

절제 실험은 이득의 출처를 분리한다. Evaluate-then-Grow를 Plan-then-Patch로 바꾸면 5.3/4.8/4.0점이 빠지고, 재계획 없는 단일 사전 계획으로 더 축소하면 8.7/7.8/6.0점이 추가로 빠져 총 14.0/12.6/10.0점이 손실된다. 컨텍스트 구성요소는 Selective Propagation(12.6/10.6/8.0) > QueryDoc(8.0/7.7/5.0) > InteractionTranscript(4.0/2.9/2.0) 순으로 중요했다. DAGRPO에서는 위상 조건부 크레딧 제거가 2.3/1.9/1.7점, 구조 준수 정규화 제거가 1.6/1.0/0.7점을 깎았다. 효율도 함께 본다. Qwen3-32B에서 과제당 평균 42.7/31.2/26.8 스텝, 67.6/36.8/32.9 툴콜, 1.20M/0.66M/0.44M 토큰을 썼고, 같은 아키텍처에서 Plan-then-Patch는 오프체인 Executor 비율을 0.25/0.20/0.18에서 0.40/0.30/0.25로 올리며 토큰 40/29/18%, 스텝 28/21/21%, 외부 툴콜 35/27/21%, 벽시계 시간 35/27/23%를 더 쓰고도 정확도는 5.3/4.8/4.0점 뒤진다.

실무 관점에서 이 논문이 주는 시사점은 명확하다. 딥리서치 에이전트의 병목이 컨텍스트 압축만이 아니라 계획 확정 시점이라는 것, 그리고 계획을 늦추면 정확도와 비용을 동시에 얻을 수 있다는 것이다. 또 DAG를 append-only로 유지하면 "최종 답으로 이어지는 사슬"이라는 구조 신호를 학습에 쓸 수 있지만, 노드를 나중에 삭제·재배선하는 Plan-then-Patch 궤적에서는 그 신호가 성립하지 않는다는 점도 설계 시 확인해야 할 지점이다.

저자들이 명시한 전제와 주의점도 있다. answer-inclusive closure는 인과적 기여도가 아니라 기록된 그래프에서 읽어낸 구조적 대리 지표이며, 재실행 없이 계산된다. 학습 시 의존 엣지를 부풀려 이 신호를 악용할 수 없다는 설명은 부록 B에 있다. 절제 실험의 일부 행은 단일 시드라 벤치마크별 작은 차이는 시드 노이즈 범위에 들어가고, 저자들은 두 신호의 근거를 모든 벤치마크에서 부호가 일치한다는 점과 Overall 차이(-2.0, -1.1)로 제시한다. 또한 answer 타입 노드가 없는 궤적에서는 α=1로 되돌려 결과 전용 GRPO 동작을 복원한다. 방법 전체가 증분 루프에 의존하므로, 이 루프를 제거하면 컨텍스트 계층과 DAGRPO가 모두 약해진다고 저자들은 밝힌다.