LLM 에이전트가 선언한 계획을 실행하도록 강제하면 성공률이 오른다

Do LLM Agents Execute the Plans They Declare? From Planning-Mode Declaration to Pattern-Specific Execution

arXiv2609.38108v1

Subba Reddy Oota2026-09-29조회 3

무엇인가

LLM 기반 에이전트는 긴 호라이즌 과제를 풀 때 계획을 세우고 환경에서 실행한다. 그런데 계획이 성공하려면 서로 다른 두 능력이 필요하다. 과제에 맞는 계획 모드를 고르는 능력과, 고른 계획을 충실히 실행하는 능력이다. 기존 planner–executor 시스템은 둘 중 어느 단계에서든 실패할 수 있는데, 최종 과제 성공률만 보면 선택 실패와 실행 실패를 구분할 수 없다. 저자들은 이 간극을 Plan Declaration–Execution Gap이라 부르고 네 가지 질문을 던진다. 선언한 계획을 실제로 실행하는가(RQ1), 환경과 모델에 따라 유리한 계획 모드가 다른가(RQ2), 선언한 모드를 대응 실행기로 실행하면 성공률이 오르는가(RQ3), LLM이 과제에 맞는 모드를 고르는가(RQ4).

어떻게 동작하나

제안 방법은 Planning-as-Routing이다. LLM이 predefined, sequential, hierarchical, search 네 가지 계획 모드 중 하나를 선언하면, 결정적 라우터가 추가 모델 추론 없이 해당 패턴 전용 실행기로 과제를 보낸다. predefined 실행기는 실행 전에 완성된 계획을 만들고 재계획 없이 그대로 따른다. sequential 실행기는 planner–executor–replanner 루프로 현재 단계를 실행하고 결과를 관찰한 뒤 남은 계획을 필요할 때 수정한다. hierarchical 실행기는 오케스트레이터–워커 구조로 과제를 하위 목표로 분해해 위임하고 결과를 취합한다. search 실행기는 여러 후보 계획을 생성해 각각 독립적으로 실행하고, 루브릭 기반 판정자로 가장 유망한 궤적을 고른다. 여기에 규칙 기반 실행 구조 검증기를 붙여 Plan+ReAct 궤적이 선언한 단계를 순서대로 실행했는지 확인한다. 실행 불가능한 텍스트를 제거한 뒤 벤치마크별 규칙으로 단계와 행동을 매칭하고, 채점 가능한 모든 단계가 선언 순서대로 매칭되어야 구조 유지로 인정하며 단계 사이의 추가 행동은 허용한다. 라우팅 실행은 실행기 디스패치 기록이 순서 충실성을 구조적으로 보장하므로 이 방식으로 채점하지 않는다.

무엇과 다른가

실험은 세 조건을 비교한다. 계획 선언이 없는 Flat ReAct, 계획을 선언하지만 강제하지 않고 같은 flat ReAct 실행기에 문맥으로만 넘기는 Plan+ReAct, 그리고 Planning-as-Routing이다. 벤치마크는 웹 내비게이션 Mind2Web과 WebArena, 소프트웨어 엔지니어링 SWE-bench Verified, 체화 과제 ALFWorld 네 개이며, 백본 모델은 Qwen3.6-35B-A3B, DeepSeek-V4-Flash, Gemma-4-26B 세 개다. 시드 7, 13, 42로 반복 실행해 평균과 표준편차를 보고한다. 지표는 벤치마크 표준 과제 성공률(ALFWorld·WebArena는 TSR, Mind2Web은 TSR과 SSR, SWE-bench는 PSR)과 과정 지표인 계획 품질, 계획 준수, 구조 충실성이다. 계획 품질과 준수는 0–3 GPA식 루브릭을 쓰는 LLM-as-judge로 채점한다. 실행 한계와 선택 실패를 분리하기 위해 forced dispatch로 모든 과제에 모든 모드를 실행해 과제–모드 성공 행렬을 만들고, 고정 모드 성공 S(p), 최고 고정 모드 S*=max_p S(p), 과제별 오라클 상한 DSR_max=(1/N)Σ_i max_p m_{i,p}, 라우팅 여지 H=DSR_max−S*를 계산한다. 선언 정책 π의 성공률은 TSR(π)=(1/N)Σ_i m_{i,π(i)}로 실행기 재실행 없이 같은 행렬에서 구한다.

어떻게 쓰나

RQ1의 결과는 명확하다. Plan+ReAct는 선언한 계획 구조를 잘 보존하지 못한다. ALFWorld, Mind2Web, SWE-bench에서 선언 구조를 유지한 궤적은 22~45%뿐이다. 계획이 길어질수록 더 나빠져서, ALFWorld에서 4~5단계 계획은 36.5~49.6%가 유지되지만 6~7단계는 4.8~21.4%로 떨어지고 더 길면 거의 0에 수렴한다. Mind2Web도 비슷하게 감소하고 SWE-bench도 짧은 계획에서 중간 길이로 가면서 같은 양상을 보인다. WebArena는 평균 계획 길이가 3.3~3.8단계인 짧은 계획 경계 사례로 유지율이 65.6~69.1%로 높다. 모드별로 보면 hierarchical 계획이 특히 어려워 ALFWorld, Mind2Web, SWE-bench에서 구조 유지가 대개 25% 미만이고 search도 선언이 충분히 있는 경우 비슷한 양상을 보인다. 검증기 신뢰도는 ALFWorld Plan+ReAct 궤적 100개에 대해 사람 주석자 두 명과 비교해 κ=0.31/0.34로 사람–사람 일치 κ=0.35와 비슷한 수준이다. 구조 충실성과 계획 준수는 다른 속성이다. ALFWorld에서 짧은 sequential 계획은 거의 전부 완료되지만 10~13개 실행 단위를 가진 hierarchical 계획은 준수율이 약 79~85%로 낮다.

전제와 한계

RQ2는 강제 패턴 상한을 측정한다. 가장 강한 패턴은 벤치마크–모델 쌍마다 다르다. ALFWorld, Mind2Web, WebArena에서는 DeepSeek-V4와 Qwen3.6-35B 모두 search가 최강이고, SWE-bench와 ALFWorld의 Gemma-4-26B는 hierarchical, Mind2Web의 Gemma-4-26B는 predefined가 최강이다. 오라클은 모든 벤치마크–모델 쌍에서 최고 고정 패턴을 능가하지만, 오라클은 여러 번의 독립 실행 기회를 주므로 과제별 상보성의 직접 증거가 아니라 경험적 상한으로 봐야 한다. 실제로 최강 고정 패턴을 3회 재시도하면 잔여 오라클 격차는 ALFWorld, Mind2Web, SWE-bench에서 −0.025~+0.027에 불과하다. search를 제외한 오라클도 ALFWorld에서 0.898, 0.843, 0.781이고 hierarchical 3회 재시도는 0.963, 0.896, 0.813으로, 남은 격차의 상당 부분이 과제별 패턴 상보성이 아니라 반복 실행으로 설명된다. 판정된 계획 품질과 성공률의 연결도 약하다. DeepSeek-V4는 sequential이 최고 품질 2.84±0.03인데 성공률은 0.64±0.02로 search의 0.91±0.03보다 낮고, Qwen3.6-35B는 hierarchical이 최고 품질 2.82±0.00인데 search가 0.79±0.00으로 최고 성공률을 내면서 품질은 최저 1.94±0.17이었다. 과제 수준 상관은 |r|≤0.181에 그친다.

RQ3에서 패턴 전용 실행의 효과는 크다. ALFWorld에서 DeepSeek-V4는 Plan+ReAct 0.480에서 최강 고정 패턴 0.918로, Qwen3.6-35B는 0.540에서 0.796으로 오른다. SWE-bench Verified에서 DeepSeek-V4는 0.360에서 0.442로 오른다. 반면 Routing@1은 최강 고정 패턴에 못 미친다. WebArena에서 search가 0.580과 0.577(각각 DeepSeek-V4, Qwen3.6-35B)인데 Routing@1은 0.460과 0.404다. 실행기는 준비돼 있지만 선언이 최강 패턴을 고르지 못한다는 뜻이다. 롤아웃을 맞춘 통제에서도 search는 3회 독립 Flat ReAct 실행 뒤 같은 판정자를 붙인 조건보다 ALFWorld에서 0.117~0.381, WebArena에서 0.153~0.233 높다. RQ4는 선언이 과제별 정보를 담는지 순열 검정으로 확인한다. 과제–모드 연관을 제거하되 모델의 전체 모드 빈도는 유지한 task-blind null과 비교해 Δ(π)가 5,000회 순열 null의 95% 구간(−0.025~+0.009, 최소 단측 p=0.094) 안에 들어, 현재 선언이 과제별로 모드를 더 잘 맞춘다는 신뢰할 증거가 없다. few-shot 예시는 대부분 설정에서 top-1 선언 성능을 올린다. ALFWorld의 DeepSeek-V4가 0.656에서 0.812로(+0.156) 가장 크게 오르고, Mind2Web은 최대 +0.018, SWE-bench는 최대 +0.027, WebArena는 최대 +0.054다.

개발자 관점에서 핵심은 계획을 프롬프트 문맥으로 넣는 것과 실행 제어 흐름을 바꾸는 것이 전혀 다르다는 점이다. 긴 과제일수록 격차가 커져서, ALFWorld에서 Flat ReAct와 Plan+ReAct는 과제가 길어지면 성공률이 급격히 무너지는 반면 hierarchical과 search 실행은 상대적으로 견고하게 버틴다. 실무에서는 계획 모드를 명시적으로 선언하게 하고, 그 선언을 결정적 라우터로 전용 실행기에 연결하고, 궤적에서 구조 충실성을 별도로 검증하는 3단 구성을 고려할 만하다. 최종 성공률만 보면 선택 실패와 실행 실패를 구분할 수 없으므로 구조 유지율, 계획 준수, 계획 품질 같은 과정 지표를 함께 봐야 한다. 계획 품질 점수가 높다고 성공률이 높지 않다는 결과도 판정 파이프라인을 그대로 신뢰하면 안 되는 이유가 된다.

저자들이 밝힌 한계는 분명하다. 네 가지 계획 패턴과 고정 실행 예산 아래의 과제 수준 라우팅만 다루며, 실행 중 모드 전환, 동적으로 조합되는 전략, 구조 충실성과 행동 정확성·실행 비용·복구 행동을 함께 평가하는 것은 향후 과제로 남긴다. 오라클 상한은 여러 독립 실행 시도를 포함하므로 과제별 상보성의 직접 증거가 아니라 경험적 상한으로 해석해야 한다. few-shot 선언에 쓰인 데모 과제는 채점에서 제외했고, null 베이스라인과 순열 검정은 주요 결과 이후에 지정된 사후 분석이다. 벤치마크 과제는 추론에만 사용했고 모델 파라미터를 학습하거나 적합하지 않았다.