JOVE가 LLM 태스크 그래프에서 실행과 유료 검증을 함께 최적화한다
JOVE: Joint Execution and Verification for Resource-Aware LLM Task Graphs
무엇인가
복잡한 추론 질의를 하나의 거대 모델에 통째로 던지는 대신, 플래너가 질의를 방향성 비순환 그래프(DAG)로 분해하고 각 노드를 서로 다른 LLM에 배정하면 병렬 실행으로 지연을 줄이고 작은 모델로도 어려운 문제를 풀 수 있다. 문제는 두 가지다. 어떤 LLM이 특정 하위 작업에 적합한지는 사전에 알 수 없고, 실행만으로는 출력이 맞았는지 알 수 없다. 모델 호출은 비용과 지연은 드러내지만 정답 여부는 감춘다. 최종 응답에 대한 피드백만으로는 어느 노드의 어느 모델 배정이 틀렸는지 귀속시키기 어렵다. 이 논문은 그래서 노드 단위의 선택적 검증을 도입한다. 각 노드에는 좁게 정의된 하위 작업과 명시적 성공 기준이 있고, 검증 대상으로 뽑힌 노드의 작업·출력·기준을 고정된 검증기(사람 평가자나 판정 모델)에 보내 이진 정답 라벨을 받는다. 검증은 현재 응답 생성에 필요하지 않으므로 비동기로 돌아 지연에 영향을 주지 않지만, 그 비용은 장기 API 예산에 계상된다.
어떻게 동작하나
JOVE의 결정은 질의마다 한 번씩 푸는 혼합정수 선형계획(MILP)이다. 각 노드 i에 대해 실행 모델 a와 검증 여부 η를 함께 나타내는 이진 변수 z를 두고, 목표는 노드 정답률을 최대화하되 장기 평균 API 비용 예산 γ와 질의별 지연 확률 제약을 지키는 것이다. 예산 제약은 그림자 가격 λ로 처리한다. λ는 처음 0에서 시작해 질의 t의 실현 총비용 c_t가 예산 γ를 넘으면 올라가고 밑돌면 내려가며, λ_{t+1} = [λ_t + α_λ(c_t − γ)]_+로 갱신된다. 이 가격이 목적함수에서 비용 항에 곱해져 어려운 질의에 더 쓰고 쉬운 질의에서 아끼는 식의 질의 간 결합을 만든다. 지연 제약은 노드별 지연 분위수로 쪼갠다. 위반 허용치 δ_t를 모든 노드에 나눠 δ_t^i = δ_t/|N_t|로 두고, 각 노드·후보 모델마다 확률 1−δ_t^i로 지켜지는 최소 마감 시간을 구한 뒤, 종료 시각 변수 F에 대한 선형 부등식으로 임계 경로가 마감 안에 끝나도록 강제한다. 이 축소는 보수적일 수 있지만 노드 지연 간 독립성을 가정하지 않아도 된다.
무엇과 다른가
온라인 구간에서는 알 수 없는 계수를 추정치로 바꾼다. 모델 품질은 작업 지시문·상류 출력 설명·후보 모델 설명을 임베딩한 특징 벡터에 대해 릿지 회귀를 돌리고, LinUCB 방식으로 불확실성 점수 u를 더해 상한(UCB)을 만든다. 비용과 지연은 실행만으로 관측되므로 추가 비용 없이 갱신된다. 검증은 정답 라벨을 사야 하므로, JOVE는 D-최적 기준으로 얻는 정보 이득 I = ½log(1+u²)에 가중치 k_v를 곱해 목적함수에 보너스로 넣는다. 이 항은 파라미터 신뢰 타원체의 로그 부피 감소량과 같아서, 과거 관측이 적은 방향의 특징 벡터일수록 크다. 검증 여부는 결국 임계값 결정이 된다. k_v·I/|N_t| ≥ λ_t·m̃(검증 비용)이면 검증하고 아니면 하지 않는다. 검증의 가치가 실행기 선택에도 영향을 주기 때문에, JOVE는 당장 품질 점수가 더 높은 모델 대신 나중에 쓸모 있는 피드백을 주는 모델을 고를 수 있다. 저자들은 품질 모델이 고정 파라미터 θ*로 선형이고 검증 라벨이 무편향 부분가우시안 잡음을 가진다는 가정 아래, 검증 가중치 k_v가 특정 구간 [K_T, 2K_T]에 있으면 품질 학습 후회가 O(T^{2/3}[log(1+T)]^{5/6})로 준선형임을 증명한다.
어떻게 쓰나
실험은 Bamboogle(멀티홉 QA), MMLU-Pro(학제간 추론), GPQA(과학), LiveBench-Reasoning(구조화 추론) 네 벤치마크에서 수행했다. 플래너는 Gemini-2.5-Flash-Lite, 검증기는 Qwen3-235B-A22B-2507, 실행기 풀은 OpenRouter를 통해 접근하는 크기가 다른 8개 모델이다. 참조 모델 Qwen3-32B의 Bamboogle 평균 비용·지연을 기준으로 예산 γ = 2.0×10⁻⁴ USD, 데드라인 μ_t = 16초를 잡았고, k_v = 5.0, β_t = 0.25, λ_reg = 1, α_λ = 100, δ_t = 0.1을 썼다. 결과는 네 벤치마크 평균 정확도 49.5%, 질의당 2.24×10⁻⁴ USD, 7.09초였다. 추론 수준 베이스라인인 CoT·SoT·Plato와 비교해 비슷한 평균 정확도를 유지하면서 비용은 3.7~16.3배, 지연은 8.3~17.0배 낮다. 지연 제약이 없는 WR-Online은 평균 정확도 43.8%에 그쳤고 평균 지연은 JOVE의 2.7배였다. 자원 제약을 지키는 휴리스틱인 Knapsack-ascend와 Knapsack-descend는 비슷한 자원을 쓰고도 평균 40.1%, 40.3%로 JOVE보다 각각 9.5점, 9.2점 낮았다. 분해 없이 한 번만 호출하는 JOVE single-node는 가장 싸고 빠르지만(1.68×10⁻⁴ USD, 2.08초) 정확도가 36.8%로 가장 낮아, 작업 분해와 노드 단위 검증이 기여하는 몫을 보여준다.
전제와 한계
검증 분석도 눈에 띈다. 검증된 노드 수 n과 검증기가 틀렸다고 판정한 노드 수 k로 질의를 묶으면, k가 늘수록 최종 정답률이 단조 감소한다. 다만 검증된 노드 5개가 모두 정답 판정을 받은 경우(n=5, k=0)에도 최종 정답률은 100%가 아니라 87.3%였다. 저자들은 이를 검증기 잡음이나 노드 수준 성공 기준과 최종 정답 사이의 불완전한 정렬 가능성으로 설명한다. 검증 가중치 k_v를 GPQA에서 쓸어보면 k_v < 1.5에서는 검증이 드물어 정확도가 낮고, k_v ∈ [2, 6]에서 정확도가 개선된 뒤 안정적으로 유지되며, k_v > 6에서는 검증이 예산을 잠식해 정확도가 다시 떨어진다. 제약 충족 측면에서는 학습이 진행될수록 구간 평균 비용이 예산 이하로 내려가고, 마감 충족률이 네 데이터셋 모두 마지막 구간에서 90% 목표 대비 96% 이상에 도달했다.
실무적으로 이 논문이 건드리는 지점은 명확하다. 여러 모델을 조합한 에이전트 워크플로를 운영할 때, 어느 노드에 비싼 모델을 쓸지와 어느 노드 출력을 검증할지를 예산·데드라인이라는 두 제약 아래에서 매 질의 다시 푸는 문제는 라우팅 레이어를 직접 구현하는 팀이 곧바로 마주치는 문제다. 특히 검증 비용을 단순 오버헤드가 아니라 미래 배정을 개선하는 정보 투자로 취급하고, 그 값을 D-최적 정보 이득으로 정량화해 실행기 선택과 같은 목적함수에 넣는 방식은 참고할 만하다. 다만 도입 전에 확인할 것은 검증기 품질이다. 노드 판정이 틀리면 학습 신호 자체가 오염되고, 위 실험에서도 노드 정답과 최종 정답 사이에 12.7%포인트의 간극이 남았다. 또한 이 접근은 플래너가 만든 DAG와 노드별 성공 기준이 이미 주어져 있다는 전제 위에 서 있다.
저자들이 밝힌 한계도 분명하다. 오라클 설정에서의 예산·지연 보장은 온라인 추정치를 쓰는 실제 정책으로 그대로 이어지지 않으며, 제약 충족은 자원 추정 정확도와 예산 가격 적응에 달려 있다. 이론 분석은 품질이 고정 선형 모델을 따르고 검증 라벨이 무편향이라는 가정, 추정 가능 집합이 비어 있지 않고 MILP를 최적으로 푼다는 가정에 기댄다. 지연 제약을 노드별 분위수와 합집합 한계로 축소한 것은 보수적일 수 있고, 정리에서 제시한 k_v 구간은 준선형 후회를 보장하는 충분조건일 뿐 최적의 k_v를 알려주지는 않는다. 이론의 T ≥ 8d·log(8n_max) 조건도 보수적이며, 특징 차원 d를 줄이면 이 문턱은 낮아지지만 품질 모델의 표현력이 제한될 수 있다.