에이전트 제어를 별도 추론으로 분리하면 긴 작업 성능이 오른다
Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning
무엇인가
긴 작업을 맡은 언어모델 에이전트는 한 문제에 수많은 모델 호출을 쓰는데, 그중 상당 부분은 다음에 무엇을 할지 정하는 데 쓰인다. 증명을 작성하는 수학 에이전트를 예로 들면, 핵심 보조정리가 검증되지 않은 후보를 들고 있을 때 그것을 검증할지, 이미 가진 논증을 다른 워커에게 검사시킬지, 아니면 접근을 통째로 버릴지를 골라야 한다. 기존 에이전트는 이런 제어 결정을 객체 수준 작업과 뒤섞어, 계속 누적되는 전체 이력에 조건을 걸어 단일 스텝으로 내린다. 논문은 이 결정이 그 자체로 하나의 에이전트 추론 과정을 가질 자격이 있다고 주장한다. 잘못된 판단은 소비한 연산보다 더 큰 대가를 치르게 해서, 실패한 접근을 실행 끝까지 끌고 가거나 이미 찾아낸 정답을 버리게 만들기 때문이다.
어떻게 동작하나
제안하는 것은 에이전트 메타 추론(agentic meta-reasoning)이라는 추론 시점 하네스다. 작업 수준 연산을 수행하는 워커와, 어떤 작업을 배정할지 결정하는 컨트롤러를 분리한다. 컨트롤러는 전체 이력을 재생하지 않고 실행에 대한 압축된 자기 서술 상태만 유지하며, 워커의 전체 출력은 영속 메모리에 남겨 필요할 때 꺼내 쓴다. 제어 주기는 네 단계로 돈다. Assess는 새로 나온 산출물을 반영해 상태를 갱신하고, Propose는 다음 후보 연산들을 명시적으로 나열하며(이 단계에는 남은 예산을 알려주지 않아 비싼 옵션도 후보에 들어온다), Evaluate는 남은 예산 아래에서 각 후보의 가치를 정성적으로 저울질하고, Dispatch는 선택된 제안을 워커 지시문과 컨텍스트로 바꿔 실행한다. 컨트롤러는 메모리 읽기·쓰기, 워커 배치 실행, 정지·선택이라는 행동을 할 수 있고, 워커는 단일 모델 호출일 수도 도구를 쓰는 코딩 에이전트일 수도 있다. 컨트롤러 호출도 워커와 같은 호출 예산에서 차감되므로, 추가된 숙고는 그 비용을 스스로 벌어야 한다. 각 워커가 어떤 선행 산출물을 컨텍스트로 받았는지 기록하면 아티팩트 그래프가 남는데, 이는 방향성 비순환 그래프로서 실행이 어디서 분기하고 무엇이 무엇 위에 쌓였는지를 보여준다.
무엇과 다른가
실험은 IMO ProofBench-Advanced, ARC-AGI-2, LongCoT-mini, ProgramBench 네 벤치마크에서 Gemini 3.1 Pro, GPT-5.5, Opus 4.8 세 모델로 수행했다. 추론 벤치마크는 100회, ProgramBench는 1200회 호출을 주 예산으로 삼았다. 워커와 행동 인터페이스를 고정하고 제어 방식만 단일 턴 누적 이력 기반으로 바꾼 Direct Control Agent와 비교했을 때, 주 예산 설정의 12개 매칭 비교 전부에서 메타 추론이 더 높았고 벤치마크별 평균 이득은 3.6~4.2점이었다. ProgramBench에서 GPT-5.5는 71.5%로 Codex의 58.0%, 직접 제어의 63.7%를 앞섰고, Opus 4.8은 67.2%로 Claude Code의 65.5%를 넘었다. IMO ProofBench-Advanced는 세 모델 평균 4.0점 향상에 Gemini 3.1 Pro가 8.6점으로 가장 컸고, ARC-AGI-2는 4.2점으로 가장 일관적이었으며(모든 모델 2.5~6.7점), LongCoT-mini는 3.6점 향상이지만 GPT-5.5의 0.4점부터 Gemini 3.1 Pro의 9.2점까지 편차가 컸다. mini-SWE Agent도 세 모델 모두에서 2.5~13.9점 차로 앞섰다.
어떻게 쓰나
예산을 늘렸을 때의 거동이 더 중요한 신호다. ProgramBench에서 GPT-5.5의 허용량을 400회에서 1200회로 늘리면 메타 추론은 64.1%에서 71.5%로 오르지만 직접 제어는 64% 근처에서 정체된다. 직접 제어는 1200회 허용량의 약 18%만 쓰고 일찍 멈추는 반면, 메타 추론은 모델에 따라 89~101%를 사용한다. 다만 일찍 멈추는 것만이 원인은 아니다. Opus 4.8의 직접 제어는 사용 호출 수가 376회에서 768회로 거의 두 배가 되는데도 점수는 62.7%에서 65.3%로 소폭 오르고 중간 예산에서 정점을 찍는다. 메타 추론이 항상 이기는 것도 아니다. Opus 4.8에서는 400회 예산에서 56.6% 대 62.7%로 뒤지다가 1200회에서 67.2% 대 65.3%로 역전한다. 단계적 제어의 오버헤드가 회수되기까지 시간이 걸린다는 뜻이다.
전제와 한계
진단 결과는 성능 향상이 어디서 오는지 분해한다. 메타 추론은 워커 산출물 자체도 더 많이 만들지만, 그보다 재사용 의존성이 훨씬 빠르게 늘어난다. IMO ProofBench-Advanced의 Gemini 3.1 Pro에서 워커 아티팩트는 약 두 배가 되는데 기록된 의존성은 자릿수 단위로 증가한다. ProgramBench의 GPT-5.5에서 예산을 400회에서 1200회로 늘리면 노드가 2.5배 이상, 엣지가 거의 4배로 늘어난다. 정답 발견(coverage)과 제출(selection)을 분리해 보면, Gemini 3.1 Pro가 IMO ProofBench-Advanced에서 20%포인트, LongCoT-mini에서 10%포인트 coverage를 올렸다. 워커 자기 확신은 정답 판별에 약해서, Gemini 3.1 Pro의 IMO ProofBench-Advanced에서 Type-2 AUC가 0.55로 거의 무작위 수준인 반면 컨트롤러의 판정은 0.88에 이른다. 최종 선택 이득은 균일하지 않아 ARC-AGI-2의 GPT-5.5에서는 메타 추론이 11%포인트, 직접 제어가 3%포인트였다. 메모리 사용에서도 컨트롤러는 자기 노트를 워커 산출물보다 훨씬 자주 다시 읽었고(ARC-AGI-2·LongCoT-mini에서 노트 평균 4.4~9.8회 대 워커 아티팩트 1.9~3.3회), 가장 긴 Opus 4.8 실행에서 직접 제어의 이력이 100만 자를 넘는 동안 메타 추론의 상태는 수천~수만 자 수준을 유지했다.
개발자 관점에서 이 논문이 주는 실무적 메시지는 두 가지다. 첫째, 에이전트 하네스를 만들 때 제어 로직을 객체 수준 작업과 분리하고, 상태를 압축해 유지하면서 원본 산출물은 영속 메모리에 두는 구조가 예산이 클수록 유리해진다. 둘째, 에이전트 성능을 볼 때 최종 점수만 보지 말고 coverage(정답이 실행 안에 등장했는가)와 selection(등장한 정답을 제출했는가)을 나눠 측정해야 한다. 논문의 분석에 따르면 ARC-AGI-2와 LongCoT-mini 실행의 83%가 가장 깊은 종단 산출물, 즉 수렴 프런티어에서 답을 제출하는데 그중 약 4분의 3은 프런티어에 후보가 여러 개라 선택 문제가 남는다. 즉 실패 원인이 탐색 부족인지 선택 실패인지에 따라 손봐야 할 부분이 완전히 다르다.
저자들이 밝힌 한계도 분명하다. 단계적 제어는 추가 연산을 쓰기 때문에 낮은 예산에서는 오히려 손해일 수 있고, 실제로 저예산 구간에서 교차가 관찰된다. 컨트롤러의 잘못된 평가는 오해를 낳는 상태를 전파하거나 다시 읽지 않은 좋은 부분 작업을 버릴 수 있으며, 압축된 상태는 손실이 있어 나중에 중요해지는 정보는 미래의 메모리 읽기에 의존해야 한다. LongCoT-mini의 체스 하위 집합에서는 메타 추론이 다른 모든 영역에서 크게 앞서면서도 직접 제어에 뒤졌는데, 저자들은 이미 맞은 답을 추가 검증·부연이 흔들어 놓는 비생산적 재고를 원인으로 추정하며 본격 분석은 향후 과제로 남긴다. 이득의 크기는 모델에 따라 달라서 Gemini 3.1 Pro는 추론 벤치마크에서, GPT-5.5는 ProgramBench에서 특히 강했고 Opus 4.8은 작지만 일관되게 양수였다. 또한 동일한 호출 예산이 동일한 토큰 비용이나 지연, FLOPs를 뜻하지는 않는다.