JevSpawn이 자연어 지시에서 유한 확률 행동 공간을 만들어 에이전트 추론을 가속한다

JevSpawn: Adaptive Agentic Inference through Compositional Action Spaces

HF Daily2610.00437

Haoyang Su, Weiran Huang2026-09-30조회 2

무엇인가

LLM 에이전트는 추론과 행동을 토큰 단위로 생성하고, 관측이 쌓이면서 다음 단계의 컨텍스트가 계속 커진다. 대안 행동을 탐색하려면 그만큼 생성 비용이 더 든다. 고정된 추론 예산 안에서 탐색의 폭과 상호작용 길이가 함께 제한되는 것이 이 논문이 푸는 문제다. 기존 연구는 모델 호출을 재배치하거나 중간 정보를 줄이는 방식으로 예산을 아꼈지만, 행동 자체를 다시 생성하는 비용은 남아 있었다. 저자들은 대안 행동들이 대개 같은 형식을 공유하고 인자 몇 개만 다르다는 점에 주목한다.

어떻게 동작하나

JevSpawn의 핵심은 행동 공간을 정책의 일부로 만드는 것이다. 각 분기 v에 대해 모델은 행동 선언 Σ_v = ({(r_j, D_j(·))}_{j=1}^{m_v}, g_v)를 구성한다. r_j는 필드 이름과 의미, D_j(·)는 앞선 할당 아래 허용되는 유한 값의 집합, g_v는 완성된 필드 값을 실행 가능한 행동으로 렌더링하는 함수다. 필드들은 b_1…b_L의 조건부 블록 단위로 평가되고, 완전한 할당 z의 확률은 각 블록 확률 Q̄_θ의 곱으로 정의된다(식 2). 즉 자연어 과제 명세와 상호작용 규칙에서 실행 가능한 유한 필드를 추론하고, 과제 규칙에 맞는 공통 문법을 따르되 빠진 필드는 컨텍스트에서 생성한다. 기존 Jev 계열이 필드를 미리 지정해야 했다는 제약을, 필드를 피드백으로 수정 가능한 정책 구성 요소로 바꿔 해소한 셈이다.

무엇과 다른가

탐색은 빔 폭 K로 유지된 할당들이 각각 자식 분기를 만들고, 부모 환경 상태의 독립 복사본에서 실행되어 자식 상태와 관측을 낳는 구조다. 관측이 돌아오면 유지된 분기들을 다시 점수화하므로 실행 후에도 행동 선호를 수정할 수 있고, 앞선 분기를 궤적 재생성 없이 재개할 수 있다. 선언 자체도 누적 피드백으로 개정되며, 답 제출이나 예산 소진 시 상호작용이 끝난다. 계산 측면에서는 선언된 값들이 이미 알려진 토큰 시퀀스라는 점을 이용해 인과적 은닉 상태를 병렬 평가하고, 어휘 항목에 사영해 확률을 Q̄_θ로 결합한다. 접두 재사용으로 B번 평가 시 처리 토큰 수가 B·n_p + Σn_b에서 n_p + Σn_b로 줄어든다(패딩과 값 접두 평가 이전 기준). 추가 학습은 없다.

어떻게 쓰나

실험은 Qwen3.8-27B를 사전학습 정책으로 쓰고 H100 4장, 텐서 병렬, bfloat16으로 돌렸다. 배치 8, 컨텍스트 16,384토큰, 생성 2,048토큰 제한, 최대 36회 탐색 라운드와 최종 제출, 300초 제한, 온도 0, 시드 42다. 확장마다 부모 하나에서 최대 4개의 서로 다른 행동을 생성한다. PPNL, Maze(LMRL Gym), Grid(LLF Bench), LightsOut·RushHour·Sokoban(TextArena), 2048·Nullify(KORGym)의 8개 과제에서 LATS, LLMCompiler, AgentPrune, HiAgent, FoldAgent, DyFlow, LatentMAS와 비교했다. 결과적으로 8개 중 5개 과제에서 최고 점수를 냈다. Maze 성공률 0.96, Grid 0.95로 FoldAgent의 0.52, 0.73을 크게 앞섰고, LightsOut 보상 0.61 대 AgentPrune 0.34, Nullify 보상 0.21 대 HiAgent·FoldAgent 0.09, 2048 점수 305.12 대 LLMCompiler 5.00이었다. 다만 PPNL, RushHour, Sokoban에서는 AgentPrune이 여전히 가장 강하다. 같은 아키텍처에서 TypeSafe Jev로 유한 점수를 대체한 변형은 PPNL, LightsOut(0.66 대 0.61), Sokoban에서 Qwen 점수 방식보다 나았고 Maze는 동률, Grid·RushHour·2048·Nullify는 낮았다. 효율에서는 Maze와 Grid에서 품질과 지연을 동시에 개선해, 가장 빨랐던 베이스라인의 47.91초·61.44초를 40.91초·40.58초로 줄였다. 반면 LightsOut은 111.05초(FoldAgent 84.17초), 2048은 169.94초(LLMCompiler 33.51초)로 점수가 오른 만큼 느려졌고, TypeSafe Jev 변형은 API 통신 포함 8개 과제 모두에서 Qwen 점수 방식의 1.4~2.1배 시간이 걸렸다. 텍스트 디코딩 처리량은 PPNL 544, LightsOut 580 토큰/초로 표에서 가장 높았다.

전제와 한계

절제 실험은 1,761개 인스턴스에서 확장 폭, 부모 할당, 선언 개정, 분기 정보 공유를 바꿔가며 이뤄졌다. 폭을 4에서 1로 줄이면 Maze 성공률이 0.88에서 0.16, Grid가 0.94에서 0.58, LightsOut 보상이 0.61에서 0.06으로 떨어져 병렬 생성의 기여가 크다는 것을 보인다. 폭을 10으로 늘리면 Maze는 전부 풀지만 Nullify 보상이 절반이 되고 RushHour 지연이 약 두 배가 된다. 행동 4개를 고정한 예산에서는 부모 2개×행동 2개 구성이 Maze와 Grid 모두 1.00을 기록해 1×4의 0.88, 0.94보다 좋았고, 4×1은 0.12, 0.75로 떨어지면서 2048 점수는 올렸다. 첫 유효 선언을 유지하면 Maze·LightsOut·Sokoban·2048 점수가 오르고 6개 과제에서 지연이 줄며, 관측을 현재 분기로 제한하면 Maze·Grid·LightsOut·RushHour가 좋아지는 대신 나머지 과제 점수와 8개 전부의 지연이 나빠진다. 마감이 없을 때 라운드 한도를 36에서 108로 늘리면 2048 점수가 315.16에서 1102.24, LightsOut 보상이 0.61에서 0.876으로 오르지만, 300초 마감 아래에서는 108라운드에서 2048 과제의 85퍼센트가 시간 초과된다.

개발자 관점에서 이 논문의 실용적 신호는 두 가지다. 첫째, 에이전트가 반복적으로 호출하는 도구·행동이 정해진 스키마를 공유한다면, 매번 전체 행동 문자열을 생성하는 대신 필드 값만 유한 확률로 예측하고 접두를 재사용하는 방식이 지연을 줄일 수 있다. 둘째, 이득은 과제 의존적이다. 항해(Maze, Grid)처럼 행동 구조가 좁고 반복적인 과제에서는 품질과 지연이 함께 개선됐지만, 퍼즐·수치 게임에서는 점수를 얻는 대신 시간을 더 쓴다. 도입 전에 자신의 워크로드가 어느 쪽에 가까운지, 그리고 300초 같은 마감 제약 아래에서 라운드 한도를 얼마로 둘지 확인해야 한다. 유한 점수를 TypeSafe Jev로 바꾸는 변형은 과제별로 승패가 갈리고 1.4~2.1배 느리므로, 정확도가 중요한 특정 과제에만 선택적으로 적용하는 편이 낫다.

저자들이 밝힌 전제와 한계는 분명하다. JevSpawn은 8개 과제 중 5개에서만 최고 점수를 냈고 PPNL·RushHour·Sokoban에서는 AgentPrune이 앞선다. Sokoban은 LLMCompiler 대비 1.50초 지연 마진과 낮은 점수 때문에 부트스트랩 재표집에서 파레토 프론티어 포함이 불안정하다. LightsOut과 2048은 점수가 오를수록 실행이 길어져 품질-지연 트레이드오프가 항상 개선되는 것은 아니다. 또한 방법은 사전학습 모델의 고정 파라미터를 그대로 쓰는 것을 전제로 하며, 선언 생성·개정·최종 답변에는 여전히 텍스트 생성이 필요하다. 마감이 있는 환경에서는 라운드를 늘려도 대부분의 2048 과제가 시간 초과된다는 점도 실무 적용 시 감안해야 할 제약이다.