LLM 에이전트가 반복 작업을 싼 산출물로 바꾸는 능력을 재는 BOTTLED

Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?

arXiv2610.08775v1

Ankit Sonthalia2026-10-06

무엇인가

LLM 에이전트는 상품 설명에서 기기 사양을 뽑아내거나 재무 보고서를 구조화 레코드로 바꾸는 식의 좁고 반복적인 작업에 점점 더 많이 쓰인다. 문제는 인스턴스마다 범용 LLM을 호출하면 총 추론 비용이 인스턴스 수에 거의 선형으로 늘어난다는 점이다. 그런데 각 작업이 요구하는 것은 모델 능력의 좁은 일부일 뿐일 수 있다. 이 논문은 이 지점에서 '병입(bottling)'이라는 능력을 정의한다. 일반 능력을 답변 품질과 상각 비용 사이의 균형을 맞춘 작업 특화 해법으로 바꾸는 능력이다. 저자들은 사람이 관련 질의에 이전 추론을 재사용한다는 확률 추론 연구(Gershman & Goodman, 2014)를 근거로, LLM 에이전트도 낯선 워크로드에서 노력을 상각할 기회를 인식하고 활용할 수 있는지 묻는다.

어떻게 동작하나

BOTTLED는 이 능력을 재는 벤치마크다. 작업 τ는 자연어 지시 d_τ, 입력 공간, 출력 공간으로 정의되며, 하나의 고정 지시가 모든 인스턴스에 같은 매핑을 지정하면 '좁은' 작업이라 부른다. 워크로드는 라벨 없는 N개 인스턴스의 집합이고 N은 수백만 규모다. 에이전트는 지시와 전체 워크로드를 파일 하나로 한꺼번에 받고, 토큰·시간 예산 B=(B_tok, B_time)을 함께 받는다. 산출물은 φ: X→Y라는 하나의 아티팩트이며, 에이전트는 이걸 만들어 전체 워크로드에 적용한다. φ의 형태에는 제약이 없다. 규칙 기반 프로그램, 파인튜닝한 소형 언어모델, 검색 인덱스, 어려운 부분집합만 다시 자기 모델로 라우팅하는 하이브리드 모두 허용된다. 비용은 구축 비용 C_build(탐색·라벨링·학습·검증)와 실행 비용 Σ c_exec로 나뉘고, 실행 비용은 실험에서 거의 항상 0이었다. 목표는 두 예산 제약 아래 워크로드 수준 점수를 최대화하는 것이며, B_tok이 제로샷 전체 비용보다 훨씬 작게 설정되므로 모든 인스턴스에 모델을 돌리는 선택지는 애초에 배제된다. 호출 비용은 c(M(p)) = t_in + (1/10)t_cache + 2t_out으로 계산해 출력 토큰에 가장 큰 가중치를 준다.

무엇과 다른가

과제는 실제 반복 워크로드를 닮은 세 가지다. MAVE는 아마존 리스팅에서 뽑은 약 477만 개의 상품-속성 쌍으로, 속성 값이 본문에 없으면 전용 no-value 토큰으로 기권해야 하며 F1으로 평가한다. ESCI는 약 262만 개의 질의-상품 쌍을 Exact/Substitute/Complement/Irrelevant 네 클래스로 분류하는 작업으로 클래스 불균형 때문에 macro-F1을 쓴다. RAID는 약 562만 개 문서가 사람이 쓴 것인지 언어모델이 쓴 것인지 판별하는 작업으로 AUROC를 쓴다. 모든 실험은 OpenCode라는 동일한 하네스에서 수행해 하네스 효과를 분리했고, A100 40GB 한 장과 8코어 CPU, 64GB RAM, 10시간, 500만 토큰이 주어진다. 에이전트는 자기 자신의 Completions API만 호출할 수 있고, 인터넷은 프록시를 거치며 벤치마크 데이터셋이나 라벨로 학습된 모델을 호스팅하는 URL은 차단된다. 예산이 소진되면 하네스가 실행을 종료하고, out.txt가 없거나 불완전하면 정보량이 없는 폴백 답으로 채점한다. 집계 점수 R(M)은 폴백 베이스라인과 정답 상한 사이의 격차를 얼마나 닫았는지로 정규화한다.

어떻게 쓰나

10개 모델, 3개 과제, 모델·과제당 2회 실행으로 총 60회를 돌린 결과는 냉정하다. 60회 중 48회가 해당 모델 제로샷 성능의 95% 신뢰구간 아래에 머물렀고, 40회는 그 과제에서 가장 낮은 제로샷 모델의 95% 신뢰구간보다도 낮았다. 병입 점수의 분포 폭은 제로샷 점수 분포 폭보다 MAVE에서 5배, ESCI에서 3배, RAID에서 2배 이상 컸다. MAVE에서 GPT 5.6 Terra와 Sonnet 5는 제로샷 F1이 둘 다 약 0.44였지만 병입 F1은 0.405와 0.154로 갈렸다. ESCI에서는 GLM 5.3이 제로샷 0.593에서 병입 0.497로 약 84%를 유지한 반면, 제로샷이 0.573으로 비슷했던 GPT 5.6 Terra는 0.265로 약 46%만 남겼다. 집계 상대 이득은 Opus 5가 약 42%로 1위, GLM 5.3 Flash와 Gemini 3.1 Pro가 각각 약 39%였는데, 이들의 제로샷 집계 이득은 각각 약 61%, 54%, 59%였다. Gemini 3.1 Flash-Lite는 제로샷 이득이 약 47%인데 병입 이득은 약 5%에 그쳤다.

전제와 한계

비용 효율은 양극단이 뚜렷하다. GLM 5.3 Flash는 1달러 미만으로 약 39%의 집계 이득을 내며 더 비싼 모델 대부분을 앞섰고, Opus 5는 약 29달러로 42%, GPT 5.6 Sol은 약 12달러로 6%에 머물렀다. 같은 500만 토큰을 GLM 5.3 Flash로 라벨링해 Qwen3-0.6B와 SmolLM2-360M-Instruct를 튜닝하는 순진한 증류 베이스라인과 비교하면, 60회 중 31회가 더 나은 학생 모델보다 낮았고 21회는 두 학생 모두보다 낮았다. 반대로 6회는 제로샷 성능의 95% 이상을 회복했다. Opus 5는 MAVE에서 병입 F1 0.461을 약 31.40달러에 달성했는데, 제로샷 0.483의 전체 워크로드 추정 비용이 약 27,914달러였으니 약 889배 저렴하다. ESCI에서는 병입 macro-F1 0.499를 26.28달러에 기록해 제로샷 0.609의 약 82%를 약 657배 낮은 비용으로 유지했다.

논문은 값싼 반복 추론 전용 '시스템 원' 모델 Jev와도 비교한다. Jev는 자유 텍스트를 생성하지 못해 MAVE에는 쓸 수 없다. ESCI에서 Opus 5의 병입 macro-F1 0.499는 Jev의 0.531에 대해 약 94%를 유지하면서, Jev의 전체 워크로드 추정 비용 104.89달러의 약 25%인 26.28달러에 끝났다. RAID에서는 Gemini 3.1 Pro가 AUROC 0.822로 Jev의 0.846에 대해 97% 이상을 달성했고 비용은 약 2%(4.69달러 대 223.16달러)였다. 예산 관리 실패도 두드러진다. 60회 중 21회가 토큰 예산 소진으로 하네스에 의해 종료됐고, 그중 8회는 out.txt 자체를 제출하지 못했으며 GPT 5.6 Sol이 그 8회 중 4회를 차지했다. 예산 초과 시 종료를 끄고 21회를 재실험해도 47회가 여전히 제로샷 95% 신뢰구간 아래였다. 다만 Opus 5는 RAID에서 0.713에서 0.929로 뛰어 제로샷을 넘어섰고, GPT 5.6 Sol은 MAVE에서 0.386(제로샷의 90%), RAID에서 0.800(약 86%)까지 올라왔다. ESCI는 0.074 상승에 그쳐 제로샷의 약 49%에 머물렀다.

예산과 무관한 실패도 많다. 60회 중 39회는 에이전트가 스스로 완료를 선언하고 끝났는데, 그중에는 명백한 오판이 있었다. Gemini 3.1 Flash-Lite는 ESCI 실행에서 read 도구 출력이 50KB로 잘리며 'lines 1-49' 경고를 냈는데도 이를 무시하고 워크로드가 49개뿐이라고 결론지어, 49개 답만 담은 파일을 제출하고 약 495만 토큰을 남긴 채 완료를 선언했다. Sonnet 5는 MAVE 두 회차에서 파인튜닝 없이 기성 소형 모델 Qwen2.5-1.5B-Instruct를 그대로 돌려 F1 0.194와 0.113을 기록했고(제로샷 0.444), 각각 468만·100만 토큰을 소모했다.

저자들이 밝힌 전제와 한계는 이렇다. 예산 관리 자체가 하나의 능력이며, 대부분의 에이전트에서 병입 격차는 예산 때문만이 아니라 의사결정 실패에서 비롯된다. 하네스는 OpenCode 하나로 고정했고 과제는 세 개뿐이며, 라벨 누출 차단 목록이 일부 소스를 놓쳤을 가능성을 에이전트 판정자로 감사했다고 밝힌다. 비용 비교는 제공자 가격 정책에 의존하고, Jev는 생성 과제에 적용할 수 없다. 실무 관점의 결론은 분명하다. 반복 워크로드에 에이전트를 투입하기 전에 같은 토큰 예산의 순진한 증류 스크립트와 먼저 비교해야 하고, 제로샷 성능이 좋다는 이유로 병입 성능을 기대해서는 안 된다. 저자들은 장기적으로 컴퓨팅에 따라 확장되는 일반 방법이 전용 방법을 앞지른다는 전제(Sutton, 2019) 아래, 가장 유능한 시스템이 가장 비싼 한 병입은 계속 유효하다고 주장한다.