LLM 에이전트 테스트타임 확장은 토큰을 더 써도 성능이 꺾이는 변곡점을 갖는다.

When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis

HF Daily2609.15309

Kaiyuan Liu, Qiuyang Mang, Bo Peng2026-09-14조회 4

무엇인가

LLM 에이전트는 답을 고치고, 도구를 쓰고, 다른 대안을 탐색하고, 언제 멈출지 스스로 정하면서 테스트타임 연산을 적응적으로 배분한다. 문제는 이 적응성 때문에 성능이 연산량에 따라 어떻게 확장되는지 측정하기 어렵다는 점이다. 같은 모델이라도 어떤 세션에서는 오래 고민하고 어떤 세션에서는 일찍 끝내므로 토큰 수와 성능 사이의 관계가 단조롭지 않다. 이 논문은 중간 제출물에 연속적인 점수를 주는 개방형(open-ended) 과제를 대상으로 삼는다. 점수가 연속값이면 긴 궤적(trajectory) 도중에도 진행 상황을 관찰할 수 있어, 토큰을 어디에 얼마나 썼을 때 최선의 해가 얼마나 좋아졌는지를 추적할 수 있다.

어떻게 동작하나

제안하는 방법은 Elo-per-token 분석이다. 절차는 두 단계로 요약된다. 먼저 각 토큰 예산 지점마다 그때까지 발견된 최선의 해(best solution found)를 기록한다. 다음으로 태스크 내부의 순위(orderings)를 Bradley-Terry 모델로 집계해, 점수 스케일이 서로 다른 태스크들 사이에서도 비교 가능한 Elo 레이팅으로 환산한다. 이렇게 하면 '토큰을 얼마나 썼는가'와 'Elo가 얼마나 올랐는가'라는 축 위에 에이전트의 테스트타임 전략을 곡선으로 그릴 수 있다. 논문은 여기에 이론적으로 성질이 규정된 기준선을 하나 세운다. 독립 샘플링(independent sampling)인데, 이 기준에서는 Elo가 로그 연산량에 대해 선형으로 증가한다. 토큰을 늘릴수록 Elo 이득이 그대로 유지되는 것이 아니라, 로그 스케일 위에서 직선을 그린다는 뜻이다.

무엇과 다른가

실험은 두 갈래로 진행된다. 하나는 범용 에이전트 4종을 개방형 벤치마크 4종에 적용한 것으로, 세션당 최대 1억(100M) 토큰까지 돌린다. 다른 하나는 피드백 기반 LLM 최적화 하네스 3종을 통제된 단일 태스크 개입(single-task intervention)으로 비교한 것이다.

어떻게 쓰나

결과의 핵심은 에이전트가 처음에는 독립 샘플링보다 빠르게 토큰을 Elo로 바꾼다는 점이다. 초반 구간에서는 같은 토큰을 써도 독립 샘플링보다 더 큰 Elo 상승을 얻는다. 그러나 한계 효용이 점점 줄어들고, 결국 독립 샘플링 기준선 아래로 떨어진다. 논문은 이 지점을 스케일링 변곡점(scaling inflection point)으로 정의한다. 세션당 예산을 어디까지 늘렸을 때 한계 Elo 이득이 독립 샘플링 기준선과 같아지는지를 나타내는 값이다. 대조적으로, 공유된 AtCoder Heuristic Contest 태스크에서 가장 강한 역사적 인간 참가자들은 대회 시간에 대해 초선형(superlinear)으로 성능을 개선했다. 저자들은 이를 지속적 학습(continual learning)의 증거이자, 에이전트가 느려진 뒤에도 남아 있는 상당한 헤드룸(headroom)의 증거로 해석한다.

전제와 한계

이 변곡점은 진단 지표에 그치지 않고 예산 배분 처방으로 쓰인다. 저자들은 변곡점을 세션당 예산으로 삼아 1억 토큰을 병렬 세션으로 쪼갠다. FrontierCS Polyomino Packing 태스크에서 이 방식은 하나의 긴 세션 대비 +264 Elo, 열 개의 짧은 세션 대비 +355 Elo를 얻었다. 같은 토큰 총량을 한 세션에 몰아넣는 것보다 변곡점 크기의 세션 여러 개로 나누는 편이 더 나았다는 뜻이다.

개발자 관점에서 이 논문이 주는 실무적 신호는 두 가지다. 첫째, 에이전트에 토큰을 더 주는 것이 항상 비례적인 개선을 주지는 않는다. 장기 실행 세션을 설계할 때는 '얼마나 오래 돌릴 것인가'보다 '어느 지점부터 한계 이득이 기준선 아래로 떨어지는가'를 먼저 확인해야 한다. 둘째, 그 지점을 찾았다면 남은 예산을 병렬 세션으로 분산하는 것이 단일 장기 세션보다 나은 선택지가 될 수 있다. 또한 Elo-per-token은 점수 스케일이 다른 여러 태스크를 하나의 축에서 비교할 수 있게 해주므로, 사내 벤치마크가 제각각인 환경에서 에이전트 버전 간 비교나 예산 정책 실험에 쓸 수 있는 측정 도구다.

한계와 전제도 분명하다. 이 방법은 중간 제출에 연속 점수를 주는 개방형 과제를 전제로 하므로, 정답과 오답만 나오는 이진 평가 태스크에는 그대로 적용하기 어렵다. 인간 비교는 공유된 AtCoder Heuristic Contest 태스크에 한정되며, 병렬 세션 분할의 이득(+264, +355 Elo)은 FrontierCS Polyomino Packing 단일 태스크에서 측정된 값이다. 이 글의 근거가 된 arXiv:2609.15309 (cs.CL) 프리프린트 범위에는 구체적인 에이전트 이름, 벤치마크 목록, 에이전트별 Elo 수치, 저자가 명시한 한계 절이 제시되어 있지 않으므로 그 부분은 원문 전체를 확인해야 한다.

관련 논문