Marathoner가 10시간 넘는 초장기 자율 실행 능력을 학습으로 부여한다
Marathoner: Ultra-Long-Horizon Autonomous Intelligence
무엇인가
사람은 몇 달, 길게는 몇 년 동안 하나의 목표를 향해 꾸준히 일한다. 논문은 이 능력을 초장기 실행(ultra-long-horizon execution)이라 부르고, 이를 명시적으로 학습시킨 에이전트 Marathoner를 제안한다. Anthropic과 OpenAI의 강력한 독점 모델(Fable-5, GPT-6-Astra 등)은 적절한 하네스와 함께 며칠씩 연속 작업한다고 알려져 있지만 그 훈련 방법은 공개되지 않았고, 오픈소스 모델은 이 능력이 사실상 없다는 것이 문제의식이다. 저자들은 베이스 모델에 초장기 실행 능력을 심는 후처리 파이프라인 전체를 공개한다.
어떻게 동작하나
첫 단계는 초장기 실행 과제 합성이다. 10,000개의 GitHub 저장소를 프런트엔드, 백엔드, CUDA·데이터베이스 커널 같은 저수준 라이브러리, SciPy 같은 성숙한 코드베이스, vLLM·SGLang 같은 LLM 관련 저장소까지 도메인과 언어를 흩어서 모으고, 여기서 100,000개의 major release PR을 채굴한다. 난이도는 새 코드 100~200줄(Easy), 200~1000줄(Medium), 1000줄 이상(Hard)으로 나뉘고 비율은 2:3:5로 각각 2만·3만·5만 개다. 각 과제는 세 요소로 구성된다. 소프트웨어는 해당 PR 직전 커밋으로 체크아웃한 저장소, 지시문은 PR 첫 코멘트를 우선 쓰고 없으면 릴리스 노트, 그것도 없으면 LLM이 PR diff를 보고 생성한다. 보상 검증기는 PR이 도입한 테스트를 fail-to-pass로, 기존 테스트를 pass-to-pass로 묶은 단위 테스트 스위트다. 모든 과제는 Harbor 포맷으로 정리되고, 샌드박스는 Ubuntu 24.04에 4 CPU, 10GB 메모리, 40GB 디스크, 인터넷 허용이며 사전 설치 패키지는 주지 않는다. 다양한 코드베이스의 환경을 스스로 구성하는 것도 에이전트의 능력으로 본다는 뜻이다. 보상은 이진값으로, 모든 테스트를 통과해야 1을 받는다.
무엇과 다른가
여기에 Multi-Task Chaining이 더해진다. 원자 과제 5개를 무작위로 골라 하나의 과제로 이어 붙이면, 소프트웨어는 여러 저장소의 묶음이 되고 지시문은 개별 지시문의 연결이 되며 검증기는 각 저장소별 원래 검증기가 그대로 붙는다. 이렇게 만든 Frontier 과제는 여러 대형 저장소를 넘나들며 계획을 세워야 하고, 중간 목표를 상당히 달성한 뒤에도 계속 진전을 만들어야 한다. 15,000개 과제로 3,000개의 체인 과제를 추가로 만든다.
어떻게 쓰나
두 번째 단계는 거부 샘플링 파인튜닝(RFT)이다. 교사 모델로 Kimi K3를 쓰고, Claude Code·Codex·OpenClaw 세 하네스를 섞어 같은 과제의 궤적을 생성한다. 특정 하네스에 과적합되는 것을 막고 실제 실행 전략을 학습시키기 위한 설계다. 최종 보상이 1인 궤적만 남기는데, Claude Code로 14,159개, Codex로 13,583개, OpenClaw로 13,078개, 합계 40,820개가 살아남았다. 이 궤적으로 베이스 모델을 256k 시퀀스 길이에서 전 파라미터 파인튜닝한다. 학습률 5e-6, 5 에폭, 코사인 스케줄에 워밍업 0.05, DeepSpeed ZeRO-3와 CPU 오프로딩을 사용했다. 이 단계가 이후 강화학습을 위한 초기 토대를 만든다.
전제와 한계
세 번째 단계는 실제 환경에서의 강화학습이다. AReaL 프레임워크 위에서 GRPO를 돌리며, 롤아웃마다 독립 샌드박스에서 실제 실행을 수행한다. 학습 데이터는 합성 과제 5,000개에 체인 과제 3,000개를 더한 8,000개, 배치 크기 32, 과제당 롤아웃 8회, 학습률 1e-6, 온도 0.6, top_p 0.95다. 이 단계의 핵심 기여는 Later Stage Bonus Reward다. 궤적이 끝나면 강한 독점 LLM(Qwen-3.8-Max)이 전체 실행을 여러 단계로 요약하고, 각 단계에 숨은 버그를 찾아 고치거나 큰 성능 향상을 만든 최적화처럼 가치 있는 조작이 있었는지 0/1로 판정한다. 실행 후반부 절반 안의 어느 단계든 1이 붙으면 0.5의 추가 보상을 준다. 최종 보상은 과제 정답성(0 또는 1)과 이 보너스의 합이다. 정답성은 결과만 감독하는 이진 신호인 반면, 보너스는 장시간 실행 중에도 의미 있는 진전을 계속 만들도록 조밀한 감독을 제공한다.
실험은 Qwen3.5-9B를 베이스로 32대의 H800에서 수행했다. 벤치마크는 다섯 개다. FrontierSWE는 인간 전문성 최전선의 소프트웨어 엔지니어링 문제 17개, NL2Repo는 코드 저장소를 처음부터 구축하는 능력을 평가하며, SWE-Marathon은 강한 독점 모델도 정확도 40% 미만을 기록하는 20개 과제, Terminal Bench 2.0은 89개 터미널 사용 과제, SWE-Bench Verified는 GitHub 이슈 기반 500개 과제다. Marathoner-9B는 베이스 모델 대비 일관되고 뚜렷한 향상을 보였고, FrontierSWE와 SWE-Marathon에서는 Gemini-3.1-Pro를 능가했다. 벤치마크별 최적화 없이 단일 파이프라인으로 얻은 결과라는 점을 저자들은 강조한다. 다만 표 1의 벤치마크별 구체 수치는 제공된 본문에 제시되지 않았다. 어블레이션에서는 Multi-Task Chaining, Diverse-Harness 궤적 생성, Later Stage Bonus Reward를 각각 적용할 때마다 성능이 올랐다. RL 학습 과제 수를 1,000개에서 8,000개로 늘리면 FrontierSWE와 Terminal Bench 2.0 성능이 꾸준히 향상됐고, RL 보상은 계속 증가하는 동안 정책 엔트로피는 안정적으로 유지됐다. 실행 통계로는 어려운 과제에서 10시간 이상 연속 작업하고 1,000회 이상 도구를 호출한다고 보고한다.
실무자에게 이 논문이 주는 시사점은 명확하다. 여러 저장소에 걸친 대규모 마이그레이션이나 장시간 리팩터링처럼 한 번의 응답으로 끝나지 않는 작업을 에이전트에 맡기려면, 과제 난이도 분포와 보상 설계, 하네스 다양성, RL 환경 수를 함께 키워야 한다는 것이다. 도입을 검토한다면 몇 가지를 확인해야 한다. 보상이 단위 테스트 통과 여부라는 이진 신호이므로 테스트로 검증 가능한 코드 과제에만 적용된다. 학습 데이터가 GitHub PR 기반이라 저장소와 PR이 존재하는 도메인에 한정된다. 또 특정 하네스에 종속되지 않도록 학습 중 하네스를 무작위로 섞지만, 실제 배포 환경의 하네스가 학습 분포와 얼마나 겹치는지는 별도로 검증해야 한다.
논문은 별도의 한계 절을 두지 않는다. 대신 전제가 곳곳에 깔려 있다. RFT 궤적 생성은 강한 독점 교사 모델 Kimi K3에, 보너스 보상 판정은 Qwen-3.8-Max에 의존하므로 이들 모델의 능력과 판정 품질이 상한을 좌우한다. 과제 합성도 PR과 단위 테스트가 갖춰진 저장소를 전제로 하며, Hard 과제 비중을 50%로 크게 잡는 등 난이도 배분이 결과에 영향을 준다. 저자들은 AI 사용 성명에서 생성 AI를 방법 구현, 데이터 정제, 합성 데이터 생성, 결과 해석에 사용했고 AI가 만든 코드와 합성 데이터 품질을 검토했으며 최종 내용의 책임은 저자에게 있다고 밝힌다.