AREX-2가 장기 반성 궤적으로 자기개선 에이전트를 학습한다
AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
무엇인가
이 논문이 다루는 문제는 "어려운 문제는 한 번에 풀리지 않는다"는 사실에서 출발한다. 학습 파이프라인, 채점 함수가 붙은 프로그램, 리서치 질문은 시도·측정·수정의 루프를 돌면서 나아지는데, 기존 에이전트 시스템은 이 루프를 대부분 스캐폴드(하네스)에 두고 모델은 한 번에 한 시도만 만들어내도록 요구한다. 저자들은 루프를 모델 안으로 옮기자고 제안하고, 자기개선을 "주어진 과제에서 라운드가 늘어날수록 스스로 무엇을 바꿀지 판단해 더 나은 해를 내놓는 능력"으로 정의한다. 형식화는 이렇다. t라운드까지 도달한 최고 점수를 s_t, t라운드의 기대 이득을 r_t라 하면 총 개선은 Σr_t이고, 이득이 유의미하게 남는 라운드 수를 T*, 그 구간의 평균 이득을 r̄라 하면 총 개선은 근사적으로 r̄·T*가 된다. 반성(reflection)이 r̄를, 장기 실행(long-horizon execution)이 T*를 결정하며, 예산 T는 모델이 학습하는 것이 아니라 주어지는 자원이고 정책이 정하는 것은 그 예산을 얼마나 생산적으로 쓰는가다. 두 능력을 합쳐 논문은 장기 반성(long-horizon reflection)이라 부른다.
어떻게 동작하나
문제는 학습 데이터다. 현재 에이전트 학습 데이터는 대개 한 번의 시도 단위로 만들어진다. 과제를 던지고, 해를 만들고, 검증기가 통과/실패를 찍고, 통과한 해만 남긴다. 이 방식은 "정답이 어떻게 생겼는지"는 보여주지만 "해가 어떻게 개선되는지"는 보여주지 않는다. 중간 시도, 그때 받은 피드백, 뒤따른 수정이 전부 버려지고, 즉시 통과한 해가 모으기 쉬우므로 긴 개선 과정이 가장 먼저 사라진다. 그래서 저자들은 궤적을 직접 합성하기로 하고, 도메인 선택 기준을 "메타 스킬을 감독하기 얼마나 좋은가"에 둔다. 장기 반성이 도메인에 묶이지 않은 메타 스킬이라는 가설 아래, 피드백이 명확하고(검증 점수나 심사 결과), 여러 라운드에 걸친 지속적 개선 여지가 있으며(베이스라인에서 튜닝된 앙상블로, 브루트포스에서 근최적해로), 소스 자료가 풍부한 두 도메인 — GitHub 기반 머신러닝 엔지니어링과 온라인 저지 기반 알고리즘 프로그래밍 — 을 고른다.
무엇과 다른가
환경 구축은 교사 모델이 소스를 실행 가능한 환경 (σ, S)로 바꾸는 과정이다. 저장소에 대해서는 코드를 읽고 저장소가 측정하는 지표를 찾아낸 뒤, 그 지표를 개선하라는 과제, 에이전트가 접근할 수 없는 홀드아웃 분할에서 지표를 계산하는 채점 스크립트, 저장소와 데이터가 설치된 샌드박스를 작성한다. 저지 문제에 대해서는 문제문이 과제가 되고 샌드박스에 컴파일러와 샘플 케이스가 들어가며, S는 숨은 테스트가 매기는 점수다. 저자가 허용하는 곳에서는 이 점수를 이진 판정이 아니라 통과한 테스트 비율이나 최선해 대비 휴리스틱 품질 같은 등급 점수로 만든다. 이진 판정은 "아직 성공하지 못했다"만 말하지만 등급 점수는 매 라운드를 정보 있게 만든다. 환경은 실행으로 확인하는 두 조건을 통과해야 채택된다. 소스에 딸린 참조 해(저장소 자체 모델 또는 저지의 정답 제출)가 S 아래에서 점수를 내야 하고, 단순 베이스라인(저장소 원본 또는 직관적 첫 프로그램)이 참조보다 훨씬 낮은 점수를 내야 한다. 두 번째 조건을 못 넘는 환경은 지속적 개선 궤적을 만들 수 없으므로 버린다.
어떻게 쓰나
궤적은 교사 에이전트를 환경에서 돌려 만들며, 세 가지 조건을 건다. 첫째, 많은 라운드. 한 번의 시도에 필요한 것보다 훨씬 큰 라운드 예산과 벽시계 시간(과제당 수 시간, 수백 회의 툴 호출 규모)을 주고 예산이 얼마인지 알려준다. 예산을 알면 에이전트는 먼저 베이스라인을 세우고, 초반 라운드를 측정에 쓰고, 측정이 시사하는 수정을 후반 라운드에 배분할 수 있다. 둘째, 운영 지식(operational knowledge). 저장소가 노출하는 API, 데이터 로더가 기대하는 형식, 문제 제약이 허용하는 최적화는 과제문에 없으므로 에이전트가 소스와 문서를 읽고, 의존 논문·라이브러리를 검색하고, 작은 실험을 돌려 습득한다. 이 행동들은 궤적에 그대로 남아 학습 모델이 환경을 조사하는 법을 배우게 된다. 일부 지식은 컨텍스트에 넣는 압축 문서인 스킬로 제공되며, 일반 스킬은 사전 준비하고 과제 특화 스킬은 과제 자체에 관한 자료를 배제한 채 검색으로 만든다. 셋째, 루프 안의 피드백. 매 라운드는 제출로 끝나고 에이전트는 다음 행동을 정하기 전에 점수와 환경 보고를 본다. 점수를 떨어뜨린 라운드도 궤적에서 제거하지 않는다. 그 뒤의 대응이야말로 모델이 배워야 할 부분이기 때문이다.
전제와 한계
학습은 궤적 단위로 이뤄진다. 궤적 전체를 남기거나 버리며, 조건은 두 가지다. 최종 점수가 참조 대비 설정된 임계값을 넘어야 하고, 전사본이 user-assistant-tool 형식을 따르고 모든 툴 호출에 관찰이 붙고 정상 종료하며 홀드아웃 분할에서 답을 재구성하거나 자격증명을 노출하는 식의 규칙 위반이 없어야 한다. 개별 라운드에는 아무 조건을 걸지 않으므로 채택된 궤적에는 실패한 실행, 점수 하락, 포기한 접근이 남는다. 손실은 궤적 전체를 컨텍스트로 둔 채 해를 전진시킨 결정에만 적용한다. 실패와 회귀는 컨텍스트에 남아 모델이 복구해야 할 상태를 보게 하고, 손실은 그 뒤의 진단·수리·전략 변경·다음 실험·개선된 제출에 걸린다. 반복 폴링, 새 관찰을 주지 않는 호출, 거의 중복인 턴은 손실을 받지 않고, 시스템 메시지·환경 보고·검색된 문서도 모델을 조건화할 뿐 모방할 출력이 아니므로 손실에서 제외한다. 이렇게 만든 궤적을 기존 AREX 레시피의 딥리서치 데이터와 그대로 섞어 Qwen3.8-27B를 파인튜닝한 것이 AREX-2다. 새 궤적이 이전 레시피와의 유일한 차이다.
결과는 두 학습 도메인과 전이 도메인 모두에서 보고된다. MLE-bench Lite에서 Any Medal 81.8로 비교 표의 최고점이며, 가장 강한 베이스라인 Naive-N0.5-Flash보다 8.1점, 가장 강한 클로즈드웨이트 베이스라인 GPT-5.6 Sol보다 9.1점 높다. Frontier-CS에서는 70.7로 가장 강한 공개 가중치 베이스라인을 16.0점 앞서고 가장 강한 클로즈드웨이트 시스템과는 5.7점 차이다. 새 궤적이 하나도 검색 과제가 아니고 딥리서치 학습 데이터도 이전 레시피 그대로인데도, AREX-2는 BrowseComp 84.0, 텍스트 전용 HLE 52.6, GAIA 92.2, DeepSearchQA 93.8(F1)을 기록하며 40B 이하 모델 중 BrowseComp·텍스트 전용 HLE·DeepSearchQA에서 선두이고, 이전 레시피로 학습한 AREX(4B)와 AREX(122B)를 네 벤치마크 모두에서 앞선다. 다만 가장 강한 BrowseComp·HLE 결과와의 격차는 남아 있다고 저자들은 밝힌다.
라운드 스케일링 분석은 두 설정에서 이뤄진다. 피드백이 있는 Frontier-CS Agent Track 188문제, 문제당 5시간 예산에서 AREX-2는 1시간 54.4, 2시간 65.9, 5시간 70.7로 계속 오르며 2시간에서 5시간 사이에 4.8점(그중 마지막 1시간에 2.2점)을 더 얻는다. 반면 DeepSeek-V4-Pro는 2시간 후 44.7에서, DeepSeek-V4-Flash는 3시간 후 39.1에서 멈춘다. 피드백이 없는 BrowseComp에서는 정답 여부를 전혀 알려주지 않고 내부 루프가 증거를 모아 잠정 답을 만들고 외부 루프가 자체 신뢰도와 궤적 상태로 수용·정제·재시작을 결정하는데, 턴당 평균 예산을 늘리면 정확도가 47턴 64.8에서 143턴 84.0까지 오른다. 같은 과정을 돌린 AREX(122B)는 약 140턴에서 12점 이상 뒤지고, AREX-2는 AREX의 최종 정확도를 절반 이하 턴으로 넘어서며 턴당 이득이 약 3배다. MLE-bench Lite 절제 실험에서는 베이스 모델이 스킬 없이 28.8, 일반 스킬 추가 41.2, 과제 특화 스킬과 라운드 확대 68.2였고, 같은 스킬 조건에서 AREX-2는 기본 라운드로 75.8, 확대 라운드로 81.8이었다. 학습이 스킬 위에 13.6점을 더하고(M2 대 M4), 더 적은 라운드로도 7.6점 앞서며(M3 대 M2), 라운드 확대가 6.0점을 추가한다(M3 대 M4).
개발자 관점에서 이 논문이 주는 실무적 시사점은 세 가지다. 첫째, 에이전트의 테스트 시점 성능을 올리려면 성공한 최종 해만 모으는 대신 실패·회귀·전략 변경이 담긴 긴 궤적을 남기고, 손실은 복구 이후의 진전 결정에만 걸어야 한다는 구체적 레시피다. 둘째, 운영 지식(스킬 문서와 환경 탐색)만으로도 베이스 모델을 28.8에서 68.2까지 끌어올릴 수 있다는 절제 결과는, 파인튜닝 없이 컨텍스트 구성만으로 얻을 수 있는 상한을 가늠하게 한다. 셋째, 평가 예산을 늘렸을 때 점수가 계속 오르는지가 모델 선택의 실질 지표가 된다는 점이다. 다만 저자들이 명시한 전제를 확인해야 한다. 학습 도메인은 검증 가능한 피드백과 지속적 개선 여지가 있는 머신러닝·알고리즘 문제로 한정됐고, 환경은 참조 해가 점수를 내고 단순 베이스라인이 크게 뒤처지는 경우에만 채택되며, 궤적 생성에는 스킬을 쥐여준 교사 에이전트가 필요하다. 또한 가장 강한 BrowseComp·HLE 결과와의 격차가 남아 있고, 향후 과제로 학습 도메인 확장, 지평 연장, 모델 자신의 궤적을 다음 학습 데이터로 삼는 루프 폐쇄를 제시한다.