배포 중 검증된 궤적만 스스로 증류해 장기 과제 에이전트를 진화시킨다

ASCENT: Online Test-Time Training of Long-Horizon Agents via Self-Distillation of Verified Experience

HF Daily2610.05303

Haodong Lu, Dong Gong2026-10-04조회 1

무엇인가

이 논문이 다루는 것은 Online Agentic Test-Time Training(OaTTT)이라는 프로토콜이다. 배포된 LLM 에이전트는 여러 턴의 추론-행동을 거쳐 장기 과제를 풀고, 종료 시점에 검증 신호 하나만 받는다. 실제 배포 환경에서는 관련 과제가 연속된 스트림으로 들어오므로 에이전트 자신의 실행 궤적이 자연스러운 개선 자원이 된다. 기존 in-context 적응 방식은 reflection, memory, skill을 텍스트로 저장해 재사용하는데, 이는 적절한 경험을 검색해내는 능력과 고정된 정책이 그것을 끝까지 실행하는 능력에 성능이 묶인다. 다른 test-time training 계열은 에피소드마다 파라미터를 리셋하거나, 배포 전에 적응 행동을 학습해두거나, 문제당 여러 번의 샘플링을 요구한다. 이 논문이 정의하는 OaTTT는 과제 스트림을 단 한 번 통과하고, 과제당 단 한 번만 시도하며, 그 궤적과 검증 결과만으로 가중치를 갱신하고 그 갱신이 이후 과제로 계속 이어진다.

어떻게 동작하나

저자들은 먼저 순진한 접근이 왜 무너지는지를 실측한다. 생성된 토큰을 직접 모방하거나 강화하는 다섯 가지 베이스라인(Online ungated imitation, Online RFT, Online RFT+KL, Online REINFORCE, Online REINFORCE++)을 같은 프로토콜에서 돌린 결과, ALFWorld 스트림에서 첫 응답 토큰 분포가 거의 결정적으로 붕괴하고 초기 모델로부터 계속 멀어진다. 정책경사 계열은 성공이 곧 끊겨 거의 모든 갱신이 실패 에피소드에서 나오고, 무효 행동 생성 비율이 증가하며, 스트림 후반부 성공률은 학습하지 않은 베이스보다 낮아진다. 원인은 손실의 그라디언트가 생성 토큰 하나에 하드 타깃을 매칭하는 형태(p^φ − e_y)라는 점이다. 긍정 가중치는 그 토큰의 확률만 밀어 올리고, 부정 가중치는 그 확률을 이미 선호하는 토큰들로 넘겨줄 뿐이며, 어느 쪽이든 분포를 자기 출력 주변으로 날카롭게 만든다.

무엇과 다른가

ASCENT의 절차는 다음과 같다. 에이전트가 과제 x_i를 한 번 실행해 궤적 τ_i와 검증 결과 v_i를 얻는다. v_i = 1일 때만 갱신한다. 교사는 학습되지 않는 LLM의 초기 사본 p_θ0이고, 여기에 검증을 통과한 궤적을 특권 정보 z_i로 조건화해 학생이 지나간 각 프리픽스 위치에서 다음 토큰 분포 q를 계산한다. 학생 분포 p^φ와의 forward KL을 최소화하는 방식으로 LoRA fast weight φ에 증류하고, 이 어댑터가 과제 간에 유지된다. v_i = 0이면 갱신을 건너뛰므로 환경 검증이 일종의 rejection sampling으로 작동한다. 여기에 더해 파싱된 행동을 환경이 실제로 실행했는지(d_i,t)를 읽어, 실행되지 않은 무효 행동 턴을 교사 입력 z_i에서 제거한다. 필터는 교사 입력만 바꾸고 학생은 제거된 턴 위치에서도 계속 학습한다. 그라디언트는 p^φ − q가 되어 생성 토큰 하나가 아니라 전체 어휘 분포를 교사의 사후 분포에 맞춘다. 교사가 고정되어 있으므로 학생이 아무리 움직여도 같은 궤적에 대한 타깃이 흔들리지 않는다.

어떻게 쓰나

실험은 ALFWorld(seen 140개 과제, 6개 과제군, unseen 134개 과제), WebShop, AppWorld(부록)에서 수행했고, Qwen3.5-4B와 Qwen3.5-9B 두 스케일을 썼다. 모든 방법이 같은 ReAct 템플릿과 그리디 디코딩, 50턴 예산, 과제당 1회 채점, 3회 독립 실행 평균±표준편차 조건을 따른다. 결과적으로 ASCENT는 ALFWorld와 WebShop 양쪽, 두 스케일 모두에서 베이스 대비 exact success를 22점 이상 끌어올리고 가장 강한 온라인 비교군을 앞선다. WebShop 평균 과제 점수도 최고이며, ALFWorld에서는 오프라인 in-context 적응 방법 전부를 상회한다. 같은 자기증류를 쓰되 교사가 현재 턴만 보는 TT-OPSD보다도 우수한데, 이는 완전한 검증 궤적에서 오는 hindsight의 효과를 보여준다. 평균 턴 수는 비교군 중 가장 적고, 베이스와 ASCENT가 모두 푸는 과제에서도 4B는 64%, 9B는 67%에서 베이스보다 적은 턴을 쓴다. seen 스트림에서 얻은 어댑터를 고정해 unseen 씬에 전이해도, 이어서 온라인 갱신을 계속해도 두 스케일 모두 온라인 비교군 중 선두를 지킨다.

전제와 한계

절제 실험에서 특권 정보의 구성이 중요하다는 점이 드러난다. 행동만 주면 베이스 근처 또는 그 이하로 떨어지고, 추론 텍스트를 더하면 성공률과 턴 효율이 일관되게 좋아진다. 추론이 각 행동의 이유를 설명하고 학생이 생성하는 토큰의 대부분을 차지하기 때문으로 저자들은 해석한다. 4B 같은 작은 모델은 관찰을 뺀 짧은 정보와 무효 턴 필터를 함께 쓸 때 가장 좋고, 9B는 전체 궤적을 줘도 잘 쓴다. 발산 함수를 바꾸면 reverse KL은 forward KL보다 뒤처지고, Jensen-Shannon은 4B에서 reverse KL과 비슷하지만 9B에서는 forward KL을 넘는다. in-context 방식(ACE, MemP)과의 결합은 상보적이어서 4B에서는 ASCENT 단독이 최고, 9B에서는 결합이 단독보다 낫다. 사례 연구로 제시된 "put a cool egg in microwave" 과제에서 베이스와 in-context 변형 5종은 턴 예산을 소진했지만 ASCENT는 20턴에 완료한다.

실무 관점에서 이 논문이 유용한 지점은, 별도 학습 단계나 추론 시 메모리 검색 없이 배포 중에 쌓이는 자기 궤적을 LoRA 어댑터 하나로 응축하는 구체적 레시피를 제시한다는 것이다. 다만 적용 조건이 분명하다. 검증 신호가 존재해야 하고, 교사로 쓸 고정 사본의 전체 next-token 분포가 필요하므로 가중치를 열 수 없는 API 전용 모델에는 그대로 쓸 수 없다. 갱신 게이트가 에피소드 단위 검증이라는 희소 신호에 걸려 있으므로 검증기 품질이 곧 학습 데이터 품질이 되고, 배치 크기 1, 과제당 1회 시도라는 제약에서 하이퍼파라미터 민감도가 커질 수 있다는 점도 확인해야 한다.

저자들이 명시한 한계는 다음과 같다. 전체 next-token 분포가 필요해 오픈웨이트 모델에만 적용된다. 에피소드 단위 검증으로 갱신을 게이팅하고 모든 턴에 동일한 가중을 주기 때문에 턴 단위 credit을 세밀하게 배분하지 못한다. 교사의 특권 컨텍스트에 학생이 생성한 응답 텍스트가 포함되어 있어 교사가 생성 토큰을 부분적으로 재구성할 수 있고, 그렇다면 hindsight의 독립성이 제한된다는 점이 미해결 문제로 남는다. 턴 효율이 좋아지는 메커니즘에 대한 이론적 이해와 완전한 증명도 향후 과제로 남겨두었다. 리플레이 버퍼는 사용하지 않는다.