먼저 행동하고 나중에 추론해 다중턴 에이전트 증류 훈련을 가속한다

Act First, Reason Later: Accelerating On-Policy Distillation for Multi-Turn Agents via Reference-Conditioned Inverse Dynamics

HF Daily2609.36608

Zubin Zheng, Jiahao Wu, Shaofeng Zhang2026-09-29조회 2

무엇인가

다중턴 LLM 에이전트를 온폴리시 증류(OPD)로 학습할 때 가장 큰 비용은 모델 업데이트가 아니라 경험 수집이다. 표준적인 think-then-act 롤아웃에서는 매 턴마다 짧은 행동 하나를 내기 전에 긴 추론을 먼저 생성해야 하고, 그동안 환경 전이가 멈춰 선다. 저자들이 Qwen3-1.7B로 ALFWorld를 프로파일링한 결과 턴당 롤아웃 시간의 81~95%가 추론에 쓰였다. 이 지연은 턴마다 누적되어 전체 학습 시간을 늘리며, 논문은 이를 '추론에 막힌 환경 전이 병목(reasoning-blocked transition bottleneck)'이라고 부른다. 반대로 추론을 생략하고 행동을 바로 생성하면 지연은 줄지만, 통제 실험에서 비생산적인 반복이 늘고 환경 전이 100회당 성공 궤적 수가 줄어드는 등 롤아웃 품질이 떨어졌다.

어떻게 동작하나

ActFirst-OPD의 핵심은 환경 상호작용과 전체 응답 생성을 분리하는 것이다. 먼저 참조 조건부 역동역학(reference-conditioned inverse dynamics)을 쓴다. 학습 과제에 대한 고품질 오프라인 참조 궤적이 있을 때, 롤아웃이 참조와 정렬되어 있는 동안에는 참조 다음 관측 o_{t+1}^ref를 국소 전이 목표로 삼아, 학생 모델이 실제 상호작용 문맥 c_t와 이 목표를 조건으로 행동 ã_t를 추론한다(π_θ^act(·|c_t ⊕ o_{t+1}^ref)). 추론 세그먼트 없이 행동만 생성하는 것이다. 행동을 실행한 뒤에는 벤치마크별 전이 검사로 결과 관측이 참조 목표와 정합적인지 확인한다. 검사는 전이 결과만 보며 생성된 행동이 참조 행동과 일치할 것을 요구하지 않는다. 검증에 실패하면 그 롤아웃의 나머지 구간에서는 참조 안내를 끄고, 상호작용 문맥만으로 다음 행동을 예측하는 자율 다음 행동 예측(NAP, π_θ^act(·|c_t))으로 전환한다. 학생이 실제로 도달한 상태에서 계속 진행하되 적용 불가능한 참조 궤적에 의존하지는 않는 구조다.

무엇과 다른가

수집된 각 상호작용 문맥 c_t에 대해서는 같은 학생이 참조 다음 관측 없이 표준 에이전트 입력으로 전체 think-then-act 응답 y_t=(z_t, a_t)를 생성한다. 이 생성은 비동기로 진행되어 서로 다른 턴의 요청이 겹칠 수 있고, 이후 환경 상호작용과도 겹칠 수 있다. 여기서 나온 행동 a_t는 실행된 빠른 행동 ã_t와 일치할 필요가 없고 환경에 제출되지도 않는다. 학습 배치는 빠른 롤아웃이 방문한 문맥에서 학생이 샘플링한 전체 응답으로 구성되며, 동결된 교사가 같은 토큰 문맥에서 이를 채점해 역방향 KL 기반 OPD 목적함수를 최적화한다. 즉 전체 응답 감독은 유지하면서 전체 응답 생성을 환경 전이의 의존 사슬에서 떼어낸다. 논문은 이상화된 모델에서 T턴 롤아웃의 속도 향상이 S_ideal(T)=T·ℓ_full/((T-1)·ℓ_fast+ℓ_full) ≤ min{T, ℓ_full/ℓ_fast}임을 명제로 제시한다. 턴이 길어질수록 마지막 전체 응답 생성 비용이 상각되어 ℓ_full/ℓ_fast에 수렴한다.

어떻게 쓰나

실험은 ALFWorld(체화 계획, 30턴), WebShop(웹 내비게이션, 15턴), ScienceWorld(과학 추론, 30턴)에서 수행됐다. 학생은 Qwen3-0.6B·1.7B·4B, 교사는 벤치마크별로 GiGPO로 학습한 과제 특화 Qwen3-8B다. 비교 대상은 Vanilla OPD, TCOD-F2B, TurnOPD, 그리고 참조 조건부 역동역학을 참조 없는 직접 행동 생성으로 바꾼 'Ours w/o ID'다. 250회 업데이트, 롤아웃 배치 16개 과제, 최적화 배치 64개 턴 단위 전체 응답, NVIDIA A100-SXM4-80GB 8장(롤아웃 4, 교사 채점 2, 학생 최적화 2) 조건에서, ActFirst-OPD는 Vanilla OPD 대비 평균 월클록 학습 속도를 ALFWorld 2.3배, WebShop 1.8배, ScienceWorld 4.9배 달성했다. 9개 벤치마크-모델 조합 중 8개에서 비교한 모든 OPD 베이스라인의 평균 성공률과 같거나 앞섰다. ALFWorld에서 Vanilla OPD 대비 성공률 이득은 0.6B 8.15%p, 1.7B 9.85%p, 4B 2.67%p였다. WebShop에서는 Qwen3-1.7B 기준 1.80배 가속에 평균 성공률 하락이 1.00%p에 그쳤다. 평가 시에는 모든 모델이 참조 없이 표준 think-then-act 상호작용을 쓴다.

전제와 한계

속도 향상의 출처를 분해하면 두 가지다. 하나는 비동기 전체 응답 생성으로 인한 처리량 증가이고, 다른 하나는 참조 조건부 역동역학이 과제 진행을 개선해 불필요한 상호작용 자체를 줄인 것이다. 250회 업데이트 학습에서 환경 전이 처리량은 초당 3.65회에서 5.68회로 1.56배 늘었고, 전체 학습 구간에서 실행한 전이 수는 55,525회에서 38,616회로 30.45% 줄었다. 1.56/(1-0.3045)≈2.24라는 계산이 Qwen3-1.7B의 2.28배 학습 가속과 근접한다. 다만 동시 생성 요청 상한 b_max가 16일 때는 128토큰 응답 0.80배, 512토큰 응답 0.92배로 오히려 느려졌고, b_max를 256으로 올려야 각각 1.49배, 2.42배가 됐다. 서빙 동시성이 부족하면 추가되는 빠른 행동 생성 비용을 상쇄하지 못한다는 뜻이다. 절제 실험에서 역동역학을 제거하면 평균 성공률이 ALFWorld 17.31%p, WebShop 1.00%p, ScienceWorld 3.04%p 떨어지고 ALFWorld 학습 시간이 1.94시간에서 2.45시간으로 늘었다. NAP 폴백을 제거하면 각각 1.05%p, 3.11%p, 2.82%p 하락해, 참조에서 벗어난 뒤 수집된 문맥도 증류에 유용하다는 것을 보여준다. 참조 행동 시퀀스를 그대로 재생하는 변형들도 세 벤치마크 모두에서 성공률이 낮았다.

실무 관점에서 이 논문이 주는 신호는 명확하다. 다중턴 에이전트 증류 파이프라인에서 GPU 시간을 잡아먹는 것이 그래디언트 계산이 아니라 추론 토큰 생성으로 인한 환경 전이 지연이라면, 추론을 학습 신호로는 그대로 쓰되 롤아웃의 임계 경로에서는 빼는 설계가 유효하다는 것이다. 다만 도입 전에 확인할 것이 있다. 첫째, 고품질 참조 궤적을 확보할 수 있어야 한다. 둘째, vLLM 같은 서빙 백엔드에서 빠른 행동 요청과 전체 응답 요청을 충분히 동시에 처리할 여력이 있어야 한다. b_max가 낮으면 이득이 사라지고 손해가 될 수 있다. 셋째, 전이 정합성 검사 규칙을 벤치마크별로 직접 정의해야 한다.

저자들이 밝힌 한계도 분명하다. 이 방법은 고품질 오프라인 참조 궤적에 접근할 수 있다는 전제 위에 서 있으며, 그런 참조를 구하기 어려운 환경은 논문의 범위 밖이다. 또한 참조 다음 관측은 현재 롤아웃 안내로만 쓰이고 궤적이 어긋나면 비활성화된다. 향후 과제로 참조 전이를 보조 감독 신호로 활용하거나, 이탈한 롤아웃을 참조 궤적으로 다시 정렬하는 방법을 제안한다.