장기 호라이즌 에이전트용 AlignOPSD는 타임스탬프가 아니라 결정에 정렬한다.

Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents

HF Daily2609.33391

Mingju Chen, Can Lv, Jinrong Liu2026-09-27조회 2

무엇인가

이 논문이 다루는 문제는 장기 호라이즌 에이전트 학습에서 보상 신호가 지나치게 거칠다는 것이다. GRPO 같은 검증 가능 보상 기반 RL은 궤적 말단의 결과 보상만으로 형제 롤아웃 간 상대 이득을 계산해 궤적 전체 토큰에 동일한 advantage를 broadcast한다. 이 방식은 전체 과업 성능은 반영하지만, 성공한 궤적 안에서 실제로 유효했던 결정과 우연히 따라온 행동을 구분하지 못하고 실패한 궤적에서 어디가 잘못됐는지도 짚지 못한다. 이를 보완하려고 온폴리시 자기증류(OPSD)가 학생 정책이 생성한 행동에 대해 특권 정보를 조건으로 한 교사 뷰의 조밀한 피드백을 제공하지만, 저자들은 여기서 Decision–Timestamp Mismatch를 발견한다. 특권 가이드가 학생의 기능적 결정과 어긋날 수 있다는 것인데, 같은 타임스탬프가 같은 결정 맥락을 뜻하지 않고 대응하는 결정이 다른 턴에 나타날 수 있으며, 하나의 결정이 여러 턴에 걸쳐 지속되기도 한다. 그 결과 타임스탬프에 국소화된 지도는 감독 맥락과 크레딧의 시간적 범위를 동시에 어긋나게 만든다.

어떻게 동작하나

제안 방법 AlignOPSD는 '크레딧을 배분하기 전에 지도를 먼저 정렬한다'는 원칙을 따른다. 두 단계로 구성되는데, 먼저 Decision-Aligned Supervision Rectification이 형제 롤아웃들 사이에서 기능적 결정 대응을 추정하고, 그다음 Semi-Markov Hierarchical Credit Assignment가 그 대응 변화로부터 가변 길이 결정 스팬을 도출해 결과에 근거한 크레딧을 배분한다. 중요한 점은 교사가 학생과 파라미터를 공유하고 조건 맥락만 다르다는 것이다. 특권 뷰는 학습 중에만 주어지는 과업 관련 정보를 추가로 조건화한 같은 정책이다.

무엇과 다른가

1단계 정렬은 결정 상태를 직접 매칭하기 어렵기 때문에 thinking trace를 결정 상태의 의미적 대리로 사용한다. 학생 응답에서 파싱한 thinking과 특권 뷰가 생성한 thinking을 동결된 의미 인코더로 임베딩하고, 코사인 유사도로 소스-타깃 대응 행렬을 만든다. 여기서 유사도 임계값 미만 후보를 제거하고, 같은 형제 롤아웃당 최대 하나의 소스만 남기고, top-K개를 선택한다. 세 벤치마크 모두에서 파싱된 액션이 유효하고 액션 임베딩 코사인이 0.8 이상이어야 한다는 액션 일관성 필터를 걸고, WebShop에서는 기호적으로 검증 가능한 액션이므로 연산 타입 일치와 클릭 타깃 동일성까지 요구한다. 이 대응 연산자는 온폴리시 배치마다 다시 계산되어 학습 중 정책과 함께 진화한다. 정류 단계에서는 검색된 응답을 모방하는 대신, 특권 정책이 정렬된 소스 히스토리 아래에서 동일한 학생 응답 전체를 teacher-forcing하여 로그확률을 계산하고, log-sum-exp로 정렬된 뷰들을 집계한다. 최종 정류 갭은 항등 뷰의 국소 갭과 정렬 뷰 갭을 계수 α_u로 혼합한 형태이며, α_u는 매칭 품질에 비례해 0과 α_max 사이에서 적응적으로 결정된다. 유효한 소스가 검색되지 않으면 α_u=0이 되어 기존의 국소 갭으로 환원된다.

어떻게 쓰나

2단계는 정류된 증거를 크레딧으로 바꾸는 부분이다. 인접 턴 사이의 정규화된 대응 분포에 JSD를 적용해 대응 변화량을 측정하고, 배치 적응적 임계값과 지속시간 제약으로 궤적을 연속적인 가변 길이 스팬으로 분할한다. 이 스팬이 semi-Markov 추상화 아래의 크레딧 단위가 된다. 증거 점수는 정류된 갭의 턴 평균에 궤적 결과의 부호를 곱해 정의되며, 값이 클수록 결과와 일관된 교사 지지가 강하다는 뜻이다. 할당기는 궤적 수준 advantage를 결과에 근거한 크레딧 예산으로 보고 2단계로 재분배한다. 스팬의 집계 증거가 스팬 수준 예산을 정하고, 그 예산 조건 아래에서 턴 수준 증거가 스팬 내부 배분을 정한다. 정규화된 턴 가중치는 stop-gradient로 advantage를 재가중하며, KL 정규화가 두 할당 수준이 중립적 크레딧 측도에서 과도하게 벗어나지 않도록 제약한다. 토큰 가중 평균 advantage는 보존된다. 별도의 증류 손실은 추가되지 않고, 대응·스팬·증거·할당량은 모두 stop-gradient로 학습 중에만 쓰인다.

전제와 한계

실험은 Qwen2.5-3B-Instruct와 7B-Instruct를 백본으로 ALFWorld(체화 가사 제어), Search-QA(검색 증강 QA), WebShop(대화형 쇼핑)에서 수행했다. 비교 대상은 학습 없는 프롬프팅(Vanilla, Skill-Prompt*), RLVR 계열(GRPO, Skill-GRPO, Skill-GRPO*), 자기증류 RL 계열(OPSD, GRPO+OPSD, Skill-SD, RLSD, SDAR, StepOPSD)이다. AlignOPSD는 3B/7B 기준으로 ALFWorld 평균 성공률 80.5%/89.1%, Search-QA 정확도 45.1%/49.1%, WebShop Score 86.8%/87.9%를 기록했다. 백본과 집계 지표를 조합한 8개 비교 중 6개에서 1위, 2개에서 2위였고, 2위로 밀린 경우는 3B ALFWorld에서 GRPO+OPSD의 81.2%, 7B WebShop Acc에서 Skill-GRPO*의 81.2%뿐이다. GRPO 대비로는 8개 비교 전부에서 개선했는데, ALFWorld 5.5%/7.9%, Search-QA 8.7%/7.1%, WebShop Score 7.0%/7.0%, WebShop Acc 5.5%/6.3%(3B/7B)다. StepOPSD보다도 8개 비교 모두에서 앞선다. 같은 스킬 소스를 공유하는 조건에서도 격차가 나므로, 특권 정보 자체보다 행동 정렬과 결과 조건부 크레딧 배분이 중요하다는 것이 저자들의 해석이다.

절제 실험은 WebShop 7B에서 이뤄졌다. 정류를 제거하고 적응적 할당만 남기면 Score가 87.9%에서 84.2%로, Acc가 78.9%에서 71.9%로 떨어진다. Acc 하락 폭이 더 큰 것은 정류가 국소적 교사-학생 격차를 완전한 과업 성공을 뒷받침하는 크레딧으로 바꾸는 데 특히 중요하다는 뜻이다. 할당 방식 비교에서는 턴 수준 할당이 토큰 수준보다, 토큰 수준이 랜덤 스팬보다 나았고, AlignOPSD는 토큰 수준 대비 Score/Acc 6.3/7.8%, 턴 수준 대비 1.6/1.6%, 랜덤 대비 9.0/9.4% 앞선다. 민감도 분석에서 검색 top-K는 ALFWorld 3B가 K=2, WebShop 3B가 K=3, WebShop 7B가 K=4를 선호해 단일 최적값이 없었고, thinking 유사도 임계값 γ_H는 0.70~0.80 구간이 유효했으며 WebShop에서 민감도가 컸다. 크레딧 온도 T는 모든 설정에서 0.5가 선호되어 안정적인 기본값으로 제시된다. 메커니즘 분석에서는 학습된 평균 스팬 길이가 ALFWorld 4.41턴, WebShop 3.92턴, Search-QA 2.24턴으로 과업마다 다르게 형성됐고, 정류가 토큰 수준 지도를 항등선에서 체계적으로 벗어나게 만든다는 것도 확인했다.

개발자 관점에서 이 논문의 실용적 시사점은 크레딧 배분의 단위를 고정하지 말라는 것이다. 토큰 단위나 고정 길이 윈도우, 혹은 턴 단위로 보상을 나누는 기존 방식은 하나의 결정이 여러 턴에 걸치는 장기 호라이즌 과업에서 구조적으로 어긋난다. 또한 특권 정보를 조건으로 한 교사 뷰를 쓸 때, 같은 위치의 확률 비교가 유효하더라도 그 비교가 현재 결정의 품질을 분리해낸다는 보장은 없다는 지적은 실무 파이프라인 설계에 직접 적용된다. 다만 도입을 검토한다면 thinking trace를 결정 상태의 대리로 쓴다는 전제, 액션 일관성 필터의 임계값(0.8), 그리고 top-K·γ_H·T가 과업과 모델 규모에 따라 달라진다는 민감도를 먼저 확인해야 한다. 특히 검색 기반 대응 연산을 매 배치마다 다시 계산하는 비용과, 특권 정보가 학습 시에만 필요하다는 제약도 함께 따져야 한다.

한계와 전제는 다음과 같다. 제공된 본문에는 별도의 한계 절이 없지만, 저자들이 명시한 전제는 여러 곳에 드러난다. 첫째, 결정 상태 매칭은 직접 상태 비교가 아니라 thinking trace를 의미적 대리로 삼는 근사이며, 부록 C.2에서 동일 상태 쌍과 크로스 롤아웃 쌍을 비교 감사하는 방식으로 이 대리를 검증했다는 정도만 밝히고 있다. 둘째, 하이퍼파라미터 민감도 분석이 보여주듯 검색 top-K와 유사도 임계값은 과업·규모 의존적이어서 단일 값이 모든 설정을 지배하지 않는다. 셋째, 민감도 곡선은 개발 히스토리에서 얻은 검증 성공률이며 시드 간 불확실성을 나타내는 곡선이 아니라고 저자들은 명시한다. 넷째, 실험은 Qwen2.5-3B/7B 두 규모와 세 벤치마크로 제한되어 있고, 정류 효과에 대한 절제는 WebShop 7B 한 조건에서만 보고된다.