UniSkill이 추가 롤아웃 없이 정책과 스킬뱅크를 함께 진화시킨다

UniSkill: Learning Actor-Aligned Skill Proposals for an Evolving Policy

HF Daily2610.10164

Yifei Lu, Cheng Liu, Dianzhi Yu2026-10-07조회 1

무엇인가

LLM 에이전트가 이전 상호작용에서 재사용 가능한 스킬을 축적해 과제를 개선한다는 흐름에서, 최근 연구는 과제 수행과 스킬 추출을 공동 최적화해 정책과 스킬뱅크를 함께 진화시킨다. 문제는 학습 피드백의 출처다. 액터가 계속 갱신되는 상황에서 이후 학습 스텝의 스킬 재사용 결과로 스킬 제안에 보상을 주면 스킬 자체의 이득과 액터의 개선이 뒤섞인다. 반대로 각 제안 스킬을 직접 검증하려면 후보마다 추가 액터 롤아웃이 필요해 비용이 크다. 이 논문은 이미 수집된 궤적이 새 스킬 제안에 대한 학습 피드백을 제공할 수 있는지 묻는다.

어떻게 동작하나

UniSkill의 골격은 하나의 공유 정책 πθ가 두 역할을 겸하는 것이다. 검색된 스킬 s를 조건으로 환경 행동을 생성하는 액터, 그리고 완료된 궤적에서 스킬 편집 제안을 생성하는 스킬 제안자다. 제안은 편집 연산 op ∈ {No Edit, Add, Update}와, Add·Update인 경우 후보 스킬 내용 s̃로 구성된다. 제안자는 소스 궤적 τ와 같은 과제·같은 검색 스킬에서 나온 반대 결과 궤적 τ_opposite를 함께 보고 판단한다. No Edit은 스킬뱅크를 그대로 두고, Add는 재사용 가능한 별도 지침이 드러났을 때 새 항목을, Update는 검색된 스킬의 교정·정제·확장이 필요할 때 수정안을 낸다.

무엇과 다른가

액터는 환경 보상으로 GRPO를 통해 학습한다. 그룹 상대 어드밴티지와 참조 정책 대비 KL 정규화를 쓰는 표준적인 형태다. 스킬 제안자 쪽의 핵심은 대조적 행동 피드백이다. 정책 업데이트 전에 현재 액터와 기록된 행동을 고정하고 조건 스킬만 바꿨을 때, 같은 과제의 성공 참조 궤적과 실패 참조 궤적 사이의 행동 로그우도 격차가 어떻게 변하는지를 측정한다. J(τ;s)는 궤적의 기록된 행동에 대한 토큰 정규화 로그우도 평균이고, Δ+ = J(τ+;s̃) − J(τ+;s), Δ− = J(τ−;s̃) − J(τ−;s)로 두면 액터 정렬 보상은 R_align = Δ+ − Δ−다. 참조 궤적은 제안자에게 입력으로 준 τ와 τ_opposite를 제외하고 같은 그룹에서 뽑으며, 성공·실패 집합이 모두 비지 않을 때만 사용한다. 제안마다 새 롤아웃을 돌리지 않는다는 점이 이 설계의 요지다.

어떻게 쓰나

제안자 보상은 세 갈래다. 형식이 제대로 갖춰졌는지에 대한 r_fmt, 스킬 크리틱이 편집 연산의 적절성을 판정한 r_op, 그리고 내용 보상 r_skill이다. 내용이 궤적에 근거하고 재사용 가능하다고 판정되면 r_skill = clip(R_align, −η, η), 지지되지 않으면 −η, No Edit이면 0이다. η는 0.05로 고정한다. 제안자는 REINFORCE++로 학습하며 세 보상을 합산한 스칼라를 전역 배치에서 정규화해 어드밴티지로 쓴다. 여기서 제안 수준 어드밴티지가 편집 연산과 내용 토큰에 함께 적용되기 때문에, 내용 점수가 나쁘면 정작 적절했던 연산까지 억제될 수 있다. 이를 막기 위한 것이 스킬 편집 지원 정규화로, 사용 가능한 연산의 재정규화 확률이 p_min = 0.1 아래로 떨어지면 페널티를 준다. 전체 목적함수는 액터 손실과 λ_prop로 가중한 제안자 손실의 합이다. 스킬뱅크 반영 기준은 학습 신호보다 엄격해서, 크리틱 검사를 통과하고 Δ+ > 0과 R_align > 0을 모두 만족하는 Add·Update만 적용하며, 같은 Update 대상에는 R_align이 가장 높은 제안을 쓴다.

전제와 한계

실험은 ALFWorld와 WebShop 두 멀티턴 벤치마크에서 Qwen2.5-7B-Instruct를 공통 베이스로 수행했다. UniSkill은 ALFWorld 98.4% 성공률, WebShop 과제 점수 90.5에 성공률 84.7%를 기록했다. RL만 쓰는 베이스라인 대비 ALFWorld 성공률이 GRPO보다 20.8%p, GiGPO보다 7.6%p 높고, 스킬 증강 RL과 비교하면 WebShop 성공률이 SkillRL보다 12.0%p 높다. Skill1과는 ALFWorld에서 0.9%p, WebShop에서 1.8%p 앞선다. 후보 스킬을 추가 환경 롤아웃으로 평가하는 Evolving-RL보다 ALFWorld 성공률이 5.4%p 높은데, Evolving-RL은 초반 상승 뒤 성능이 붕괴하는 반면 UniSkill은 250 스텝 동안 검증 성공률이 완만하게 상승하며 안정적으로 공동 학습을 유지했다. 스킬뱅크는 학습 초반 급격히 커지다가 채택되는 Add가 줄면서 완만해지고, 이후에도 간헐적 추가와 갱신이 이어진다. 단계별 시간 비교에서는 롤아웃 기반 스킬 평가가 Evolving-RL 시간의 대부분을 차지하는 반면, UniSkill은 기존 궤적에서 R_align을 계산해 전체 시간이 더 낮았다. 공유 백본을 Qwen2.5-3B-Instruct로 줄여도 후반 학습에서 90%를 넘기며 GRPO-7B를 앞섰다.

분석은 세 갈래다. 첫째, 공동 학습의 기여를 보기 위해 평가 시 스킬 검색을 끄면 UniSkill이 96.1%를 유지한 반면 Actor Only와 R_align 보상을 뺀 변형은 각각 84.4%, Skill Proposer Only는 34.4%에 그쳤다. 같은 공동 학습 절차와 갱신 규칙을 쓰고 R_align 포함 여부만 다른 비교라, 액터 정렬 피드백 자체가 검색 없는 액터 성능에 기여한다는 근거로 제시된다. 둘째, R_align이 실제 액터 정렬을 잡아내는지 확인한 결과 25스텝과 75스텝에서 Spearman 상관이 각각 ρ = 0.312, 0.367이었고, 양수 제안의 평균 롤아웃 이득은 8.4%p와 7.2%p, 음수 제안은 −3.4%p와 −0.5%p였다. 다만 양수 제안 중 13/53(24.5%)과 10/64(15.6%)는 실제 이득이 음수여서, 집계 수준에서는 유용하지만 개별 제안의 개선을 보장하지는 않는다. 셋째, 지원 정규화가 없으면 편집 연산이 하나(해당 실행에서는 Add)로 붕괴했고, 있으면 세 연산이 비율을 바꿔가며 계속 샘플링되면서 초반 개선이 빠르고 후반 성공률도 높았다.

실무 관점에서 이 논문은 스킬 메모리를 가진 에이전트를 RL로 학습시킬 때 스킬 평가 비용을 어디서 줄일 수 있는지에 대한 설계도를 준다. 재사용 시점에는 액터가 이미 갱신되어 있어 과제 성공만으로는 스킬의 기여를 분리할 수 없다는 진단, 그리고 그 대안으로 로그우도 대조를 쓰는 방식은 스킬뱅크를 운영하는 시스템에 바로 참고할 만하다. 도입 전에 확인할 것은 스킬 크리틱이 별도 LLM(논문에서는 DeepSeek-V4-Pro 프롬프트) 판정에 의존한다는 점, 검색기가 Qwen3-Embedding-0.6B라는 점, η = 0.05와 p_min = 0.1 같은 하이퍼파라미터, 그리고 R_align이 개별 제안 단위가 아니라 집계 수준의 프록시라는 점이다.

저자들이 명시한 전제와 한계는 다음과 같다. R_align은 액터 정렬의 근사 신호로, 양수 점수를 받은 제안 상당수(24.5%, 15.6%)가 실제 롤아웃에서 오히려 손해를 냈다. 스킬뱅크 반영 여부도 크리틱 판정과 Δ+ > 0, R_align > 0이라는 조건에 의존한다. 실험은 공개된 ALFWorld와 WebShop 시뮬레이션 환경에 한정되며 실제 물리 행동이나 실제 구매는 포함하지 않고, 사람 대상 실험이나 개인정보 수집도 없다. 학습은 빈 스킬뱅크에서 시작한다. 분포 외 일반화와 스킬 크리틱 민감도 실험은 부록 D.1, D.2로 위임되어 본문에는 구체적 수치가 제시되지 않았고, 별도의 한계 절도 원문에 마련되어 있지 않다.