SkillForge가 스킬 도태와 변이로 에이전트와 스킬을 함께 진화시킨다

SkillForge: Co-Evolving Skills and Agents via Dynamic Skill Lifecycles

HF Daily2610.09832

Yuyao Ge, Yiwei Wang, Yuchen He2026-10-07조회 1

무엇인가

LLM 에이전트가 장기 호흡 과제를 푸는 데 쓰이는 메모리 증강 강화학습에서 스킬은 지시문과 적용 조건을 묶은 일종의 메모리다. 문제는 정책이 좋아질수록 스킬 라이브러리를 무차별적으로 계속 쌓는 방식이 통하지 않는다는 점이다. 쓸모없어진 스킬, 심지어 해로운 스킬이 남아 에이전트를 오도하고, top-k 검색은 노이즈를 늘리며, 한때 유용했던 스킬이 정책이 성숙하면서 오히려 역효과를 내는 현상을 저자들은 지연된 진부화(delayed obsolescence)라고 부른다. 논문은 이를 어떤 시점에 f_i ≥ δ_stable이었다가 이후 f_i < δ_retire로 떨어지는 사건으로 형식화한다. 기존 스킬 증강 RL(SkillRL 등)은 라이브러리를 단조 증가(append-only)로 취급해 이 문제를 그대로 안고 있었다.

어떻게 동작하나

SkillForge는 라이브러리 관리를 수동적 축적이 아니라 능동적 단조(forging) 과정으로 다룬다. 1단계는 사전 퇴역 평가다. 베이스 모델로 스킬을 주입한 롤아웃을 M회 돌려 스킬별 사용 횟수 U_i와 성공 횟수 C_i를 모으고, 원시 적합도 f̂_i = C_i / U_i가 보수적 임계값 δ_pre 미만이면서 최소 N_min회 이상 쓰인 스킬을 미리 퇴역시킨다. 2단계는 퇴역 인지 콜드스타트 SFT다. 성공한 궤적 가운데 이미 퇴역한 스킬에 의존한 궤적을 제외한 문맥-행동 쌍으로 교차엔트로피 파인튜닝을 해 초기 정책과 참조 정책을 만든다. 3단계에서 GRPO 기반 에이전트 RL이 시작되고, 매 반복마다 스킬과 정책이 함께 진화한다.

무엇과 다른가

핵심은 적합도 기반 수명주기다. 각 스킬은 trial, active, stable, retired 네 상태를 오가며, 임계값은 δ_retire < δ_demote < δ_stable로 두어 히스테리시스를 준다. stable 스킬의 적합도가 떨어지면 곧바로 퇴역하지 않고 먼저 active로 강등된 뒤에야 퇴역 자격을 얻는다. trial 스킬은 N_promote회 사용을 채워야 active가 되고, active는 f_i ≥ δ_stable과 N_stable 사용을 만족하면 stable로 승격한다. 퇴역 문턱은 변이 세대 g_i에 따라 달라서, 증류된 원본 스킬(g_i=0)은 N_protect라는 더 높은 사용 기준을 넘겨야 퇴역한다. 적합도가 중간 구간 [δ_low, δ_high]에 걸친 active 스킬은 변이 후보가 되고, 역적합도 가중 샘플링 P(s_i) ∝ 1-f_i로 부모를 뽑아 최근 실패 궤적과 함께 교사 모델에 넘겨 개선판을 생성한다. 자식은 trial 상태와 g_parent+1 세대로 들어간다. 교사 모델은 훈련 대상 정책과 다른 모델 계열로 쓴다는 점도 명시돼 있다.

어떻게 쓰나

실험은 ALFWorld(체화 제어), WebShop(웹 내비게이션), Search-Augmented QA(NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue, Bamboogle) 세 축에서 이뤄졌다. 베이스 모델은 Qwen2.5-7B-Instruct, 프레임워크는 verl, 정책 최적화는 GRPO다. 200 스텝, 학습률 1e-6, 클리핑 ε=0.2, KL 계수 β=0.001, 롤아웃 온도 1.0, 그룹 크기 G=8, 단조 주기는 10 스텝마다, 사이클당 변이 최대 5개·퇴역 최대 3개, 변이 교사 모델은 Kimi-K2.5다. 결과는 ALFWorld 92.4%, WebShop 78.4%로 GPT-4o와 Gemini-2.5-Pro를 크게 앞서고, 가장 직접적인 비교 대상인 SkillRL 대비 ALFWorld에서 2.8%, WebShop에서 7.8% 상대 개선이다. ALFWorld 하위 과제 중 Look에서는 상대 개선이 21.3%에 달했고, Clean은 SkillRL과 0.2% 차이로 샘플링 노이즈 범위였다. Search-Augmented QA 전체 테스트셋에서는 48.7±0.3% 마이크로 평균 정확도로 전체 방법 중 최고였다.

전제와 한계

절제 실험에서 수명주기 전체를 제거했을 때 모든 환경에서 가장 큰 하락이 나왔고 WebShop에서 7.4%까지 떨어졌다. 단일 요소로는 사전 퇴역이 가장 영향이 커서 ALFWorld 1.8%, WebShop 4.5%, Search-Augmented QA 2.5%의 상대 하락을 만들었다. 라이브러리 크기가 성능을 보장하지 않는다는 점도 수치로 드러난다. 퇴역을 끄면 ALFWorld에서 스킬이 130개를 넘지만 SkillForge는 100개의 간결한 집합으로 더 좋은 성능을 낸다. WebShop에서는 사전 퇴역과 변이만 켜면 정적 72.6%가 75.9%로 오르고, 여기에 퇴역을 더하면 라이브러리가 121개에서 95개로 줄면서 남은 3.2% 상대 격차를 메워 최종 78.4%가 된다. ALFWorld 기준 200 스텝 동안 132개가 생성되고 32개가 퇴역해 비퇴역 스킬 100개가 되며, 170 스텝 부근에서 상한이 걸린 뒤 변이와 퇴역이 균형을 이룬다. 최종 체크포인트에서 76개가 stable, 24개가 active 또는 trial이다. 적합도 분포는 δ_retire 미만 비율이 7.5%에서 2.0%로 줄고, 중간 구간은 18.9%에서 22.0%로 늘며, 평균 적합도는 0.73 근처에서 균형을 유지한다.

실무적으로 이 논문이 주는 신호는 명확하다. 에이전트에 스킬·메모리·프롬프트 라이브러리를 붙여 RL이나 파인튜닝을 돌린다면, 라이브러리를 추가만 하는 구조는 정책이 좋아질수록 조용히 성능을 깎는다. 특히 한때 잘 되던 스킬이 정책 성숙 후 방해물이 되는 지연된 진부화는 사람이 눈으로 찾기 어렵다. SkillForge의 처방은 스킬마다 사용·성공 카운터를 유지하고, 최소 사용량 조건과 히스테리시스 임계값을 두고, 중간 성능 스킬은 버리지 말고 교사 모델로 재작성하며, 퇴역 스킬에 의존한 성공 궤적은 SFT 데이터에서 제외하는 것이다. 훈련 파이프라인에 스킬 감사 주기를 넣을지 판단할 때 참고할 만하다. 함께 공개된 SkillFurnace는 5k+ 레코드로, 퇴역 필터를 거친 SFT 궤적과 적합도 주석이 붙은 진화한 스킬 라이브러리, 사람이 실패 유형을 라벨링한 퇴역 이벤트를 묶은 데이터셋이다.

저자들이 밝힌 전제는 몇 가지다. 변이를 만드는 교사 모델은 훈련 대상 정책과 다른 모델 계열을 써야 한다는 것으로, 자기 생성 스킬은 이득이 미미하거나 오히려 해롭다는 선행 연구를 근거로 든다. 온폴리시 적합도 추정을 쓰는 이유도 오프폴리시 대안의 노출 편향을 피하기 위해서다. 계산 비용은 사이클당 퇴역·변이 예산과 전체 스킬 상한으로 묶어 두었고, 임계값과 최소 사용 횟수 같은 하이퍼파라미터는 부록에 정리돼 있다. 실험은 Qwen2.5-7B-Instruct 단일 베이스 모델과 세 벤치마크 계열에 한정되며, 제공된 본문에는 별도의 한계 절이 없어 이 설정 밖으로의 일반화는 검증되지 않았다. 다만 퇴역 스킬의 평균 적합도가 0.67까지 올랐다가 퇴역 시점에 0.28 하락하고, 57.2%가 stable 상태를 먼저 거친 뒤 쇠퇴했다는 관찰은 지연된 진부화가 예외가 아니라 기본 양상임을 보여준다.