Skill2Env가 스킬을 실행 환경으로 합성해 에이전트를 학습시킨다
Skill2Env: Capability-Oriented Environment Synthesis from Skills for General Agents
무엇인가
도구 사용과 다단계 상호작용이 필요한 실제 작업에 LLM을 투입하려면 실행 가능한 환경에서의 후학습이 중요하다. 그런데 실행 가능한 과제와 환경을 만드는 일은 지시문 생성만으로 끝나지 않는다. 사용할 도구를 구성하고, 과제 자원과 상태를 담을 워크스페이스를 준비하고, 과제 목표에 정렬된 평가 기제를 세워야 한다. 이 상호의존적인 구성요소를 과제마다 수작업으로 만들고 유지하는 것은 에이전트 학습에 필요한 규모와 다양성으로 확장하기 어렵다. 스킬은 도메인 지식과 운영 절차, 도구 사용 지침을 담고 있어 좋은 출발점이지만, 스킬에 담긴 정보와 구체적이고 도전적인 과제 및 완전한 실행 환경 사이에는 여전히 큰 간극이 있다. 이 논문은 그 간극을 에이전트의 능력 요구로부터 메우는 Skill2Env를 제안한다.
어떻게 동작하나
방법의 핵심은 능력 요구를 난이도 패턴으로, 난이도 패턴을 태스크 블루프린트로 번역하는 것이다. 저자들은 복잡한 과제 수행 과정을 분석해 환경 이해, 계획, 스킬 사용, 장기 일관성, 오류 복구라는 다섯 가지 능력 요구를 정의한다. 각 요구는 여러 난이도 패턴으로 구체화되며, 예컨대 환경 이해에는 사실을 여러 출처에 흩어 놓는 분산 증거와 명시되지 않은 규칙을 추론하게 하는 암묵적 제약이, 계획에는 뒤 연산을 앞 결과에 묶는 상태 의존성과 누적 자원 사용을 제한하는 자원 예산이 대응한다. 패턴 풀은 100개로 초기화되고 다섯 차원으로 조직된다. 합성 에이전트는 스킬 κ가 지원하는 워크플로를 파악해 호환되는 패턴 부분집합을 고르고, 목표·도전·환경 사실·정보 경계·수용 기준·실행 요구사항을 담은 태스크 블루프린트 B를 작성한다. 블루프린트는 저자 측 계약으로서 과제 지시문 g, 실행 기반 X, 초기 워크스페이스 W0, 루브릭 평가기 V의 동시 구성을 이끈다. 형식적으로 환경은 E=(X, κ, W0), 과제는 T=(g, E, V)이며, 보상은 루브릭 항목별 점수 q_c에 가중치 w_c를 곱한 합(가중치 합은 1)으로 정의된다. 프로그램으로 검증 가능한 항목은 이진 점수를, 나머지는 LLM 판정이 부분 점수를 준다. 실행 후에는 검증 에이전트가 블루프린트와 실행 증거를 대조하고, 과제 조건 불일치나 평가기 오류에서 비롯된 증거는 능력 진단에서 제외한다.
무엇과 다른가
스킬은 ClawHub에서 47K개 이상의 공개 스킬 폴더를 내려받아 실용성, 런타임 호환성, 설치 가능성 세 기준으로 걸러 3K개 이상을 남겨 확보했다. 여기에 Iterative Task Hardening을 얹는다. 반복 j에서 솔버가 과제 T(j)를 실행해 궤적과 루브릭 결과를 내면, 보상이 임계값 0.7을 넘는 과제만 추가 경화 대상이 된다. 진단 에이전트는 블루프린트가 의도한 도전을 솔버가 어떻게 처리했는지, 지름길로 우회했는지, 어디에 잔여 실패가 남았는지 비교한다. 일반화 가능한 도전이 발견되면 재사용 난이도 패턴으로 추상화해 패턴 풀에 추가하고, 경화 제안을 블루프린트에 반영해 지시문·실행 기반·워크스페이스·평가기를 함께 갱신한다. 전체 파이프라인은 2,963개의 실행 가능한 과제를 만들어낸다.
어떻게 쓰나
실험은 7개 벤치마크에서 이뤄졌다. Terminal-Bench 2.1, SWE-bench Multilingual, SkillsBench, Claw-Eval, τ³-Banking, AutomationBench, VitaBench가 대상이며, 비교군은 GPT-5.4, Claude Opus 4.6, Gemini-3.1 Pro, DeepSeek-V4-Flash, GLM-5.2, Kimi-K2.6, Qwen3.8-27B, Qwen3.5-397B-A17B와 백본 Qwen3.6-35B-A3B, 그리고 스킬 기반 환경 합성 베이스라인 FACET이다. 학습은 DeepSeek-V4-Flash가 생성한 궤적 중 r>0.9 필터를 통과한 1.5K개로 Qwen3.6-35B-A3B를 5 에폭, 글로벌 배치 32, Megatron, 최대 학습률 10⁻⁵·최소 10⁻⁶, 코사인 감쇠, 10% 워밍업으로 미세조정하는 방식이다. 결과적으로 7개 벤치마크 비가중 평균이 36.6에서 45.0으로 8.4포인트 올랐다. SkillsBench +14.34, Terminal-Bench 2.1 +13.5, SWE-bench Multilingual +7.7, AutomationBench +7.34, VitaBench +5.87, Claw-Eval +5.51, τ³-Banking +4.47 순으로 개선됐다. 35B 백본이 397B급인 Qwen3.5-397B-A17B를 7개 중 6개 벤치마크에서 앞선 점도 눈에 띈다.
전제와 한계
세부 분석도 제시된다. SkillsBench에서는 스킬을 켠 조건에서 14.3%p, 끈 조건에서 10.4%p 향상됐고, 스킬을 켠 경우 8개 도메인 중 7개(금융은 변화 없음), 끈 경우 8개 전부에서 좋아졌다. 미디어 +46.7, 수학·운영연구 +26.9, 소프트웨어 공학 +23.4가 특히 컸다. Terminal-Bench 2.1은 하네스를 바꿔도 개선이 유지됐다. pi 46.1→57.3(+11.2), Terminus-2 44.9→58.4(+13.5), OpenCode 38.2→55.1(+16.9), Claude Code 40.5→52.8(+12.3)이다. 경화 효과는 동일 과제 정체성 500쌍을 반복 0·1·2에서 비교해 확인했다. DeepSeek-V4-Flash와 pi 하네스 기준 만점률은 48.40%에서 24.80%, 15.40%로 떨어졌고 평균 어시스턴트 턴 수는 25.91에서 36.54, 38.85로 늘었다. 반복 0에서 2로 가며 만점률 33.0%p 감소, 상호작용 스텝 약 50% 증가다. 학습 효용도 각 반복에서 r>0.9 필터로 500개 궤적을 무작위 샘플링해 비교했을 때 7개 벤치마크 평균이 40.58, 42.51, 42.87로 올라 반복 0 대비 2.29포인트 개선됐다.
개발자 관점에서 이 논문의 실용적 메시지는 스킬 라이브러리를 학습 데이터 소스로 쓸 때 스킬을 그대로 태스크로 삼지 말라는 것이다. 능력 요구를 먼저 정의하고, 그것을 재사용 가능한 난이도 패턴으로 환원하고, 목표·정보 경계·수용 기준을 명시한 블루프린트를 계약처럼 두고 환경과 평가기를 함께 만드는 구조가 핵심이다. 특히 솔버 실행 증거로 이미 잘 푸는 과제만 골라 난이도를 반복 상향하는 루프는 자체 에이전트 학습 데이터의 난이도 관리에 참고할 만하다. 도입 전에 확인할 것은 루브릭 가중치 설계와 LLM 판정 의존도, 특정 하네스에 묶인 평가 프로토콜, 그리고 합성에 Kimi-K3, 솔버에 Qwen3.6-35B-A3B, 루브릭 판정에 Qwen3.5-397B-A17B를 고정 사용했다는 전제다.
저자들이 밝힌 가장 분명한 한계는 프런티어 모델 참조가 여러 벤치마크에서 여전히 더 강하며 상당한 개선 여지가 남아 있다는 점이다. 또한 FACET 수치는 원 논문의 보고치를 그대로 인용했고, 경화 트리거 임계값 0.7, SFT 품질 필터 r>0.9, 1.5K 궤적, 반복별 500개 샘플 같은 실험 설정이 특정 모델과 하네스 조합에 묶여 있다. 제공된 본문에는 별도의 한계 절이 없어, 합성 파이프라인이 특정 스킬 라이브러리(ClawHub)와 Linux 샌드박스 전제에 의존한다는 점은 방법 서술에서 확인되는 조건부 전제로 남는다.