공개 스킬 수백만 개를 검색해 에이전트 스킬을 최적화하는 RASO
Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation
무엇인가
에이전트 스킬은 특정 실행 환경(harness)에서 에이전트가 과제를 수행하는 절차를 자연어로 적어 둔 재사용 가능한 문서다. 모델 가중치와 달리 텍스트라서 검사·수정·공유가 쉽고, 이미 수백만 개의 스킬이 공개돼 다양한 과제·도메인·harness의 절차 지식을 담고 있다. 그런데 기존 스킬 최적화 기법은 이 축적된 지식을 거의 쓰지 않고, 대상 과제에서 에이전트를 반복 실행(롤아웃)해 얻은 경험만으로 스킬을 다듬는다. 논문은 이 비용을 문제로 지목하고, 외부 스킬 코퍼스를 사전 지식으로 끌어오는 RASO(Retrieval-Augmented Skill Optimization)를 제안한다.
어떻게 동작하나
RASO의 공통 부품은 두 가지다. 먼저 스킬 문서를 제목 기준 섹션으로 쪼개 섹션 단위로 검색한다. 문서 전체를 검색하면 관련 없는 내용이 섞이고 전체 목적이 비슷한 문서가 과대평가되기 때문이다. 질의 생성 에이전트가 질의 q를 만들면 BM25로 상위 K개 섹션을 가져온다. 다음으로 Cross-Harness Adaptation이 붙는다. 검색된 스킬은 원래 다른 과제와 harness용이라 도메인 고유 명사나 대상 환경에 없는 도구를 참조할 수 있다. 적응 에이전트는 요구사항 c_i, 과제 설명 T, harness 설명 H, 검색 섹션들을 받아 짧고 실행 가능한 교훈 ℓ_i를 만든다. 이때 도메인 고유 명사를 지우고, 대상 harness에 대응물이 없는 절차는 생략하며, 도구·파라미터 동작에 대한 구체적 주장은 H로 뒷받침될 때만 남긴다. 결과물은 대상 과제와 harness의 객체·명령·단위로 다시 표현된다.
무엇과 다른가
첫 단계인 RASI(Retrieval-Augmented Skill Initialization)는 롤아웃을 한 번도 쓰지 않고 초기 스킬을 만든다. 과제·harness 설명에서 요구사항-질의 쌍 M개를 생성하고, 각 질의로 섹션을 검색해 교훈 집합을 만든 뒤, 스킬 초기화 에이전트가 각 교훈을 해당 실행 단계에 통합해 초기 스킬 s0를 합성한다. 두 번째 단계인 RASU(Retrieval-Augmented Skill Update)는 학습 데이터에서 미니배치를 뽑아 현재 스킬로 롤아웃을 돌리고, 실패 궤적을 분석해 실패 모드별 텍스트 그래디언트 δ_i와 검색 질의 q_i를 N개 생성한다. 같은 검색·적응 파이프라인으로 교훈을 얻은 뒤 스킬 업데이터가 후보 스킬 s_{t+1}을 만든다. 후보는 검증셋에서 기존 스킬보다 나을 때만 채택되고, 아니면 기존 스킬이 유지된다. 문제 설정 자체는 고정된 모델 M과 harness h 아래에서 검증셋 기대 보상을 최대화하는 자연어 스킬 s를 찾는 것이며, 초기 스킬 생성까지 최적화 문제에 포함한다.
어떻게 쓰나
실험은 OfficeQA, SpreadsheetBench, ALFWorld, WebShop 네 벤치마크와 GPT-5.6-Luna, Qwen-3.5-9B 두 모델에서 수행했고, 외부 코퍼스로 GitSkills를 썼다. 초기화만 비교했을 때 RASI는 GPT-5.6-Luna에서 RFSI(검색 없는 LLM 초기화) 대비 OfficeQA 45.74 대 40.11(+5.63), Spreadsheet 49.17 대 44.40(+4.77), ALFWorld 72.64 대 69.40(+3.24), WebShop 45.06 대 43.89(+1.17)를 기록했다. Qwen-3.5-9B에서는 +5.61, +2.74, +5.72, +10.73이었다. 검색만 하고 적응을 하지 않는 SkillRouter는 여러 벤치마크에서 스킬 없음(No Skill)보다도 낮았고, OfficeQA에서는 두 방법 모두 11.44에 그쳤다. 이는 적응 없는 직접 재사용이 무관하거나 맞지 않는 절차 지식을 끌어온다는 신호다.
전제와 한계
업데이트까지 포함한 RASO는 TextGrad, GEPA, SkillOpt, WikiSkill을 앞섰다. GPT-5.6-Luna에서 최강 경쟁 기법 대비 OfficeQA 49.03 대 45.54(+3.49), SpreadsheetBench 63.33 대 57.02(+6.31), ALFWorld 74.13 대 72.64(+1.49), WebShop 46.61 대 45.54(+1.07)였다. Qwen-3.5-9B에서는 +4.85(42.25 대 37.40), +1.79(31.55 대 29.76), +7.47(51.00 대 43.53), +11.30(24.73 대 13.43)이었다. 절제 실험에서 검색 없는 기준선(40.70/51.67)에 RASU만 붙이면 47.56/61.07(+6.86/+9.40), RASI만 붙이면 45.93/58.45(+5.23/+6.78), 둘 다 붙이면 49.03/63.33(+8.33/+11.66)으로 두 요소가 상보적이었다. Cross-Harness Adaptation을 빼면 RASI가 OfficeQA 41.86→45.74, Spreadsheet 41.43→49.17로, RASU가 46.70→49.03, 57.86→63.33으로 떨어졌다. 검색 섹션 수 K는 1에서 5까지 늘릴수록 좋아지고 K=10에서는 소폭 나빠져 K=5를 쓴다. 코퍼스 크기는 1%만 써도 검색 없음보다 나았고, 커질수록 개선됐다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 명확하다. 에이전트 스킬을 처음부터 롤아웃으로 학습시키는 대신, 공개 스킬 저장소를 섹션 단위로 검색해 초기 스킬의 출발점으로 쓰면 롤아웃 예산을 아낄 수 있다. 다만 검색 결과를 그대로 프롬프트에 붙이는 방식은 SkillRouter 결과가 보여주듯 위험하다. 대상 harness의 도구·명령·단위로 다시 써 주는 적응 단계가 사실상 성능을 좌우하므로, 자체 파이프라인을 만들 때는 검색기보다 적응 프롬프트와 harness 설명의 품질을 먼저 점검해야 한다. 또한 RASU는 검증셋 기반 채택 규칙을 쓰므로 검증 분할과 평가 지표 설계가 그대로 최적화 루프의 안전장치가 된다.
논문이 제시한 전제와 한계도 분명하다. 모델 M과 harness h는 최적화 내내 고정이고 의사결정 변수는 자연어 스킬 텍스트뿐이다. 보상은 참조 답이 있으면 비교로, 없으면 환경의 자체 성공 기준으로 계산되므로 벤치마크별 평가기에 의존한다. 검색 품질은 GitSkills 코퍼스와 BM25, K=5 설정에 묶여 있고, K를 10으로 늘리면 중복·저관련 정보가 섞여 성능이 소폭 떨어진다고 저자들은 밝힌다. 제공된 본문에는 별도의 한계 절이 없어, 코퍼스 도메인 편향이나 적응 에이전트의 오류 전파 같은 항목은 명시적으로 다뤄지지 않았다.