자연어 설명만으로 LLM용 스킬을 최적화하는 Prompt2Skill
Prompt2Skill: Unsupervised Skill Optimization From Natural Language Instructions
무엇인가
이 논문이 다루는 것은 LLM이 추론 시점에 컨텍스트에 넣어 쓰는 외부 산출물, 즉 '스킬'이다. 스킬은 모델 가중치를 건드리지 않고도 특정 도메인의 절차와 관례, 도구 사용법을 주입해 성능을 올린다. 문제는 지금 대부분 전문가가 손으로 쓴다는 점이다. 새 과제마다 도메인 지식과 스킬 포맷 이해, 모델 동작에 대한 반복 실험이 필요해 확장이 안 된다. 게다가 만들어진 스킬은 소비하는 모델에 맞춰 최적화된 것이 아니다. 모델의 실패 양상은 버전, 규모, 학습 방식에 따라 달라진다. Trace2Skill이나 SkillOpt 같은 기존 자동 스킬 최적화 연구도 라벨이 붙은 in-distribution 학습셋을 전제하는데, 배포된 사용자에게 그런 자원은 없다. 학습셋을 예시 하나로 줄이면 이득이 데이터 없이 쓴 초안 수준으로 무너진다는 것이 선행 연구의 보고다. Prompt2Skill은 이 전제를 제거하고, "위키피디아 지문을 읽고 질문에 답하는 모델을 원한다" 같은 자연어 설명 하나만 받는다.
어떻게 동작하나
구조는 두 개의 에이전트다. 먼저 Data Agent가 과제 설명 d와 선택적 예시로부터 과제 명세 τ와 시드 스킬 s0를 함께 생성한다. τ에는 입력 구조, 과제 유형, 언어, 기대 답변 형식, 평가 기준이 기록되고, 이로부터 정규화 exact match나 수치 동등성, 답변 포함 여부 같은 실행 가능한 프록시 지표 μ̂_τ가 정해진다. 논문은 μ̂_τ와 실제 지표 μ를 명확히 구분한다. 전자는 시스템이 요청을 해석한 결과이고, 후자는 타깃 과제에서의 진짜 성능이다. 시드 스킬 s0는 데이터를 보거나 모델 실패를 관찰하기 전에 생성되는 짧은 지시문으로, 이후 최적화의 출발점이 된다.
무엇과 다른가
Data Agent의 일은 최적화용 입력-정답 쌍 풀을 만드는 것이다. Hugging Face 데이터셋 카탈로그와 위키피디아 인터페이스를 검색 도구로 두고, τ를 바탕으로 검색 질의를 생성해 후보 소스를 모은다. 검색된 소스가 요청한 과제 형태가 아니면 스키마와 샘플을 보고 변환 계획 π_b를 세워 레코드를 입력-정답 쌍으로 바꾸고, 구조적 변환으로 부족하면 검색된 지문이나 예시를 재료로 새 항목을 합성한다. 모든 항목은 구조 검사와 과제 적합성 검사를 거친다. 특히 시드 스킬을 장착한 모델이 샘플 항목을 하나도 맞추지 못하는 소스는 통째로 거부하고, 합성 항목은 시드 모델이나 직접 프롬프트 모델 중 하나라도 정답을 내야 통과한다. 통과한 항목은 중복 제거를 거쳐 풀 P에 들어가며, 이 데이터는 세 역할로 나뉜다. 반성 집합 T_t는 실패 사례를 제공하고, 매 라운드 새로 뽑는 수용 배치 B_t는 후보 비교에 쓰이며, 초기화 시 고정된 선택 집합 V는 최종 선택 전용으로 남는다.
어떻게 쓰나
Skill Agent는 시드 스킬을 반성적 편집으로 다듬는다. 라운드 t에서 현재 스킬 s_t로 T_t 항목을 실행해 오답과 피드백을 모으고, 이를 근거로 후보 스킬들을 제안한다. 핵심은 수용 기준이다. 후보와 기존 스킬을 같은 새 배치 B_t에서 평가해, 후보만 맞춘 항목 수 w와 기존만 맞춘 항목 수 l을 세고, w가 l보다 크면서 z = (|w-l|-1)/√(w+l) ≥ κ(κ=1)일 때만 후보에 자격을 준다. 자격을 넘긴 후보 중 순이득 w-l이 가장 큰 것을 채택하고, 아무도 통과하지 못하면 기존 스킬을 유지한다. 채택된 스킬은 체크포인트로 저장된다. 최적화가 끝나면 초기 스킬과 채택된 스킬 전체를 고정 선택 집합 V에서 비교해 최고를 고르고, 이를 SKILL.md로 내보내 추론 시점에 모델에 제공한다. 모델 파라미터는 전혀 갱신되지 않는다.
전제와 한계
실험은 네 도메인에서 이뤄졌다. 사실형 질의응답 SearchQA, 독해 SQuAD, 수학 추론 AIME, 스프레드시트 조작 SpreadsheetBench다. 타깃 모델은 오픈 웨이트 Qwen3-8B, Qwen3-32B, Llama-3.2-1B-Instruct와 상용 Claude Haiku 4.5, GPT-5.5이며, GPT-5.5가 최적화 과정의 반성 피드백을 제공한다. 베이스라인은 스킬 없이 지시문만 주는 Direct, 도메인 관련성을 기준으로 고른 외부 공개 스킬 Off-the-shelf, Qwen3-32B가 도메인 설명만으로 한 번 작성한 LLM-generated다. 결과적으로 Prompt2Skill은 모든 타깃 모델에서 최고 평균 상대 개선을 냈고, Qwen과 상용 모델에서 22.0~29.1%, Llama-3.2-1B에서는 보고된 세 벤치마크 기준 93.5%였다. SQuAD 전 모델과 Qwen3-32B 전 벤치마크를 포함해 10개 조합에서 최고 평균 점수를 기록했다. 고정 스킬의 위험도 드러났다. Off-the-shelf 스킬은 Llama-3.2-1B의 SQuAD 점수를 0.207에서 0.048로 떨어뜨린 반면, Prompt2Skill은 같은 모델을 0.492까지 올렸다. 초록은 평균 10.8%p 개선을, 결론은 19개 모델-벤치마크 쌍 평균으로 Direct 대비 36.1%, Off-the-shelf 대비 83.0%의 상대 개선을 보고한다. 두 수치는 기준이 다르므로 함께 읽어야 한다.
절제 실험도 구체적이다. 초기화 민감도에서는 기본 시드와 Off-the-shelf 시드 중 일관되게 우세한 쪽이 없었고, Off-the-shelf 시드는 Qwen3-8B의 SQuAD를 올렸지만 GPT-5.5에서는 떨어뜨렸다. 사용자 예시 개수는 Direct 프롬프팅에서 SQuAD가 0개 70.5%에서 4개 79.0%로 오른 반면, Prompt2Skill은 SearchQA에서 1개 61.1%와 4개 60.9%로 거의 변하지 않았다. 예시를 선택 사항으로 취급해도 된다는 근거다. 동일한 프록시 데이터와 초기 스킬을 쓰고 Qwen3-8B를 solver, GPT-5.5를 editor로 두며 과제당 solver 평가 7,400회로 상한을 맞춘 SkillOpt 비교에서는 SearchQA EM이 2.93%p, SQuAD EM/F1이 1.20/0.61%p 개선됐다. 저자들은 보관된 프록시 데이터와 타깃 테스트 사이에 어휘 중복 플래그나 워크북 해시 일치가 없었다는 감사 결과도 밝힌다.
개발자 입장에서 이 논문의 쓸모는 스킬 배포 워크플로에 있다. 사내 모델용 스킬을 마크다운으로 관리한다면, 과제 설명 한 줄과 타깃 모델만 주고 검색·합성·반성 편집·통계적 수용을 자동으로 돌리는 이 파이프라인을 참고할 수 있다. 다만 도입 전에 확인할 것이 있다. 프록시 지표 μ̂_τ가 실제 평가 지표와 얼마나 어긋나는지, 데이터 검색과 합성이 사내 데이터 접근 권한과 라이선스 정책에 맞는지, 그리고 스킬이 특정 모델 버전에 맞춰 최적화되므로 모델을 교체할 때마다 재최적화가 필요한지다. 코드는 공개 저장소에 있다.
한계는 저자들이 명시한다. 시스템은 타깃 분포 D와 지표 μ를 관측하지 못하므로 μ̂_τ 위에서 최적화하며, 둘 사이의 불일치는 그대로 남는다. 검증 절차는 실용적 사용 가능성의 증거일 뿐이고, solver들이 정답에 합의했다고 해서 참조 정답의 정확성이나 타깃 분포 대표성이 보장되지는 않는다. 최종 선택의 성능 보장 역시 독립적인 선택 샘플과 유계 프록시 불일치를 가정한 바운드로, 부록 A에서 형식화된다. 또한 저자들은 아이디어 브레인스토밍, 코드베이스 일부 구현, 이론 증명 정식화, 논문 초안 일부 작성에 생성 AI를 사용했고 최종 내용에 대한 책임은 저자에게 있다고 밝힌다.