SkillOpt

LLM FrameworksskillPython

★ 17,266주당 +364조회 7

무엇인가

SkillOpt는 스킬 문서 자체를 학습 가능한 상태로 취급하는 텍스트 공간 최적화기다. 고정된 LLM 에이전트의 가중치는 건드리지 않고 자연어로 쓰인 스킬 텍스트만 편집해 재사용 가능한 형태로 훈련한다. 규율하는 영역은 스킬 작성·개정 절차, 즉 어떤 편집을 채택하고 어떤 편집을 버릴지에 대한 규칙이다.

어떻게 동작하나

동작은 신경망 학습 루프를 텍스트로 옮긴 형태다. 롤아웃 → 반성(reflect) → 집계 → 선택 → 갱신 → 평가 순서로 돌고, 별도 옵티마이저 모델이 채점된 롤아웃을 단일 스킬 문서에 대한 추가·삭제·교체 편집으로 변환한다. 텍스트 학습률 예산, 거부된 편집 버퍼, 에폭 단위 slow/meta 갱신이 편집 폭을 제한한다. 기본 경로에서는 후보 편집이 홀드아웃 검증 점수를 엄격히 개선할 때만 채택된다. 산출물은 300~2,000 토큰 규모의 best_skill.md이며 배포 시 추가 추론 호출이 발생하지 않는다.

무엇과 다른가

손으로 작성한 스킬, 강한 LLM의 일회성 생성, 통제 없는 자기 수정과 구조적으로 다르다. 편집이 검증 게이트를 통과해야만 반영되고, 거부 이력이 버퍼에 남아 같은 방향의 편집이 반복되지 않는다. 결과물이 단일 문서로 압축되어 모델 가중치 변경 없이 배포되며, 최적화된 스킬은 모델 규모 간, Codex와 Claude Code 하네스 간, 인접 벤치마크로 이전된다.

어떻게 쓰나

설치는 pip install skillopt. 저장소에는 Claude Code·Codex·Copilot·Devin용 통합 셸과 OpenClaw 참조 적응이 포함되지만 이 플러그인/MCP 파일들은 PyPI 휠이 아니라 저장소에 있다. 모니터링 대시보드는 pip install -e ".[webui]" 후 python -m skillopt_webui.app로 띄운다. 새 백엔드는 docs/guide/new-backend.md, 새 벤치마크는 docs/guide/new-benchmark.md의 계약을 따른다.

전제와 한계

대상은 OpenAI·Azure·Claude·Qwen·MiniMax 등 채팅 백엔드와 codex_exec·claude_code_exec·cursor_exec·copilot_exec 실행 하네스다. 채점 가능한 롤아웃과 홀드아웃 검증 분할이 있어야 루프가 성립한다. 메인 CLI는 보수적 기본값을 쓰며 실험 하네스의 모든 제어를 플래그로 노출하지 않는다. v0.2.0의 SkillOpt-Sleep은 skillopt-sleep CLI로 별도 제공되는 야간 오프라인 자가 진화 엔진이다.

유사 도구