video-to-note

Document to MarkdownskillPython

★ 71주당 +16조회 4

무엇인가

video-to-note는 영상 입력을 시간축이 붙은 자막과 Markdown 노트로 변환하는 절차를 에이전트에 주입하는 스킬이다. 규율하는 영역은 영상 획득, 플랫폼 자막 확보, 오프라인 전사, 노트 생성으로 이어지는 순서와 그 각 단계에서 어떤 도구를 어떤 조건에 호출할지다. 로컬 우선 서비스 VideoToNo를 백엔드로 두고, 에이전트는 그 앞단에서 호출 규약만 따른다.

어떻게 동작하나

배포 형태는 저장소의 `skills/video-to-note/` 디렉터리이며, 규칙 본문은 그 안의 `SKILL.md`에 있다. 에이전트의 스킬 디렉터리에 두면 자동으로 로드되어 한 문장 요청으로 실행된다. 규칙 내용은 플랫폼 자막 우선, 자막이 없을 때 faster-whisper 계열 로컬 전사로의 폴백, `transcribe_video`와 `get_transcript`로 시간축 자막만 받아 정리는 에이전트가 직접 하는 경로, 완성 노트가 필요할 때만 `summarize_video`를 쓰는 분기, 그리고 API Key를 표준 입력이나 환경 변수로 넘기는 방식을 포함한다.

무엇과 다른가

MCP 서버를 붙이는 것만으로는 도구가 노출될 뿐 호출 순서와 키 처리, 전사와 요약의 분기가 사용자에게 남는다. 이 스킬은 그 분기를 문서로 고정해 대화마다 도구 이름과 인자를 다시 설명하지 않게 한다. 데스크톱 GUI가 사람이 폼을 채워 작업을 제출하는 경로라면, 이 스킬은 에이전트가 대화 중에 같은 백엔드를 호출하는 경로다.

어떻게 쓰나

설치는 `skills/video-to-note/` 디렉터리를 `C:/Users/<사용자>/.agents/skills/` 같은 에이전트 스킬 경로에 복사하는 방식이다. 사용 전에 VideoToNo를 실행해야 하며, MCP 도구는 로컬 백엔드로 작업을 넘겨 본机的 Whisper 모델 캐시와 작업 디렉터리를 재사용한다. Cherry Studio 같은 클라이언트에서는 SSE로 `http://127.0.0.1:8000/mcp/sse`를 등록한다. 첫 사용 시 `save_llm_config`와 `save_bilibili_credentials`로 설정을 한 번 저장해 두면 이후 대화에서 민감 정보를 반복 입력하지 않는다.

전제와 한계

전제는 `SKILL.md`를 읽는 Claude Code, pi 등의 에이전트와 실행 중인 VideoToNo 로컬 서비스다. 서비스는 기본적으로 `127.0.0.1`만 수신한다. 입력은 빌리빌리, 더우인, 유튜브와 yt-dlp가 해석하는 http(s) 링크, 그리고 로컬 음성·영상 파일이다. 아이치이와 텐센트 비디오는 별도 적응이 없고, 더우인은 단일 공개 공유 링크만 지원한다. 첫 Whisper 전사에는 모델 다운로드가 필요하며, 자막만 받는 경로는 API Key가 필요 없고 `summarize_video` 경로에서만 키를 요구한다.

유사 도구