knowhere

Document to MarkdownskillPython

★ 3,308주당 +152조회 4

무엇인가

Knowhere는 비정형 문서를 파싱해 계층 구조·출처 페이지·연결 자산이 유지되는 영속적 메모리로 변환하는 문서 메모리 기반이다. 단일 규칙 파일이 아니라 파싱 절차와 검색 도구 계약을 묶어 에이전트에 주입하는 스킬 팩이며, 문서 수집·구조 재구성·다중 모달 정규화·그래프 구축·인용 해석이라는 문제 영역을 규율한다.

어떻게 동작하나

동작은 두 단계로 나뉜다. 1단계에서 Route(포맷과 API 세대에 따라 Vision 트랙 또는 Text 트랙 선택) → Understand(신뢰 가능한 네이티브 텍스트 구조 보존 또는 비전 모델로 페이지 전체 해석) → Normalize(두 트랙을 동일한 계층 기반 청크·메타데이터 스키마로 변환) → Build Memory(탐색 트리, 연결 자산, 인용, 문서 간 관계 저장)를 수행한다. 2단계에서는 하나의 코퍼스 스키마와 문서 개요, 구조 필터, 정확 검색, 퍼지 리콜, 전문 읽기, 자산, 문서 간 관계 도구를 노출하고, 호출 순서와 탐색 깊이는 에이전트가 결정한다. V2 Jobs API로 업로드한 PDF와 .pptx는 Vision 트랙, 나머지 지원 포맷은 Text 트랙을 탄다.

무엇과 다른가

OCR 결과를 Markdown으로 덤프해 컨텍스트에 넣는 방식이나 고정된 내비게이션 파이프라인과 구조적으로 다르다. 파서가 생성한 Markdown을 유일한 진실 원천으로 두지 않고, 페이지 단위 비전 해석과 문서 프로파일·TOC 구조를 결합해 페이지 근거가 있는 계층 노드를 조립한다. 검색도 고정 워크플로가 아니라 코퍼스 네이티브 기반과 해석 가능한 근거 참조를 제공하고 탐색 전략은 에이전트에 위임한다. 두 파싱 경로가 같은 청크·메타데이터 계약으로 수렴하므로 저장·계층·그래프·검색이 포맷 독립적으로 유지된다.

어떻게 쓰나

설치는 README에 별도 명령이 제시되지 않는다. knowhere-self-hosted 저장소로 전체 스택을 자체 호스팅하거나 knowhereto.ai의 관리형 API를 등록해 사용하고, MCP로 Claude Code에 연결한다. 첫 사용은 문서를 업로드해 메모리를 구축한 뒤 개요·구조 필터·검색·전문 읽기 도구를 순서대로 호출해 인용까지 해석하는 흐름이다.

전제와 한계

Claude Code를 비롯한 MCP 클라이언트에서 동작하며, 텍스트와 이미지 입력을 함께 받는 LLM/VLM이 필요하다(권장 모델로 deepseek-v4-flash-vision-exp를 제시). V1 청크 기반 파이프라인의 기본 PDF 추출기는 MinerU이고, V2는 비전 페이지 경로를 사용한다. 코딩 규칙이나 코드 스타일을 강제하는 파일이 아니며, 문서 파싱·검색 계층에만 관여한다.

관련 논문 4

유사 도구