Hyper-Extract
무엇인가
Hyper-Extract는 문서 더미를 지식 구조로 바꾸는 추출 파이프라인을 CLI 하나로 묶은 도구다. 검색 증강 생성 계열에서 색인을 만드는 단계, 즉 텍스트를 청크 단위로 그대로 벡터화하는 대신 엔티티·관계·사건을 타입이 있는 구조로 먼저 뽑아 두는 쪽에 속한다. 결과물은 그래프, 하이퍼그래프, 시공간 그래프, 문서 코퍼스 형태로 남고 그 위에서 질의와 시각화가 이루어진다.
어떻게 동작하나
내부는 세 층으로 나뉜다. Auto-Types 층은 Model, List, Set, Graph, Hypergraph, Temporal Graph, Spatial Graph, Spatio-Temporal Graph, Document corpus 아홉 가지 타입을 정의한다. Methods 층은 Chunk-RAG 베이스라인, KG-Gen, GraphRAG, LightRAG, Hyper-RAG, Cog-RAG 같은 추출·검색 알고리즘을 담는다. Templates 층은 6개 도메인에 걸친 프리셋으로 코드 없이 구조를 고르게 한다. LLM 호출은 LangChain 구조화 출력과 function calling으로 이루어지고, 색인은 v0.10.1부터 JSON으로 저장된다. 이전 pickle 색인은 경고와 함께 읽히며 `he build-index --force`로 마이그레이션한다.
무엇과 다른가
GraphRAG나 LightRAG 같은 구현체는 각각 하나의 방법론이다. Hyper-Extract는 이들을 Methods 층의 선택지로 나란히 두고 같은 문서에 대해 구조 타입과 방법을 바꿔 가며 돌릴 수 있게 한다. 청크 RAG가 텍스트 조각을 그대로 검색하는 것과 달리, 하이퍼그래프·시간 그래프·공간 그래프처럼 다자 관계나 시공간 좌표를 담는 구조를 1급 타입으로 다룬다. 추출 결과는 원본 문서와 연결되어 갱신·롤백·감사가 가능하다.
어떻게 쓰나
설치는 pip 한 줄이고 실행 명령은 `he`다. 제공자별 API 키를 환경 변수로 두고 쓰며, OpenAI와 알리바바 바이롄은 LLM과 임베딩을 한 API에서 함께 제공하고 Anthropic과 DeepSeek은 LLM만 제공하므로 OpenAI 호환 임베딩 엔드포인트를 따로 붙인다. DeepSeek V4는 기본 thinking 모드를 자동으로 끄고, 로컬 vLLM으로 Qwen 계열과 bge-m3를 돌리면 데이터가 외부로 나가지 않는다. Python API로 직접 호출하거나 MCP 서버를 띄워 Claude Desktop·IDE 에이전트에 노출할 수 있다.
전제와 한계
모델이 tool/function calling을 지원해야 한다. 임베딩 API가 없는 제공자를 쓰면 임베딩을 별도로 구성해야 하고, 로컬 vLLM 경로는 GPU를 요구한다. MCP 서버가 노출하는 도구는 list_templates, info, search, ask, export_obsidian, export_graphml, export_csv, export_jsonld, export_cypher로 읽기와 내보내기만 하며 쓰기는 없다. 라이선스는 Apache-2.0이다.
관련 논문 1
유사 도구
- graphrag비정형 텍스트에서 LLM으로 개체와 관계를 추출해 지식 그래프 인덱스를 만들고, 그 그래프를 컨텍스트로 질의응답에 쓰는 Python CLI 파이프라인이다.
- LightRAG문서를 지식 그래프와 벡터 인덱스로 함께 색인해 질의에 답하는 검색 증강 생성 프레임워크다. Python 서버와 WebUI를 함께 제공한다.
- graphify코드베이스와 문서·SQL·PDF를 tree-sitter AST로 파싱해 질의 가능한 지식 그래프로 바꾸는 CLI다. 임베딩 없이 그래프를 순회하며 모든 엣지에 출처 태그를 붙인다.
- semantica기업 데이터를 컨텍스트 그래프와 지식 그래프로 적재하고 결정 출처와 추론 경로를 그래프 구조에 남기는 Python 기반 인프라다.
- llama_index사설 데이터를 수집·구조화해 LLM이 검색·질의할 수 있게 하는 Python 프레임워크다. 코어와 300여 개 통합 패키지를 조합해 RAG·에이전트 앱을 만든다.
- cognee에이전트에 세션을 넘어 지속되는 장기 기억을 붙이는 오픈소스 AI 메모리 플랫폼이다. 자체 호스팅 지식 그래프 엔진 위에서 동작한다.