Hyper-Extract

LLM FrameworksCLIPython

★ 3,930주당 +44조회 4

무엇인가

Hyper-Extract는 문서 더미를 지식 구조로 바꾸는 추출 파이프라인을 CLI 하나로 묶은 도구다. 검색 증강 생성 계열에서 색인을 만드는 단계, 즉 텍스트를 청크 단위로 그대로 벡터화하는 대신 엔티티·관계·사건을 타입이 있는 구조로 먼저 뽑아 두는 쪽에 속한다. 결과물은 그래프, 하이퍼그래프, 시공간 그래프, 문서 코퍼스 형태로 남고 그 위에서 질의와 시각화가 이루어진다.

어떻게 동작하나

내부는 세 층으로 나뉜다. Auto-Types 층은 Model, List, Set, Graph, Hypergraph, Temporal Graph, Spatial Graph, Spatio-Temporal Graph, Document corpus 아홉 가지 타입을 정의한다. Methods 층은 Chunk-RAG 베이스라인, KG-Gen, GraphRAG, LightRAG, Hyper-RAG, Cog-RAG 같은 추출·검색 알고리즘을 담는다. Templates 층은 6개 도메인에 걸친 프리셋으로 코드 없이 구조를 고르게 한다. LLM 호출은 LangChain 구조화 출력과 function calling으로 이루어지고, 색인은 v0.10.1부터 JSON으로 저장된다. 이전 pickle 색인은 경고와 함께 읽히며 `he build-index --force`로 마이그레이션한다.

무엇과 다른가

GraphRAG나 LightRAG 같은 구현체는 각각 하나의 방법론이다. Hyper-Extract는 이들을 Methods 층의 선택지로 나란히 두고 같은 문서에 대해 구조 타입과 방법을 바꿔 가며 돌릴 수 있게 한다. 청크 RAG가 텍스트 조각을 그대로 검색하는 것과 달리, 하이퍼그래프·시간 그래프·공간 그래프처럼 다자 관계나 시공간 좌표를 담는 구조를 1급 타입으로 다룬다. 추출 결과는 원본 문서와 연결되어 갱신·롤백·감사가 가능하다.

어떻게 쓰나

설치는 pip 한 줄이고 실행 명령은 `he`다. 제공자별 API 키를 환경 변수로 두고 쓰며, OpenAI와 알리바바 바이롄은 LLM과 임베딩을 한 API에서 함께 제공하고 Anthropic과 DeepSeek은 LLM만 제공하므로 OpenAI 호환 임베딩 엔드포인트를 따로 붙인다. DeepSeek V4는 기본 thinking 모드를 자동으로 끄고, 로컬 vLLM으로 Qwen 계열과 bge-m3를 돌리면 데이터가 외부로 나가지 않는다. Python API로 직접 호출하거나 MCP 서버를 띄워 Claude Desktop·IDE 에이전트에 노출할 수 있다.

전제와 한계

모델이 tool/function calling을 지원해야 한다. 임베딩 API가 없는 제공자를 쓰면 임베딩을 별도로 구성해야 하고, 로컬 vLLM 경로는 GPU를 요구한다. MCP 서버가 노출하는 도구는 list_templates, info, search, ask, export_obsidian, export_graphml, export_csv, export_jsonld, export_cypher로 읽기와 내보내기만 하며 쓰기는 없다. 라이선스는 Apache-2.0이다.

관련 논문 1

유사 도구