PageIndex

LLM FrameworksCLIPython

★ 35,624주당 +1,015조회 4

무엇인가

PageIndex는 문서 검색 파이프라인에서 벡터 DB와 청커가 차지하던 자리를 대체하는 검색 계층이다. 질의와 문서 조각의 의미적 유사도가 아니라, 문서 구조에 대한 LLM의 추론으로 근거 위치를 정한다. 금융 보고서, 법률 문서, 규제 제출 자료, 기술 매뉴얼, 의학 문헌, 학술 교재처럼 길고 복잡한 전문 문서를 대상으로 한다.

어떻게 동작하나

동작은 인덱싱과 검색 두 단계로 나뉜다. 인덱싱 단계에서 문서마다 계층적 트리 구조 인덱스를 생성한다. 트리 골격은 LLM 없이 문서 레이아웃에서 추출하고, 인덱스 모델은 노드 요약과 정제만 담당한다. 검색 단계에서는 LLM이 그 트리를 에이전트 방식으로 탐색하며 추론이 도달한 노드만 읽는다. 로컬 모드의 기본 인덱싱 방식은 텍스트 기반 PDF용 고속 트리 생성기인 PageIndex Flash다. 클라우드에서는 파싱, OCR, 이미지 이해, 트리 인덱스 생성, 저장소 관리를 PageIndex가 맡는다.

무엇과 다른가

벡터 RAG는 의미적 유사도로 검색한다. 유사도는 관련성과 다르고, 관련성은 추론을 요구한다. PageIndex는 벡터 DB도 청킹도 쓰지 않으므로 검색 경로가 트리 노드 단위로 남아 추적과 설명이 가능하다. 질의 비용도 문서 길이에 비례해 늘지 않는다. 같은 답을 내는 조건에서 전체 PDF를 매번 모델에 넣는 방식은 52페이지에서 2.1배, 420페이지에서 16.6배 더 비쌌고, 805페이지에서는 컨텍스트 윈도에 들어가지 않았다.

어떻게 쓰나

설치는 pip install -U pageindex 한 줄이다. 로컬 모드에서는 PageIndexClient()로 인덱싱, 검색, 챗을 자신의 LLM 키로 실행한다. 클라우드로 옮길 때는 PageIndex API 키만 지정하면 되고, 챗·검색 계층은 기존 모델 제공자를 그대로 쓴다. 인덱스 모델은 기본 모델로 충분하고, 트리를 탐색하는 chat 모델은 쓸 수 있는 가장 좋은 모델을 권장한다. PageIndex 도구를 OpenAI Agents SDK나 Claude Agent SDK 같은 프레임워크에 넣어 자체 에이전트에 통합할 수도 있다.

전제와 한계

오픈소스 버전은 텍스트 위주 PDF와 로컬 워크플로를 대상으로 한다. OCR과 이미지 이해는 클라우드에서만 처리된다. 여러 문서를 한 번에 추론하는 파일 수준 트리 계층 PageIndex File System도 클라우드 전용이다. 로컬 인덱싱 비용은 페이지당 약 $0.001로 1,000페이지 교재가 1달러 남짓이고, 한 번 만들면 이후 질의는 재사용한다. 인덱싱 시간은 문서 길이에 따라 9페이지에서 13초, 1,098페이지에서 약 4.5분이 걸린다.

관련 논문 3

유사 도구