semantica
무엇인가
Semantica는 LLM·벡터 스토어·에이전트 프레임워크 아래에 놓이는 시맨틱/컨텍스트 계층이다. 임베딩 유사도 검색이 아니라 온톨로지와 관계로 표현된 지식 그래프를 에이전트의 컨텍스트로 공급하는 인프라에 속한다. 값비싼 엔터프라이즈 지식 플랫폼을 대체하는 자리를 겨냥한다.
어떻게 동작하나
동작은 파이프라인으로 나뉜다. 여러 소스에서 데이터를 수집하고, 엔티티를 인식하는 청킹을 거쳐 NER·관계·이벤트를 추출한 뒤 그래프를 구성한다. 이때 의미 기반 중복 제거와 출처를 보존하는 병합이 수행되고, 충돌하는 사실은 조용히 덮어쓰지 않고 플래그로 남긴다. 저장은 RDF 계열(Oxigraph, Blazegraph, Jena, RDF4J)과 LPG 계열(Neo4j, FalkorDB, AGE, Neptune), 그리고 벡터 스토어를 함께 쓰는 폴리글랏 구성이다. 추론은 전방향 체이닝, Rete 네트워크, Datalog, SPARQL로 수행하며 각 경로를 설명 가능한 형태로 남긴다. 모든 사실에는 W3C PROV-O 출처가 붙고 JSON·CSV·RDF로 내보낼 수 있다.
무엇과 다른가
임베딩 기반 에이전트와의 차이는 구조에 있다. 임베딩은 유사도 점수만 주고 관계·규칙·출처를 담지 않는다. Semantica는 OWL·SHACL·SKOS로 엔티티의 정의와 제약을 데이터와 같은 층위에 명시한다. LLM은 그래프 구축·추론·출처 기록에 필요하지 않으며, 쓰는 경우에도 semantica.llms를 통해 OpenAI·Anthropic·Gemini 등 제공자를 교체할 수 있다. 설명 범위도 다르다. 모델 내부 추론은 다루지 않고, 모델에 입력된 컨텍스트·산출된 결정·적용된 정책·실행 추적을 설명한다.
어떻게 쓰나
인터페이스는 CLI, REST API, MCP 서버, 에디터 플러그인으로 나뉜다. Agno·CrewAI·LangChain에는 드롭인 통합으로 붙는다. Databricks(Unity Catalog + Delta Lake), Snowflake, SAP OData 커넥터는 데이터를 외부 SaaS로 내보내지 않고 레이크하우스·웨어하우스의 테이블을 출처가 붙은 그래프 노드로 만든다. 그래프·온톨로지·타임라인은 브라우저 워크벤치에서 탐색한다.
전제와 한계
Python으로 작성되었고 그래프 저장소 백엔드는 코드 수정 없이 교체한다. 결정은 일급 객체로 저장되어 선례로 검색되고 인과 관계로 연결된다. 그래프 분석은 중심성, 커뮤니티 탐지, 링크 예측, 최단 경로 질의를 포함한다. LLM 내부 동작은 불투명하게 남으며 시스템 수준 설명만 제공한다는 것이 명시된 경계다.
관련 논문 3
유사 도구
- graphify코드베이스와 문서·SQL·PDF를 tree-sitter AST로 파싱해 질의 가능한 지식 그래프로 바꾸는 CLI다. 임베딩 없이 그래프를 순회하며 모든 엣지에 출처 태그를 붙인다.
- graphrag비정형 텍스트에서 LLM으로 개체와 관계를 추출해 지식 그래프 인덱스를 만들고, 그 그래프를 컨텍스트로 질의응답에 쓰는 Python CLI 파이프라인이다.
- code-graph-ragTree-sitter로 모노레포를 파싱해 Memgraph 지식 그래프를 만들고, 자연어로 코드를 질의·편집·최적화하는 Python CLI다.
- Hyper-Extract비정형 텍스트를 LLM으로 구조화해 그래프·하이퍼그래프·시공간 그래프로 추출하는 Python CLI다. 추출·검색·시각화를 한 명령으로 처리한다.
- LightRAG문서를 지식 그래프와 벡터 인덱스로 함께 색인해 질의에 답하는 검색 증강 생성 프레임워크다. Python 서버와 WebUI를 함께 제공한다.
- cognee에이전트에 세션을 넘어 지속되는 장기 기억을 붙이는 오픈소스 AI 메모리 플랫폼이다. 자체 호스팅 지식 그래프 엔진 위에서 동작한다.