스스로 진화하는 온톨로지 계층으로 데이터 에이전트의 에이전트-데이터 간극을 메우기

EvoOntology: A Self-Evolving Ontology Layer for Data Agents

HF Daily2609.15779

Meiduo Chong, Shaolei Zhang, Ju Fan2026-09-14조회 4

무엇인가

이 논문이 다루는 문제는 데이터 에이전트의 에이전트-데이터 간극이다. 데이터 에이전트는 테이블, 파일, 데이터베이스처럼 서로 다른 형태의 데이터에 대해 자연어 지시를 수행해야 한다. 그런데 데이터는 에이전트 바깥에 있고, 에이전트는 SQL 인터페이스나 파일 리더 같은 범용 도구를 통해서만 컬럼 이름이나 파일 경로 수준의 정보에 접근할 수 있다. 구조도 내용도 사전에 알 수 없으니 에이전트는 탐색용 질의를 반복해서 던지고, 요청된 개념이 어디 있는지 추측하고, 무관한 내용을 뒤지게 된다. 기존 접근은 두 갈래다. 원시 질의 방식은 에이전트가 스키마를 직접 보고 탐색 질의를 던지게 하는데, 작고 단순한 데이터에는 통하지만 넓고 이질적인 데이터에서는 반복적이고 비효율적인 탐색에 갇힌다. 시맨틱 레이어 방식은 스키마, 엔티티, 메트릭 같은 메타데이터를 프롬프트에 주입하는데, 컨텍스트 길이 한계 때문에 큰 데이터 소스에는 전체를 넣을 수 없고, 대개 수동으로 작성·유지되므로 새 데이터나 새 태스크, 새 에이전트에 적응하기 어렵다. 논문은 한 궤적에서 발견한 그라운딩이 다음 태스크를 위해 보존되지 않고 버려진다는 점도 문제로 지적한다.

어떻게 동작하나

제안 방법 EvoOntology는 온톨로지를 MCP 서버로 캡슐화해, 에이전트가 컨텍스트로 수동 소비하는 대신 런타임에 능동적으로 질의하고 상호작용하게 만든다. 진화 라운드 t에서의 온톨로지 상태는 L_t = (S_t, Γ_t, R_t)로 표현되며 세 계층으로 나뉜다. 콘텐츠 계층 S_t는 타입이 있는 시맨틱 그래프로, Terms, Mappings, Constraints, Evidence라는 네 가지 노드 패밀리와 두 가지 엣지 패밀리를 갖는다. Terms는 도메인 개념, Mappings는 그 개념을 필드와 연결 경로에 접지시키는 정보, Constraints는 유효한 사용 규칙, Evidence는 시맨틱 주장을 뒷받침하는 근거다. 엣지는 Semantic Relations(association, hierarchy, composition, equivalence, derivation)와 Structural References로 구성된다. 스키마 계층 Γ_t는 이 네 노드 패밀리의 필드, 허용되는 관계 타입, 허용되는 참조 패턴을 정의하므로, 스키마 업데이트는 인스턴스화된 콘텐츠를 바꾸지 않고 표현 능력만 확장한다. 도구 계층 R_t는 두 개의 MCP 도구와 세션 매니페스트를 노출한다. f_browse(q, k, n)는 질의 q와 종류 k에 대해 상위 n개의 시맨틱 매치를 검색하고, f_resolve(I, c)는 요청된 레코드와 그에 연결된 객체를 반환한다. 프롬프트에 들어가는 온톨로지 내용은 세션 초기화 시 제공되는 압축된 매니페스트뿐이며, 상세 레코드는 필요할 때 검색된다.

무엇과 다른가

초기 온톨로지는 빌더 에이전트가 만든다. 학습 워크로드 W와 원시 소스 D가 주어지면 반복적으로 등장하는 엔티티, 메트릭, 연산, 분석 조건으로부터 후보 집합 C = propose(W)를 제안하고, 각 후보 c에 대해 probe(c, D)를 실행해 후보 필드와 연결 경로를 찾고 그 타입, 값, 시맨틱 일관성을 검사한다. 프로브 결과로 검증된 후보만 커밋되는데, C+ = {c ∈ C | verify(probe(c, D)) = 1}이고 S_0 = construct(C+, D; Γ_0)이다. 이때 verify는 선언된 타입, 필터, 값 분포 요구사항을 확인하며, 검증된 후보의 근거 레코드는 Evidence로 보존된다. 이 과정에서 정답(gold answer)은 보지 않는다. 이후 진화는 과거 궤적을 행동 근거로 사용한다. 성공한 실행은 효과적인 시맨틱 구조와 접근 패턴을 드러내고, 실패한 실행은 빠졌거나 오해를 유발하거나 잘 노출되지 않은 구성요소를 드러낸다. 진화 에이전트는 궤적 T_t와 현재 상태 L_t로부터 반복 서명 Σ_t = analyze(T_t, L_t)를 추출하고, 각 서명을 α: Σ_t → {C, T, S}로 콘텐츠, 도구, 스키마 중 하나에 귀속시킨 뒤 기대되는 행동 효과를 명시한다. 개입은 patch(L_t, σ, α(σ)) 형태로 한 번에 한 레벨만 수정하며, 콘텐츠 개입은 인스턴스화된 시맨틱 객체를 추가·삭제·수정하고, 도구 개입은 관찰된 에이전트 행동에 따라 기존 도구를 고치거나 도구를 추가·제거하며, 스키마 개입은 객체 모델 자체를 수정한다. 채택 여부는 백본 조건부 paired 검증으로 결정된다. 백본 m에 대해 검증셋 V에서 후보와 부모를 동일한 디코딩과 상호작용 예산으로 평가하고, φ(L'_t, V; m) − φ(L_t, V; m) ≥ τ일 때만 후보를 채택한다. 거부된 후보는 배포되지 않고 그 서명, 개입, 평가 결과가 로그로 남아 반복적인 비효율 업데이트를 막는다. 모든 백본은 같은 초기 상태 L_0에서 출발하지만 각자 독립적으로 진화한다.

어떻게 쓰나

실험은 이질적 모달리티와 답변 형식을 가진 세 벤치마크에서 수행된다. DDR-Bench는 이질 소스에 걸친 개방형 데이터 리서치 벤치마크로 10-K 시나리오에서 턴별 해석을 보는 Message-Wise 정확도와 전체 이력 종합을 보는 Trajectory-Wise 정확도를 보고한다. InsightBench는 비즈니스 인텔리전스 플래그마다 CSV 데이터셋과 정답 인사이트가 짝지어진 비즈니스 분석 벤치마크로 Insight와 Summary 점수를 보고한다. BIRD는 실제 데이터베이스에 대한 텍스트-투-SQL 벤치마크로 공식 Oracle Knowledge 설정에서 Execution Accuracy(EX)와 Valid Efficiency Score(VES)를 측정한다. 백본은 GPT-5.5, GPT-5.6-sol, Claude-Sonnet-5, Claude-Opus-4.8, DeepSeek-V4-Flash, Qwen3.5-Flash 여섯 종이며, 모든 조건이 같은 ReAct 스캐폴드와 원시 데이터 도구, 디코딩 설정, 상호작용 예산을 쓴다. 베이스라인은 온톨로지 없이 ReAct만 쓰는 Baseline, 빌더 에이전트의 시맨틱 레이어를 정적 프롬프트 조각으로 앞에 붙이는 Baseline + SL, 그리고 과거 궤적을 검색 가능한 에피소드로 저장하는 ReAct + Memory다. 평가는 상호 두 겹 설계를 따른다. 각 벤치마크를 A와 B 두 fold로 나누고, A에서 70%를 온톨로지 구축과 궤적 분석, 후보 생성에 쓰고 나머지 30%를 paired 검증에 쓴 뒤, 선택된 온톨로지를 동결하고 B에서 테스트한다. 그다음 fold를 뒤집어 같은 절차를 반복하고 두 점수의 평균을 보고한다. 테스트 fold는 온톨로지가 동결된 뒤 최종 평가에만 접근되며, 그 답과 평가자 피드백은 구축·진화·후보 선택에 절대 쓰이지 않는다.

전제와 한계

주요 결과는 다음과 같다. DDR-Bench에서 EvoOntology는 여섯 백본 모두에서 Trajectory-Wise 정확도를 개선해 Baseline 대비 평균 +17.8점을 기록했고, 개선폭은 Qwen3.5-Flash의 +4.8점에서 GPT-5.5의 +26.7점까지 걸쳐 있다. 반면 정적 프롬프트로 시맨틱 레이어를 주입하는 Baseline + SL은 일관된 개선을 보이지 못했고 Claude-Sonnet-5에서는 오히려 −15.0점 떨어졌다. ReAct + Memory는 Trajectory-Wise를 69.5에서 75.8로 끌어올렸지만 EvoOntology보다 13.7점 낮았는데, 논문은 에피소드 메모리가 이미 한 일을 재생할 뿐 타입이 있고 조합 가능한 구조를 노출하지 않기 때문이라고 설명한다. InsightBench에서는 모든 백본에서 Overall이 개선되어 평균 +1.9점, 최대 개선은 DeepSeek-V4-Flash의 +6.1점이었다. Baseline + SL이 Claude-Sonnet-5 Summary에서 −3.3점 떨어진 것과 대조적이다. BIRD에서는 모든 백본에서 EX와 VES가 함께 개선되어 평균 +7.4점과 +8.6점을 기록했고, Baseline + SL은 VES는 올랐지만 EX가 GPT-5.5에서 최대 −5.6점 떨어지는 혼합 양상을 보였다. 온톨로지 계층 자체의 효과를 분리한 비교에서는 DDR-Bench 평균 Trajectory-Wise가 Baseline에서 Initial로 +12.3%p 오르고 Initial에서 Evolved로 다시 +7.7%p 올랐으며, InsightBench 평균 Insight는 +0.8점 뒤 +0.2점, BIRD 평균 EX는 +5.1%p 뒤 +3.7%p 추가 상승했다.

분석 섹션은 이 이득이 어디서 오는지 더 파고든다. DDR-Bench에서 채택된 진화 라운드를 따라가면 네 백본 모두 Initial에서 단조 증가했고, GPT-5.6-sol은 5라운드 후 Trajectory-Wise 93.5, Claude-Opus-4.8은 4라운드 후 92.3에 도달했으며 마지막 두 라운드에서 평탄해졌다. 진화 루프의 네 단계(diagnose, attribute, patch, gate)를 하나씩 끄는 절제 실험에서 gate 제거가 −11.2점으로 가장 큰 하락을 냈고, attribution 제거 −6.3점, diagnose 제거 −4.8점, 타입 있는 패치를 자유 형식 재작성으로 바꾼 경우 −1.7점이었다. 레벨별 제한 실험에서는 도구만 진화시킨 경우 +13.2점으로 단일 레벨 최대 이득을 냈고, 콘텐츠만 +8.7점, 스키마만 +3.6점이었지만 세 레벨 전체의 +20.0점에는 미치지 못했다. 구조 절제에서는 Mappings 마스킹이 −13.4점으로 가장 컸고 Evidence −8.7점, Constraints −3.5점, Relations −2.1점 순이었다. 백본 간 차이도 보고된다. 채택된 Term 식별자 집합의 Jaccard 겹침은 어떤 쌍도 0.62를 넘지 않았고, Claude 두 백본끼리(0.55)가 GPT 두 백본끼리(0.61)보다 더 적게 겹쳤다. 진화된 저장소를 다른 백본에 적용하는 전이 실험에서는 대각선이 항상 해당 열의 최고값이었고, 비대각 항목은 최소 6.6점 하락했으며 평균 열 하락은 Sonnet-5의 −6.6점에서 GPT-5.5의 −10.9점까지였다.

개발자 관점에서 이 논문의 실질적 메시지는 시맨틱 레이어를 프롬프트 조각이 아니라 런타임에 질의 가능한 도구로 노출하라는 것이다. 같은 내용이라도 정적 프롬프트로 넣으면 턴마다 가지치기할 수 없어 다른 지시와 경쟁하고, MCP 도구로 노출하면 현재 단계에 관련된 용어와 매핑만 검색해 온다. 실무에 적용하려면 학습 워크로드와 별도의 held-out 검증셋이 필요하고, 백본마다 온톨로지를 따로 진화시켜야 한다는 점을 예산에 넣어야 한다. 전이 실험이 보여주듯 다른 백본의 진화 결과를 그대로 가져다 쓰면 최소 6.6점 손해다. 또한 최종 평가 전에 온톨로지를 동결하는 운영 절차가 전제된다. 저자들이 별도의 한계 절을 두고 있지는 않지만 전제는 본문에 명시되어 있다. 초기 구축은 정답 없이 워크로드와 실행 가능한 프로브에만 의존하므로, 워크로드가 도메인 개념을 충분히 드러내지 못하면 출발점 자체가 약해진다. 진화는 백본 조건부 paired gate가 있어야 성립하고, 검증셋에서 τ 이상의 개선을 못 내는 후보는 버려지므로 라운드가 진행될수록 실패 서명이 줄어 이득이 평탄해진다. InsightBench의 이득이 상대적으로 작은 것은 짧은 참조 스타일 발견에 채점되어 정답과 정렬되면 포화되기 때문이라고 논문은 설명한다. 한 가지 짚어둘 점은 초록이 네 개의 LLM 백본에서 실험했다고 쓰는 반면 실험 섹션은 여섯 개 백본을 평가한다고 기술해 수치가 어긋난다는 것이다. 그 외에 원문에 제시되지 않은 수치는 이 글에 넣지 않았다.