OceanBase, Data Agent Benchmark 1위…정확도 90.62%로 첫 90% 돌파
중국 데이터베이스 기업 OceanBase가 국제 데이터 에이전트 벤치마크인 Data Agent Benchmark(DAB)에서 자사 팀이 제출한 방안이 1위를 차지했다고 밝혔다. 정확도는 90.62%로, 이 벤치마크에서 90%를 넘긴 첫 참가안이라고 회사 측은 설명했다.
이번 제출안의 내부 코드명은 Scout다. OceanBase 데이터베이스와 자체 대규모 언어모델 GLM-5.2를 조합해 구성했으며, 회사 측에 따르면 GPT, Claude Opus, Claude Fable 등 해외 모델을 기반으로 만들어진 여러 참가안보다 높은 점수를 받았다. 관련 기술은 향후 OceanBase DataPilot 제품에 반영될 예정이라고 한다.
DAB는 UC Berkeley EPIC Data Lab과 Hasura PromptQL이 함께 만든 벤치마크다. 인터넷·로컬 생활, 금융·주식, 생물의학, 지식재산, 기업 운영, 정부·공공 관리, 미디어·엔터테인먼트 등 여러 영역을 다루며, PostgreSQL, MongoDB, SQLite, DuckDB 같은 서로 다른 데이터베이스를 평가 대상에 포함한다.
기존 Text-to-SQL 벤치마크가 자연어를 SQL로 바꾸는 능력을 주로 본다면, DAB는 AI가 실제 데이터 환경에 들어갔을 때 흩어져 있고 형태가 제각각인 데이터에서 정답을 찾아낼 수 있는지를 본다. 하나의 과제를 끝내려면 데이터를 이해하고, 쓸 데이터를 고르고, 분석 경로를 세우고, 질의와 계산을 수행한 뒤 결과를 검증하는 과정이 모두 필요하다. 결국 하위 모델 하나의 성능이 아니라 모델, 에이전트, 데이터 시스템의 결합을 측정하는 셈이다.
OceanBase가 제출한 방식도 이 구조를 겨냥한다. DataLens로 데이터 프로파일을 만들고 필드와 데이터 간 관계를 파악한 뒤, 과제 난이도에 따라 실행 경로를 계획해 데이터 선택·필터링·조인·계산을 처리한다. 결과가 나온 뒤에는 근거 추적과 답 검증으로 계산 과정과 결과를 확인하고, 문제가 발견되면 계획을 수정해 다시 검증하는 식이다. 데이터 이해, 계획과 실행, 검증과 수정으로 이어지는 순환 구조를 만든 것이다.
이 흐름은 데이터베이스의 역할 변화와 맞물린다. AI 에이전트가 새로운 데이터 소비자로 등장하면서 데이터베이스는 데이터를 저장하고 꺼내주는 것을 넘어, AI가 데이터를 이해하고 연결하고 분석하며 결과의 신뢰성까지 확인하도록 돕는 쪽으로 확장되고 있다. OceanBase는 자사가 데이터베이스에서 AI 데이터 플랫폼으로 나아가는 과정에 있다고 밝혔고, DataPilot을 그 방향의 제품으로 제시했다.
개발자 입장에서는 자연어 질의를 SQL 한 줄로 변환하는 접근만으로는 실제 업무 데이터를 다루기 어렵다는 점이 다시 확인된 셈이다. 스키마 탐색, 조인 경로 선택, 계산 결과 검증, 실패 시 재계획 같은 단계를 에이전트 워크플로에 어떻게 넣을지가 실무 과제가 된다. 다만 이번 결과는 OceanBase가 자체적으로 발표한 단일 벤치마크 성적이며, 평가 세부 조건과 재현 결과는 제3자 검증이 필요하다. GLM-5.2와 Claude Fable 등 원문에 등장하는 모델 명칭과 버전도 회사 측 발표를 그대로 옮긴 것으로, 실제 공개된 모델 목록과 대조해 확인할 필요가 있다.