표 이미지를 이중으로 분리해 이해하는 DELTA와 OTSL 기반 LLM TarQA
Tables Decoded: DELTA for Structure, TARQA for Understanding
무엇인가
이 논문이 다루는 것은 문서 지능의 핵심 과제인 표 이해다. 표 이해는 크게 두 갈래로 나뉘는데, 표 이미지에서 구조와 내용을 복원하는 표 구조 인식(TSR)과 표 이미지에 대한 시각 질의응답(TabVQA)이다. 최근 연구는 표 이미지를 그대로 비전-언어 모델(VLM)에 넣는 방식이 주류지만, 저자들은 이 접근이 구조 추론과 내용 추출, 질의응답을 하나의 불투명한 파이프라인에 묶어버려 디버깅과 적응이 어렵다고 지적한다. 또한 이미지-텍스트 쌍으로 대규모 사전학습이 필요하고, 비라틴 문자나 저자원 언어에서 성능 격차가 나타난다. 대안으로 제시하는 것이 구조화된 텍스트 표현이다. 텍스트 표현은 처리하기 쉽고 LLM과 자연스럽게 정렬되며, 언어별 시각 인코더가 필요 없어 다국어 문서에 특히 적합하다는 것이 논문의 출발점이다.
어떻게 동작하나
제안하는 DELTA는 이중 분리(doubly decoupled) 표 재구성 프레임워크다. 분리가 두 층에서 일어나는데, 첫째는 표 구조 인식과 OCR을 분리해 구조와 텍스트를 독립적으로 처리하는 것이고, 둘째는 표 구조 인식 내부에서 물리적 구조(행과 열)와 논리적 구조(셀 배치)를 분리하는 것이다. 구체적으로 물리 구조는 TATR이, 논리 구조는 SPRINT가 담당한다. SPRINT는 언어에 독립적으로 셀 관계를 잡아내는 논리 구조 인식 모델이고, TATR은 행과 열을 식별해 개별 셀의 경계를 정확히 표시한다. 두 모델의 결합 출력은 셀 병합, 행·열 스팬 같은 복잡한 요소를 담고 각 td 태그에 정확한 바운딩 박스 좌표가 붙은 HTML 태그 시퀀스다. 이 HTML을 가지고 각 셀의 바운딩 박스로 이미지를 잘라 EasyOCR로 텍스트를 추출한 뒤 다시 HTML에 삽입한다. EasyOCR은 TSR과의 통합이 쉽고 GPU 호환성과 처리 속도가 좋아 선택했으며, 모듈식이라 교체 가능하다는 점을 강조한다. 최종 단계에서는 Algorithm 1에 정의된 무손실 변환으로 HTML을 OTSL 시퀀스로 바꾼다.
무엇과 다른가
OTSL은 최적화된 표 구조 언어(Optimised Table Structure Language)로, 셀 배치와 텍스트 내용을 함께 인코딩하는 압축되고 통일된 포맷이다. HTML은 태그가 반복적이고 장황해 토큰 시퀀스가 길어지고 LLM 입력 한도를 압박하는 반면, OTSL은 계층적 레이아웃과 스팬 셀, 텍스트를 HTML보다 짧은 형태로 보존한다. 이 위에 올리는 것이 TarQA다. TarQA는 OTSL 시퀀스에 직접 파인튜닝한 LLM으로, 표 이해를 텍스트-투-텍스트 문제로 재정의해 하위 추론에서 표 이미지 의존성을 없앤다. 베이스 모델은 Meta-LLaMA-3-8B-Instruct이고, 각 예제는 지시문과 직렬화된 표, 자연어 질문, 정답으로 구성된 프롬프트 템플릿을 따른다. 프롬프트는 한 단어나 짧은 구절로 답하고 설명을 덧붙이지 말라고 지시하며, 최대 4096 토큰으로 패딩하고 truncation을 켠 뒤 greedy decoding으로 추론했다. 실험은 NVIDIA H100 80GB 한 대에서 수행했다.
어떻게 쓰나
실험은 영어와 비영어 데이터셋 양쪽에서 이뤄졌다. DELTA는 여러 기성 블록을 조합한 프레임워크라 별도 학습 없이 FinTabNet(test), PubTables(test), PubTabNet(validation)에서 바로 추론해 결과를 보고한다. 표 구조 인식에서 DELTA는 TEDS-Structure 점수 기준으로 FinTabNet, PubTabNet, PubTables-1M 전반에서 최신 방법들과 견줄 만한 수준을 낸다. 다만 일반화가 떨어지는 MTL-TabNet이나, PDF 파싱을 활용해 거의 완벽한 텍스트 충실도를 얻는 VAST, TableFormer에는 TEDS 전체 점수에서 미치지 못한다. 저자들은 그 원인이 OCR에 있다고 밝힌다. 보충 자료의 OCR 절제 실험에서 정답에 매핑한 콘텐츠를 넣으면 거의 완벽한 TEDS가 나왔고, 이는 재구성 자체는 신뢰할 만하고 OCR만이 유일한 병목이라는 것을 확인해준다.
전제와 한계
질의응답 쪽 성과도 구체적이다. 같은 설정으로 포맷만 바꿔 파인튜닝한 비교에서 TarQA-OTSL은 TarQA-HTML 대비 ANLS와 Exact Match 두 지표 모두 약 14 p.p. 앞선다. WTQ에서는 기존 최강 HTML 베이스라인보다 ANLS 기준 9.3 p.p. 향상됐고, FinTabNetQA에서는 의미적으로 동등하지만 표기가 다른 답을 감안하는 relieved accuracy 지표로 모든 베이스라인을 능가하며 9.2 p.p. 개선을 기록했다. 정답 시퀀스를 넣은 스카이라인 실험이 모든 방법을 앞섰고 그중 OTSL 기반 스카이라인이 최고점을 냈다는 점은, OTSL 재구성 품질(TEDS)이 높아질수록 하위 TabVQA 성능이 직접적으로 좋아진다는 것을 보여준다.
다국어 검증을 위해 공개한 TORQUE는 힌디 표 재구성과 힌디 TabVQA를 함께 평가하는 벤치마크다. 정부 회람과 MUSTARD의 영성 서적에서 잘라낸 210개 표로 구성되며 109개는 스캔본, 101개는 디지털 생성본이고 단순 구조 149개, 복잡 구조 61개가 섞여 있다. 422개의 수동 검증 QA 쌍이 포함되고 이는 GPT-oss-20B로 생성했으며, 재구성용 정답 HTML은 ChatGPT-4o 출력을 사람이 후보정해 만들었다. DELTA는 힌디로 학습된 구성 요소가 하나도 없이 zero-shot으로 이 데이터셋에 적용됐고, Qwen-2.5 VL Instruct를 제외한 모든 VLM을 10 p.p. 이상 앞선다. Qwen이 앞서는 유일한 이유는 사전학습 코퍼스에 힌디 데이터가 포함돼 있어 본질적 이점을 갖기 때문이라고 저자들은 설명한다. 힌디 능력을 갖춘 LLM 중에서는 어떤 모델도 이 접근을 넘지 못했고, 전체 VLM 및 DELTA+LLM 변형을 통틀어 2위를 기록했다.
개발자 입장에서 이 논문의 실용적 의미는 파이프라인을 어디서 끊을지에 대한 근거를 준다는 것이다. VLM 하나로 끝내는 대신 구조 인식, OCR, 추론을 분리하면 각 단계를 따로 교체하고 측정할 수 있고, 언어별 시각 인코더 없이도 다국어로 확장할 수 있다. 다만 도입 전에 확인해야 할 것이 있다. 첫째, 전체 성능의 상한이 OCR 품질에 걸려 있다는 점이다. TEDS-Structure는 경쟁력 있지만 TEDS 전체 점수는 OCR 오류 때문에 제한되며, 이는 하위 TabVQA 성능까지 끌어내린다. 둘째, TEDS-S와 TEDS를 구분해서 읽어야 한다. 셋째, FinTabNetQA 평가에 쓰인 relieved accuracy는 숫자 포맷이나 통화 기호 같은 표기 차이를 감안하는 지표이므로 다른 논문의 정확도 수치와 단순 비교하면 안 된다. 넷째, EasyOCR은 모듈식으로 교체 가능하게 설계됐으니 자체 OCR이나 PDF 텍스트 레이어를 끼워 넣는 것이 가장 빠른 개선 경로다.
저자들이 명시한 한계는 분명하다. DELTA는 좋은 TEDS-S 점수를 내지만 전체 TEDS는 여전히 개선 여지가 있고, 그 원인은 파이프라인의 현재 OCR 지원이다. OCR 품질을 끌어올리면 TEDS가 100%에 가까워지고, 그때 DELTA+TarQA가 스카이라인 성능에 근접할 수 있다고 본다. 실험 범위도 영어와 힌디 벤치마크로 제한되며, 모듈식 설계와 OCR 지원 덕분에 다른 언어로 확장 가능하다는 것이 저자들의 전제다. 향후 계획으로는 추상적 질의응답(abstractive QA)처럼 복잡한 질의에 대한 추론 능력을 강화해 접근의 범위와 영향력을 넓히는 것을 제시한다.