ColNanoVDR이 문서 없이 다중 벡터 검색 질의 인코더를 증류한다

ColNanoVDR: Document-Free Query Distillation for Multi-Vector Visual Document Retrieval via Optimal Transport

HF Daily2609.34899

Zhuchenyang Liu, Ziyi Wang, Yao Zhang2026-09-28조회 2

무엇인가

시각 문서 검색(VDR)은 OCR 없이 텍스트 질의를 페이지 이미지에 직접 매칭한다. 최신 검색기는 질의 인코더와 문서 인코더를 모두 90억 파라미터급 비전언어모델로 구성하는데, 페이지는 오프라인에서 한 번 색인되지만 질의 인코더는 매 요청마다 실행된다. 질의 측 증류는 이 병목을 없앤다. 교사의 문서 인코더와 페이지 인덱스는 그대로 두고 질의 인코더만 작은 학생으로 교체하는 방식이다. 선행 연구 NanoVDR은 교사의 질의 임베딩만으로 학습하는 이른바 문서 없는(document-free) 학습을 단일 벡터 검색기에 적용했지만, 가장 강한 VDR 시스템은 다중 벡터다. 질의와 페이지를 토큰 벡터 집합으로 표현하고 각 질의 토큰을 가장 유사한 페이지 토큰에 매칭해 최댓값을 합산하는 MaxSim 후기 상호작용을 쓴다. 논문에 따르면 ViDoRe v3에서 저자들이 다루는 다중 벡터 교사는 최고 단일 벡터 시스템을 NDCG@5 기준 15~19점 앞선다. 문제는 기존의 점수 증류가 문서 의존적이라는 점이다. 모든 학습 페이지를 교사로 인코딩해 캐시해야 하고, 고해상도 페이지 하나가 1000개가 넘는 토큰 벡터를 만든다. 저자들은 ColVec1.1 기준으로 학습 쌍 100만 개에 약 2TiB의 페이지 토큰 캐시가 필요하다고 추정한다.

어떻게 동작하나

ColNanoVDR의 핵심은 OTW(학습된 가중치를 갖는 최적 수송)다. 질의를 단위 구 위의 가중치 있는 토큰 임베딩 집합, 즉 이산 확률 측도로 본다. 페이지 D에 대한 가중 후기 상호작용 점수는 각 질의 토큰이 페이지에서 찾은 최선의 매칭 h_D(q)를 가중 평균한 값이다. 교사는 균등 가중치 1/K_t를 쓰므로 표준 MaxSim과 같고, 학생은 학습된 가중치를 쓴다. 두 토큰 집합은 토크나이저가 달라 개수가 다르고 대응 관계가 없다. OTW는 학생 토큰 i의 가중치를 교사 토큰 j에 배분하는 수송 계획 P를 도입해, 각 학생 토큰이 자기 가중치를 모두 내보내고 각 교사 토큰이 자기 가중치를 정확히 받도록 제약한다. 비용은 MaxSim이 쓰는 내적에 기반한 코사인 비용 1-<x,y>이고, 정렬 비용은 모든 계획 중 최소 비용이다. 선형 계획법의 해는 희소해 학습 목표로 부적합하므로 엔트로피 항을 더해 완화하고, 온도 ε를 조절해 Sinkhorn 반복으로 미분 가능한 유일한 계획을 얻는다. 가중치는 별도 지도 없이 학생이 질의만 보고 예측한다. 토큰 은닉 상태를 읽는 선형 헤드에 소프트맥스를 적용해 가중치를 만들고, 손실은 그 가중치 아래의 엔트로피 수송 계획과 비용 행렬의 내적이다. 저자들은 학습 질의에서 학생이 평균 17개, 교사가 29개 토큰을 만든다고 밝히며, 균등 가중치는 이런 불일치에서 정렬 비용을 높게 유지한다고 지적한다.

무엇과 다른가

이 설계가 성립하는 근거는 정리 1이다. 단위 구 위의 비어 있지 않은 모든 유한 페이지 D에 대해 학생과 교사의 가중 점수 차이의 절댓값이 정렬 비용의 제곱근의 2배 이하이고, 다시 손실의 제곱근의 2배 이하로 묶인다. 즉 OTW가 최소화하는 목적함수는 학습에 등장하지 않은 페이지를 포함한 모든 페이지에서 MaxSim 점수 차이의 상한이다. 추론 시에는 교사를 버리고 학생이 각 토큰을 가중치로 스케일한 뒤 표준 MaxSim으로 채점하는데, 양수 가중치는 최댓값 밖으로 나올 수 있어 이 값이 학습에서 정렬한 가중 점수와 정확히 일치한다. 따라서 기존 후기 상호작용 엔진에 인덱스나 스코어링 커널 변경 없이 그대로 꽂힌다. 학생은 텍스트 전용 인코더에 두 개의 선형 헤드를 붙인 구조로, 교사 폭으로의 편향 없는 투영과 L2 정규화, 그리고 가중치 헤드다. Sinkhorn은 로그 영역에서 풀되 처음 반복은 기울기를 추적하지 않고 마지막 반복만 자동미분 그래프 안에서 재계산해 한 번의 반복 분량 메모리만 요구한다. 행렬 크기가 약 17×29로 작아 학습 속도는 점수 증류와 비슷하다.

어떻게 쓰나

실험은 ViDoRe v3에서 가장 강한 다중 벡터 검색기 다섯 개를 교사로 삼아 진행했다. 두 세대의 백본, 320과 640 두 임베딩 차원, 4.5B에서 8.8B 파라미터에 걸친다. 주 교사는 ColQwen3.5-4.5B다. 학생은 Ettin 인코더 계열로, 헤드를 포함해 149M 파라미터인 Ettin-150M이 주 결과에 쓰였고 32M·68M·150M·400M 용량 절제 실험도 있다. 학습 데이터는 NanoVDR 학습셋으로 공개 데이터 네 종류에서 온 711,603개 (질의, 페이지 이미지) 쌍과 기계 번역된 질의 변형 777,649개다. 평가 지표는 ViDoRe v1(10개 데이터셋), v2(4개), v3(8개)의 NDCG@5와 교사 대비 유지율이다. 결과적으로 v1에서는 모든 학생이 교사 NDCG@5의 약 99%를 유지했고, 더 어려운 v2와 학습 도메인 밖 기업 컬렉션인 v3에서는 다섯 교사 모두 93.0~96.5% 유지율을 보였다. 파라미터는 30~60배 적고 문서 측 지도는 전혀 쓰지 않았다. 단일 CPU 스레드에서 질의를 87ms에 인코딩해 ColQwen3.5 교사보다 26배 빠르며, 다른 비전언어 검색기는 질의당 1초 이상이 걸린다. GPU 배치 크기 1에서는 격차가 1.3~2.2배로 줄고, ColQwen3.5의 110.7ms는 모델 크기 때문이 아니라 대체 커널 경로 때문이라고 논문은 설명한다. 감독 비용 면에서 OTW는 점수 증류보다 캐시된 교사 데이터를 12.6배 적게 읽는다. 용량을 키우면 유지율은 모든 벤치마크에서 단조 증가하고, Ettin-32M도 v3에서 87%를 유지한다.

전제와 한계

목적함수 자체의 기여를 분리하기 위해 동일한 학습 조건에서 문서 의존적 목적 두 개(InfoNCE, Listwise KL)와 문서 없는 목적 두 개(Coverage, 균등 가중치 OT)를 비교했다. OTW는 가장 강한 문서 의존적 기준인 Listwise KL과 대등하다. ColQwen3.5에서는 v2에서 60.0 대 61.2로 뒤지고 v1과 v3에서는 동률이며, Tomoro-ColQwen3-8B에서는 세 벤치마크 모두 앞서고 v3에서 5.0점 리드한다. InfoNCE는 두 교사 모두에서 뒤진다. 학습된 가중치의 효과도 드러난다. 균등 가중치를 쓰는 OT-uniform은 ColQwen3.5에서는 OTW와 1.7점 이내지만 Tomoro-ColQwen3-8B에서는 4.7~9.2점 뒤처지고, 하드 할당을 쓰는 Coverage는 두 교사 모두 모든 벤치마크에서 OTW에 못 미친다. 즉 두 토큰 집합이 다를 때 균등 가중치는 잘 맞지 않고, 학습된 가중치가 교사 전반에 걸쳐 증류를 안정시킨다.

배포 측면에서는 인덱스 압축과의 조합도 확인했다. ColVec1.1-4b의 ViDoRe v3 인덱스를 계층적 토큰 풀링으로 3배와 9배 압축한 뒤 교사와 학생 질의를 같은 압축 인덱스에 채점했다. 벡터를 9배 줄여도 유지율은 95.8%에서 95.3%로만 떨어져, 학생이 교사만큼만 손해를 본다. 질의 인코더 경량화와 인덱스 압축이라는 두 절감이 서로 상쇄되지 않고 합성된다는 뜻이다. 실무적으로는 새 교사를 추가할 때 그 교사의 학습 질의만 인코딩하면 되고, 페이지 캐시를 다시 만들 필요가 없다.

저자들이 밝힌 한계는 분명하다. 학생은 모두 단일 인코더 계열(Ettin)에서 나왔고 모든 구성이 고정 시드 단일 실행이라 분산을 보고하지 않는다. ColQwen3.5에서 문서 없는 목적들 사이 격차는 최대 2점이고 v1의 차이는 단일 실행으로 판별할 수 없는 범위에 있다. 목적함수 비교는 두 교사만 다루므로 나머지 세 교사에서도 같은 순서가 나오는지는 검증되지 않았다. OTW는 질의-페이지 쌍을 읽지 않지만 학습 질의는 모두 쌍이 있는 집합에서 왔고, 쌍이 없는 질의 로그로의 학습은 시험되지 않았다. 압축되는 것은 질의 인코더뿐이라 문서 인덱스와 저장량은 교사 것이 그대로 남고, 검색 비용은 짧아진 질의를 통해서만 줄어든다. 이론적 보장은 점수 차이에 대한 충분조건이며 측정한 학생들에서 약 8배 느슨하고, 학생 측도의 가중치 선택을 구분하지 못한다. 또한 학생은 영어 중심 인코더이고 ViDoRe 질의도 대부분 영어라 언어별 결과 분석은 없다.