검색 임베딩에서 공유 투영과 이중 투영의 선택 기준을 편향분산 이론으로 제시한다

When Does Dense Retrieval Need Asymmetric Geometry? A Bias-Variance Theory of Shared and Dual Projections

HF Daily2609.32488

Maojun Sun, Yancheng Yuan, Jian Huang2026-09-26조회 3

무엇인가

이 논문은 dense retrieval에서 질의와 문서 임베딩을 저랭크 투영으로 적응할 때, 같은 투영을 쓰는 shared와 질의·문서에 별도 투영을 쓰는 dual 중 무엇이 나은지를 다룬다. shared는 M=P^T P 형태라 양의 준정부호(PSD) 연산자만 만들고, dual은 M=A^T B로 임의의 rank≤r 행렬을 표현할 수 있다. dual은 근사 편향을 줄이지만 더 많은 방향으로 학습 잡음을 흡수할 위험이 있다. 논문은 방향성 신호가 언제 추가 자유도의 추정 비용을 정당화하는지, 그리고 그 답을 학습 데이터에서 추정할 수 있는지 묻는다.

어떻게 동작하나

이론은 bilinear margin m_M(X,Y+,Y-)=X^T M D=<M, XD^T>_F에서 출발한다. shared family M_s(r)은 대칭 PSD rank≤r, dual family M_d(r)은 rank≤r 전체다. Theorem 1은 shared의 정확한 근사 손실을 제시한다. 목표 M*=H+K의 대칭부 H를 고유분해했을 때 최적 shared 근사는 가장 큰 r개 양의 고유값만 남긴 S_r^+=U diag(η_j 1{j∈J_r}) U^T이고, 최소 제곱오차는 skew 에너지 ||K||_F², 음의 고유값 제곱합, 버려진 양의 고유값 제곱합의 합이다. dual의 최소 오차는 특이값 꼬리합 ∑_{j>r} σ_j(M*)²이며, shared-minus-dual 근사 갭은 이 둘의 차이다. 검색 해석에서는 whitening 후 M*=Σx^{-1/2} C Σy^{-1/2}로 두면 이 갭이 rank-r 양성-음성 분리 성능의 갭과 같아진다.

무엇과 다른가

유한 표본에서의 추정 비용은 국소 가우시안 모델로 분석한다. rank-r shared 연산자 S 주변에서 M_n=S+n^{-1/2}H+O(n^{-1})이고, 관측 Y_n=M_n+(σ/√n)G_n이다. 접공간 차원은 dim T_d=2pr-r², dim T_s=pr-r(r-1)/2이며, dual만의 방향 수는 k=r(2p-r-1)/2다. 이 k는 r(r-1)/2개의 활성 부분공간 내 skew 방향과 r(p-r)개의 좌우 교차 부분공간 차이로 나뉜다. Theorem 2에 따르면 n배 기대 제곱오차는 dual이 σ² dim T_d로, shared가 ||Π_{T_s⊥}H||²+σ² dim T_s로 수렴한다. Corollary 1의 경계는 δ²=||Π_A H||²일 때 δ²>σ²k이면 dual의 국소 위험이 더 낮다고 말한다. 즉 dual만의 신호 에너지가 추가 k개 좌표의 분산 비용을 넘어야 한다.

어떻게 쓰나

이 경계를 데이터에서 추정하기 위해 SURE 기반 선택 규칙과 CARS를 제안한다. Z_n=√n Π_Td(Y_n-S)로 두면 plug-in 통계 ||Π_A Z||²는 기대값이 δ²+σ²k라 위로 편향된다. SURE 위험 추정 R̂_j=||Z-Π_Tj Z||²+σ²(2 dim T_j-dim T_d)를 비교해 dual을 선택하는 조건은 ||Π_A Z||²>2σ²k다. 선택 확률은 비중심 카이제곱 Pr(χ_k²(λ)>2k), λ=δ²/σ²로 주어지고, 모델 선택 리그렛 공식도 제시된다. δ=0일 때 dual을 잘못 고를 확률은 최대 (2/e)^{k/2}로 작다. 실제 임베딩에서는 CARS가 L개의 무작위 반분할에서 V_I=P_{d,r}(Ĉ_I)-P_{s,r}(Ĉ_I)를 계산하고, Γ̂_CARS=1/L∑[<V_{I_b,1},V_{I_b,2}>_F-1/4||V_{I_b,1}-V_{I_b,2}||²_F]가 0보다 크면 dual을 고른다. 이 기대값은 ||Δ||²-tr(Σ)/n이고, 잔차가 dual-only 방향 A에 있고 등방성 잡음이면 (δ²-σ²k)/n이 되어 국소 경계와 같은 신호 대 분산 비교를 데이터로 추정한다.

전제와 한계

실험은 네 가지 연구 질문으로 구성된다. RQ1의 통제된 two-view 검색은 p=32, rank 4/8/16, 학습 쌍 32~2048개, 299개 음성 문서, 5개 시드에서 수행됐다. rank-8 격자에서 첫 양의 평균은 0.8라디안 회전에서 n=256, 1.2라디안 회전에서 n=64로 나타나, 방향 불일치가 클수록 dual의 추정 비용을 넘는 데 더 적은 데이터가 필요함을 보였다. 별도 국소 가우시안 보정은 Theorem 2의 위험 한계를 0.25% 이내로, Theorem 3의 SURE 선택 확률을 0.001 이내로 맞췄다. RQ2에서는 plug-in 비대칭 점수가 점수 십분위에 걸쳐 거의 평평했지만, 분산을 보정한 점수는 홀드아웃 적합에서 shared 선호에서 dual 선호로 상승했다. 실제 임베딩에서는 10개 과제, 840개 연산자 적합을 비교했다.

RQ3은 실제 코퍼스 검색에서 불일치, rank, 학습 크기의 효과를 본다. FEVER, HotpotQA, NQ, MS MARCO, CQA-TeX에서 BGE-base와 GTE-base를 쓰고, rank-16 어댑터를 1,024개 질의로 학습했다. 질의 벡터만 8개 관련성 기반 평면에서 0°부터 90°까지 7개 각도로 회전시켰다. 평균 Dual-minus-Shared NDCG@10 이점은 0°에서 약 .0032, 90°에서 .0146으로 약 4.6배 증가했고, 다섯 데이터셋 평균 모두 증가했다. MS MARCO에서는 약 -.0008에서 +.0219로 부호가 바뀌었다. rank-학습크기 격자에서는 n=32일 때 shared가 16개 셀 중 13개를 이겼지만, n=1024와 2048에서는 dual이 32개 셀을 모두 이겼다. rank 32는 rank 4보다 절대 NDCG@10이 약간 높았지만(shared 0.7242→0.7257, dual 0.7282→0.7289) dual의 상대적 이점을 키우지는 않았다.

RQ4는 데이터가 늘수록 연산자 위험이 dual 쪽으로 이동하는지, CARS가 더 나은 기하를 고르는지 확인한다. NQ와 SciFact에서 네 인코더, 세 시드, 중첩 학습 크기와 rank를 사용했고, FEVER, NQ, ArguAna, SciFact의 168개 비교 가능한 표본 크기 기울기는 모두 양수였다. NQ에서는 네 곡선 중 세 개가 shared 선호에서 dual 선호 홀드아웃 적합으로 교차했다. 기하 선택 평가는 ArguAna, MS MARCO, FEVER, NQ, SciFact의 다섯 홀드아웃 질의 폴드에서 네 인코더, 중첩 학습 크기, rank 4/8/16/32, 20회 내부 반분할로 수행됐다. CARS는 100개 인코더-폴드 비교 중 85개에서 이겼고, 평균 기하 선택 정확도 90.1%, 더 나은 고정 선택 대비 평균 홀드아웃 리그렛을 49~96% 줄였다.

저자들이 밝힌 한계는 이론이 국소 등방성 가우시안 연산자 잡음을 가정한다는 점이다. 이방성 잡음으로의 확장과 랭킹 지표에 직접 맞춘 위험 추정은 향후 과제로 남는다. 또한 rank와 함께 별도로 매개변수화할 방향 수를 고르는 부분 공유도 미래 방향으로 제시된다. 개발자 관점에서는 질의-문서 불일치가 크고 학습 쌍이 충분할 때 dual 투영이 유리해질 수 있으며, 데이터가 적으면 shared가 안전하다. 고정 기하를 쓰기보다 학습 데이터에서 cross-fitted 신호 대 분산을 추정해 선택하는 CARS식 절차를 검토할 만하다. 다만 실제 지표와 잡음 구조가 이론 가정과 얼마나 맞는지 확인해야 한다.