혼합 모달 검색기에서 텍스트가 이미지를 앞서는 편향을 Trident가 교정한다
Chaos in the Text: Revealing the Modality Preference in Mixed-Modality Retrievers
무엇인가
이 논문은 텍스트, 이미지, 그리고 둘이 융합된 문서가 한 컬렉션에 섞여 있을 때 밀집 검색기(dense retriever)가 얼마나 믿을 만하게 동작하는지를 다룬다. 텍스트 코퍼스와 이미지 코퍼스 각각에서는 검색 성능이 크게 발전했지만, 두 모달리티가 공존하는 혼합 코퍼스에서도 그 능력이 그대로 유지되는지는 분명하지 않았다. 저자들은 여러 아키텍처를 가로질러 검색기를 체계적으로 점검하고, 성능이 모달리티 구성비에 극도로 민감하다는 사실을 확인한다. 단일 모달리티 코퍼스에서는 강하게 유지되던 검색 품질이 모달리티가 공존하는 순간 크게 떨어진다는 것은, 실제 서비스에서 문서 형식이 조금만 달라져도 검색 순위가 흔들릴 수 있다는 뜻이다.
어떻게 동작하나
핵심 관찰은 이미지 문서를 의미상 대응하는 텍스트 표현으로 점진적으로 치환해 나갈 때 검색 성능이 뚜렷한 V자 곡선을 그린다는 점이다. 양 끝의 단일 모달리티 구간에서는 성능이 강하지만, 두 모달리티가 섞이는 중간 구간에서 급격히 무너진다. 특히 같은 수의 무관한 이미지보다 무관한 텍스트가 더 심각한 성능 저하를 일으키는데, 저자들은 이 현상을 Chaos in the Text라고 부른다.
무엇과 다른가
원인 분석은 모달리티 선호(modality preference)로 이어진다. 텍스트 표현이 체계적으로 더 높은 유사도 점수를 받기 때문에, 무관한 텍스트가 관련 있는 이미지를 앞질러 상위 순위를 차지할 수 있다는 것이다. 검색기가 내용의 관련성이 아니라 모달리티 자체에 끌리는 셈이며, 이것이 혼합 코퍼스에서 순위가 무너지는 직접적인 메커니즘이 된다.
어떻게 쓰나
이를 완화하기 위해 제안하는 방법이 Trident다. 각 문서에 대해 텍스트 뷰, 이미지 뷰, 텍스트-이미지 융합 뷰를 만들어 세 뷰를 동등한 양성(co-equal positives)으로 취급하고, Multi-Positive View InfoNCE로 관련성 판별과 양성 뷰 간 균형을 함께 최적화한다. 특정 모달리티가 정답 신호를 독점하지 않도록 학습 목표 자체를 설계한 구조라고 볼 수 있다.
전제와 한계
실험은 visual document와 natural image 벤치마크에서 수행됐다. 초록에 따르면 Trident는 CLIP 기반과 VLM 기반 아키텍처 양쪽에서 혼합 모달리티 검색 성능을 끌어올리고, 모달리티 구성과 텍스트 방해물(distractor)에 대한 민감도를 낮추며, 단일 모달리티 검색의 평균 성능까지 높인다. 초록에는 구체적인 데이터셋 이름이나 수치가 제시되지 않으므로, 정량적 비교는 원문을 확인해야 한다.
개발자에게 이 논문은 혼합 코퍼스 검색의 실패 모드를 짚어주는 경고에 가깝다. PDF, 슬라이드, 스크린샷처럼 텍스트와 이미지가 뒤섞인 문서를 RAG나 검색 파이프라인에 넣는다면, 검색 품질이 컬렉션의 모달리티 비율에 따라 요동칠 수 있다는 점을 전제로 삼아야 한다. 특히 OCR 텍스트나 캡션처럼 관련성이 낮은 텍스트가 관련 이미지를 밀어낼 수 있으므로, 혼합 코퍼스에서는 모달리티별로 나눠 평가하고 무관한 텍스트를 일부러 섞는 스트레스 테스트를 함께 돌려보는 것이 좋다. Trident의 접근처럼 문서를 여러 뷰로 표현하고 뷰 간 균형을 학습 신호에 넣는 발상은 자체 검색 모델을 파인튜닝할 때 참고할 만하다.
한계와 전제는 초록 수준에서 저자가 명시적으로 밝히지 않는다. 다만 실험 범위가 CLIP 기반과 VLM 기반 아키텍처, 그리고 visual document 및 natural image 벤치마크에 한정된다는 점은 확인해야 할 전제다. 또한 각 문서를 텍스트·이미지·융합 세 가지 뷰로 구성하는 방식이므로, 실제 도입 시 인덱스 구성과 저장 방식이 기존 단일 뷰 검색과 어떻게 달라지는지는 별도로 검토할 필요가 있다.