텍스트 임베딩을 얼려 두고 6개 모달리티를 한 벡터 공간에 묶는다

Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation

arXiv2610.02148v1

Mohammed Irfan Kurpath2026-10-01

무엇인가

텍스트 임베딩 모델에 이미지·오디오·비디오를 붙이면 텍스트 검색 품질이 떨어지는 현상(치명적 망각)과, 이를 막으려면 모델이 수십억 파라미터로 커지는 현상(모달리티 비대화)이 함께 온다. 논문은 이 둘을 묶어 멀티모달 확장 딜레마라고 부른다. 기존 공개 옴니 임베더는 LCO-Embedding-Omni-3B/7B, BidirLM-Omni-2.5B, NVIDIA omni-embed-nemotron-3B, e5-omni-3B/7B 등 2.5B~8.9B 규모이고, 텍스트는 여전히 실무 검색에서 가장 중요한 모달리티라 이 손실이 곤란하다는 것이 문제 설정이다.

어떻게 동작하나

해법의 핵심은 텍스트를 공동 학습자가 아니라 움직이지 않는 기준점으로 두는 것이다. 백본은 전혀 업데이트하지 않고(0.9B는 텍스트 경로, 2.3B는 텍스트와 비전 경로), 각 미디어 샘플에 밀집 캡션을 붙인 뒤 그 캡션을 같은 동결 백본에 통과시킨 EOS 풀링 임베딩을 교사 타깃으로 쓴다. 교사와 학생이 같은 가중치를 공유하므로 별도 투영 헤드 없이 코사인 정렬만으로 충분하고, 타깃은 학습 내내 상수라 디스크에 캐시된다. 학습은 1단계에서 프로젝터만, 전체 스텝의 20% 이후 2단계에서 인코더 LoRA(r=16, α=32)를 투입하는 순서를 따른다.

무엇과 다른가

구조는 0.9B가 Qwen3-Embedding-0.6B(hidden 1024)에 Qwen3.5-0.8B에서 뽑은 ViT를 붙인 형태이고, 2.3B는 Qwen3-VL-Embedding-2B(hidden 2048)의 네이티브 비전을 쓴다. 오디오는 Whisper(mel)와 Dasheng(raw waveform)을 병렬로 돌려 30초 청크당 각 128토큰을 뽑고 (w1,d1,w2,d2,…)로 시간축 인터리빙해 256토큰을 만든다. 비전은 ViT → 2×2 공간 병합 → 차원 프로젝터 순이고, 비디오는 학습 가능한 196개 쿼리에 대한 크로스어텐션 풀러로 프레임 수와 무관한 길이를 만든다. 손실은 Matryoshka SigLIP 대조 손실(차원 {128,256,512,1024}, 2.3B는 +2048, 가중치 ∝ 1/√d)에 코사인 자기증류를 λ=1로 더한 형태이며, FAISS-CPU 인덱스 기반 온라인 하이브리드 하드 네거티브 마이너가 텍스트 사이클(에폭당 약 10회)과 모달리티별 미디어 사이클(약 5회)을 서로 다른 주기로 갱신한다. 텍스트 쪽은 그래디언트를 받지 않으므로 인덱스가 완전히 안정적이다.

어떻게 쓰나

학습 데이터는 590,858행에서 캡션 카테고리만 걸러 242,080개, 길이 필터 후 227,704개를 쓴다. 모든 캡션은 Qwen3-Omni-30B-A3B-Instruct를 T=0.7로 한 번 호출해 만들고, 원본 데이터셋의 정답 캡션을 시스템 프롬프트에 참조로 넣어 그라운딩한다.

전제와 한계

결과는 0.9B가 MTEB-v2 BEIR-8에서 49.57 nDCG@10으로, 텍스트 가중치가 Qwen3-Embedding-0.6B와 비트 단위로 동일해 학습이 이 점수를 움직일 수 없다. 공개 옴니 임베더 중 텍스트에서 앞서는 것은 5배 큰 omni-embed-nemotron-3B(50.48)뿐이다. 크기는 다음 공개 모델 대비 약 2.7배, LCO-Embedding-Omni-7B 대비 약 9.5배 작다. 2.3B 변형은 전체 모달리티 평균 51.39로 비공개 gemini-embedding-2의 49.51을 앞서고, 이미지 64.80, 비디오 55.18, 비주얼 문서 58.10을 기록한다. 다만 0.9B는 이미지 26.29, 비디오 18.48로 낮은데, 저자들은 정렬 레시피가 아니라 0.8B 백본에서 뽑은 작은 ViT 용량(이미지 약 86K, 비디오 약 36K 행)이 원인이라고 본다. e5-omni-7B는 전체 평균에서 52.93으로 앞서지만, e5-omni는 3B에서 7B로 갈 때 텍스트가 47.80에서 45.34로 떨어지는데 이는 동결 앵커가 피하려는 비용과 일치한다.

어블레이션에서 백본 동결을 풀면 0.9B는 미디어가 +1.10~+5.66 오르는 대신 텍스트가 3.13점 떨어지고, 2.3B에서는 오히려 모든 모달리티가 나빠진다(음성 −10.53, 오디오 −8.40). 밀집 캡션을 원본 캡션으로 바꾸면 음성 +2.68, 비디오 +14.06만큼 차이가 나고, 음성·오디오·이미지·비디오 평균에서 7.01점, 비주얼 문서에서 4.8 nDCG@10(46.98→42.21)이 빠진다. 하이브리드 마이닝은 미디어 5개 평균에서 마이닝 없음 대비 +2.6이고, 텍스트 마이닝만 하면 일부 모달리티가 오히려 나빠진다. 시드 3개(42, 71, 1234) 분산은 이미지 27.48±0.43, 오디오 33.96±0.59, 비디오 19.82±0.95, 음성 43.10±1.03, 비주얼 문서 45.48±1.76이며 텍스트는 세 시드 모두 49.57로 동일하다. Matryoshka 덕에 128차원 절단 시 인덱스 저장량이 8배 줄어 1,000만 항목 float32 인덱스가 약 41GB에서 약 5GB가 된다.

실무 관점에서 이 논문의 가치는 텍스트 검색 품질을 계약처럼 보장한다는 점이다. 텍스트 추론 경로가 학습된 프로젝터나 LoRA를 전혀 거치지 않으므로, 기존 텍스트 검색 위에 이미지·오디오·비디오 검색을 얹으면서 기존 지표가 흔들릴 위험을 구조적으로 제거한다. 또 백본을 교체해도 프로젝터와 LoRA만 다시 학습하면 되므로, 더 좋은 텍스트 임베더가 나왔을 때 재학습 비용이 작다. 다만 0.9B의 이미지·비디오 점수는 실서비스 품질로 보기 어렵고, 오디오·음성도 큰 베이스라인에 뒤진다.

저자들이 밝힌 한계는 분명하다. 연구 프로토타입이며 고위험 의사결정에 단독으로 쓰면 안 된다. 동결 텍스트 백본이 공간을 제약하므로 복잡한 음향 질감, 추상적 시각 패턴, 미세한 시간적 단서처럼 언어화하기 어려운 현상은 충분히 표현되지 않을 수 있다. 캡션 파이프라인은 환각·누락·편향을 그대로 학생에게 물려주며, 사실성 필터링이나 원본 미디어 대조 검증을 하지 않고 마이닝 단계의 0.92 코사인 임계값이 유일한 자동 검사다. 캡션 품질을 인위적으로 떨어뜨리는 통제 실험도 하지 않아 품질 저하에 따른 검색 성능 하락 폭을 정량화하지 못했고, 단일 캡셔너의 편향이 코퍼스 전체에 균일하게 적용된다는 점을 가장 측정하고 싶은 실패 모드로 꼽는다. 오디오 경로의 고정 시간 인터리빙은 한 종류 오디오만 있는 입력에 최적이 아닐 수 있고, 6개 모달리티 전부를 아우르는 임의 질의→코퍼스 검색 벤치마크가 아직 없어 결과가 모든 조합·언어·도메인으로 일반화된다고 보장할 수 없다.