임베딩 모델이 검색 지시문을 무시하는 이유를 쿼리측 방해문으로 밝힌다

Your Prompt Should Do More: Effects of Retrieval Instructions in Embedding Models

arXiv2610.10508v1

Amanda Myntti2026-10-07

무엇인가

프롬프트 기반 임베딩 모델은 검색 과제에서 쿼리 앞에만 과제 지시문을 붙이고 문서는 지시문 없이 독립적으로 임베딩하는 비대칭 구조를 쓴다. 이렇게 하면 하나의 문서 인덱스를 여러 검색 과제에 재사용할 수 있다. 문제는 평가 방식이 이 사용법과 맞지 않는다는 점이다. MTEB 같은 대표 벤치마크는 과제를 하나씩 따로 평가하기 때문에 후보 문서 풀에 '의미적으로는 비슷하지만 지시문이 요구하는 관계는 아닌' 텍스트가 거의 들어가지 않는다. 저자들은 이 설정이 지시문이 쿼리 임베딩을 실제로 어떻게 바꾸는지에 대해 거의 알려주지 않는다고 주장한다.

어떻게 동작하나

연구는 세 단계로 진행된다. 먼저 47개(타토에바는 대상 언어를 언급하는 4개를 더해 51개)의 자연어 지시문을 모아 과제 관련성과 성능의 관계를 본다. 클러스터링처럼 명백히 무관한 과제의 지시문도 일부러 포함시켰다. 다음으로 지시문이 임베딩에 만든 변화를 세 가지 구조적 지표로 측정한다. 유사도 향상은 지시문을 붙이기 전후의 쿼리-정답 코사인 유사도 차이, 변위는 원본 쿼리와 지시문이 붙은 쿼리 사이의 코사인 거리, 방향성은 쿼리에서 지시문 쿼리로 가는 벡터가 쿼리에서 정답으로 가는 벡터와 얼마나 같은 방향인지를 나타낸다. 데이터셋은 번역쌍으로 바이텍스트 마이닝을 평가하는 타토에바(아랍어·중국어·독일어·핀란드어·프랑스어·스페인어·베트남어·터키어 8개 언어, recall@1)와 과학 문제와 선택지를 쓰는 ARCChallenge(ndcg@10)이고, 파인튜닝에는 SQuAD.v1을 쓴다. 모델은 Octen-Embedding-8B, F2LLM-v2-4B, Qwen3-Embedding-4B와 0.6B, harrier-oss-v1-0.6b, bge-m3, multilingual-e5-large-instruct, embeddinggemma-300m 8종이다.

무엇과 다른가

표준 평가에서는 과제 관련 지시문이 항상 상위권에 오지만, 무관한 지시문도 비슷한 성능에 자주 도달한다. 관련성 라벨로 선형 모델을 적합한 R²는 뚜렷한 예외인 F2LLM-v2-4B를 빼면 일관되게 0에 가까웠고, Mann-Whitney U 효과 크기는 컸다. 즉 분포 수준에서는 관련성 신호가 있지만 점수 변동의 주된 원인은 다른 데 있다. ARCChallenge에서는 최고 성능 모델 중 하나인 Octen-Embedding-8B의 상위 결과에 키스매시(무작위 타건) 지시문이 들어가기도 했다. 구조적 지표를 보면 변위가 작을수록 성능이 좋았고, ARCChallenge에서는 관련 지시문의 유사도 향상이 성능과 상관되지 않았으며 검색 지시문 다수가 오히려 음의 값을 보였다. 방향성도 높은 점수를 받은 지시문 대부분이 쿼리-정답 축을 따라 움직이지 않았다. 타토에바는 사정이 달라 관련 지시문이 다른 지시문과 거의 완전히 분리됐고, 변위가 작고 방향성이 큰 쪽이 높은 성능을 냈다.

어떻게 쓰나

저자들은 이 현상의 원인을 쿼리측 네거티브가 없는 대조 학습 관행으로 본다. 이를 검증하려고 모든 쿼리에 대해 GPT-5.4-mini로 의미를 유지한 패러프레이즈를 생성해 쿼리측 하드 네거티브, 즉 방해문으로 넣었다. 쿼리마다 방해문 하나만 추가해도 ARCChallenge에서는 모든 지시문의 성능이 완전히 무너졌다. 반면 타토에바에서는 두 모델이 성능을 거의 그대로 유지했고, 최고 점수를 낸 지시문들은 관련 지시문이었다. 방해문이 성능을 망가뜨리지 않은 경우에는 쿼리로부터 멀어지는 이동보다 정답 쪽으로 이동하는 비율이 더 컸다.

전제와 한계

이 특성을 학습시킬 수 있는지 확인하려고 Qwen3-Embedding-0.6B를 SWIFT 프레임워크로 파인튜닝한다. QA용과 바이텍스트 마이닝용 모델을 따로 학습시키고, 파국적 망각을 막기 위해 검색 과제와 의미 텍스트 유사도(STS)를 함께 학습한다. 각 예시는 쿼리, 정답, 쿼리의 패러프레이즈인 방해문으로 구성된다. 검색 과제에서는 지시문을 붙인 쿼리가 정답을 향하고, STS에서는 같은 방해문이 양성 정답이 된다. 즉 하나의 방해문이 검색에서는 쿼리측 네거티브, STS에서는 양성이 된다. 각 양성 정답에는 무작위 문서측 네거티브 8개가 붙고, 학습 예시의 50%에서는 네거티브 하나를 잘못된 과제의 정답으로 바꾼다. QA는 SQuAD.v1, 바이텍스트 마이닝은 OPUS에서 학습 데이터를 얻었고, 전체 학습 예시는 14만~15만 개 규모로 대부분의 개선이 첫 5,000스텝(약 1에포크의 30%) 안에 나타난 뒤 정체됐다.

평가는 방해문 없음, 무작위 방해문, 패러프레이즈 방해문 세 설정에서 이뤄진다. 베이스라인은 패러프레이즈 방해문을 넣으면 Recall@1이 거의 완전히 무너져 정답 대신 방해문을 검색했고, 무작위 방해문은 중간 정도의 하락만 일으켰다. 파인튜닝 모델은 무작위 방해문에 거의 영향받지 않았고 패러프레이즈 방해문에서도 하락 폭이 훨씬 작았다. 방해문 없는 일반 검색 성능은 베이스라인과 비슷하게 유지됐다. 부록 실험에서는 같은 데이터로 쿼리측 네거티브만 빼고 학습하면 패러프레이즈 방해문 성능이 전혀 좋아지지 않아, 개선이 과제별 파인튜닝 자체가 아니라 쿼리측 네거티브 추가에서 온 것임을 보인다. 파인튜닝 후 변위와 방향성은 두 모델 모두 커졌고, SQuAD 모델은 관련 지시문 전체의 유사도 향상이 늘었으며 타토에바 모델은 소폭 줄었다. MTEB English v2 전체 평가에서 다른 과제 성능 차이는 작았다.

실무적으로 이 논문은 RAG나 검색 시스템에서 지시문 하나로 여러 과제를 처리하는 구성을 쓸 때 무엇을 확인해야 하는지 알려준다. 후보 풀에 쿼리와 의미가 비슷한 텍스트가 섞이는 순간, 벤치마크 점수가 높은 모델도 지시문을 무시하고 단순 의미 유사도로 검색할 수 있다. 따라서 자체 평가셋을 만들 때 쿼리의 패러프레이즈처럼 '비슷하지만 정답이 아닌' 쿼리측 방해문을 후보에 넣어야 실제 취약점이 드러난다. 이미 파인튜닝 파이프라인이 있다면 학습 데이터에 쿼리측 네거티브를 추가하는 것만으로 큰 개선을 얻을 수 있고, 논문 기준으로는 소량의 데이터와 짧은 학습으로도 효과가 나타난다.

저자들이 밝힌 한계는 명확하다. 검색과 바이텍스트 마이닝 두 과제만 다뤘고 클러스터링 같은 다른 임베딩 과제는 제외했다. 8개 모델만 실험했기 때문에 결과가 전체 모델로 일반화된다고 보장할 수 없다. 방해문 합성 데이터는 단일 모델로 생성했고 생성 모델 선택에 대한 절제 실험은 하지 않았다. 다만 짧은 쿼리의 패러프레이즈는 생성 자유도가 낮아 모델 선택의 영향이 제한적일 것으로 본다. 향후 더 많은 과제 범주와 쿼리-정답 관계로 분석을 확장할 계획이다.