T-Search는 답 생성을 떼어내고 근거 수집만 학습한 검색 에이전트다

T-Search: An Open Agentic Retriever and Playground for Hard Multi-Step Search

arXiv2610.06782v1

Olga Tsymboi2026-10-05

무엇인가

RAG는 질문을 그대로 검색하면 답이 나온다는 가정 위에 서 있지만, HotpotQA 이후의 멀티홉 질문이 이 가정을 깨뜨렸고 BrowseComp와 고정 코퍼스 버전인 BrowseComp-Plus는 질문에 등장하지 않는 검색어를 요구하는 단계까지 밀어붙였다. 질문이 이름을 대지 않은 엔티티를 찾아내야 하고, 관련 있어 보이지만 아닌 문서를 걸러내야 한다. 기존 딥리서치 에이전트들은 큰 모델로 긴 툴 호출 궤적을 돌려 이 문제를 다루는데, 느리고 비싸며 최종 답변으로 평가되기 때문에 검색 품질과 생성 품질이 뒤섞인다. T-Search는 이 둘을 분리해 검색 단계만 떼어내 학습한다.

어떻게 동작하나

시스템은 세 개의 툴로 동작한다. search_corpus로 질의하고, save_and_advance로 남길 청크를 이유와 함께 고르고, finalize_ranking으로 순위를 확정한다. 핵심은 라운드 사이에 무엇을 넘기느냐다. 하네스는 원래 질문, 저장된 청크, 라운드 요약, 질문의 어느 부분이 커버됐고 어느 부분이 미해결인지에 대한 상태, 다음 라운드 목표만으로 다음 입력을 구성하고, 직전 툴 트랜스크립트와 전체 추론 이력은 버린다. 툴 출력이 누적되며 모델의 판단을 흐리는 것을 막기 위해서다. 기본 설정은 최대 5라운드, 라운드당 약 32k 토큰 예산이며 예산의 75%에 도달하면 검색이 잠긴다. 다음 라운드로 넘어가려면 최소 5회 검색과 1개 이상의 저장된 청크가 필요하고, 마지막 라운드 전에는 선언한 질문 구성요소의 절반 이상이 미해결이면 파이널라이즈가 거부된다. 마지막 라운드에서는 진행이 비활성화되고 커버리지 제약이 풀린다. 출력은 최대 10개 청크이며, 3개의 병렬 롤아웃을 reciprocal rank fusion으로 합친 뒤 10개로 자를 수 있다.

무엇과 다른가

학습 데이터는 합성 검색 과제를 적대적으로 걸러 만든다. 명명 엔티티 주석과 언급 빈도, 동시출현 통계로 연결된 청크 서브그래프를 미리 골라 소형 로컬 모델로도 생성을 가능하게 하고, 사실을 중간 표현으로 추출·패러프레이즈해 원문 인용이 그대로 노출되지 않게 한다. 이후 적대적 루프가 전체 지원 집합만으로 답이 가능한지, 정답이나 중간 엔티티가 새는지, 폐쇄형(closed-book)으로 풀리는지, 질문 전체를 질의로 던져 필요한 근거가 바로 검색되는지를 검사하고, 지원 청크를 하나씩 제거해 필요성을 확인한 뒤 불필요한 청크를 잘라낸다. 67k 후보 중 약 40k가 이 과정을 통과한다. 언어별로 약 8k SFT 질문과 별도 2k RL 질문 풀이 있고, GLM-5.1이 교사 궤적을 수집한다. 궤적은 라운드 단위로 잘라 SFT하고, 이후 GSPO로 청크 식별자 기반 recall 보상을 최적화한다. 판정 모델은 쓰지 않으며 저장에 대한 별도 보상이나 라운드별 셰이핑도 없다. 정밀도 기반 목적함수는 예비 실험에서 불완전한 근거로 조기 파이널라이즈하는 결과를 낳아 recall을 택했다. 영어와 러시아어 브랜치는 SFT 단계는 DARE로, RL 단계는 SLERP로 병합해 단일 이중언어 모델이 된다.

어떻게 쓰나

평가는 BrowseComp-Plus, SealQA의 Seal-Hard 부분집합, 이 둘의 러시아어 번역본, 그리고 새로 만든 TRuST(러시아어 수작업 324문항, 270만 패시지)와 SynthComp(영어·러시아어 각 395문항) 등 7개 벤치마크에서 이뤄졌다. 모든 모델이 Qwen3-Embedding-8B로 색인된 동일 고정 코퍼스를 검색하고, 리랭킹 없이 스니펫은 512토큰으로 제한했다. 단일 롤아웃에서 T-Search는 모든 벤치마크에서 베이스 모델을 앞서며 평균 Recall@10 55.96을 기록했고, 이는 베이스보다 14.4포인트 높은 값이다. 러시아어 BrowseComp-Plus에서는 GLM-5.1이 앞섰지만 나머지 일반 목적 베이스라인은 모두 앞선다. 3개 롤아웃을 융합하면 모든 벤치마크에서 recall이 올라 평균 61.33이 되고, 이때는 전 벤치마크에서 최종 집합 Recall@10 최고치를 낸다. 검색기 교체 실험에서는 동일 체크포인트로 Qwen3-Embedding-0.6B에서 49.38, 기본 검색기에 LLM 리랭커를 얹으면 62.87까지 나왔다. BM25는 SynthComp와 TRuST에서 가장 좋지만 BrowseComp-Plus에서는 테스트한 검색기 중 가장 나쁘다. 지연-품질 곡선에서는 1라운드 T-Search가 Qwen3.5-397B-A17B의 5라운드와 비슷한 평균 recall을 40% 지연으로 달성하고, 3라운드에서는 GLM-5.1의 5라운드에 근접하면서 지연은 3분의 1 이하다.

전제와 한계

실무 관점에서 이 논문의 값어치는 검색기와 생성기를 분리했다는 데 있다. T-Search는 답을 쓰지 않고 근거 청크와 한 줄짜리 이유만 반환하므로, 이미 쓰고 있는 생성기를 그대로 두고 검색 백엔드만 자기 색인으로 바꿔 끼울 수 있다. 문서에 접근하는 경로가 검색 툴 하나뿐이라 백엔드 교체에 재학습이 필요 없고, 품질을 정답 판정 모델이 아니라 gold 근거의 recall로 직접 측정한다. 다만 하네스 자체가 모델의 일부라는 점은 실무 적용 시 중요하다. 라운드 수, 세 툴 계약, 가드레일 규칙이 모두 정책이 학습한 환경이므로, 다른 루프에 넣으면 품질이 달라질 수 있어 저자들은 공개된 하네스로 자기 색인에서 먼저 검증할 것을 권한다. 또한 이 모델은 단독 질의응답 시스템으로 배포하거나 평가할 수 없고, 일반 목적 벤치마크에서는 베이스 모델과 눈에 띄는 차이를 관찰하지 못했다고 밝힌다. recall에 최적화되어 있으므로 반환 목록에 실제로는 답을 뒷받침하지 않는 청크가 섞일 수 있고, 하류 시스템이 반환된 텍스트로 주장을 검증해야 한다. 학습과 평가는 영어와 러시아어로만 이뤄졌고 다른 언어의 동작은 검증되지 않았다. 모델과 하네스는 Apache-2.0, 벤치마크는 ODC-BY로 공개되며, 두 언어의 SFT와 RL에 8개 H100 GPU 노드 4대를 약 3천 GPU-시간 사용했다.