UNREAL은 하나의 고정 LLM 내부 표현으로 검색과 롱컨텍스트 증거 선택을 통합한다
UNREAL: Unifying Retrieval and Long-Context with a Single Model
무엇인가
이 논문은 긴 문맥과 코퍼스 검색에서 증거 선택이 서로 다른 규모로 이뤄지는 문제를 다룬다. 롱컨텍스트 추론은 모델이 전체 프롬프트를 받고 내부적으로 관련 내용을 억제해야 하며, RAG는 별도 검색기가 먼저 문단을 고른 뒤 생성기에 넘긴다. 저자들은 두 접근이 결국 질의 조건부 증거 선택이라는 같은 연산이고 규모만 수백 개 청크에서 수백만 개 청크로 달라진다고 본다. 그래서 하나의 사전학습 LLM이 두 규모 모두에서 명시적으로 증거를 선택할 수 있는지 묻는다.
어떻게 동작하나
UNREAL은 고정된 디코더 전용 LLM의 내부 표현을 읽어 검색과 롱컨텍스트 선택을 수행한다. 이는 encoder-decoder와 cross-attention에 의존한 INTRA를 디코더 전용 LLM으로 일반화한 것이다. 먼저 각 코퍼스 청크를 LLM의 중간 레이어 ℓ_c의 residual stream에서 토큰 수준 표현 k_i로 인코딩한다. 질의에는 학습된 retrieval token ρ를 뒤에 붙이고 BM25 상위 청크 C0(x)를 앞에 둔 뒤, retrieval token 위치의 레이어별 상태 q_ℓ를 읽는다. 학습된 레이어 혼합 계수 α_ℓ로 q_ℓ를 합산하고 MaxSim late-interaction으로 각 청크 점수 s_i를 계산해 상위 n개를 고른다. 학습은 oracle 청크와 hard negative를 대조하는 multi-positive InfoNCE 손실로 이뤄지며, LLM은 고정하고 ρ와 α만 갱신한다. 추가 학습 파라미터는 500K 미만이다. 저장량을 줄이려면 청크 표현을 L_p개 그룹으로, 질의 표현을 G개 그룹으로 mean-pool해 압축한다. 생성 시에는 선택된 청크의 원문 텍스트만 질의와 함께 같은 LLM에 넣어 재인코딩·생성한다.
무엇과 다른가
검색 실험은 3B 토큰, 21M 청크의 Wiki-2018 코퍼스에서 이뤄졌고 평균 청크 길이는 140토큰이다. 평가 지표는 모든 oracle 청크가 top-n 안에 들어온 비율인 complete-evidence recall@n이다. BM25, Qwen3-Embedding, BGE, Jina cross-encoder reranker, LightOn multi-vector, RRF 기반 hybrid RAG와 비교했다. 네 가지 백본(Qwen3.5-4B, Muse-Glimmer-30B, 선형 어텐션 하이브리드 Qwen3.5-35B-A3B, Mamba-어텐션 하이브리드 Nemotron-3.5-Lightning-30B-A3B) 모두 강한 retriever-reranker 시스템을 앞섰다. 최고 모델은 recall@10을 HotpotQA에서 49.1%에서 73.2%로, 2WikiMultiHopQA에서 31.7%에서 60.1%로, MuSiQue에서 8.8%에서 14.4%로 올렸다. Nemotron-3.5-Lightning을 생성기로 고정한 end-to-end QA에서도 UNREAL이 세 데이터셋 모두 가장 높은 EM과 F1을 기록했다.
어떻게 쓰나
롱컨텍스트에서는 같은 선택기를 그대로 쓴다. 긴 입력을 평균 140토큰 청크로 나누고 각 청크를 고정 LLM으로 따로 인코딩한 뒤, 질의에 대해 순위를 매겨 상위 n개만 원문 그대로 생성기에 넣는다. 별도 롱컨텍스트 학습 데이터는 쓰지 않았다. NoLiMa에서는 최대 128K 토큰에서 정확도가 1.0%에서 24.83%로 올랐고, LV-Eval 영어 QA에서는 256K에서 F1이 49.97%에서 54.66%로 올랐다. HELMET QA의 RAG 하위셋(8K–128K)에서는 두 생성기 모두 UNREAL이 가장 높은 exact match를 냈다. LOFT 방식으로 8K부터 100M 토큰까지 확장한 실험에서는 전체 문맥 추론 정확도가 급격히 떨어지는 반면 UNREAL은 대규모에서 모든 베이스라인을 앞서고 100M 토큰에서도 증거를 골라 생성할 수 있음을 보였다.
전제와 한계
저자들은 선택 청크 수 n이 성능에 미치는 영향도 분석한다. NoLiMa에서 n을 늘리면 처음에는 증거 재현율이 올라 성능이 좋아지지만, 이후에는 추가 디스트랙터가 생성을 방해해 정확도가 떨어지는 역U자 패턴이 나타난다. 또한 학습 전 고정 LLM의 어텐션 레이어 키와 질의 임베딩을 평균 풀링해 계산한 내재적 검색 점수가 랜덤보다 높다는 것을 보여, UNREAL이 retrieval token ρ를 학습해 이미 존재하는 검색 신호를 강화한다고 설명한다.
효율성 측면에서 UNREAL은 검색 패스에서 청크를 독립적으로 인코딩해 청크 간 어텐션을 대부분 피하고, 생성 패스에서는 선택된 청크만 어텐션해 KV 캐시와 문맥 어텐션을 줄인다. 고정 청크 크기와 선택 예산에서는 전체 문맥 추론의 이차 스케일링과 달리 선형으로 확장된다. 실험 설정에서 18K 토큰 이상부터 FLOPs가 더 적었고, 단일 H100과 vLLM에서 측정한 time-to-first-token은 대략 32K 토큰부터 줄어들며 문맥이 길수록 이득이 커졌다.
개발자 관점에서 이 논문은 RAG의 별도 retriever-reranker와 롱컨텍스트 추론을 하나의 고정 LLM 내부 선택기로 대체할 수 있는 경로를 제시한다. 백본을 바꾸지 않고 500K 미만 파라미터만 학습하며, residual stream을 읽기 때문에 softmax 어텐션, 선형 어텐션, 상태공간 레이어를 섞은 하이브리드에도 적용할 수 있다. 다만 BM25 초기 문맥에 의존하고, 청크 인코딩과 검색 단계가 추가되며, 청크당 L_p개 벡터를 저장하므로 단일 벡터 dense 인덱스보다 저장 비용이 크다. 또한 top-n 선택이 성능에 민감하므로 실제 도메인에서 증거 재현율과 답변 정확도를 함께 확인해야 한다.
저자들이 밝힌 한계는 분명하다. 학습 데이터가 위키백과 QA에서 나왔기 때문에 이질적인 도메인과 언어로의 전이는 향후 과제다. 롱컨텍스트 실험은 증거가 희소한 작업에 집중했고, 입력의 큰 부분을 통합해야 하는 증거 밀집 문제는 다루지 않는다. 또한 일반 목적 LLM으로 답을 생성하기 때문에 SpanBERT 같은 추출형 QA 특화 모델보다 exact match가 낮을 수 있다. 다중 패스 에이전트 RAG는 전체 반복 파이프라인을 평가하므로 단일 검색 단계를 분리한 UNREAL과 직접 비교하지 않았다. 저자들은 앞으로 벤치마크가 증거 희소 작업과 증거 밀집 작업을 구분하고, 답변 정확도와 함께 증거 재현율을 보고해야 한다고 주장한다.