근접 배경이 먼 증거를 덮는 근접성 함정과 이를 완화하는 LYRA
The Sirens' Song: When Proximal Background Context Overshadows Distant Evidence
무엇인가
이 논문은 긴 문맥 LLM이 먼 곳의 증거를 활용하지 못하는 이유를 거리 하나로 설명하는 기존 관점에 반기를 든다. 저자들은 Proximity Trap, 즉 근접성 함정을 제안한다. 질의 근처에 있는 과도한 무관 배경 토큰들이 softmax 분모에서 누적되어, 멀리 있는 과제 관련 증거의 attention을 잠식한다는 것이다. Qwen3-8B와 LongBench-v2에서 proximal background 토큰을 마스킹하면 전체 정확도가 오히려 향상되었고, Long In-context Learning에서 개선이 더 두드러졌다. 레이어별 attention 분석에서도 약 19층 이후 먼 증거에 대한 attention은 급증하지만, 그 주변 토큰은 uniform baseline 이하에 머무는 반면, 질의 근처 배경은 상당한 attention을 받는다. 모델이 먼 증거를 찾지 못하는 것이 아니라, 찾은 뒤에도 abundant proximal background와의 누적 경쟁에서 밀린다는 해석이다.
어떻게 동작하나
메커니즘 설명은 RoPE와 softmax 경쟁에 기반한다. RoPE를 적용하면 QK 점수는 상대 거리 Δ=t-i에 의존하고, 거리가 멀어지면 방향 정합이 약해져 점수가 감쇠할 수 있다. 그러나 논문은 감쇠 자체보다 배경 토큰 수 M의 누적 효과를 강조한다. 먼 증거의 QK 점수를 s_E, M개의 근접 배경 토큰 점수를 s_B라고 하면, softmax에서 증거의 비중은 α_E = 1/(1+M e^(s_B-s_E))이고, α_E < 1/2가 되는 조건은 s_E - s_B < log M이다. 즉 배경 토큰 하나하나의 관련성은 낮아도 수가 많으면 증거를 압도할 수 있다. 저자들은 먼 증거를 가까이 옮기는 개입과 근접 배경을 약화하는 개입을 비교했는데, 전자는 성능 개선이 일관되지 않았고 후자는 evidence attention과 정답 confidence를 더 일관되게 높였다. 따라서 핵심 장애물은 거리 자체보다 누적 배경 경쟁이다.
무엇과 다른가
제안 방법 LYRA는 Long-context heavY-tailed Relevance Alignment의 약자로, t-분포 방향 매칭 메커니즘이다. 기존 attention의 QK 점수 계산만 교체하고 RoPE, causal masking, softmax 정규화, value aggregation은 그대로 둔다. 먼저 RoPE가 적용된 query q~_t와 key k~_i의 정규화된 방향 유사도 c_t,i = q~_t^T k~_i / (||q~_t|| ||k~_i||)를 계산한다. 이를 φ_κ(c_t,i) = (1+c_t,i)/(1+κ(1-c_t,i)) - 1로 변환하고, attention 가중치를 softmax_i(β φ_κ(c_t,i))로 정의한다. κ=0이면 원래 cosine similarity가 되고, β는 inverse temperature다. 이 변환은 단조 증가하므로 유사도 순서를 보존한다. 임계값 c*_κ = 1 - 2/(sqrt(1+2κ)+1)을 기준으로 낮은 유사도 구간은 차이를 압축하고 높은 유사도 구간은 차이를 증폭한다. 두 유사도 사이의 gap scaling G_κ = (1+2κ)/[(1+κ(1-c_B))(1+κ(1-c_E))]가 1보다 작으면 배경의 이점을 줄이고, 1보다 크면 증거의 이점을 키운다. 증거 대 배경 attention 비율의 상대 변화는 exp[β(1-G_κ)(c_B-c_E)]로 표현된다. 결과적으로 약하게 관련된 근접 배경의 영향은 줄이고, 강하게 정합하는 먼 증거는 더 구분되게 만든다. 모든 먼 토큰을 무차별적으로 올리는 방식이 아니다.
어떻게 쓰나
저자들은 ProxBench라는 다단계 세밀 벤치마크도 제안한다. 기존 long-context 벤치마크가 입력 길이 증가에 따른 검색·통합 능력을 주로 평가하는 반면, 질의 근처의 경쟁 배경을 통제하는 데 한계가 있다는 문제의식이다. ProxBench는 먼 위치에 희소한 증거를 두고, 질의 근처에 과제 무관하지만 점점 더 혼동하기 쉬운 배경을 배치한다. Level 1은 문법 구조는 비슷하지만 엔티티, 주제, 답 관계가 다른 스타일 매칭 배경이다. Level 2는 교차 바인딩으로, 대상 엔티티와 접근 코드 단서를 같은 문장에 두면서 후보 값을 다른 엔티티에 명시적으로 연결한다. Level 3은 서로 다른 엔티티에 같은 관계를 섞고 대상 엔티티의 서로 다른 속성을 함께 넣어 모호성을 높인다. Level 4는 하위 유형, 속성, 의미 역할, 값 형식 등 세밀한 교란을 넣어, 필요한 증거와 표면적으로 매우 비슷하지만 논리적으로는 답과 무관한 배경을 만든다. 이 계층 구조로 근접 배경이 어려워질수록 모델 성능이 어떻게 변하는지 측정한다.
전제와 한계
실험 설정은 Qwen3-8B를 베이스로 하고, 마지막 Transformer 블록의 표준 attention만 LYRA로 교체한다. 나머지 아키텍처는 그대로 두고, LongAlign으로 1 에폭 미세조정하며, 마지막 블록만 업데이트하고 앞선 레이어, 토큰 임베딩, 언어모델링 헤드는 동결한다. bfloat16, AdamW, 학습률 2×10^-5, 최대 시퀀스 길이 16,384를 사용한다. LongBench-v2에서는 Table 1 기준 LYRA가 최고 전체 성능을 내고 모든 context-length split에서 강한 순위를 보인다. Short split에서도 앞선다는 점은 로컬 문맥 모델링을 희생하지 않았음을, Long split에서의 우위는 긴 문맥에서 증거 보존·검색 능력이 더 낫다는 것을 뜻한다고 저자들은 해석한다. RULER에서는 Table 2 기준 8K부터 128K까지 모든 평가 길이에서 최고 성능과 최고 평균을 기록했고, 중간·긴 길이에서 특히 개선이 크며 128K에서도 선두를 유지한다. LongBench에서는 Table 3 기준 최고 평균 성능을 내고 multi-document QA, summarization, few-shot learning에서 앞서며 나머지 과제에서도 경쟁력 있는 결과를 보인다. ProxBench에서는 Figure 4 기준 LYRA가 최고 평균 성능과 함께 난이도가 올라갈수록 더 큰 강건성을 보인다. 가장 쉬운 레벨에서는 Llama가 약간 더 좋지만, 이후 레벨에서는 LYRA가 일관되게 가장 강하고 가장 세밀한 교란에서 우위가 특히 분명하다. 베이스라인들은 근접 배경이 엔티티, 관계, 속성, 값 형식을 공유할 때 성능이 급격히 떨어진다. 다만 제공된 원문에는 표와 그림의 구체적인 수치가 옮겨져 있지 않아 개선폭의 숫자는 확인할 수 없다.
개발자 관점에서 이 논문은 긴 문맥 RAG, 멀티문서 QA, 요약, few-shot 프롬프트, 코드 완성처럼 먼 정의나 근거를 찾아야 하는 시스템에 직접 관련된다. 질의 근처에 비슷한 표현, 같은 엔티티, 유사한 값 형식이 많아 모델이 그럴듯한 배경에 끌리는 경우, 단순히 검색기를 바꾸거나 문맥을 더 길게 넣는 것만으로는 해결되지 않을 수 있다. LYRA는 attention의 QK scoring 단계만 바꾸므로 기존 아키텍처에 비교적 낮은 침습으로 통합할 수 있다는 점이 실무적 장점이다. 다만 κ와 β가 성능을 좌우할 수 있으므로 자체 데이터에서 민감도를 확인해야 하고, 원문이 언급한 Appendix D의 ablation도 확인 대상이다. 또한 ProxBench식으로 질의 근처에 혼동하기 쉬운 무관 배경을 단계적으로 넣어 평가하면, 모델이 진짜 증거를 쓰는지 표면적 근접성에 의존하는지 진단할 수 있다. 프로덕션에서는 근접 배경 마스킹이 성능을 올리는지 먼저 실험해 Proximity Trap 존재 여부를 확인하는 것도 유용하다.
한계와 전제도 분명히 해 둔다. 제공된 원문 발췌에는 별도의 한계 절이 없지만, 방법 분석에서 q_r = k_r인 최대 정렬 사례는 설명용 단순화이며 사전학습 LLM에서 성립한다고 가정하지 않는다고 밝힌다. 실험은 Qwen3-8B를 중심으로 하고, 마지막 Transformer 블록만 LYRA로 교체해 LongAlign 1 에폭만 미세조정하는 설정이다. 따라서 다른 모델 아키텍처, 전체 레이어 적용, 더 큰 모델, 다른 학습 데이터에서의 일반화는 이 발췌만으로 확립되지 않는다. ProxBench는 통제된 벤치마크이므로 실제 서비스의 잡음 많은 문맥을 모두 대표하지는 않는다. 그럼에도 논문의 핵심 주장은 명확하다. 긴 문맥 모델을 평가하고 개선할 때는 관련 증거가 얼마나 먼지만 보지 말고, 그 증거가 질의 근처의 어떤 배경과 누적적으로 경쟁하는지를 함께 봐야 한다.