하이브리드 LM이 순환 메모리를 안 쓰는 문제를 보조 손실로 고친다
Balancing Memory Pathways: Analyzing and Improving Memory Utilization in Hybrid LMs
무엇인가
이 논문은 어텐션 레이어와 선형 순환 레이어를 교차 배치한 하이브리드 언어모델이 실제로 두 개의 메모리 경로를 얼마나 잘 쓰는지를 묻는다. 하이브리드 LM은 과거 정보를 두 갈래로 나른다. 어텐션은 이전 토큰에 직접 접근해 정확한 인출을 담당하고, 순환 레이어는 고정 크기 상태에 정보를 압축해 긴 문맥에 흩어진 정보를 통합한다. 저자들은 두 경로를 모두 제공하는 것과 모델이 둘을 효과적으로 쓰는 것이 다르다는 것을 확인하고, 그 불균형을 측정하고 교정하는 방법을 제안한다.
어떻게 동작하나
분석을 위해 입력을 과거 구간과 현재 구간으로 나누고, 어느 경로가 과거 정보를 현재로 넘길 수 있는지 선택적으로 차단한다. 순환 전용(recurrent-only) 조건에서는 세그먼트 경계를 넘는 어텐션을 마스킹해 과거 정보가 순환 상태로만 도달하게 하고, 어텐션 전용(attention-only) 조건에서는 세그먼트 경계에서 순환 상태 전파를 0으로 만들어 어텐션으로만 도달하게 한다. 각 구간 내부에서는 모든 레이어가 정상 동작한다. 질의응답에서는 문맥이 과거, 질문이 현재에 해당한다.
무엇과 다른가
측정 결과는 뚜렷한 불균형을 보인다. Qwen3.5에서 원본 모델의 전체 조건 정확도 30.2%가 순환 경로를 막은 어텐션 전용 조건에서 20.2%로만 떨어지지만, 어텐션을 막은 순환 전용 조건에서는 5.1%로 무너진다. 표준 지도 파인튜닝(SFT)은 전체 성능을 올리면서 이 쏠림을 오히려 심화시킨다. Qwen3.5의 SFT 후 전체 정확도는 34.6%로 오르고 어텐션 전용도 20.2%에서 25.0%로 오르지만, 순환 전용은 5.1%에서 5.0%로 사실상 제자리다. 에이전트 과제인 TextWorld Quest에서도 전체 성공률이 27.0%에서 78.5%로 뛰는 동안 어텐션 전용은 6.0%에서 52.0%로 오르고 순환 전용은 2.5%에서 4.0%로 거의 변하지 않는다. 질문 유형별로도 어텐션 의존이 커지는데, 원문 그대로의 답이 있는 질문과 단일 근거 질문이 비원문·다중 근거 질문보다 어텐션 전용 유지율 상승폭이 크다(평균 25.5% 대 19.2%).
어떻게 쓰나
제안 방법은 표준 SFT 손실에 보조 손실을 더하는 것이다. 보조 순전파에서는 어텐션의 선행 문맥 접근을 마스킹하되 순환 레이어는 전체 시퀀스를 그대로 처리하게 두어, 과거 정보가 순환 메모리를 통해서만 답에 영향을 미치도록 강제한다. 최종 목적함수는 L_SFT + λ·L_rec 형태이며, λ는 보조 감독의 강도를 조절한다(λ별 절제 실험은 부록 C.1). 대조군으로 순환 상태 전파를 막고 어텐션을 자유롭게 두는 L_attn도 함께 실험한다.
전제와 한계
질의응답 결과는 여섯 개 데이터셋 평균에서 Qwen3.5가 34.6%에서 38.5%로, Nemotron-H-4B-Instruct가 31.0%에서 36.2%로 오른다. Qasper·NarrativeQA·MINTEval처럼 문맥이 긴 데이터셋에서 이득이 크고, 긴 문맥 데이터셋 평균 이득 8.0%가 짧은 문맥의 0.2%를 크게 앞선다. 순환 전용 정확도는 5.0%에서 22.8%로 뛰는 반면 어텐션 전용은 25.0%에서 23.7%로 거의 유지된다. 반대로 L_SFT+L_attn은 평균 절대 개선이 2.1%와 4.6%에 그쳐 L_SFT+L_rec(3.9%와 5.2%)보다 작고, 어텐션 전용만 28.0%로 올라 불균형이 남는다. 보조 손실만 단독으로 쓰면 표준 SFT보다 평균 정확도가 1.3%와 2.7% 낮아, 제한된 손실은 비제한 SFT와 함께 쓸 때 가장 효과적이다. 에이전트 과제에서는 두 모델 평균으로 TextWorld Quest +3.5%, Treasure +9.3%, BabyAI PutNextLocal +22.0%, GoToObjMaze +13.5%의 성공률 향상이 나온다. BabyAI 궤적이 평균 134.0스텝으로 TextWorld의 42.2스텝보다 길다는 점이 긴 문맥에서 이득이 크다는 결과와 맞물린다.
보조 감독의 효과는 실패·성공 경험 활용으로도 이어진다. 이전 실패 시도를 문맥에 넣고 재시도하게 하면 누적 복구율이 질의응답에서 16.6%, 에이전트 과제에서 19.2% 개선되고, 특히 다중 근거 질문의 복구율이 27.3%에서 57.6%로 오르는 반면 단일 근거 질문은 14.8%에서 17.6%로 소폭 증가한다. 여러 개의 성공 시연을 주고 더 짧은 성공 궤적을 만들게 했을 때도 보조 손실 모델이 평균 6.0% 더 자주 최단 시연보다 짧은 경로를 생성한다. 같은 불균형과 보조 손실의 효과는 텍스트 메모리와 잠재 메모리를 함께 쓰는 어텐션 기반 LM에도 나타난다. 표준 SFT는 24.1%로 텍스트 전용 모델 25.9%보다도 낮고 두 메모리 중 나은 쪽을 고르는 오라클 32.0%에 크게 못 미치지만, 보조 손실을 더하면 28.6%로 오르면서 잠재 메모리 사용이 늘고 텍스트 메모리 사용은 대체로 유지된다.
실무적으로 이 논문은 하이브리드 LM을 파인튜닝할 때 전체 성능만 보지 말고 경로별 기여를 분리 측정하라고 권한다. 세그먼트 마스킹만으로 어텐션 전용·순환 전용 조건을 만들어 평가하면, 순환 상태가 사실상 죽어 있는지 몇 줄의 코드로 확인할 수 있다. 학습 설정은 LoRA(rank 16, scaling 32, dropout 0.05), AdamW 학습률 1e-4, 코사인 스케줄, 3% 워밍업, 유효 배치 16이며, 보조 손실의 추가 연산을 상쇄하려고 최적화 스텝 수를 절반으로 줄여 총 연산량을 표준 SFT와 맞춘다. 실험은 4B급 하이브리드 두 종(Qwen3.5-4B는 Gated DeltaNet 24개와 전체 어텐션 8개, Nemotron-H-4B-Instruct는 Mamba2 24개와 전체 어텐션 4개)에서만 수행됐고, 학습 데이터는 DROP·HotpotQA·Qasper·NarrativeQA에서 모은 1만 2천 개(검증 2천 개), 평가는 MINTEval·MuSR을 포함해 8.2k 예시, 평균 문맥 길이 84k 토큰 규모다. 원문에 별도의 한계 절은 없지만, 저자들이 밝힌 전제는 보조 손실이 비제한 SFT와 결합될 때만 이득을 준다는 점, λ 민감도가 부록에만 제시된다는 점, 그리고 검증이 LoRA 파인튜닝과 특정 하이브리드 구조 두 종에 한정된다는 점이다.