하이브리드 LLM의 KV 너머의 기억을 4B에서 9B로 프리픽스 재생 없이 넘긴다

LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay

HF Daily2609.25053

Simon P. Villani2026-09-07조회 7

무엇인가

이 논문이 다루는 문제는 모델을 바꿔 끼울 때 수신 모델이 과거 프리픽스를 처음부터 다시 읽어 추론 상태를 재구축해야 한다는 비용이다. 완전 어텐션 모델에서는 cross-model KV 번역으로 이 반복을 피할 수 있지만, 어텐션과 Gated DeltaNet(GDN)을 섞은 하이브리드 모델은 KV만 유지하지 않는다. 어텐션 층은 토큰 인덱스 기반 키와 값을 갖고, GDN 층은 재귀 행렬과 컨볼루션 히스토리를 갖는다. KV만 옮기면 이 지속 메모리가 남는다. 논문은 이 메모리가 모델 경계를 넘을 수 있는지 묻는다. 소스 모델은 자기 투영과 게이트로 상태를 쓰고, 수신 모델은 다른 가중치로 그 상태를 읽고 갱신해야 한다. 형상이 맞아 복사할 수 있다는 사실은 유용성을 보장하지 않는다. 저자들은 Qwen3.5 4B에서 9B로, 타깃 프리픽스 재생 없이 하이브리드 상태를 넘기는 실험을 제시한다.

어떻게 동작하나

실험은 Qwen3.5-4B-Base와 Qwen3.5-9B-Base 한 쌍을 쓴다. 파라미터 수와 히든 폭은 2,560 대 4,096으로 다르지만 GDN 지속 상태의 기하 구조는 정확히 일치한다. 두 모델 모두 GDN 층 세 개 뒤에 완전 어텐션 층 하나를 반복하는 구조다. GDN은 게이트된 망각과 델타 규칙 메모리 갱신을 결합하며, 논문은 S̄_t = α_t S_{t-1}, S_t = S̄_t + β_t (v_t - S̄_t k_t) k_t^T 형태로 설명한다. 런타임은 전치를 저장할 수 있고, 지속 상태에는 재귀 입력을 만드는 컨볼루션 히스토리도 포함된다. 소스 상태는 H_4(x_1:L) = (K_4, R_4, C_4, m_4)로 표현된다. K는 어텐션 키와 값, R은 재귀 행렬, C는 컨볼루션 버퍼, m은 부기 정보다. 소스는 L=4096개의 과거 토큰을 읽고, 수신 모델의 첫 입력은 실제 다음 토큰 x_{L+1}이며 그 로짓이 64개 채점 타깃 x_{L+2:L+65}의 첫 토큰을 예측한다. 이 다리는 관측된 문서 텍스트이지 학습된 프롬프트나 과거 재생이 아니다. KV만 옮기면 GDN 구성요소는 새 상태로 비어 있거나 초기화되지 않은 채 남는다. GDN 상태를 설치하면 재귀 행렬, 컨볼루션 히스토리, 올바른 초기화 의미가 함께 들어간다. 그래서 주 대비는 GDN 지속 상태 패키지 전체의 효과를 재며, 재귀 행렬 하나의 효과로 분리되지 않는다.

무엇과 다른가

구성요소 번역과 직접 재사용도 실험한다. 실험 1은 소스와 타깃 상태 쌍에 별도 맵을 적합한다. 어텐션 K와 V는 층, KV 헤드, 역할별 릿지 맵을 쓰고, 키는 매핑 전에 회전을 풀고 타깃을 위해 다시 회전한다. 재귀 상태는 각 층/헤드에서 Ŝ_9 = μ_9 + A(S_4 - μ_4)B^T로 매핑한다. 컨볼루션 버퍼는 그룹 선형 릿지 맵을 쓴다. 정규화와 허용 정규화는 검증 텐서 오차로 선택한 뒤 고정한다. 실험 2는 (K,R,C)의 직접(D)/번역(T) 여덟 조합을 평가하고, 검증 평균 초과 NLL, 고정된 0.01 nat 동점 허용, 번역 구성요소 수, 사전순으로 TDD를 고른다. TDD는 KV는 번역하고 재귀와 컨볼루션은 직접 복사한다. 여기에 434,176개 학습 파라미터의 보정을 더한다. 보정은 항등 앵커 방식이며 두 언어 모델은 고정한다. KV 특징 행렬 X에는 X' = X + (XB)U^T를 적용하고, B는 고정 직교, U는 학습 가능하며 층/역할 안에서 헤드와 위치에 공유한다. 재귀에는 S' = S + U_L B_L^T S + S B_R U_R^T를, 컨볼루션에는 C'_{j,t} = C_{j,t} + a_j C_{j,t} + b_j를 적용한다. 모든 학습 가능 잔차 출력은 0에서 시작하고 고정 기저는 0이 아니다. 손실은 네이티브 9B에서 핸드오프로의 전체 어휘 KL을 다리 토큰과 여덟 교사 입력, 아홉 출력 위치에서 평균한 것이고 항등 페널티를 더한다. 검증에서 rank 4와 항등 가중치 0.01을 고른다. 이 434,176개 파라미터는 적합된 KV 번역기, 고정 기저, 두 언어 모델을 제외한 추가 보정이며 직렬화 크기는 1.90 MB다.

어떻게 쓰나

실험 1은 128개 FineWeb-Edu 문서로 번역기를 보정하고 32개 분리 문서로 검증하며, 1,024토큰 프리픽스와 여덟 상태 체크포인트를 쓴다. 홀드아웃 테스트는 64개 PG19 책이고 각 책은 4,096토큰 프리픽스와 64개 교사 강제 타깃을 갖는다. 번역된 KV를 고정한 채 번역된 GDN 지속 상태 패키지를 더하면 NLL이 0.7473 nats/token 낮아진다. 95% 짝지은 문서 부트스트랩 신뢰구간은 [0.6921, 0.8047]이고 64개 문서 모두 개선된다. KV만 쓴 NLL은 3.115로 빈 9B의 3.246에 가깝고 네이티브 9B의 2.161보다 훨씬 높다. GDN 상태를 더하면 2.368로 내려가 KV-only 초과 NLL의 약 80%를 제거한다. 문서별 평균 감소는 79.7%, 중앙값은 80.2%다. 그러나 완전 번역 조건은 계속된 4B의 2.307 NLL보다 여전히 나쁘고 초과 NLL은 0.207이다. 재귀와 컨볼루션 번역을 직접 복사로 바꾸면 번역 KV를 그대로 둔 상태에서 NLL이 2.368에서 2.291로 0.077 nat 개선된다.

전제와 한계

실험 2는 4K 길이의 새 FineWeb-Edu 문서 32개로 구성요소 요인 실험을 하고, 추가로 새 문서 64개에서 주 테스트를 한다. 32문서 요인 실험에서 KV를 번역하면 NLL이 평균 0.070 nats/token 낮아진다. 번역 마이너스 직접 값은 -0.0705이고 신뢰구간은 [-0.1009, -0.0409]다. 반대로 재귀 상태를 번역하면 NLL이 0.0280 높아진다. 신뢰구간은 [0.0104, 0.0475]다. 컨볼루션 번역 추정치는 -0.0004이고 신뢰구간 [-0.0026, 0.0018]로 동등성을 입증하지 못한다. TDT의 검증 초과 NLL은 0.132226, TDD는 0.133377로 동점 허용 안에 들어 TDD가 번역 구성요소가 더 적어 선택된다. 별도 64문서 테스트에서 TDD 초과 NLL은 0.105, TTT는 0.134이며 짝지은 TTT-마이너스-베이스 신뢰구간은 [0.0170, 0.0418]이다. 보정된 9B의 NLL은 1.989로 계속된 4B의 2.042보다 낮다. 보정 마이너스 소스는 -0.0521 nats/token이고 신뢰구간은 [-0.0843, -0.0185]다. 보정은 베이스 NLL을 2.018에서 1.989로, 초과 NLL을 0.105에서 0.076으로 낮춘다. 짝지은 개선은 0.0290 nats/token이고 신뢰구간은 [0.0228, 0.0354]이며 남은 네이티브 격차의 27.5%를 제거한다. 비율 신뢰구간은 [22.4%, 33.9%]다. JS 발산은 0.029에서 0.022로, NCR은 0.918, top-1 일치율은 0.846에서 0.864로 좋아진다. 층 상대 잔차 노름 중앙값은 0.0264, 최대는 0.0440이다. 이 결과는 전체 상태 핸드오프 게이트는 통과하지만 근사 네이티브 게이트는 실패한다. 초과 NLL 0.076은 0.05를 넘고 NCR 0.918은 0.95 미만이며 top-1 일치율 0.864는 0.90 미만이다. 그래서 조건부 16K 분기는 실행되지 않았다.

도너 통제는 올바른 소스 문맥이 중요한지 확인한다. 같은 길이 문서 사이에서 완전 상태를 회전시키면 이점이 사라진다. 실험 1에서 올바른 전체 상태는 섞인 상태보다 0.948 nats/token 좋고 신뢰구간은 [0.878, 1.022]다. 실험 2에서 보정 마이너스 섞인 상태 NLL은 -1.188이고 신뢰구간은 [-1.296, -1.085]이며, 섞인 상태 NLL 3.178은 빈 9B의 2.842보다 나쁘다. 수신 모델이 전이된 하이브리드 상태의 문서별 정보를 실제로 사용한다는 뜻이다. 같은 모델 복원 검사에서는 모델별 16개 문맥, 네 길이에서 top-1 일치율 100%와 최대 절대 로짓 차이 0을 얻었지만 이는 캡처와 복원을 검증할 뿐 상태 이식성을 검증하지 않는다. 학습된 재귀 매퍼는 검증 재귀 상태 재구성 오차를 직접 복사의 0.6732에서 0.5037로 낮췄지만 행동적으로는 직접 GDN 재사용보다 나쁘다. 저자들은 낮은 텐서 재구성 오차가 더 나은 크로스모델 연속을 보장하지 않는다고 정리한다. 이 결과는 이 형제 모델 쌍에서 지속 상태 좌표의 부분적 기능 호환성과 일치하지만, 표현 동일성이나 공식 상태 ABI를 뜻하지는 않는다.

개발자 관점에서 이 논문은 모델 교체나 서빙에서 과거 프리픽스 재처리 비용을 줄일 수 있는지에 대한 연구 프로토타입으로 읽어야 한다. 특히 하이브리드 LLM에서는 KV 캐시만 옮기는 것으로 충분하지 않고 GDN 재귀 행렬과 컨볼루션 히스토리, 초기화 의미까지 함께 다뤄야 한다는 점이 실무 설계에 직접적인 시사점이다. 또 KV는 번역하는 편이 낫고 재귀와 컨볼루션은 직접 재사용하는 편이 더 나았다는 구성요소 선택 결과는, 상태 인터페이스를 만들 때 무엇을 학습 변환하고 무엇을 그대로 넘길지 판단하는 출발점이 된다. 다만 적용 전 확인할 전제가 많다. 실험은 한 방향 4B에서 9B, 기하 구조가 정확히 맞는 Qwen3.5 Base 형제 쌍, 4K 프리픽스, 64개 교사 강제 타깃에 한정된다. Instruct 모델, 크로스 패밀리, 기하 불일치 전이는 테스트되지 않았고 자유 생성 동등성과 다운스트림 과제 성공도 입증되지 않았다. 16K 분기는 실행되지 않았고 프로토타입 타이밍은 서빙 속도 향상을 입증하지 않는다. 런타임 스케줄링도 중요해서 청크 처리와 원샷 프리필이 동등하지 않았다는 사전 점검이 있었다. 따라서 프로덕션에 넣기 전에는 상태 기하 일치, 캡처와 복원 정확도, 도너 특이성, 보정의 모델 쌍 의존성, 자유 생성에서의 오류 누적을 별도로 검증해야 한다.

논문이 스스로 밝힌 한계는 분명하다. 번역기와 보정은 이 특정 모델 쌍에 맞춰져 있고, 공유 사전학습이나 학습 레시피가 호환성에 기여했을 수 있다는 것은 가설로 남는다. 원래 주 대비는 재귀 행렬을 컨볼루션 히스토리 및 초기화 의미와 분리하지 못한다. 부트스트랩 불확실성은 고정된 모델, 적합된 맵, 선택된 보정, 코퍼스 절차에 조건부이며 학습 시드나 모델 쌍 변동을 포괄하지 않는다. 사후 판정 절제는 테스트 문서를 재사용한 탐색적 분석이다. 결론적으로 이 논문은 하이브리드 LLM의 전이 가능한 추론 상태가 KV만이 아니라는 존재 증명을 제공하지만, 보편적 상태 번역 규칙이나 바로 쓸 수 있는 모델 전환 인터페이스를 제공하는 것은 아니다.

관련 논문