HeteroFold가 이종 LLM 간 KV 캐시를 프리필 없이 전달한다
Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs
무엇인가
이 논문은 서로 다른 모델 패밀리를 역할별로 섞어 쓰는 이종 멀티에이전트 LLM 시스템에서 발생하는 중복 연산 문제를 다룬다. 텍스트로 대화를 주고받으면 수신 모델은 송신 모델이 이미 처리한 공유 문맥을 다시 프리필하고 자기 KV 캐시를 새로 만들어야 한다. 문맥이 길어질수록 이 중복은 지연시간으로 그대로 누적된다. 송신 측 KV 캐시를 재사용하면 이 낭비를 없앨 수 있지만, 모델 패밀리가 다르면 토크나이저, 모델 깊이, KV 표현 방식이 모두 어긋난다. 저자들은 이 세 가지 불일치를 명시적으로 해결하지 않으면 캐시 재구성 오차가 낮아도 수신 모델의 어텐션이 왜곡된다는 점을 지적한다. 실제로 KV Ridge는 HeteroFold보다 낮은 재구성 오차를 보이면서도 수신 어텐션을 망가뜨린다.
어떻게 동작하나
제안 방법 HeteroFold는 송신·수신 모델을 모두 동결한 채 캐시만 변환한다. 첫 단계는 토큰 정렬(Token Alignment)로, 두 토크나이저가 공유하는 문자 단위 경계를 기준으로 대응을 세운다. 예를 들어 "The unbelievable result."에서 Qwen3의 토큰 끝 위치가 3, 16, 23, 24이고 Ministral-3가 3, 9, 12, 16, 23, 24라면, Qwen3에서 Ministral-3로 갈 때 수신 경계 9와 12는 문자 3에서 끝난 Qwen 상태를 재사용한다. 여러 송신 토큰이 한 수신 토큰에 대응해도 평균을 내지 않고, 같은 인과적 접두사 끝점을 맞춘다. K/V 매핑 후 위치 인코딩(RoPE)은 수신 모델이 자기 위치 인덱스로 다시 적용한다. 두 번째는 층 정렬로, 깊이가 다른 두 모델을 비례 대응시킨 뒤 대응 층 주변 오프셋 (-4, 0, +4)의 송신 층 세 개를 골라 특징을 이어 붙인다. 이렇게 평탄화하면 헤드 수가 달라도 교차 헤드 매핑이 가능하다.
무엇과 다른가
세 번째는 모멘트 정합 리컬러(Recolor)다. 토큰별 재구성 목표는 재구성 오차를 낮게 유지하면서도 수신 어텐션과 출력을 바꿔버리므로, 대신 수신 특징의 평균과 공분산을 맞춘다. 송신 특징을 RMS로 스케일링한 뒤 양쪽 공간을 화이트닝하고, 특이값 분해로 얻은 Procrustes 회전 R* = UQ^T를 이용해 A = Σ_Z^{-1/2} R* Σ_Y^{1/2}, b = μ_Y − μ_Z A를 초기화한다. 마지막으로 출력 인지 보정을 붙인다. 수신 어텐션 출력의 차이를 키가 유발한 변화와 값이 유발한 변화로 분해하고, 각각에 랭크 ρ 보정항 ŷ = y^(0) + (y^(0)B)G를 더한다. B와 G만 학습하며 G는 0으로 초기화되고 두 모델은 동결된다. 보정에는 정답이나 생성 결과 없이, 질문 구간과 겹치는 토큰에서 얻은 수신 모델의 네이티브 쿼리·어텐션 가중치·값·출력만 쓴다. 키 목적함수는 네이티브 어텐션과의 KL 발산에 키 유발 출력 변화를 수신 히든 차원으로 나눈 항을 더하고, 값 목적함수는 어텐션을 고정한 채 출력의 상대 프로베니우스 오차를 줄인다. 학습된 보정은 A_final = A(I+BG), b_final = b(I+BG)로 접혀 추론 시 층·역할당 하나의 고정 아핀 맵만 남는다.
어떻게 쓰나
실험은 Llama-3.1-8B-Instruct, Qwen3-4B, Ministral-3-14B-Instruct 사이의 여섯 방향 전이를 모두 BF16 동결 상태에서 평가한다. 비교 대상은 텍스트 통신 기준선 TextMas와 프리필 없는 기존 방법 Dense Latent, KV Ridge이며, 이들에는 같은 토큰 정렬을 붙인 +TA 변형도 함께 둔다. 장문 문맥 QA는 Qasper, HotpotQA(둘 다 LongBench 200문항 부분집합), LoCoMo, QuALITY 네 개, 단문 문맥은 ARC-Challenge, MMLU, WinoGrande, HellaSwag, GSM8K 다섯 개다. 캘리브레이션은 Open-R1 800개와 HotpotQA 800개로 총 1,600개 학습 프롬프트, 400개 홀드아웃 프롬프트를 쓰고 랭크 16 보정 체크포인트를 고른다. 결과적으로 HeteroFold는 네 개 장문 문맥 벤치마크 전부와 단문 문맥 대부분에서 평가된 캐시 전이 기준선을 앞선다. 멀티에이전트 벤치마크 HiddenBench에서는 수신 프리필 없이 텍스트 통신과 비슷한 집단 결정 정확도를 낸다.
전제와 한계
지연시간은 4K, 16K, 32K QuALITY 문맥, 배치 크기 2, NVLink로 연결된 H100 80GB 두 장에서 측정한다. 32K에서 Llama-3.1-8B에서 Ministral-3-14B로의 전이는 네이티브 프리필보다 10.7배 빠르고, Dense Latent와 KV Ridge보다 1.18~1.47배 빠르다. 네이티브 프리필 대비 속도 향상은 4K의 약 3.5~3.8배에서 32K의 약 10.7배로 문맥이 길수록 커진다. 이는 Dense Latent의 2층 MLP 매퍼 대신 단일 아핀 매핑을 쓰고, KV Ridge의 층당 8개 대신 3개 송신 층만 참조하기 때문이다. Ministral-3-14B에서 Llama-3.1-8B로 가는 절제 실험에서는 토큰 정렬을 같은 인덱스 짝짓기로 바꿨을 때 성능 하락이 가장 컸고, 단일 층·헤드 국소 매핑도 성능을 떨어뜨렸다. Recolor는 릿지 회귀보다 우수했고, 출력 인지 보정은 릿지의 성능을 상당히 회복시키지만 토큰 정렬과 Recolor를 함께 쓴 구성에는 미치지 못했다. 장문 문맥에서는 키 보정이 이득의 대부분을 차지한다.
개발자 관점에서 이 방법은 모델 가중치를 건드리지 않고 캐시만 변환한다는 점이 핵심이다. 서로 다른 패밀리의 모델을 솔버·평가자·집계자로 나눠 쓰는 파이프라인에서, 긴 공유 문맥을 매 홉마다 다시 프리필하는 비용을 없앨 수 있다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, 캘리브레이션 단계에서 수신 모델의 내부 상태(쿼리, 어텐션 가중치, 값, 출력)에 접근해야 하므로 API 뒤에 숨은 모델에는 그대로 적용하기 어렵다. 둘째, 토큰 정렬이 문자 단위 공유 경계에 의존하므로 문자 기반 토크나이저끼리만 안전하다. 셋째, 논문이 보고한 지연시간에는 송신 프리필과 모델 로딩, 오프라인 캘리브레이션 시간이 제외되어 있다.
저자들이 명시적으로 밝힌 전제는 두 모델을 모두 동결한 채로 동작한다는 것, 그리고 보정이 정답이나 생성 연속체 없이 질문 구간과 겹치는 토큰의 수신 네이티브 상태만으로 이루어진다는 것이다. 또한 캘리브레이션에 쓰는 HotpotQA 프롬프트는 학습 분할에서 가져와 평가셋과 겹치지 않게 했고, 보정에 쓰지 않은 벤치마크에서도 장문 문맥 성능이 유지된다는 점을 근거로 일반화를 주장한다. 다만 원문에는 별도의 한계 절이 없어, 어떤 조건에서 전이가 실패하는지에 대한 정량적 분석은 제시되지 않았다.