Draft-KV가 잠재 통신의 메시지 의존성을 되살린다
Draft-KV: Learning Useful Latent Communication Between Language Models
무엇인가
언어 모델 사이의 잠재 통신(latent communication)은 디코딩된 텍스트 대신 내부 상태를 넘긴다. 문제는 수신 모델의 정확도가 올라가도 그것이 메시지 내용을 실제로 썼다는 증거가 되지 않는다는 점이다. 저자들은 현재 질문에 맞춰 만들어진 메시지를 쓴 조건(A_M), 다른 질문의 메시지로 바꿔치기한 조건(A_D), 통신을 아예 끈 조건(A_R)을 두고 시스템 이득 G=A_M−A_R과 짝 이득 P=A_M−A_D를 분리한다. 두 값이 벌어지는 현상을 정보 사용 격차(information-use gap)라고 부른다. 통신이 수신 모델 단독 대비 15.44점을 더해줘도 메시지를 무관한 질문의 것으로 바꾸면 정확도가 0.60점 이내로밖에 움직이지 않는다면, 그 이득은 콘텐츠가 아니라 인터페이스 적응에서 나온 것이고 공유 모델은 없어도 되는 존재가 된다.
어떻게 동작하나
논문은 다섯 개 방법-데이터셋 조합을 감사한다. C2C는 MMLU-Redux에서 시스템 이득 12.29pp에 짝 이득 −0.47pp, OpenBookQA에서 13.40pp에 0.00pp, ARC-Challenge에서 15.44pp에 0.42pp를 기록했다. LatentMAS는 ARC-Challenge에서 4.86pp 시스템 이득 중 0.60pp만 짝에 의존했다. 다섯 조합 어디에서도 짝 이득이 0.60pp를 넘지 않았다. 어댑터만 평가하면 C2C는 MMLU-Redux 96.06%, ARC-Challenge 95.93%, OpenBookQA 93.16%의 Matched 정확도를 유지했고, Matched가 어댑터 단독보다 각각 1.69, 2.22, 3.60pp 높았다. 공유 모델을 0.6B에서 8B로 키우면 공유 모델 단독 정확도는 29.85pp 오르는데 시스템 정확도는 3.54pp만 올랐고, 8B에서 14B로 키울 때는 단독 4.48pp 상승에 시스템은 0.77pp 상승에 그쳤다.
무엇과 다른가
Draft-KV는 메시지를 공유 모델이 답을 초안(draft)으로 쓰는 과정에서 만든 키-값 상태로 정의한다. 인과적 어텐션에서 프롬프트 위치의 KV는 뒤따르는 답변에 영향받지 않지만, 초안 위치의 KV는 질문과 앞선 답변 토큰을 함께 반영한다. 공유 모델은 입력 x에서 정답을 보지 않고 탐욕적으로 초안 d를 디코딩하고, [x;d]를 한 번 순전파해 각 레이어 s=π(ℓ)의 K, V를 모은 뒤 초안 위치만 노출하는 가시성 마스크 b를 붙인다. 각 통신 레이어에서 편향 없는 선형 사상 K̃=K_S·W_K, Ṽ=V_S·W_V로 수신 모델의 KV 헤드 레이아웃에 맞춰 재배열하고, 패킷 E_θ(x,d)={(K̃^ℓ, Ṽ^ℓ, b)}를 만든다. 수신 모델은 자기 쿼리·출력 사영과 정규화, 헤드 레이아웃을 그대로 재사용하는 어텐션 분기로 이 패킷을 읽는다. 추가 파라미터는 KV 헤드마다 하나씩 있는 부호 있는 게이트 g=tanh(a)뿐이고, 분기 출력 ΔH는 자기 어텐션과 같은 잔차 스트림에 더해진다(H̄=H+SelfAttn(U)+ΔH). 패킷은 수신 모델의 자기 어텐션 캐시에 합쳐지지 않고 별도 메모리로 남으며 게이트는 0으로 초기화된다. 두 모델은 모두 동결되고 인터페이스는 1.05M 파라미터만 학습한다. C2C보다 348배, DLC보다 36배 작다.
어떻게 쓰나
학습은 세 단계로 진행된다. 1단계는 메시지 재구성으로, OpenHermes 대화의 마지막 어시스턴트 턴을 페이로드로 삼고 샘플별 전송 키를 덧붙인 뒤, 수신 모델은 대화나 질문 없이 고정된 디코딩 지시문만 받고 패킷만으로 그 페이로드를 복원하도록 학습된다. 2단계는 답 정렬로, 패킷이 공유 모델 자신의 초안에서 나오고 목표는 같은 대화의 데이터셋 정답이 된다. 초안이 틀릴 수 있고 정답이 공유 모델에 입력되지 않으므로 수신 모델은 초안 상태를 베끼는 대신 그것으로 답하는 법을 배우며, 다섯 번의 업데이트마다 재구성 손실을 재생해 코드 판독성을 유지한다. 3단계는 후보 선택지가 있는 과제에서 공유 모델이 질문과 선택지를 받아 짧게 설명하고 선택지를 끝에 쓰게 하고, 수신 모델은 정답 텍스트 전체로 지도받는다. 이때 학습 분할 안에서 σ(i)≠i인 뒤섞기를 고정해 Matched, Deranged, Receiver-only 세 패킷을 같은 입력과 답 접두사로 비교하고, L=(1/B)Σ(N_i^M + λ_p·[N_i^D − sg(N_i^R) − τ]_+)를 최소화한다(λ_p=0.1, τ=0.1). 두 번째 항은 단방향 가드로, 뒤바뀐 패킷이 아무것도 안 보낼 때보다 토큰당 τ nats 이상 정답을 비싸게 만들 때만 작동해 수신 모델이 아무 메시지에나 현혹되지 않게 한다.
전제와 한계
공개 프로토콜(공유자와 수신자가 같은 질문을 봄)에서 Draft-KV는 35개 설정 모두에서 수신 모델 단독을 이겼고 30개에서 최고 정확도, 33개에서 텍스트 전달(T2T)을 앞섰으며 평균 이득 5.85점이다. Qwen3-8B 공유자에 동결된 Qwen2.5-0.5B-Instruct 수신자를 붙이면 MMLU-Redux에서 78.04%로, 단독 37.45%와 메시지 재배정 36.40%를 크게 앞선다. 공유자를 0.6B에서 8B로 키우면 같은 인터페이스 크기에서 46.11%에서 78.04%로 오른다. 35개 공개 설정 모두에서 시스템 이득과 짝 이득이 양수였고 평균은 각각 24.24pp, 25.65pp였다. 불일치 손해는 중앙값 1.19pp로 33개 설정에서 2.5pp 이내였고 Qwen3-4B 공유자의 MMLU-Redux에서 11.65pp까지 컸다. 반면 C2C의 짝 이득은 평균 1.31pp에 그쳤고 시스템 이득은 35개 중 29개에서 음수였다. 비공개 프로토콜(HotpotQA, 2WikiMultihopQA에서 정답 근거를 나눠 가짐)에서는 14개 설정 모두에서 T2T를 평균 6.41점 앞섰고, 뒤바뀐 패킷은 Receiver-only보다 10.98pp 떨어졌다(공개 프로토콜에서는 1.41pp). 절제 실험에서 초안 위치 KV를 프롬프트 위치 KV로 바꾸면 ARC-C와 MMLU-Redux의 Matched 정확도가 33.70pp, 21.48pp 떨어지고 짝 이득은 0.17pp, 0.09pp로 거의 사라진다. ARC-Challenge에서 수신 모델은 공유자가 틀린 문항의 24.1%를 되살리면서 공유자가 맞힌 문항은 1.1%만 잃었다.
실무 관점에서 이 논문이 주는 가장 직접적인 교훈은 평가 지표다. 두 모델을 붙여 정확도가 올랐다는 사실만으로 그 연결이 정보를 나르고 있다고 결론 내리면 안 된다. 메시지를 다른 입력의 것으로 바꿔치기하는 대조군을 항상 함께 재야 하고, 그 차이인 짝 이득이 0에 가까우면 이득은 인터페이스 적응에서 나온 것이므로 더 강한 파트너로 교체해도 성능이 따라 오르지 않는다. 또한 Draft-KV는 두 모델을 동결하고 1.05M 파라미터만 학습하므로, 큰 모델을 다시 학습시키지 않고도 작은 수신 모델에 강한 모델의 계산을 얹는 구성이 가능하다는 것을 보여준다. 다만 인터페이스는 모델 쌍마다 따로 학습되고, 패킷이 수신 모델의 자기 어텐션 캐시에 합쳐지지 않고 별도 메모리로 읽힌다는 점은 서빙 스택에 반영해야 할 구조적 제약이다.
저자들이 밝힌 전제와 한계는 다음과 같다. 두 언어 모델은 항상 동결되고 인터페이스만 학습되며, 모델 쌍마다 별도로 학습된다. 3단계 학습은 ARC-Easy와 ARC-Challenge 훈련 데이터로만 하고 나머지 평가 벤치마크는 학습과 체크포인트 선택에서 제외했는데, 절제 실험에서 단계를 빼면 학습에 쓰지 않은 MMLU-Redux에서 손실이 더 크게 나타나 3단계 업데이트가 최적화 대상 과제에서 약한 매핑을 부분적으로 보상하고 있음을 보여준다. 비공개 프로토콜은 정답 근거를 인위적으로 반으로 나눠야 성립한다. 또한 논문이 감사한 C2C의 공개 퓨저는 단일 체크포인트 점추정치라서, 저자들은 자기들 레시피로 퓨저를 다시 학습해 95% 부트스트랩 구간이 20개 중 13개에서 0을 포함함을 확인했다.