트랜스포머가 두 생각을 동시에 담을 수 있음은 LLM의 선형 중첩 실증이다

Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs

HF Daily2609.29845

Pavel Tikhonov, Anton Korznikov, Matvey Mikhalchuk2026-09-24조회 10

무엇인가

이 논문이 다루는 문제는 Transformer의 비선형성과 실제 입출력 거동 사이의 간극이다. 셀프 어텐션의 softmax와 비선형 활성화를 가진 MLP 때문에, 지금까지 추론은 하나의 일관된 의미 흐름으로 취급됐다. 여러 개의 독립적인 텍스트 스트림을 처리하려면 별도의 순전파를 돌리거나 순차 처리하거나 아키텍처를 고쳐야 했다. 그런데 최근 연구는 디코더 전용 Transformer의 residual stream에서 연속한 층 사이의 변환이 affine map으로 잘 근사된다는 것을 보였다. 저자들은 이 층간 선형성이 모델의 종단 간 입출력 거동까지 확장되는지, 즉 입력의 선형 결합에 대한 응답이 각 입력의 독립적 출력의 결합으로 근사되는지를 묻는다. 이것이 Superposition Linearity Hypothesis다.

어떻게 동작하나

방법의 핵심은 단순하다. 두 개의 서로 다른 텍스트 시퀀스 x와 y를 토큰화한 뒤, 각 위치 t에서 두 임베딩의 원소별 산술 평균을 취해 혼합 표현 z를 만든다. 이 혼합 표현을 동결된 사전학습 백본에 그대로 통과시키고, 표준 인과적 셀프 어텐션으로 이전의 혼합 위치들을 참조하게 한다. 이론적 목표 분포는 두 독립 분포의 산술 평균이다. 저자들은 혼합 출력에서 각 스트림의 정답 다음 토큰이 차지하는 순위를 측정하고, KL·Jensen-Shannon 발산과 상위 256개 토큰에 대한 Wasserstein 거리(토큰 임베딩 간 코사인 거리를 ground metric으로 사용)로 분포 형태를 비교한다. 수치 안정성을 위해 KL·JS에는 온도 스무딩 τ=1.5를 적용했고, 모델 패밀리와 문맥 간 비교를 위해 두 무관한 문맥 사이의 거리로 나눈 정규화 지표인 Superposition Approximation Ratio를 도입한다. 이 값이 1보다 작으면 혼합 출력이 무관한 두 문맥보다 이상적 선형 혼합에 가깝다는 뜻이다.

무엇과 다른가

사전학습된 모델에 대한 순위 분석 결과는 놀랍다. Pythia-2.8B, Llama-3.2-3B, Qwen2.5-3B 등에서 정답 토큰이 상위 10위 안에 드는 경우가 약 30~40%, 상위 50위 안이 50~60%, 상위 100위 안이 60~65%에 이른다. 어휘 크기가 5만 이상이라는 점을 감안하면 신호가 잡음 바닥보다 훨씬 위에 보존된다는 것이다. 분포 수준에서도 FineWeb 기준으로 KL, JS, Wasserstein 모두 정규화 비율이 1 미만으로 일관되게 나와, 혼합 출력이 무관한 분포로 붕괴하지 않고 목표 혼합의 구조를 상당히 보존한다. 이 성질은 특정 위치에 국한되지 않는다. Total Variation Distance는 처음 약 20개 토큰에서 조금 높다가 이후 문맥 창 전체에서 일정 수준으로 안정화된다. 스트림을 3개로 늘린 N=3 실험에서도 중첩 선형성은 정성적으로 유지되며, KL 비율이 모델별로 0.04~0.09 정도 증가하는 양적 저하만 나타난다.

어떻게 쓰나

저자들은 이 현상이 학습으로 얻어진 능력이 아니라 아키텍처에 내재한 속성이라고 주장한다. Pythia 패밀리의 사전학습 궤적을 따라 은닉 상태의 가산성을 추적하면, 층 평균 오차가 가장 이른 체크포인트에서 최소이고 학습이 진행될수록 단조 증가한다. 즉 사전학습이 residual stream의 비선형 상호작용을 증폭시켜 이 성질을 오히려 약화시킨다. 층별 선형성 분석에서는 깊은 층(전체 층의 약 2/3 이상)이 거의 선형으로 남는 U자형 깊이 프로파일이 나타나는데, 이것이 중첩 신호가 출력 로짓까지 살아남는 기하학적 설명이 된다. 어텐션이 이 선형성의 원인인지 방해물인지 분리하기 위해 저자들은 donor patching(자연스러운 어텐션 구조는 유지하되 내용과 분리)과 permutation patching(구조를 파괴하되 행별 가중치 분포는 보존)을 비교한다. Qwen2.5-3B에서 예측 가능한 위치는 두 방식 모두 중위 순위 3~6으로 버티지만, 콘텐츠 위치에서는 임베딩 혼합이 중위 순위 284, donor patching이 111로 갈린다. permutation patching은 예측 가능 위치 3,079, 콘텐츠 위치 19,246으로 완전히 붕괴한다. 200개 LAMBADA 프롬프트(128토큰으로 좌측 절단)에서 donor patching은 정확도를 기존 73%에서 0.5%로 떨어뜨리고 정답 중위 순위를 2,350으로 밀어낸다. 반면 임베딩 혼합은 2.25% 정확도, 중위 순위 339로 4.5배의 정확도 격차와 7배의 순위 격차를 보인다.

전제와 한계

선형성은 경량 파인튜닝으로 복원된다. 저자들은 사전학습 가중치로 초기화한 student와 동결된 teacher 복사본을 두고, teacher가 두 스트림을 독립적으로 예측한 분포의 산술 평균을 목표로 삼아, 혼합 임베딩을 입력받은 student의 출력과의 KL 발산을 최소화하는 self-distillation을 수행한다. FineWeb의 일부로 약 20만 스텝을 학습시킨 결과, Pythia-2.8B에서 평균 KL이 1.86에서 0.27로, 정규화 비율이 0.42에서 0.06으로 떨어진다. 정답 토큰이 상위 5위 안에 들 확률은 약 30%에서 60% 이상으로 오른다. 특히 기존 모델이 사실상 붕괴했던 콘텐츠 토큰에서 중위 순위가 284에서 5로 회복되고 정확한 top-1 일치율이 22.8%까지 오른다. 다만 이 복원은 공짜가 아니다. 같은 목적함수가 단일 스트림 다음 토큰 예측 품질을 떨어뜨려, Pythia-2.8B의 LAMBADA가 0.544에서 0.357로, Qwen2.5-3B가 0.602에서 0.460으로 하락한다.

마지막으로 저자들은 혼합 순전파에서 두 스트림을 분리해 디코딩하는 문제를 다룬다. 여기에는 기하평균 장애물이 있다. 로짓이 근사적으로 평균되면 혼합 확률은 두 독립 확률의 기하평균, 즉 제곱근에 비례한다. 따라서 스트림 A에서는 확률이 높지만 B에서는 낮은 토큰이 강하게 억제되어, 표준 디코딩으로 두 스트림 모두를 동시에 1위로 만드는 것은 극히 어렵다. 개념 증명으로 제시된 Joint Contrastive 디코딩은 작은 보조 모델의 로짓을 이용해 각 스트림의 로짓을 큰 모델의 혼합 로짓에 α를 곱해 더하고 반대 스트림 로짓에 β를 곱해 빼는 형태로 분리한다. α와 β는 1로 초기화되어 대칭적 스트림별 교차 엔트로피 손실로 백본과 함께 학습된다. LAMBADA 평균 정확도는 원래 0.06~0.18에서 0.11~0.43으로 올라가고, Llama-3.2-3B에서는 0.43에 도달한다(단일 스트림 소형 모델 기준선은 0.54). 저자들은 남은 격차가 파인튜닝의 부족이 아니라 기하평균 장애물 때문이라고 본다.

개발자 관점에서 이 논문의 실무적 함의는 명확하다. 두 스트림을 하나의 벡터로 압축하면 이론적으로 추론 처리량이 2배가 되고, 활성 스트림당 KV 캐시 footprint가 절반으로 줄어든다. 하지만 그 대가로 단일 스트림 품질이 눈에 띄게 떨어진다는 점이 수치로 명시돼 있고, 분리 디코딩은 아직 개념 증명 수준이다. 따라서 지금 단계에서 이 기법을 프로덕션에 넣으려면 콘텐츠 토큰 위치에서의 정확도, 즉 예측 가능한 고빈도 토큰이 아닌 실제 의미 판단이 필요한 위치에서의 성능을 반드시 별도로 측정해야 한다. 이 논문의 집계 지표는 예측 가능한 위치에 크게 가중되어 있어, 집계 수치만 보면 실제 체감 품질을 과대평가할 수 있다.

저자들이 밝힌 한계도 분명하다. 분석 실험은 대부분 128토큰 이하의 짧은 문맥(2.3절에서 512까지 확장)과 단일 언어 위주 코퍼스에서 수행됐고, 훨씬 긴 문맥이나 다국어 설정은 더 복잡한 임베딩 기하를 요구하므로 향후 과제로 남는다. 또한 텍스트 기반 언어 모델만 조사했으며, 텍스트 토큰과 이미지 패치처럼 근본적으로 다른 모달리티의 임베딩을 섞는 경우 이 선형 중첩 성질이 유지되는지는 전혀 검증되지 않았다. 중첩된 은닉 상태를 완전히 분리해 두 스트림을 복원하는 문제 역시 미해결로 남아 있다.

관련 논문