MLLM은 아키텍처에 따라 비전과 텍스트를 다른 순서로 융합한다
Architecture-Dependent Fusion Pathways in MLLMs
무엇인가
이 논문은 멀티모달 대형 언어모델(MLLM)이 내부에서 시각 정보와 텍스트 정보를 어느 층에서 어떻게 섞는지를 다룬다. 기존 연구는 대부분 다운스트림 정확도와 추론 벤치마크 점수로 MLLM을 평가해 왔지만, 최종 성능만으로는 시각 토큰과 텍스트 토큰이 모델 깊이에 따라 어떻게 상호작용하는지 알 수 없다. 저자들은 MLLM을 비전-언어 인터페이스 설계에 따라 두 계열로 나눈다. 사전학습된 CLIP 계열 비전 인코더와 경량 프로젝션 모듈을 붙이는 결합(concatenation) 아키텍처와, 시각 토큰화와 언어 표현을 하나의 종단간 멀티모달 프레임워크에서 함께 학습하는 네이티브 멀티모달 아키텍처다. 문제는 이 두 계열이 층별 융합 동역학에서 어떻게 다른지 체계적으로 규명된 적이 없다는 점이다.
어떻게 동작하나
방법은 세 개의 점진적으로 연결된 분석과 별도의 인과 개입 검증으로 구성된다. 첫째, 정렬 분리(alignment decoupling)는 층 0의 표현을 기준으로 시각·텍스트 각 모달리티 내부의 CKA를 따로 계산해 어느 모달리티가 변하는지를 판별한다. 모달리티별로 토큰을 평균 풀링해 토큰 수가 다른 모델끼리도 비교 가능하게 만든다. 둘째, 어텐션 라우팅과 엔트로피는 시각 질의가 텍스트 키에 할당하는 어텐션 질량 r(V→T)와 그 반대 방향 r(T→V)을 계산하고, 대상 토큰 수로 정규화한 교차 모달 엔트로피로 어텐션이 소수 토큰에 집중되는지 넓게 퍼지는지를 측정한다. 셋째, 내재 차원(intrinsic dimensionality)은 중심화한 특징 행렬에 SVD를 적용해 분산 보존 임계값 τ(0.5, 0.6, 0.7, 0.8)를 넘기는 최소 특이값 개수를 세어, 융합이 특징 공간의 압축인지 확장인지 재조직인지를 본다. 여기에 더해 집중된 텍스트 앵커를 마스킹하거나 초기층(0–7)·후기층(16–32) 은닉 상태에 가우시안 노이즈를 주입하는 인과 개입 실험으로 해석의 기능적 타당성을 검증한다.
무엇과 다른가
실험은 결합 계열 3개(LLaVA-next Vicuna, LLaVA-next Mistral, Cambrian)와 네이티브 계열 3개(SOLO, EVE, SAIL)를 대상으로 한다. LLaVA 계열은 CLIP-ViT-L을, Cambrian은 DINO와 CLIP을 결합한 하이브리드 비전 인코더를 쓴다. 표현·어텐션 분석에는 COCO-val, VQA, MMMU에서 무작위로 뽑은 1만 개 이미지-텍스트 쌍 중 캡션 스타일의 깨끗한 입력을 사용하고, 특수 토큰·패딩·잘림 위치는 마스킹한다. 은닉 표현은 층마다 정규화해 d=4096으로 맞추고, 층 인덱스는 0–32다. 인과 개입은 MMBench에서 VLMEvalKit으로, 객체 환각은 POPE로 평가한다. 표본 불확실성은 5,000쌍 부분집합에서 1,000회 부트스트랩 재표집으로 정량화한다.
어떻게 쓰나
결과는 두 개의 뚜렷한 융합 경로를 보여준다. 정렬 분리에서 결합 모델은 얕은 층에서 시각 표현이 초기 상태에 가깝게 유지되다가 텍스트가 먼저 변형되고 그 뒤에 시각이 늦게 재편되는 반면, 네이티브 모델은 시각 표현이 훨씬 이른 층에서 기준 상태로부터 벗어나 텍스트와 함께 연속적으로 적응한다. 어텐션에서는 모든 표시 모델에서 시각→텍스트 라우팅 중앙값이 역방향보다 컸고 Δr은 0.301~0.605였다(Cambrian 0.605, EVE 0.571). 라우팅 크기만으로는 두 계열이 갈리지 않지만 집중도는 갈린다. 결합 모델의 시각→텍스트 정규화 엔트로피 중앙값은 0.046~0.192인데 EVE는 0.497, SOLO는 0.301이었고, 방향성 엔트로피 격차 ΔH도 결합 모델이 0.544~0.703으로 EVE 0.283, SOLO 0.462보다 컸다. 내재 차원에서는 Cambrian의 시각 내재 차원이 초기·전이 구간에서 낮게 평탄하다가 중후반에 상승해 지연된 특징 공간 확장을 보였고, EVE는 더 이른 층부터 시각 내재 차원이 증가하며 얕은 층 평탄 구간이 나타나지 않았다.
전제와 한계
인과 개입은 이 해석을 뒷받침한다. 집중된 텍스트 타깃을 마스킹했을 때 POPE F1 하락은 결합 모델이 더 컸다(LLaVA-Vicuna 87.5→44.6, 42.9p 하락; LLaVA-Mistral 86.4→39.9, 46.5p; Cambrian 86.4→36.3, 50.1p). 반대로 네이티브 모델의 하락은 EVE 31.2p, SOLO 34.8p로 상대적으로 작았다. SAIL은 하이브리드 어텐션 때문에 이 표에서 제외됐다. MMBench 노이즈 주입에서는 패턴이 뒤집힌다. 네이티브 모델이 초기층 노이즈에 더 취약하고(EVE 22.4p, SOLO 24.1p 하락), 결합 모델이 후기층 노이즈에 더 취약하다(LLaVA-Vicuna 19.8p, LLaVA-Mistral 19.5p, Cambrian 17.9p). 보조 분석으로 층별 시각 CKA를 모델 쌍마다 계산한 결과, 층 1에서는 아키텍처 의존성이 매우 높았지만 층 30에서는 거의 모든 모델 쌍에서 유사도가 크게 올라, 서로 다른 MLLM의 깊은 시각 표현이 유사한 의미 구조로 수렴한다는 플라톤 표현 가설과 일관된 증거를 제시한다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 진단과 튜닝 위치다. 저자들은 전이 층과 소수의 텍스트 앵커를 견고성 진단 지표로 쓸 수 있다고 제안한다. 특히 적대적 취약성과 환각 행동을 연구할 때 유용하다. 또 결합 아키텍처를 학습시킬 때 전이 구간을 중심으로 더 이른 교차 모달 피드백, 앵커 정규화, 층 선택적 적응을 적용하는 전략이 도움이 될 수 있고, LoRA나 어댑터를 모든 층에 균일하게 붙이는 대신 관측된 경로 차이에 따라 층을 골라 배치하라는 제안도 한다. 즉 어느 층에 개입할 것인가를 감이 아니라 측정으로 정하자는 것이다.
한계도 분명하다. 저자들은 두 패러다임이 근본적으로 다른 학습 파이프라인을 쓰기 때문에 모든 요인을 고정한 완전 통제 비교는 불가능하다고 밝힌다. 결합 모델은 사전학습 비전 인코더·프로젝션·언어 백본 조합이고, 네이티브 모델은 모델별 감독 파이프라인을 가진 종단간 프레임워크라 조건이 다르다. 그래서 목표는 대표적인 오픈 모델들에서 패러다임 수준의 규칙성을 찾는 것이며, 단일 모델 아티팩트를 줄이기 위해 계열마다 여러 모델을 평가하고 CKA·어텐션·내재 차원·개입 증거에서 같은 해석이 지지될 것을 요구한다. 또한 네이티브 계열 안에서도 어텐션 프로파일이 이질적이어서 SAIL은 하이브리드 어텐션 때문에 구조적 예외로 부록에서 따로 다룬다. 분석은 층별 정규화와 고정 은닉 크기 d=4096, 각 모델 기본 토큰 수 설정에 의존한다.