멀티모달 LLM의 시각-텍스트 정렬 점수는 내용 통합의 증거가 아니라 착시일 수 있다
The Alignment Illusion in Multimodal Large Language Models
무엇인가
멀티모달 LLM(MLLM) 연구에서 층별 시각-텍스트 유사도는 언어모델이 깊어질수록 이미지 내용을 공유 표현 공간에 통합한다는 증거로 널리 읽혀 왔다. 이 논문은 그 해석의 전제, 즉 스칼라 정렬 점수가 내용 수준의 교차모달 상호작용을 반영한다는 가정을 직접 검증한다. 문제는 MLLM에서 시각 토큰과 텍스트 토큰이 같은 트랜스포머 블록, 같은 어텐션과 MLP 가중치를 통과한다는 점이다. CKA, SVCCA, 주성분각(principal angle) 유사도 같은 도구는 원래 독립적으로 학습된 두 네트워크를 비교하려고 만든 것이라, 독립성 조건이 깨진 MLLM에서는 높은 점수가 내용 통합이 아니라 가중치가 강요한 기하일 수 있다. 저자들은 이 실패 모드를 정렬 착시(alignment illusion)라고 부른다.
어떻게 동작하나
검증 방식은 시각 스트림에 대한 통제된 개입이다. 13개 MLLM, 5개 계열(LLaVA-OV, LLaVA-OV-1.5, Qwen2-VL, Qwen2.5-VL, InternVL3), 0.5B에서 72B 파라미터까지를 대상으로 MMBench 정확도를 측정한다. 핵심 비교는 Orig(질문에 붙은 원본 이미지의 프로젝터 출력)와 Noise(각 프로젝터 출력 시각 토큰을 등방성 가우시안 벡터로 바꾸되 토큰별 노름은 원본과 맞춰 스케일을 보존)다. Noise에서 과제 정확도는 13개 모델 전부에서 38~50pp 떨어지지만, 선행 주성분각 코사인 σ1은 층별로 Orig와 비슷하거나 오히려 더 높고 깊은 층에서는 두 곡선 모두 1에 근접한다. Orig와 Noise를 구분하는 separation score의 중앙값은 σ1, CKA, SVCCA에서 음수였고 MIR은 0 근처였다. 즉 네 가지 표준 스칼라 지표는 내용이 제거된 시각 스트림을 안정적으로 분리하지 못한다.
무엇과 다른가
저자들은 이 착시를 공유 언어모델 경로로 추적한다. 첫째, 고정된 프로젝터 출력과 층별 텍스트 표현 사이의 σ1은 랜덤 상한 근처의 중간값에 머물다가 두 스트림이 공유 경로를 통과한 뒤에야 1에 가까워진다. 둘째, MLP를 우회하면 어텐션을 우회할 때보다 σ1의 층 평균 변화가 13개 모델 전부에서 더 컸다(중앙값 3.5배). 셋째, MLP 하향 투영 W_out의 특이값 비 s1/s2가 1.2~1.6으로, 같은 크기의 가우시안 랜덤 행렬(약 1)보다 크다. 넷째, 주성분각 기저 Ψ는 W_out의 상위 10개 좌특이 부분공간에 랜덤 기준선 대비 2.8~13.6배 많은 에너지를 담는다. 논문은 이를 가중치 유발 정렬(weight-induced alignment)이라 부르고, 공통 출력 방향 U1에 대해 σ1(WX, WY) ≥ cos(θX+θY)라는 하한을 제시한다. 이 부등식에는 X와 Y를 결합하는 항이 없다는 점이 핵심이다.
어떻게 쓰나
이 단일 방향 메커니즘을 분리하기 위해 제안하는 지표가 PA 갭이다. ΔPA = σ1 − σ2, 즉 상위 두 주성분각 코사인의 차이(층 평균)다. Noise에서는 σ2 이하가 급락해 정렬이 한 방향으로 붕괴하므로 ΔPA가 커지고, 구조 있는 시각 입력에서는 정렬이 여러 방향에 걸쳐 ΔPA가 작아진다. 실제로 ΔPA는 13개 모델 전부에서 Noise가 Orig보다 컸고, Orig를 Noise보다 위로 일관되게 정렬한 유일한 지표였다. 원본 토큰과 노이즈를 V_α = αV_Orig + (1−α)Z (α = 0.0~1.0)로 보간한 단계적 손상 실험에서 ΔPA는 과제 정확도와의 Pearson |r| 평균 0.894, 중앙값 0.917, 최소 0.655를 기록했고, 12/13 모델에서 |r| > 0.80, 13/13 모델에서 부호가 기대와 일치했다. 비교 대상은 σ1, CKA, SVCCA, MIR, 그리고 같은 스펙트럼에서 계산한 participation ratio와 spectral entropy였다.
전제와 한계
논문은 시각 구조와 과제 관련성을 분리하는 실험도 추가한다. 다른 질문의 이미지를 붙인 Irr 설정에서 정확도는 텍스트만 쓴 Text 기준선보다 중앙값 5.0pp 낮았고, Noise는 Text와 2.1pp 차이에 그쳤다. 토큰 순서만 섞은 Shuf는 Orig 대비 0.8pp 차이로 거의 영향이 없었다. 3B 미만 그룹에서는 Irr−Text 격차가 2.9pp로 줄고, 3B 이상 그룹에서는 Irr−Noise 격차가 3.2pp로 벌어진다. 프로젝터 토큰에 학습한 선형 프로브는 무관 이미지의 범주를 74.4~78.5%로 복원해(우연 수준 5%) 프로젝터가 무관 이미지를 충실히 부호화함을 보였다. 주성분각 부분공간 안(In-Band)과 그 직교 여공간(Out-of-Band)에 같은 크기의 노이즈를 주면 ε=1.0에서 13개 모델 전부 In-Band의 정확도 하락이 더 컸고, 그 차이는 1.1~5.5pp였다. 다만 ΔPA의 순서(Orig 0.130 < Irr 0.213 < Noise 0.324)와 정확도 순서(Orig 85.4%, Irr 36.1%, Noise 39.0%)는 어긋난다. 구조 있는 시각 내용이 내부 기하에는 반영되면서도 질문에는 도움이 되지 않을 수 있다는 뜻이다.
개발자에게 이 논문이 주는 실무적 결론은 분명하다. 내부 정렬 점수가 높다는 사실만으로 모델이 이미지를 사용해 답한다고 주장하면 안 된다. 정렬 점수를 진단에 쓰려면 노이즈 대체, 무관 이미지, 토큰 셔플 같은 통제된 시각 개입 아래의 과제 정확도와 함께 보고해야 하며, 단일 스칼라 대신 σ1과 σ2의 차이인 PA 갭을 보조 지표로 삼는 편이 내용 기반 구조와 가중치 기반 유사도를 구분하는 데 낫다. 시각 인코더나 프로젝터를 바꿨을 때 정렬 곡선이 좋아졌다는 이유만으로 개선이라고 판단하는 것은 이 결과에 비추어 근거가 약하다.
저자들이 밝힌 한계도 분명하다. 분석은 프로젝터-LLM 구조, 통제된 객관식 평가, 프로젝터 출력 개입이라는 세 조건에 한정된다. 다른 융합 설계나 개방형 생성, 비디오, 문서, 에이전트 과제는 이미지 조건부 추론과 교차모달 상호작용의 형태가 다를 수 있으므로 같은 개입 기반 분석을 확장하는 일이 향후 과제로 남는다.
관련 논문
- RoboFollow는 장면 엔트로피로 로봇 에이전트의 지시 따르기 환상을 해부한다RoboFollow는 장면 엔트로피가 낮아 언어 없이도 높은 성공률을 얻는 embodied agent의 착시를 진단하는 벤치마크다. 9개 VLA·WAM 정책에서 L0 성능이 L1~L3로 전이되지 않음을 보인다.
- MLLM 환각을 시너지 헤드의 정보 분포 이탈로 진단하고 추론 시 보정하는 HEAL멀티모달 LLM의 환각을 시너지 헤드의 정보 분포 이동으로 설명하고, 헤드 단위 정보 분리·보정 기법 HEAL을 제안한다. 기존 어텐션 가중치 기반 완화가 놓치는 실제 정보 이동을 정면으로 겨냥한다.
- UFO는 다중 모달 이미지 생성의 조건 동시 정렬을 원자 단위로 평가하는 틀이다.다중 모달 이미지 생성 평가가 모델 발전 속도를 따라가지 못하는 문제를 다룬다. 기존 임베딩·MLLM 기반 평가가 각 조건을 따로 보는 한계를 지적하고, 조건 동시 정렬을 겨냥한 Chain-of-Evaluation 접근 UFO를 제안한다.