MLLM 환각을 시너지 헤드의 정보 분포 이탈로 진단하고 추론 시 보정하는 HEAL
MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads
무엇인가
이 논문은 멀티모달 대형 언어모델(MLLM)이 시각 입력과 사실적으로 어긋나는 그럴듯한 답을 생성하는 환각 문제를 다룬다. 기존 어텐션 기반 완화법은 어텐션 가중치나 FFN 활성값 같은 간접 신호에 의존해 실제 환각 생성의 원인인 정보 분포 변화를 정확히 반영하지 못하고, 시각 어텐션만 강화하면 언어 유창성이 떨어지거나 언어 의존이 커져 시각 환각이 심해지는 '시소' 딜레마가 있다고 지적한다. 저자들은 어텐션 헤드 내부 정보를 분해해 보면 환각은 모달리티 특화 헤드의 개수나 강도 부족이 아니라, 시너지 헤드(synergy head)의 시각-언어 정보 분포가 건강한 균형에서 이탈할 때 발생한다고 주장한다. 또한 헤드 역할은 자기회귀 생성 중 동적으로 변하며, 언어 중심 토큰에서는 시너지 헤드가 언어 헤드로, 시각 근거 토큰에서는 일부 언어 헤드가 시너지 헤드로 이동하는 과제 주도 상전이를 보인다고 설명한다.
어떻게 동작하나
제안 방법 HEAL은 먼저 다중 헤드 출력에 인과적 노이즈 개입을 적용해 인과적으로 중복된 헤드를 걸러낸다. 각 레이어 l, 생성 스텝 t, 헤드 i의 출력 o(t,l,i)를 평균과 공분산이 일치하는 가우시안 노이즈 o~(t,l,i)로 대체한 뒤, 원래 레이어 출력 y(t,l)와 대체 출력 y~(-i)(t,l)의 유사도 Sim(a,b)=1/2(1+cos(a,b))를 계산한다. 헤드의 정보 기여도는 I(t,l,i)=1-Sim(y(t,l), y~(-i)(t,l))로 정의하고, I가 레이어 내 평균에서 3 표준편차보다 작으면 인과적 중복 헤드로 분류해 이후 분석에서 제외한다. 이는 W_O의 투영 가중치만 보는 대신 실제 출력 변화를 측정해 헤드 간 협력 효과까지 반영하려는 설계다.
무엇과 다른가
다음으로 반사실적 이중차분(Difference-in-Differences)으로 남은 헤드 내부의 정보 분포를 시각, 언어, 사전지식, 시너지 성분으로 분해한다. 시각 토큰과 언어 토큰을 각각 가우시안 노이즈로 마스킹해 H11=H(V,T), H01=H(Vbar,T), H10=H(V,Tbar), H00=H(Vbar,Tbar) 네 가지 반사실 입력을 만들고, 전체 정보 I_total=1-Sim(H11,H00), 언어 정보 I_lang=Sim(H11,H01)-Sim(H11,H00), 시각 정보 I_vis=Sim(H11,H10)-Sim(H11,H00), 시너지 I_syn=1+Sim(H11,H00)-Sim(H11,H01)-Sim(H11,H10)를 계산한다. I_total이 평균-3표준편차보다 작으면 정보 중복 헤드, I_vis>0이고 I_lang<=0이면 시각 헤드, 반대면 언어 헤드, 둘 다 양수이면 모달리티 비율 alpha_vis=I_vis/(I_vis+I_lang), alpha_lang=I_lang/(I_vis+I_lang)를 로짓 변환한 뒤 중앙값과 MAD 기준으로 시각/언어/시너지 헤드를 나눈다. 시너지 헤드는 다시 시각 선호와 언어 선호로 구분된다.
어떻게 쓰나
환각이 시너지 헤드의 정보 이탈에서 온다는 관찰에 따라, HEAL은 추론 시 동적 정보 보정을 수행한다. 목표 시각-언어 균형을 나타내는 equilibrium factor alpha를 (0,1) 범위에서 두고, beta I_vis/(beta I_vis+gamma I_lang)=alpha가 되도록 beta=alpha/alpha_vis, gamma=(1-alpha)/alpha_lang을 계산한다. 이 beta와 gamma를 각각 시각 토큰과 언어 토큰의 value vector에 곱해, o(t,l,i)=Softmax(qK^T/sqrt(d))[beta V_vis; gamma V_lang] 형태로 어텐션 출력을 보정한다. 이 연산은 KV 캐시 갱신 뒤, 어텐션 커널 앞에 적용되어 FlashAttention이나 PagedAttention 구현을 바꾸지 않는다. 논문은 정리 1에서 value 공간 보정이 헤드 내 모달리티별 정보 분포 보정과 동등함을, 정리 2에서 alpha가 커질수록 출력과 시각 정보의 정렬이 단조 증가함을 보인다고 주장한다. 구현상 헤드 타입은 짧은 생성 구간에서 거의 안정적이라는 시간적 지역성을 이용해 S스텝마다 주기적으로 갱신하고, beta와 gamma는 매 디코딩 스텝 계산하며, 인과 개입과 이중차분은 병렬/배치 텐서 연산으로 처리한다.
전제와 한계
실험은 LLaVA-1.5-7B, LLaVA-NeXT-7B, Qwen2-VL-7B, Qwen2.5-VL-7B, Qwen3-VL-8B, InternVL-7B, InternVL3.5-8B 같은 MLLM에서 수행됐다. 종합 벤치마크로 LLaVA-Bench, MME, BLINK-Twice를, 환각 벤치마크로 객체 존재를 보는 POPE, 세밀한 이미지 캡션을 보는 CHAIR, 복합 행동과 공간 관계를 보는 MMHal-Bench를 사용했다. 하이퍼파라미터로 LLaVA/InternVL 계열은 POPE와 CHAIR 같은 단순 벤치마크에서 alpha=0.5, 더 어려운 종합 벤치마크에서 0.6을, Qwen 계열은 단순에서 0.4, 나머지에서 0.5를 썼고, 헤드 타입 갱신 간격은 모든 실험에서 10스텝으로 두었다. 논문은 MME와 POPE에서 일관된 성능 향상을 보고하고, EAH와 비교해 CHAIR에서 더 높은 recall과 더 긴 생성 길이를 얻었다고 설명한다. TAME은 토큰 간 어텐션 점수를 모으지만 시각 정보를 간과하고, VAR은 시각 정보를 강화하지만 텍스트 신호를 과소평가해 긴 캡션 생성에서 성능이 떨어질 수 있다는 점과 대비해, HEAL은 언어 유창성을 유지하면서 시각 근거를 개선한다고 주장한다. 표 1의 개별 점수와 개선폭은 이 발췌에 포함되어 있지 않아 구체 수치로 제시할 수 없다.
절제 실험에서는 헤드 타입 갱신 간격을 2에서 20까지 바꿨을 때 POPE 성능을 비교했다. 간격이 작으면 약간 더 좋지만 반사실 분석이 늘어 계산 오버헤드가 커지고, 10~15스텝이 비슷한 성능을 유지하면서 디코딩 효율을 크게 높인다고 보고한다. equilibrium factor alpha는 CHAIR(LLaVA-1.5)에서 U자형 추세를 보여, alpha가 커지면 처음에는 환각이 줄지만 너무 커지면 언어 정보가 억제되어 생성 품질이 나빠진다. LLaVA-Bench에서도 LLaVA-1.5와 Qwen2.5-VL 모두 비슷한 패턴이 나타나며 최적 alpha는 모델과 과제마다 다르다. 양방향 인과 분석에서는 원래 정답을 내던 모델에서 시각 정보 비율을 인위적으로 낮추면 환각이 유도되고, 원래 환각을 내던 모델에서 시각 정보 비율을 높이면 환각이 완화된다고 보고해, 단순 상관이 아니라 개입 가능한 인과 관계라는 근거로 제시한다.
강건성 분석에서는 마스킹 전략을 제로 마스킹, 균일 마스킹, 다른 이미지나 텍스트 토큰으로 교체하는 방식으로 바꿔도 헤드 분류가 92.13%~95.36% 일치했고, 정답 토큰과 환각 토큰 사이의 시각-언어 정보 이탈이 모든 마스킹 전략에서 관찰됐다. POPE 성능도 비슷했으며 가우시안 마스킹이 가장 좋았다. 임계값을 바꾸면 헤드 비율은 달라지지만, 환각 토큰이 시너지 헤드에서 언어 표현 쪽으로 이동하는 핵심 관찰과 HEAL의 효과는 유지됐고, 표준 3σ_total 정보 중복 기준과 lambda=2.9652 부근에서 가장 좋은 POPE 성능을 보였다. 저자들은 MAD에서 1.4826, 2.9652, 4.4478이 각각 정규성 가정의 1σ, 2σ, 3σ에 해당한다고 설명한다.
개발자 관점에서 HEAL은 재학습 없이 추론 단계에 붙일 수 있는 플러그인형 보정 기법이라는 점이 핵심이다. KV 캐시 뒤와 어텐션 커널 앞에서 value vector만 조정하므로 FlashAttention/PagedAttention 기반 서빙에 비교적 쉽게 통합할 수 있고, 시각 근거가 필요한 생성에서 언어 사전지식이 과도하게 작동하는 환각을 줄이는 데 쓸 수 있다. 다만 alpha와 갱신 간격은 모델과 과제별로 최적값이 다르고, 논문도 이 값들을 경험적으로 정했다고 밝힌다. 또한 시각 인코딩 단계나 초기 융합에서 이미 시각 정보가 유실된 환각은 어텐션 헤드 보정만으로 해결되지 않을 수 있으므로, 자체 모델에서 alpha 스윕과 환각 원인 진단을 함께 해야 한다. 향후 과제로 더 적응적인 보정 정책과 모델 학습과의 긴밀한 통합을 제안한다.
관련 논문
- 멀티모달 LLM의 시각-텍스트 정렬 점수는 내용 통합의 증거가 아니라 착시일 수 있다13개 멀티모달 LLM에서 시각 토큰을 가우시안 노이즈로 바꿔도 CKA·SVCCA·MIR 같은 정렬 점수는 거의 변하지 않았다. 공유 MLP 하향 투영이 만든 가짜 정렬을 분리하는 PA 갭을 제안하고, 내부 정렬은 과제 정확도와 함께 읽어야 함을 보인다.
- OLLM의 모달리티 편향과 증거 형태 편향을 분리한 Tri-PvP 벤치마크Tri-PvP는 비전·오디오·텍스트가 충돌하는 8,000개 샘플 벤치마크로, 기존 평가가 뒤섞어 온 양상 편향과 증거 형태 편향을 분리해 측정한다. 5개 OLLM을 평가한 결과 비전 편향과 증거 형태별 비대칭이 드러났다.