교차모달 어텐션의 주파수 필터가 장황한 프롬프트로 VLM의 손상 견고성을 높인다
Cross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models
무엇인가
이 논문이 다루는 문제는 비전-언어 모델(VLM)이 이미지 손상 앞에서 조용히 무너진다는 것이다. 휴대폰 스냅샷, JPEG 스캔, 저해상도 비디오 프레임 같은 일상적 입력에서 VLM은 잘못된 답을 내면서도 실패를 알리지 않는다. 저자들은 여기서 질문 문구가 견고성에 서로 반대 방향으로 작용한다는 관찰을 제시한다. "고양이가 있나요?"를 "잘 살펴보고 답해 주세요: 고양이가 있나요?"처럼 늘어놓으면 손상에 대한 흔들림이 줄어들고, 반대로 "의자 왼쪽에 있는 컵은 무슨 색인가요?"처럼 의미적으로 복잡하고 세밀한 질문은 더 취약해진다. 기존 프롬프트 민감도 연구는 이런 어휘적 잉여를 제거해야 할 잡음으로 취급했지만, 이 논문은 같은 의미 내용을 바이트 단위로 고정한 미러 설계로 항목 수준에서 부호가 반대인 두 힘을 분리해낸다.
어떻게 동작하나
핵심 도구는 질문 조건부 주파수 필터 W_t(ω)다. 텍스트 질의 토큰에서 비전 토큰으로 향하는 교차모달 어텐션을 헤드와 텍스트 위치에 대해 평균하면 디코더 어텐션 레이어마다 하나의 2D 공간 맵 a_t(I)가 나온다. 이 맵에 2D 이산 푸리에 변환을 적용하고 제곱 크기를 방사형으로 등간격 B개 밴드에 binning한 뒤 L1 정규화하면, 이미지 스케일(주파수)에 대한 확률 분포가 된다. 밴드 수는 B = ⌈0.6√N⌉로 자동 결정되며 Qwen3-VL의 12×16 GQA 패치 그리드에서 B=7, CLEVR 그리드에서 B=9다. 분포의 모양은 역참여비 G(t) = 1/Σ_ω W_t(ω)²로 요약하는데, 값이 1이면 한 밴드에 몰린 협대역, B에 가까우면 균일한 광대역이다.
무엇과 다른가
손상 쪽은 별도로 특성화한다. 원본 이미지와 손상 이미지의 픽셀 차이를 그레이스케일로 바꿔 2D DFT를 취하고 방사형 전력 스펙트럼으로 평균낸 ΔF(ω)_p가 손상의 주파수 서명이다. 이는 모델도 프롬프트도 필요 없는 손상 자체의 속성이다. 두 분포를 같은 밴드에 맞춰 내적한 S_pred(t,p) = Σ_ω W_t(ω)ΔF(ω)_p가 논문의 예측 법칙이다. 프롬프트가 신경 쓰는 대역과 손상이 흔드는 대역이 겹칠수록 답이 더 흔들린다는 것이다. 의미 복잡도는 C_sem = E + A + R + O + D + ln(1+G_amb)로 점수화하고(엔티티, 속성, 관계, 추론 연산자, 프로그램 깊이, 지시 표현 모호성), 프롬프트 길이는 불용어 제거 후 내용 토큰 수 C_prompt로, 선택지 난이도는 H_opt로 따로 측정한다. 자연 질문에서 C_sem과 C_prompt가 상관되므로 Frisch–Waugh–Lovell 정리로 C_sem을 C_prompt에 회귀한 잔차 C_res를 써서 두 기울기를 분리한다. 결과 변수는 부호 있는 드리프트가 아니라 같은 질의의 깨끗한 기준선 대비 이동량, 즉 변동성 Vol = E_p[|Δ_t|]다.
어떻게 쓰나
실험은 이미지당 8개 질문을 만드는 미러 설계를 쓴다. L1~L4는 점점 세밀해지는 간결한 추론 질문(객체 존재 Y/N, 속성 MCQ, 공간 관계 Y/N, 속성과 공간 제약을 결합한 조합 MCQ)이고, L5~L8은 L1~L4의 의미 원자를 바이트 단위로 보존한 채 C_prompt만 부풀린 장황한 미러다. L4는 L2의 속성 범주와 선택지 집합, 정답 레이블을 재사용해 관계 연산자 추가만 분리한다. 손상 뱅크는 기하·광도·가림·스펙트럼 4범주 21개 연산자를 심각도 1, 2, 3으로 적용해 이미지당 78개 슬라이스를 만든다. 모델은 Qwen3-VL-2B-Instruct와 Qwen3-VL-8B-Instruct, 데이터셋은 GQA와 CLEVR로 2×2 격자를 돌리고 셀당 500 샘플, 총 312,000개 스코어링 행과 런당 500개 이미지 클러스터를 얻는다. 별도로 LLaVA-OneVision-0.5B에서 교차 아키텍처 확인도 한다.
전제와 한계
이미지 고정효과 회귀에서 표준화 부분 기울기는 네 런 모두 β~_Cres > 0, β~_Cprompt < 0로 나온다. 의미 복잡도는 불안정하게, 프롬프트 길이는 안정적으로 작용하며 R²는 0.18에서 0.76 사이다. 312,000개 행에 대한 클러스터 강건 회귀에서도 β_Csem > 0이 p ≤ 10^-6, β_Cprompt < 0이 p ≤ 10^-64 수준이다. 미러 쌍별 드리프트 분산비는 0.19~0.76 범위이고 16개 셀 중 14개에서 1보다 작다. 8B 모델에서는 장황한 바꿔쓰기가 드리프트 분산을 70~81% 줄인다(CLEVR-8B 평균비 0.19, GQA-8B 0.30). 이 효과가 로그 확률 스케일의 착시가 아님을 보이기 위해 세 가지 스케일 불변 검사를 제시한다. 깨끗한 이미지에서 장황한 프롬프트는 정답 로그 확률을 중앙값 11 nats 올리지만 최선의 오답은 덜 올려 정답 대 오답 마진을 약 5 nats 넓히고(16개 셀 중 15개), 손상 하 결정 뒤집힘률은 16개 중 12개 셀에서 평균 24% 줄며, 같은 셀에서 손상 하 정확도가 평균 1.5%p, 조합 과제인 L4/L8 쌍에서는 최대 5.8%p 오른다.
메커니즘 검증은 필터 모양과 손상 대역의 상호작용을 본다. 협대역 W_t가 광대역 W_t보다 평균 변동성이 높은 행이 16개 중 9개이고, CLEVR-2B와 GQA-8B에서는 4개 행 모두에서 그렇다(각각 46%, 70% 높음). CLEVR-8B는 회복 우세 때문에 4개 행이 모두 뒤집히고 GQA-2B는 사실상 동률이다. 손상 분포는 전체 관측의 약 76%가 저주파, 16%가 중간, 4%가 고주파, 4%가 광대역이며 평균 변동성은 저주파와 중간에서 가장 크고 고주파에서 가장 작다. 필터 W_t 자체가 최고 주파수 대역에 질량의 3~5%만 두기 때문에 고주파 손상이 가장 덜 해롭다는 설명이 나온다. 디코더 깊이에 따른 대역폭 궤적은 네 단계다. 0번 레이어는 길이 사전확률, 초기 레이어는 그 사전확률의 소거, 중간 레이어는 C_sem에 의한 협소화, 후반과 마지막에서 두 번째 레이어는 장황함에 의한 광대역화다. 광대역화 정점은 2B에서 마지막 어텐션 레이어, 8B에서 약 16번째 레이어다. 파라미터 없이 계산한 중첩 법칙은 네 런 모두에서 양의 상관을 보이며 그룹화 피어슨 r은 0.26(GQA-2B)에서 0.42(CLEVR-8B), 셀별 중앙값 r은 0.16~0.46, 양의 비율 62~72%다. LLaVA-OneVision-0.5B에서는 그룹 r = +0.343으로 다른 VLM 계열에서도 재현된다.
실무적 함의는 단순하다. 저자들이 말하는 처방은 프롬프트를 채우라는 것이다. 같은 질문에 정중한 군더더기를 붙이는 것만으로 손상 하 정확도가 측정 가능하게 오르고, 특히 선택지가 여러 개인 조합 과제에서 이득이 크다. 반대로 세밀한 공간·속성 추론을 요구하는 질문은 손상에 더 취약해지므로, 그런 태스크에서는 입력 화질 관리나 손상 유형별 점검이 필요하다. 또 하나 주목할 점은 고주파 노이즈가 가장 어려운 손상이라는 통념이 이 분석에서는 뒤집힌다는 것이다. 실제 손상의 대부분은 저주파이고 필터도 최고 주파수 대역에 거의 질량을 두지 않으므로, 견고성 평가를 설계할 때는 저주파·중간 주파수 손상(모션 블러, JPEG 압축, 밝기 변화 등)을 중심에 놓아야 한다. 다만 이득의 크기는 과제 유형에 따라 다르고, Y/N처럼 선택지가 두 개뿐인 문항에서는 천장 효과 때문에 효과가 작다는 점을 감안해야 한다.
저자들이 밝힌 한계는 다음과 같다. 결과는 Qwen3-VL-2B와 8B, GQA와 CLEVR에 국한되며 교차 계열 재현은 자연스러운 확장 과제다. LLaVA-OneVision-0.5B에서의 단일 조건 확인은 대역폭 궤적, 중첩 법칙, 컷오프, 주변 C_sem 예측이 모두 재현됨을 보이지만 범위가 좁다. 일부 검증은 8B에서만 깨끗하게 성립하고(부호 있는 드리프트는 회복 우세 아래 CLEVR-8B에서 실패), 중첩 법칙은 CLEVR에서, 컷오프 법칙은 GQA에서 더 깨끗하다. W_t(ω)는 어텐션 점수에서 읽어낸 것으로 인과적 필터의 상관적 하한이며, 장황한 미러는 프로그램적으로 생성된 것이므로 사람이 판단한 바꿔쓰기로의 확장이 남아 있다. L4 대 L1 효과 크기는 중간 수준(Cohen's d 0.45~0.77)이다.