질문 상태 릴레이 교정으로 오디오비주얼 LLM의 출처 혼동 환각을 줄인다
Devils in Question Relay: Source-Conditioned Relay Steering to Mitigate Hallucinations in Audio-visual Large Language Models
무엇인가
오디오비주얼 대규모 언어모델(AVLLM)은 영상·음성·텍스트를 함께 받아 추론하지만, 질문이 특정 모달리티를 근거로 요구했는데도 쓰이지 않은 다른 모달리티의 단서가 답을 끌어가는 실패를 보인다. 논문은 이를 출처 혼동 그라운딩 환각(source-confused grounding hallucination)이라 부른다. 예를 들어 화면에 피아노가 보이기만 해도, 오디오에 사람 말소리밖에 없는데 모델이 피아노 연주를 들었다고 답하는 식이다. 기존 완화 기법들은 추론 시점 보정 디코딩이나 학습 시점 정렬에 의존했지만, 이 실패가 내부 교차모달 상호작용에서 어떻게 발생하는지는 충분히 규명되지 않았다는 것이 저자들의 문제의식이다.
어떻게 동작하나
저자들은 먼저 세 단계 진단을 수행한다. 첫째, Qwen2.5-Omni-7B에 질문 텍스트만 주고 요구 모달리티를 분류시켰더니 99.85%를 맞혔다. 즉 모델은 무엇을 근거로 답해야 하는지 알고 있으며, 실패는 질문 이해의 문제가 아니다. 둘째, 어텐션 경로 절단(path cutting) 분석으로 소스 충실(source-faithful) 사례를 조사한 결과, 요구 모달리티 토큰에서 질문 토큰으로 가는 경로 X_r→X_Q를 끊었을 때 정답 확률 하락이 X_r→X_G(생성 위치)나 X_r→X_r̄보다 가장 컸다. 질문 토큰 위치의 은닉 표현, 즉 질문 상태(question state)가 정답 예측을 위한 중계 역할을 한다는 뜻으로 저자들은 이를 질문 릴레이(question relay)라 명명한다. 셋째, 방해 모달리티에서 질문 상태로 가는 경로 X_r̄→X_Q를 끊으면 로짓 렌즈로 측정한 목표 객체 점수가 모든 테스트 레이어에서 90% 이상의 사례에서 낮아졌고, 같은 개입을 생성 위치에 적용한 Generation Cut보다 질문 상태에 적용한 Question Cut이 레이어 10~20 전 구간에서 더 큰 정답 로짓 회복(ΔLogit)을 보였다. 방해 단서가 요구 근거와 나란히 질문 상태로 유입되어 답을 오염시킨다는 진단이다.
무엇과 다른가
이 진단 위에 제안하는 SECRET(Source-Conditioned Relay Steering)은 재학습이 필요 없는 추론 시점 기법이다. 먼저 질문 텍스트만으로 AVLLM에 요구 모달리티 r̂∈{A,V}를 예측시킨다. 이어 두 개의 어텐션 마스크를 만든다. 양성 마스크 M+는 방해 모달리티 X_r̂̄에서 질문 토큰 X_Q로 가는 경로를 끊고 요구 모달리티 경로는 보존하며, 음성 마스크 M−는 반대로 요구 모달리티 경로를 끊고 방해 모달리티 경로를 보존한다. 인코딩된 입력을 파라미터를 공유하는 세 개의 병렬 브랜치(원본, 양성, 음성)로 처음 L1개 트랜스포머 레이어에 통과시켜 질문 상태 H_Q, H_Q+, H_Q−를 얻는다. 각 질문 위치 i에 대해 토큰별 차이 Δh_i = h_i+ − h_i−를 계산하고, 원래 상태의 L2 노름에 맞춰 스케일한 뒤 더한다: h̃_i = h_i + (‖h_i‖₂/‖Δh_i‖₂)·Δh_i. 이렇게 교정된 질문 상태를 원본 브랜치의 오디오·비디오 상태와 원래 토큰 순서대로 합쳐 남은 L2개 레이어로 답을 생성한다. 스티어링은 프리필 단계에서만 적용되고, 이후 자기회귀 생성은 갱신된 시퀀스로 캐시된 키·값을 사용한다. 입력 자체를 변형하거나 모달리티를 제거하는 기존 방식과 달리 오디오비주얼 컨텍스트를 그대로 보존한다는 점이 차이다.
어떻게 쓰나
실험은 AVHBench의 Video-Driven Audio Hallucination과 Audio-Driven Video Hallucination(총 3,426개 질의응답 쌍), CMM의 visual-dominance와 audio-dominance(총 800문항)에서 수행했다. 백본은 VideoLLaMA2-AV, Qwen2.5-Omni-7B, Qwen3-Omni-30B-A3B 세 종이며, 비교 대상은 학습이 필요 없는 VCD, AVCD, MAD다. SECRET은 베이스 모델 대비 CMM에서 최대 18.0%p, AVHBench에서 최대 7.1%p 전체 정확도를 끌어올렸고, 세 백본 모두에서 두 벤치마크의 평가 대상 기법 중 최고 전체 정확도를 기록했다. 향상 폭은 요구 모달리티에 따라 갈렸는데, VideoLLaMA2-AV-7B와 Qwen2.5-Omni-7B는 오디오 요구 과제에서, Qwen3-Omni-30B-A3B는 비디오 요구 과제에서 더 큰 이득을 봤다.
전제와 한계
추가 분석도 구체적이다. 생성 위치에 개입하는 Gen-Interv.와 모달리티 제거로 대조를 만드는 Removal-Interv.보다 SECRET이 두 모델 모두에서 우수했고, 노름 정합을 뺀 w/o Norm 변형은 정확도가 떨어져 정규화 항의 기여를 확인했다. 스티어링 깊이 L1을 21~25 사이에서 바꿔보면 VideoLLaMA2-AV는 L1=21에서 89.3%, Qwen2.5-Omni-7B는 L1=25에서 86.4%로 최고였는데, 두 모델 모두 양성·음성 질문 표현 간 코사인 유사도가 가장 낮은 깊이와 최적 깊이가 일치했다. 즉 대조 신호가 더 분리될수록 스티어링 정보량이 커진다는 해석이다. 불일치 오디오-비디오 입력에서 특정 모달리티만 묘사하게 하는 개방형 캡셔닝 과제에서는 T-CIDEr를 경쟁력 있게 유지하면서 D-CIDEr가 가장 낮고 LLM-score가 가장 높았다. CMM 세부 평가에서는 정답 로짓에서 오답 로짓을 뺀 answer margin의 평균·중앙값이 모두 상승했고, 가장 긴 구간(14~16초)에서 VideoLLaMA2-AV가 14.7%p 향상을 보이는 등 긴 클립에서도 이득이 유지됐다.
실무 관점에서 이 논문이 주는 시사점은 명확하다. 영상과 음성을 동시에 받는 모델에 "오디오만 보고 답하라" 같은 조건을 걸어 쓰는 파이프라인이라면, 실패 원인이 질문 이해가 아니라 질문 토큰 상태로 새어 들어오는 방해 모달리티 신호라는 점을 먼저 확인해야 한다. SECRET은 가중치를 건드리지 않고 프리필 단계에서 어텐션 마스크 두 개와 상태 보정만 추가하는 구조라, 기존 서빙 스택에 추론 시점 플러그인으로 얹기 쉬운 편이다. 다만 요구 모달리티 예측을 모델 자신에게 맡기고, 최적 스티어링 깊이 L1이 백본마다 다르다는 점은 도입 시 반드시 자체 검증해야 할 항목이다.
한계와 전제도 짚어둘 만하다. 논문은 별도의 한계 절을 두지 않았고, 윤리 진술에서 이 분석이 안전 필터가 우회될 수 있는 취약점을 드러낼 수 있다는 점을 인정한다. 방법 자체는 요구 모달리티 식별이 정확하다는 전제 위에 서 있으며(측정치는 99.85%지만 100%는 아니다), L1과 L2 같은 레이어 구간 선택이 모델별 튜닝을 요구한다. 평가도 AVHBench와 CMM 두 벤치마크, 세 개 백본에 한정되어 있어 다른 모달리티 조합이나 더 긴 영상, 다른 언어권 입력에서의 거동은 원문에 수치가 제시되지 않았다.