OLLM의 모달리티 편향과 증거 형태 편향을 분리한 Tri-PvP 벤치마크

Tri-PvP: Exposing Modality Bias in Omni-Modal Large Language Models through Perceptual-Propositional Evidence Conflicts

HF Daily2609.06011

Yen-Ting Piao, Shu-Yun Chen, Chin-Hui Chu2026-09-05조회 6

무엇인가

옴니모달 대형 언어모델(OLLM)은 한 번의 순전파에서 시각, 청각, 텍스트를 함께 처리한다. 문제는 세 입력이 서로 다른 답을 내놓을 때 모델이 어느 스트림을 믿는가이다. 모달리티 편향이라 불리는 이 성향은 실제 입력이 잡음이거나 상충할 때 모델 신뢰성을 떨어뜨리고, 공격자가 모델이 가장 신뢰하는 모달리티에 유해 콘텐츠를 심는 보안 취약점으로도 이어질 수 있다. 그런데 이 논문은 기존 삼중 모달리티 편향 벤치마크에 구조적 교란이 숨어 있다고 지적한다. 한 모달리티 안에서도 증거의 형태가 두 가지로 나뉘는데, 이를 구분하지 않는다는 것이다. 지각적 증거는 개 사진이나 개 짖는 소리 녹음처럼 직접 감각 경험으로 얻는 신호이고, 명제적 증거는 "이것은 개다"라는 선언적 진술의 내용이다. 기존 설계에서 시각은 압도적으로 자연 이미지(지각적)로, 청각은 실제 녹음과 합성 음성이 뒤섞인 형태로, 텍스트는 구조상 명제적으로 구현된다. 이 비율이 모달리티마다 맞춰지지 않으면 측정된 모달리티 편향은 증거 형태 편향과 뒤엉켜 어느 쪽에서 온 것인지 귀속할 수 없다. 시각 편향처럼 보이는 것이 실은 지각적 증거에 대한 편향일 수 있다.

어떻게 동작하나

이를 풀기 위해 저자들은 Tri-PvP를 제안한다. 이미지와 오디오 채널이 나르는 증거의 형태를 명시적으로 바꾸는 삼중 모달리티 충돌 벤치마크다. 규모는 8,000 샘플이고, 동물, 감정, 환경, 음악 네 개의 일상 지각 도메인을 아우른다. 각 샘플은 x = (x_I, x_A, x_T, x_Q)로 표현되며, x_I는 이미지, x_A는 오디오, x_T는 텍스트, x_Q는 질문이다. 이미지와 오디오는 각각 지각적 형태와 명제적 형태를 가질 수 있고, 텍스트는 인식론적 틀상 항상 명제적이다. 이 조합이 네 가지 증거 유형 조건, 즉 PercI-PercA, PercI-PropA, PropI-PercA, PropI-PropA를 만든다. 구성 방식은 대응 반사실(matched counterfactual)이다. 먼저 라벨 삼중항과 질문을 생성한 뒤, 같은 삼중항을 네 조건 모두에 인스턴스화하고 채널이 같은 증거 형태를 취할 때는 같은 자산을 재사용한다. 따라서 네 조건 비교는 동일한 삼중항 집합 위에서 이루어진다. 도메인마다 500개 삼중항이 있어 각 도메인이 조건별로 500 샘플씩, 도메인당 2,000 샘플, 총 8,000 샘플이 된다. 지각적 증거는 기존 데이터셋의 실제 이미지와 녹음을 가져오되 세 가지 품질 필터를 적용한다. 도메인 내 클래스는 지각적으로 구분되게 골라 분류 난이도와 편향 측정이 뒤섞이지 않게 하고, 샘플마다 도메인 관련 주체를 하나만 두고, 수동 검증으로 모호함이 없음을 확인한다. 명제적 증거는 수작업 문장 템플릿에서 나온 자연어 서술을 이미지에서는 흰 배경 위 텍스트로 렌더링하고, 오디오에서는 GPT-4o mini TTS로 여러 목소리를 써서 합성하고, 텍스트에서는 그대로 쓴다. 질문 설계도 편향 중립을 강제한다. "무엇이 보이나요" 같은 모달리티 특정 표현을 피하고, 미리 정해진 선택지가 응답을 유도하지 않도록 객관식 대신 개방형을 쓰며, 충돌 인정 선택지를 넣지 않는다.

무엇과 다른가

평가 프로토콜은 자유 형식 응답을 여덟 개의 상호 배타적 범주로 분류한다. BIAS_IMAGE, BIAS_AUDIO, BIAS_TEXT, 그리고 두 모달리티에 걸친 BIAS_IMAGE_AUDIO, BIAS_IMAGE_TEXT, BIAS_AUDIO_TEXT, 충돌을 명시적으로 인정하거나 세 모달리티 내용을 모두 보고하면서 결론에 이르지 않은 NO_BIAS, 어느 라벨과도 맞지 않고 충돌도 인정하지 않은 HALLUCINATION이다. 설계상 어느 모달리티도 다른 것보다 신뢰할 만하지 않으므로 NO_BIAS가 적절한 행동이 된다. 판정은 LLM-as-a-Judge로 하며 GPT-5.4 nano를 심판 모델로 쓴다. 저자들이 모델, 도메인, 증거 유형 조건, 편향 유형으로 층화해 800 샘플(10%)을 수동 검증한 결과 일치율은 97.1%였다. 평가 대상은 Qwen2.5-Omni-7B(11B), MiniCPM-o 4.5(9B), Qwen3-Omni-30B-A3B-Thinking(32B), Gemma 4 E4B(8B), Gemini 3 Flash 다섯 모델이고, 오픈소스 모델은 vLLM으로 실행한다. 입력 순서는 이미지, 오디오, 텍스트, 질문 순으로 고정한다.

어떻게 쓰나

주요 결과는 시각 편향의 압도적 우세다. 모델과 증거 유형을 조합한 20개 막대 중 18개에서 BIAS_IMAGE가 지배 라벨이었고, 예외 두 개는 모두 Qwen2.5의 PropI 조건에서 나타나 BIAS_TEXT나 NO_BIAS가 최다가 되었다. BIAS_IMAGE 크기는 흔히 60%를 넘어 시각 스트림이 최종 답을 불균형하게 이끈다는 것을 보여준다. BIAS_AUDIO는 20개 중 18개에서 세 단일 모달리티 편향 중 가장 작았고 대개 10% 미만이었다. 예외 두 개는 Gemma4의 PropA 조건으로, 뒤에 나올 증거 형태 비대칭을 예고한다. 핵심 발견은 증거 형태가 두 비텍스트 모달리티를 반대 방향으로 조절한다는 점이다. Qwen2.5의 BIAS_IMAGE는 PercI-PropA에서 49.7%인데 PropI-PropA에서는 12.7%로 떨어지고, 오디오 편향은 명제적 오디오에서 오히려 올라 Gemma4는 PercI-PercA의 0.9%에서 PercI-PropA의 25.4%까지 치솟는다. 저자들은 이 비대칭이 두 모달리티 인코더의 사전학습 목표 차이를 반영한다고 가정한다. 시각 인코더는 지각적 이미지 내용을 포착하도록 학습되는 반면, 오디오 인코더는 음성에서 언어 내용을 복원하는 ASR 계열 목표로 초기화되는 경우가 많다는 것이다. 각 모달리티에서 더 강한 편향을 유발하는 증거 형태가 그 인코더가 최적화된 신호와 일치한다. 또한 NO_BIAS 응답은 완전 명제적 조건인 PropI-PropA에서 최대로 치솟는다. Qwen2.5 60.1%, MiniCPM 13.6%, Gemini3 11.6%, Gemma4 7.2%, Qwen3 1.5%이며 다른 대부분 조건에서는 10% 미만이다. 명제적 입력만 주어지면 모델이 특정 스트림을 암묵적으로 우선하는 경향이 줄어든다는 뜻이다.

전제와 한계

저자들은 입력 순서와 표현 수준도 더 파고든다. 세 모달리티를 순열로 바꿔도 핵심 결론은 유지된다. 다만 위치 편향은 모델마다 갈린다. Qwen2.5는 질문 바로 앞에 놓인 마지막 모달리티를 일관되게 선호하는 최신성 편향을 보이고, Gemma4는 이미지가 PropI 조건에서는 맨 앞에 있을 때, PercI 조건에서는 맨 뒤에 있을 때 BIAS_IMAGE가 최대가 되는 등 모달리티별로 다른 패턴을 보인다. 텍스트는 대체로 앞에 있을 때 더 의존하고, 오디오의 우선성 경향은 PropI-PropA에서만 나타나 앞자리에서 24.3%를 기록한다. 표현 수준 분석에는 층별 선형 프로빙을 쓴다. 각 층의 마지막 프롬프트 토큰 위치 은닉 상태를 뽑아, 편향 라벨을 모달리티별 이진 타깃으로 분해하고 로지스틱 회귀를 적합해 균형 정확도를 보고한다. 무작위 기준선은 50%다. 이미지 관련 프로브가 두 모델과 모든 조건에서 최상위권이고, Gemma4의 오디오 프로브는 두 PercA 조건에서 무작위 기준선 근처까지 떨어져 출력 단계의 거의 0에 가까운 오디오 편향과 맞아떨어진다. Qwen2.5의 이미지 프로브는 두 PercI 조건에서 약 80% 정확도를 찍어 같은 조건의 출력 수준 이미지 편향 약 50%와 대응한다. 편향 정보는 출력 단계가 아니라 이미 중간 표현에서 선형적으로 디코딩 가능하며, 두 모델 모두 대부분의 프로브가 첫 두 층 안에서 기준선을 넘는다. Gemma4는 중후반 층에서 정점을 찍으며 점진적으로 강해지고, Qwen2.5는 처음 몇 층에서 거의 최종 정확도에 도달한 뒤 거의 개선되지 않아 편향이 인코딩되는 깊이가 모델마다 다르다.

완화 실험으로 저자들은 대조 디코딩(contrastive decoding)을 진단적 개입으로 차용한다. 각 디코딩 단계에서 같은 모델로 두 개의 다음 토큰 로짓 분포를 계산한다. 전체 삼중 모달 입력에서 얻은 z_full과, 이미지와 텍스트 스트림을 제거한 z_audio다. 대조 로짓은 z_cd = (1+α) z_audio − α z_full로 정의하고 α = 0.5를 쓴다. 목표는 충돌 상황에서 NO_BIAS 응답 비율을 높이는 것이므로, 전체 입력 분포 자체를 편향된 기준으로 보고 가중치를 낮춘다. 어떤 입력에서도 그럴듯하지 않은 토큰이 음수 계수로 승격되지 않도록 β = 0.1의 적응적 타당성 제약을 적용한다. 이미지 편향이 가장 두드러진 Gemma4로 실험한 결과, 네 조건 모두에서 이미지 편향이 크게 줄었다. 가장 큰 절대 감소는 PropI-PropA의 74.9%에서 38.8%, PropI-PercA의 74.4%에서 39.6%다. NO_BIAS 비율은 네 조건 모두에서 올라 PropI-PropA에서 7.2%에서 38.6%로 가장 크게 증가했다. 다만 부작용도 있다. z_audio를 증폭해도 이미지 편향이 오디오로 재분배되지 않고, 밀려난 질량의 일부가 텍스트 편향으로 표면화한다. 증가폭은 PropI-PropA의 2.2%에서 PercI-PropA의 13.5%까지 네 조건 모두에서 일관되며, 대조 디코딩을 적용해도 BIAS_AUDIO는 모든 조건에서 여전히 최소 편향 범주다. 일반 옴니모달 역량 훼손 여부는 OmniBench로 확인했는데, Gemma4에서 대조 디코딩이 37.4% 정확도로 미수정 디코더의 38.4%와 비슷해 큰 성능 저하 없이 편향이 줄었음을 보인다.

개발자 관점에서 이 논문이 주는 실무적 신호는 명확하다. 이미지, 오디오, 텍스트를 함께 받는 어시스턴트를 만들 때 세 입력이 어긋나는 상황은 드물지 않고, 이때 모델은 대개 이미지를 믿는다. 특히 이미지가 사진처럼 지각적일 때 그 경향이 강해지므로, 오디오에 담긴 비언어적 단서(환경음, 감정 표현, 음악)에 의존하는 기능을 설계한다면 모델이 그 단서를 실제로 반영하는지 별도로 검증해야 한다. 반대로 이미지 안에 텍스트가 박혀 있는 형태(스크린샷, 문서 사진)를 쓰는 파이프라인에서는 증거 형태가 바뀌면서 편향 강도가 달라진다는 점을 감안해야 한다. 또 하나 실무적으로 중요한 지점은 입력 순서다. Qwen2.5처럼 마지막에 놓인 모달리티를 선호하는 모델에서는 프롬프트 내 모달리티 배치만 바꿔도 답이 흔들릴 수 있으므로, 순서를 고정하고 회귀 테스트를 두는 편이 안전하다. 마지막으로 편향이 초기 은닉 상태에 이미 선형적으로 드러난다는 결과는, 프롬프트 문구를 다듬는 수준의 대응이 근본적 해결이 되기 어렵다는 것을 시사한다. 대조 디코딩 같은 추론 시점 개입도 이미지 편향을 줄이는 대신 텍스트 편향을 남기고 추가 순전파 비용을 요구한다.

저자들이 밝힌 한계도 분명하다. 벤치마크가 일상적 지각 스케일에만 한정되어 있어, 복잡한 도표나 과학 데이터처럼 더 넓은 인식론적 스케일의 멀티모달 충돌에서 모델이 어떻게 행동하는지는 알 수 없다. 질문 설계도 의도적으로 편향 중립이어서, 모든 출처를 나열하라고 요구하거나 단일 답을 강제하거나 출처 신뢰도 단서를 주는 비중립 지시 아래에서 선호가 어떻게 바뀌는지는 별개의 연구 문제로 남긴다. 완화 실험 역시 진단적 테스트로서 단일 모델에 고정된 α와 β로만 수행되었고, 계수 민감도 분석과 더 넓은 모델 평가는 향후 과제다. 대조 디코딩은 잔여 텍스트 편향을 유발하고 이미지와 텍스트 스트림을 제거한 로짓을 계산하기 위한 추가 순전파가 필요해 계산 비용이 더 든다. 저자들은 표면적 개입을 넘어선 더 근본적인 완화 전략과 표현 수준의 인과 분석이 필요하다고 결론짓는다.

관련 논문