OmniConfess가 토큰별 채널 의존도를 캐내 옴니모달 환각을 줄인다
OmniConfess: Eliciting Token Confessions to Mitigate Omni-Modal Hallucination
무엇인가
옴니모달 대형언어모델(OmniLLM)은 텍스트·이미지·오디오·비디오를 하나의 생성 모델로 묶지만, 생성이 잘못된 증거에 의존하면 환각이 발생한다. 기존 추론 시점(inference-time) 기법들은 환각을 줄이기는 해도 어떤 증거가 특정 생성 내용을 떠받치고 있는지는 잘 드러내지 못한다. 저자들은 환각 억제가 최종 출력의 정답 여부뿐 아니라 각 생성 커밋먼트를 지지하는 증거까지 함께 평가해야 하는 문제라고 규정한다. 논문은 이를 세 가지 난점으로 정리한다. 증거 개입 후 재생성하면 자기회귀 문맥이 바뀌어 증거 효과와 시퀀스 차이가 뒤섞이는 궤적 변동성, 채널들이 얽혀 개별 토큰에 대한 채널 기여가 흐려지는 교차 채널 의존성, 그리고 채널 안에서도 토큰마다 의존도가 달라 전역·모달리티 수준 점수로는 수정 대상을 집어내기 어렵다는 점이다.
어떻게 동작하나
제안 방법 OmniConfess는 학습이 필요 없는 추론 시점 환각 교정 기법으로, 세 단계로 구성된다. 첫째, 커밋먼트 앵커링(Commitment Anchoring)은 후보 응답을 생성한 뒤 고정하고, 자기회귀 디코딩 중 선택 토큰의 로그확률 벡터를 기록해 전체 시야(full-view) 점수로 삼는다. 이후 증거를 바꿔도 후보와 그 접두부는 얼려 두고 재채점만 하므로, 증거 조건 간 토큰 비교에서 궤적 변동이 제거된다. 둘째, 증거 심문(Evidence Interrogation)은 채널 m을 제거한 입력 X^{-m}에 대해 고정된 후보와 대안 토큰을 다시 채점한다. 후보 대비 대안의 마진 F_i, 채널 제거 시의 토큰 의존도 δ_i^(m), 마진 기여 κ_i^(m)을 계산하고, 질문·토큰·채널 축으로 정리한 구조적 '자백(confession)'을 만든다. 이때 각 항목은 정렬·과소의존·과대의존·지배적 의존 상태로 라벨링되고, 채널별 기여를 더한 대리 마진으로 잔여 선호, 관련 증거, 무관 증거 성분을 분리한다. 셋째, 자백 유도 교정(Confession-Guided Correction)은 판단 과제에서 후보 클래스 점수만 γ만큼 조정해 최종 판단을 다시 고르고, 자유 생성 과제에서는 세 가지 자백 신호를 합쳐 토큰별 수정 위험도 ρ_i를 구한 뒤 임계값을 넘는 토큰을 단어 경계로 확장·병합해 수정 구간만 원래 증거와 자백을 조건으로 재생성한다.
무엇과 다른가
사전 분석에서 저자들은 환각 샘플의 증거 의존성이 앞쪽에 몰려 있고(정규화 위치 기준 첫 1/3 구간이 의존 질량의 49.8%를 차지), 채널 간 방향이 이질적이며, 상위 20% 토큰이 평균 82%의 의존 질량을 담는다는 세 가지 성질을 제시한다. 이것이 고정 후보 앵커링, 채널별 개입, 토큰 단위 재채점이라는 설계의 근거다.
어떻게 쓰나
평가는 6개 공개 데이터셋에서 뽑은 3,540개 난이도 높은 예시로 구성한 OmniHalluBench에서 이뤄졌다. 판단 과제는 CMM(오디오·비주얼·텍스트), PhD(이미지·텍스트), PubMedQA(텍스트), 자유 생성 과제는 AVHBench, HaloQuest, RAGTruth다. 백본은 Qwen2.5-Omni-7B(기본), Qwen3-Omni-30B-A3B, Nemotron-3-Nano-Omni-30B이고, 비교 대상은 검색 기반(SC, GD, PD, ToT), 증거 대조 기반(VCD, AVCD, CAD, MAD), 세밀 단위(DoLa, OPERA) 기법과 베이스 모델이다. Qwen2.5-Omni-7B에서 OmniConfess는 6개 데이터셋 전 지표에서 모든 베이스라인을 앞섰다. PHD와 CMM의 F1은 최강 베이스라인을 각각 10.20점, 9.35점 초과했고, RAGTruth의 Token-F1은 16.84점, PubMedQA의 F1은 2.02점 올랐다.
전제와 한계
모듈 제거 실험에서 전체 평균 F1은 71.63이었고, 앵커링·심문·교정을 각각 빼면 67.06, 63.96, 58.66으로 떨어져 교정 제거의 타격이 가장 컸다. 앵커링 비교에서는 앵커 없음 56.73, 공유 접두부 앵커링 59.00, OmniConfess 65.10으로 평균 F1이 올랐고, 환각 위치 탐지 AUPRC도 47.28, 58.20, 66.38로 개선됐다. 증거 심문 전략 비교에서는 채널별 자백이 F1 82.15, PhD-Index 84.01로 앞섰고, YES·NO 재현율 격차를 나타내는 Recall Balance는 86.49로 풀링 증거 78.16, 전체 시야 신뢰도 61.69, 베이스 모델 48.84를 크게 웃돌았다. 동일한 교정 예산에서 자백 유도 수정은 신뢰도 유도 수정보다 F1 +8.92 대 +3.95, GAVIE-Acc +1.49 대 +0.58로 더 큰 이득을 냈다. 생성 품질을 GPT-4o와 인간 전문가가 7개 차원으로 교차 평가한 결과 OmniConfess는 Overall 88.7, Evidence Grounding 86.7, Factual Correctness 92.0, Uncertainty Calibration 82.1을 기록해 최강 베이스라인을 각각 5.4, 6.9, 18.3점 앞섰다. 백본 이식성에서는 Dense, MoE, Hybrid 세 구조에서 각 베이스 모델 대비 평균 F1을 10.30, 6.34, 7.50점 올렸다.
개발자 관점에서 이 방법의 실질적 가치는 환각을 줄이는 것과 함께 '어느 채널의 증거가 문제인지'를 토큰 단위로 보고한다는 점이다. 판단 과제에서는 클래스 점수 보정만으로, 자유 생성에서는 수정 구간 재생성만으로 개입하므로 모델 가중치를 건드리지 않고 파이프라인에 얹을 수 있다. 다만 비용을 확인해야 한다. PHD 추론 시간은 베이스 2.23초에서 5.43초로, 오디오·비주얼 CMM은 20.64초에서 35.14초로 늘었다. CMM이 24.6토큰만 생성하는데도 지연이 커진 것은 출력 길이보다 채널별 증거 재채점 반복이 원인이다. 검색 기반 기법 대비 생성 토큰은 PHD와 CMM에서 각각 약 27배, 22배 적지만 추론 시간은 6.4배, 1.1배만 줄었다. AVHBench에서는 생성 토큰이 569.5에서 164.1로, 시간이 36.15초에서 7.93초로 감소했다.
저자들이 밝힌 한계는 지연 시간이다. 후보를 앵커링해 생성 비용은 억제되지만, 멀티모달 증거 심문 자체가 일부 과제에서 상당한 지연을 유발한다고 명시한다. 또한 방법은 과제별 채널 관련성 규칙 r_m(Q,T)과 임계값, 수정 예산 같은 하이퍼파라미터에 의존하며, 실험은 4대의 NVIDIA A40 GPU에서 수행됐다. 코드와 벤치마크는 공개돼 있다.