MoE 라우팅 확률로 VLM의 없는 객체 질문을 생성 전에 걸러낸다

From Routing Signals to Selective Review: Visual regrounding in MoE VLMs

arXiv2609.38111v1

Hongzhu Guo2026-09-29조회 3

무엇인가

이 논문이 겨냥하는 실패는 VLM이 거짓 시각적 전제를 그대로 받아들이는 현상이다. 이미지에 개가 없는데도 "개의 색은 무엇인가"라는 질문에 그럴듯한 색을 답한다. 질문이 객체의 존재 여부가 아니라 속성을 요구하기 때문에 모델은 전제를 검증하지 않고 답을 만들어내고, 결과는 유창해 보여서 놓치기 쉽다. 저자들은 이를 target-absence grounding failure라고 부른다. 기존 검출기는 생성된 응답, 은닉 상태, 불확실성 측정에 주로 의존했지만, MoE VLM은 층마다 라우터가 토큰을 일부 전문가에게 배정하면서 계산이 어떻게 배분됐는지에 대한 구조적 기록을 이미 남긴다. 이 기록이 생성 이전에 시각적 근거의 유무를 드러내는지가 논문의 출발점이다.

어떻게 동작하나

방법은 추출, 검출, 개입의 세 단계다. 먼저 동결된 규칙 기반 추출기로 질문에서 목표 명사구를 찾고, 토크나이저가 이를 멀티모달 시퀀스의 서브토큰 위치로 매핑한다. 추론 시점에 정답 객체 주석은 쓰지 않는다. 표준 프롬프트 prefill 과정에서 라우터의 사전 선택 확률 분포 softmax(W_l 곱하기 h)를 해당 목표 스팬 전체에 대해 평균 내고, 이를 층별로 이어 붙여 하나의 벡터로 만든다. Top-k 전문가만 실제로 실행되지만 이 벡터는 전체 전문가 확률을 보존한다. Qwen3-VL-30B-A3B-Instruct의 경우 층 48개, 전문가 128개, k=8이라 입력 하나당 6,144차원이 나온다.

무엇과 다른가

이 벡터 위에 모델별로 L2 정규화 선형 프로브를 따로 학습시킨다. 정보 누출을 막기 위해 표준화는 학습 분할 통계만 사용하고 검증·테스트·외부 데이터에는 같은 값을 동결해 적용한다. 프로브는 이진 교차엔트로피로 학습하고, 정규화 강도는 검증 ROC-AUC로, 결정 임계값은 검증 균형 정확도로 고른다. 임계값을 넘으면 해당 입력에만 목표 인지 검토 프롬프트를 덧붙여 같은 이미지와 질문으로 다시 생성하고, 넘지 않으면 표준 응답을 그대로 쓴다. 모델 가중치나 라우터 파라미터는 전혀 수정하지 않는다. 선형 형태라서 어떤 층-전문가 좌표가 판정에 기여했는지 직접 읽어낼 수 있다는 점도 설계의 일부다.

어떻게 쓰나

검출 성능은 GQA-Inpaint 동결 테스트 분할에서 Qwen 0.9988, Gemma 0.9956 ROC-AUC를 기록했고 정확도는 각각 98.54%, 96.68%였다. 외부 OBER 데이터셋에서는 0.8095와 0.7781로 순위 신호가 유지됐다. 라벨을 섞은 대조 실험에서 Gemma 프로브는 0.515±0.062로 우연 수준에 머물렀다. 목표 토큰 표현 베이스라인과 비교하면 입력 임베딩은 우연 수준이었고, 층 전체 평균 은닉 상태는 0.9979 ROC-AUC와 98.06% 정확도로 근접했으며, 라우팅이 소폭 앞섰다. 특징을 상위 500개로 줄여도 0.9984로 6,144개 전체의 0.9988에 거의 도달했다.

전제와 한계

개입 효과는 더 크다. 목표 인지 검토를 걸면 Qwen은 GQA에서 66.75%에서 89.00%로, OBER에서 83.39%에서 95.57%로 올랐고, Gemma는 80.00%에서 93.42%, 93.91%에서 95.30%로 개선됐다. Qwen의 향상폭은 다섯 번 실행 모두 양수로 +22.25±0.23%p, +12.17±0.81%p다. 항상 검토하는 정책과 비교하면 GQA에서 89.00% 대 86.25%, OBER에서 95.57% 대 95.30%로 선택적 검토가 앞서면서도 각각 49.58%, 16.09%의 검토 호출을 아꼈다. 트리거된 부재 이미지만 보면 Qwen의 OBER 정확도가 66.49%에서 95.79%로, Gemma는 93.10%에서 100%로 올랐다.

분석 결과 신호의 위치도 드러난다. 전체 프로브에서 절대 계수가 큰 상위 8개 전문가 중 4개가 2층에 몰려 있었고, 가장 큰 계수조차 전체 절대 계수 합의 0.164%에 불과해 여러 전문가에 넓게 분산돼 있었다. 층별로 따로 프로브를 학습시키면 1층이 처음으로 검증 ROC-AUC 0.90을 넘고, 2층 단독으로 128개 특징만으로 테스트 ROC-AUC 0.9836과 정확도 94.33%를 낸다. 목표 부재 정보가 이른 MoE 층에서 읽히며, 라우팅에 담긴 시각적 증거와 최종 답변 사이에 간극이 있다는 것이 저자들의 해석이다.

실무 관점에서 이 방법의 값어치는 추가 비용 구조에 있다. 점수는 표준 prefill에서 이미 만들어진 라우팅으로 계산되므로, 트리거되지 않은 입력은 기존 디코딩 경로를 그대로 간다. 추가 전방 패스는 트리거율에 비례해서만 발생한다. 다만 GQA에서 고른 임계값이 OBER에서 그대로 작동하지 않아 데이터셋이 바뀌면 재보정이 필요하다. 잘못 트리거됐을 때의 대가도 프롬프트에 따라 다르다. 목표 인지 검토는 처음 맞았던 Qwen 답변 405개 중 32개(7.90%)를 틀리게 만들었고 일반 검토는 4개(0.99%)만 망가뜨렸다. Gemma는 188개 중 각각 15개(7.98%)와 10개(5.32%)였다. 검출 임계값과 검토 프롬프트를 함께 골라 개입 위험을 조절하라는 것이 저자들의 권고다.

한계도 분명하다. 데이터셋 간 임계값 이동 때문에 순위 신호는 잘 전이되지만 고정 결정 임계값은 그렇지 않다. 부정 트리거 비용을 측정한 GQA 하위 집합은 이미지 2장에 답변 5개씩뿐이라 데이터셋 수준 위험의 근거로는 약하다고 저자들 스스로 밝힌다. 선형 프로브의 가중치는 조건부 예측 기여도일 뿐 특정 전문가의 인과적 중요도가 아니며, 전문가 확률이 층 안에서 상호 상관돼 있어 계수 크기만으로 해석하면 안 된다. 또한 목표 인지 검토가 부재 답변은 더 많이 고치지만, 존재 객체가 트리거됐을 때 더 많은 피해를 낸다는 교정과 피해의 맞교환도 남는다.