AnswerMap이 VLM 답변 확률로 이미지 근거 지도를 만든다
AnswerMap: Faithful Spatial Interpretability of VLMs from Answer Posteriors
무엇인가
VLM이 시각 질의에 답할 때 자연스러운 확인은 공간적이다. 그 답이 이미지 어디에서 나왔는가. 기존 해석 도구는 세 갈래인데 각각 구조적 한계가 있다. 텍스트 근거는 답과 같은 출력 헤드에서 나오지만 모달리티가 어긋나 있어 명시적 영역을 지목하지 못하고 이미지에 대해 검증할 수 없다. 어텐션·그래디언트 같은 내부 read-out은 모달리티는 맞지만 답이 생성되는 지점보다 네트워크 앞단에서 나오고, 그 값과 최종 출력의 관계가 불분명하며, 질량이 답에 필요 없는 싱크 토큰에 쏠리고, 화이트박스 접근을 요구한다. 섭동(occlusion)은 시각적이고 최종 출력을 읽으며 내부 접근이 필요 없지만, 셀 하나를 전체 이미지에서 제거해 점수를 매기므로 각 점수가 거의 확실한 두 답의 차이에 불과하고 주변 맥락이 가려주면 0이 되며 셀당 한 번의 forward pass로 제곱 비용이 든다.
어떻게 동작하나
AnswerMap은 학습이 필요 없고 태스크에 무관한 블랙박스 시각 근거다. 이미지를 K개의 가로 밴드와 K개의 세로 밴드로 자르고, 각 밴드를 인덱스도 주변 이미지도 없는 단독 스트립 이미지로, "이 밴드에 {q}가 있는가"라는 이진 질문과 함께 고정된 모델에 보여준다. 답은 생성 텍스트에서 읽지 않고 yes/no 첫 답 토큰 로짓으로 posterior를 계산한다. 행 밴드 i의 yes posterior와 열 밴드 j의 yes posterior를 외적해 K×K 맵 M_ij = p_row_i × p_col_j를 만든다. 셀은 행과 열이 모두 확신 있는 yes를 낼 때만 중요해진다. 8×8 맵이 2K=16회 forward pass로 끝나 같은 그리드 occlusion의 65회보다 훨씬 싸고, 필요한 접근은 두 레이블의 첫 토큰 로그프롭스뿐이다. 밴드는 픽셀 공간에서 자르므로 동적 해상도·타일링·토큰 병합 같은 내부 토큰 레이아웃을 건드리지 않는다. occlusion이 "나머지가 있을 때 이 셀이 필요한가"를 묻는 반면, 이 프로브는 "이 밴드만으로 충분한가"를 묻는다.
무엇과 다른가
맵 자체가 근거이고, 답은 맵 위에 정의된 고정 함수 R(M)을 계산해 얻는다. 기대값은 셀 중심의 가중 평균으로 연속적인 서브셀 위치를 주고, 최대값은 접지 강도 스칼라가 된다. 여러 개의 거친·고운 그리드를 64×64로 업샘플하고 min-max 정규화한 뒤 원소별로 곱하는 multigrid product를 쓰는데, 이는 product-of-experts로 모든 뷰가 지지하는 위치만 살아남게 한다. 서로소 크기 {3,5}는 K1+K2-1개의 조각을 K1+K2개 질문으로 얻는 반면 {2,4,8} 같은 중첩 크기는 경계를 중복 계산해 더 많은 질의로 더 적은 것을 얻는다. 검증은 ground-truth-free 테스트 두 개로 한다. (a) 일치도는 모델이 스스로 생성한 포인트가 맵에서 높은 곳에 떨어지는지 NSS와 AUC로 보고, (b) 삭제는 맵이 지목한 상위 8개 셀(이미지의 12.5%)을 회색으로 지운 뒤 정답이 바뀌는 비율을 랜덤 대조군과 비교한다.
어떻게 쓰나
실험은 Qwen3-VL-4B-Instruct를 주 모델로 Qwen3-VL-8B, Qwen3-VL-30B-A3B, InternVL3.5-8B에 복제했고, RefCOCOg·RefCOCO+·CAVE(테스트1)와 TextVQA·GQA(테스트2)에서 평가했다. 테스트1에서 맵은 모델이 지목한 지점에 AUC 0.85로 떨어졌고 어텐션은 0.38이었다. 테스트2에서 맵 영역을 삭제하면 정답의 53%가 뒤집혔고 어텐션은 19%였다. TextVQA에서 균일 랜덤 영역 대비 6배, GQA에서 5배 파괴율을 보였고 이 격차는 블러와 비이진 질문에서도 유지됐다. 블랙박스 방법 중 유일하게 chance 위인 occlusion은 같은 접근 권한에 4배의 질의를 쓰고도 두 지표 모두 뒤졌고, 화이트박스 최강인 T-MM은 어텐션보다 높고 AnswerMap보다 낮았다. 빈 이미지를 넣으면 맵이 평평해져 두 지표가 정확히 chance에 떨어지고, 다른 예시의 이미지로 바꾸면 그 이미지를 따라가므로 맵은 중립이 아니라 본 것에 커밋한다. 첫 토큰 로그프롭스 이상이 필요 없어 GPT-6-sol 같은 폐쇄 모델에서도 API로 그대로 동작한다.
전제와 한계
같은 맵에 다른 read-out을 얹으면 다른 과제를 푼다. 기대값은 모델의 자체 포인팅이 실패할 때 위치를 복원한다. 의료 모델 Lingshu-7B는 RefCOCOg 질의의 30%에서 포인팅 파싱이 실패하는데, 이 모델에서 맵이 모델 자신의 포인트보다 11포인트 앞선다. 최대값은 생성 없이 환각 객체를 표시한다. POPE에서 모델이 yes라고 답한 4,006건 중 223건이 환각이었고, 16개 질의만으로 두 종류를 ROC-AUC 0.833으로 분리했다. top-mass 영역을 잘라 다시 넣으면 TextVQA에서 모델의 오답 42개 중 50%를 정답으로 바꿨고(랜덤 크롭은 38%), 정답이던 답을 흔든 비율은 4% 대 6%였다.
개발자에게 이 논문의 실질적 의미는 인터페이스다. 가중치에 손대지 않고 첫 토큰 로그프롭스 두 개만 얻을 수 있으면, 16회 호출로 질의 조건부 공간 맵을 만들고 그 위에 기대값·최대값 같은 고정 함수를 얹어 좌표나 접지 강도를 직접 계산할 수 있다. 답변 감사, 환각 플래깅, 실패한 포인팅 보정, 크롭 재질의 같은 파이프라인에 붙일 수 있다는 뜻이다. 도입 전에는 대상 모델이 비정사각 입력(길고 얇은 스트립)을 네이티브로 또는 타일링으로 받는지, 밴드 단위 yes/no 프롬프트가 안정적으로 파싱되는지부터 확인해야 한다.
저자들이 밝힌 한계도 분명하다. 각 밴드가 긴 스트립이라 비정사각 입력을 받는 모델이 필요하다. 또 맵은 질의가 어느 행과 어느 열에 있는지는 알지만 어느 (행, 열) 쌍인지는 모른다. 질의가 서로 다른 두 객체를 가리키면 두 객체의 행과 열이 교차하는 빈 셀 두 곳도 함께 밝아진다. read-out이 주요 설계 표면이며, 범위·개수·관계 같은 더 풍부한 read-out, 맵을 레이블 없는 감독으로 쓰는 학습, 주장을 생성하기 전에 감사를 반영하는 프로브 유도 생성이 다음 단계로 남아 있다.