DEPICT가 답 일치로 텍스트-이미지 정렬을 채점한다

DEPICT: Scoring Text-to-Image Alignment by Answer Agreement

arXiv2610.03617v1

Vasco Ramos2026-10-02

무엇인가

텍스트-이미지 정렬 평가는 캡션 채점, VLM 환각 탐지, 학습 데이터 필터링, 그리고 텍스트-투-이미지(T2I) 생성기 벤치마킹에 쓰인다. T2I 모델이 좋아지면서 질문이 바뀌었다. 프롬프트와 그럴듯하게 맞는 이미지를 만드는가가 아니라, 객체를 빠뜨리지 않고 속성을 뒤바꾸지 않고 개수를 틀리지 않고 부정을 무시하지 않는가를 물어야 한다. 기존 평가기는 세 갈래인데 각각 한계가 있다. 선호 데이터로 파인튜닝한 지표는 특정 백본과 학습 분포에 묶이고, 캡션 전체를 한 번에 묻는 홀리스틱 지표는 미세한 오류를 놓치며, 캡션을 질문으로 쪼개는 분해형 지표는 '정답은 항상 yes'라는 고정-YES 가정에 기댄다. 논문은 이 고정-YES 가정을 구조적 결함으로 지목한다. 부정문 캡션에서 생성된 질문의 87%, 혼합형에서 47%가 정답이 no인데(그 외 구간에서는 4%에 불과), 정답을 이미지 보기 전에 yes로 고정하면 충실한 이미지에 낮은 점수를 주게 된다. 실제로 DSG와 Soft-TIFA는 부정 항목에서 정확도의 85~95%를 잃고 우연 수준 아래로 떨어진다.

어떻게 동작하나

DEPICT는 이 고정 참조를 없앤다. 먼저 캡션에서 직접 yes/no 질문 N개를 생성한다. DSG처럼 캡션을 의미 튜플로 파싱하는 중간 단계를 건너뛰기 때문에 파싱 오류를 물려받지 않고, 튜플 추출이 버리는 문맥도 유지된다. 각 질문은 두 번 답한다. 한 번은 이미지와 함께, 한 번은 이미지를 제거하고 캡션만 주고 답한다. 이때 이산 답을 디코딩하지 않고 yes 토큰의 소프트맥스 확률 질량을 읽는다. 이미지 채널 확률을 p_v, 캡션 채널 확률을 p_t라 하면 세 가지 채점 규칙을 비교한다. Faith는 a=p_v로 시각 채널만 본다. Confirm은 a=p_v·p_t로 텍스트 채널을 소프트 참조로 쓰지만 긍정 일치만 보상하므로 정답이 no일 때 무너진다. Agree는 a=p_v·p_t+p̄_v·p̄_t로 no 확률까지 포함해 잠재 답변에 대해 주변화하며, 두 채널이 같은 진리값을 지지하면 극성과 무관하게 높은 점수를 준다. 여기에 캡션만 보고 그 질문을 얼마나 단호하게 결정하는지를 나타내는 커미트먼트 가중치 w=|p_t-p̄_t|를 곱해 가중 평균을 낸다. 이는 별도 사후 필터링 없이 모호하거나 빗나간 질문을 자동으로 감쇠시키는 역할을 한다. 마지막으로 분해 과정에서 잃는 거시 문맥을 되찾기 위해, 캡션 전체를 이미지와 함께 물어 얻은 홀리스틱 점수 S_hol을 볼록 결합한다. 최종 점수는 (1-λ)·S_dec+λ·S_hol이며 λ=0.5로 벤치마크 튜닝 없이 고정했다.

무엇과 다른가

실험은 사람 판단과의 상관을 보는 GenAI-Bench, TIFA160, RichHF-18K misalignment_score(SRCC·PLCC)와 진단용 Winoground, NegBench의 COCO-MCQ 분할에서 수행했다. 백본은 Qwen3.5, InternVL3.5, Gemma-4 세 패밀리에 걸쳐 11개를 썼고, 비교 대상은 임베딩 유사도(CLIPScore, BLIPv2Score), 학습 없는 VLM 지표(DSG, Soft-TIFA, VQAScore), 파인튜닝 평가기(ImageReward, PickScore, UniGenBench++, LongT2IBench, T2I-Eval, FGA-BLIP2, DynEval)다. 가장 강한 파인튜닝 평가기 DynEval-4B와 같은 Qwen3-VL-4B 백본에서 맞붙였을 때 DEPICT는 GenAI-Bench에서 SRCC 0.630 대 0.595, RichHF에서 0.607 대 0.546으로 앞섰고 TIFA160에서만 0.691 대 0.802로 뒤졌다. 백본 효과도 크다. VQAScore의 2024년 백본을 Qwen3-VL-4B로 바꾸기만 해도 GenAI-Bench SRCC가 0.075, RichHF가 0.124 올라 72B 모델로 학습한 평가기까지 넘어선다. DEPICT를 Qwen3-VL-4B에서 Qwen3.5-27B로 옮기면 모든 열에서 0.06~0.10이 추가된다. 11개 백본 전체에서 DEPICT는 55개 백본-벤치마크 조합 중 54개에서 최강 베이스라인과 동등하거나 앞섰고, 43개에서 승리, 그중 23개가 통계적으로 유의했다. 유일한 패배는 비전 인코더가 없는 Gemma-4-12B 변형의 GenAI-Bench였다.

어떻게 쓰나

핵심 개선은 채점 규칙에서 나온다. 같은 백본(Qwen3.5-27B)에서 Faith를 Agree로 바꾸면 GenAI-Bench의 VQAScore 격차가 SRCC 0.15에서 0.03으로 줄고, NegBench 정확도는 우연 수준 이하에서 88.3%로 뛰며 TIFA160 성능은 손상되지 않는다. 전체 보고에서 부정문 정확도는 19%에서 88%로 올라간다. 병합의 효과는 두 항이 서로 다른 표본에서 실패하기 때문에 생긴다. GenAI-Bench에서 두 항은 19%의 항목 쌍에서 의견이 갈리는데, DEPICT는 그 contested 쌍에서 60% 정확도를 기록해 홀리스틱 단독(53%)과 분해 단독(47%)을 모두 앞선다. 반대로 VQAScore를 Soft-TIFA와 결합하면 GenAI-Bench는 그대로이고 NegBench는 62.2로 떨어져 VQAScore 단독보다도 나빠진다. 절제 실험에서 튜플 추출을 되살리면 모든 벤치마크가 나빠졌고, 부정 캡션의 47%가 튜플을 하나도 만들지 못해 부정 하위 집합 정확도가 4.1까지 추락했다. 사후 질문 프루닝도 모든 벤치마크에서 성능을 낮췄다. Faith를 DSG처럼 이산화하면 Winoground 16.3점과 SRCC 0.033을 잃는다.

전제와 한계

실무적으로 이 논문이 주는 시사점은 두 가지다. 첫째, T2I 평가 파이프라인에서 부정 표현이나 '없음'을 다루는 프롬프트가 있다면 고정 YES 방식의 분해 지표는 그 구간에서 사실상 무작위 이하로 떨어진다는 점을 전제해야 한다. 둘째, 학습 없는 지표는 백본을 교체하는 것만으로 파인튜닝 평가기를 앞지를 수 있으므로, 평가기 자체를 학습시키는 비용보다 백본 업그레이드 비용을 먼저 검토하는 편이 합리적일 수 있다. 다만 DEPICT는 질문 생성과 채점에 같은 백본을 쓰므로 두 채널이 같은 사전 지식을 공유하고, 이 때문에 동일한 환각이 양쪽에서 일치로 보일 위험이 있다. 저자들은 채널마다 다른 백본을 쓰면 이 사전 지식을 분리할 수 있지만 모델 두 개를 서비스해야 하는 비용이 든다고 밝힌다. 또 하나의 한계는 짧은 프롬프트에서 단어 순서 같은 조합적 구조가 승부를 가르는 경우(Winoground) 분해가 홀리스틱 대비 이득을 주지 못한다는 점이며, 답변 단계에 추론을 켜면 이 구간이 개선된다고 덧붙인다. 코드는 연구 목적으로 공개될 예정이라고만 언급되어 있다.