VIEScore2는 이미지 품질 점수와 결함 위치를 한 번에 예측한다
VIEScore2: Unified Image Evaluation with Spatially Grounded Explanations
무엇인가
이미지 생성·편집 모델은 갈수록 사실적인 결과를 내지만, 구조 왜곡이나 물체 일그러짐, 아티팩트, 프롬프트 위반 같은 국소적 결함은 여전히 남는다. 이런 결함을 사람이 일일이 찾는 일은 비싸고 확장이 어렵다. 그런데 기존 자동 평가기는 대개 스칼라 점수 하나만 돌려주고, 그 점수를 뒷받침하는 이미지 영역을 짚어주지 않는다. VIEScore는 얼린 VLM에 점수와 자유 형식 설명을 요구했지만 그 설명이 실제 이미지 영역에 근거한다는 보장이 없었고, PAL·RAHF·LEGION 같은 공간 평가기들은 마스크나 히트맵, 박스를 내놓지만 대부분 text-to-image 전용이라 조건 이미지가 필요한 편집 과제로 확장하기 어려웠다. VIEScore2는 이 두 갈래를 하나의 모델로 합치려는 시도다.
어떻게 동작하나
입력은 생성 이미지, 프롬프트, 0개에서 여러 개까지의 조건 이미지(편집의 원본 이미지나 생성의 참조 이미지), 그리고 어떤 출력 필드를 원하는지 지정하는 평가 지시문으로 구성된다. 모델은 한 번의 자기회귀 패스로 세 가지를 함께 낸다. 0~10 스케일의 점수(전체 점수, 또는 지각 품질 PQ와 의미 일관성 SC를 따로), N×N 격자 위의 결함 셀 좌표, 그리고 선택적인 커버리지 마크다. 결함은 시각적 아티팩트와 의미적 불일치라는 두 범주로 나눠 각각 별도 격자에 담을 수 있다. 격자 기본값은 16×16이며, 결함 셀은 "r5: 8,9!"처럼 1-based 행·열 텍스트로 희소하게 표현된다. 이 텍스트 격자 표현이 핵심인데, 서로 다른 데이터셋의 마스크·히트맵·박스 주석을 하나의 공통 인터페이스로 정규화하고, 동시에 파싱 가능한 검증 대상이 되기 때문이다. 학습은 ImagenWorld, RichHF-18K, EvalMuse-40K, PAL4VST, COCO 다섯 소스를 합친 약 38K 예시로 Qwen3-VL-8B를 지도 미세조정(SFT)한 뒤, GRPO로 후속 학습하는 2단계다. GRPO 보상은 커버리지 가중 셀 단위 Dice(β=1), 점수 정확도(1-|오차|/10), 출력 형식 유효성의 세 항을 λ=(1, 0.3, 0.1)로 결합한다. Dice 항에서 정답 커버리지 마크가 붙은 셀은 가중치 2를 받고, 오탐은 가중치 없이 세어진다. 추론 후에는 학습 파라미터가 전혀 없는 규칙 기반 파서가 점수와 결함 격자를 연결된 영역별로 묶어 읽을 수 있는 설명 문장으로 바꾼다.
무엇과 다른가
주 평가 스위트는 다섯 소스에서 뽑은 1,300개 홀드아웃 예시다. 전체 점수 상관도에서 VIEScore2는 SRCC 0.601을 기록해, 같은 입력 조건의 범용 VLM 중 가장 강했던 Gemini-3-Flash의 0.491, GPT-5.6-sol의 0.437을 앞섰다. 결함 위치 추정에서는 per-image grid IoU 기준으로 RichHF 0.299, PAL4VST 0.335, SynthScars 0.234로 1위, HAD 2위, AbHuman 3위를 차지했고, 6개 벤치마크 중 5개에서 상위 3위 안에 들었다. SynthScars에서는 F1 0.368로 1위다. 학습 소스에 없던 AbHuman, HAD, SynthScars, SDG-30K 같은 외부 데이터셋에서도 경쟁력이 유지된다는 점을 저자들은 강조한다. 조건 이미지를 함께 넣으면 같은 250개 조건부 예시에서 전체 점수 SRCC가 0.420에서 0.451로, 위치 추정 F1이 0.514에서 0.536으로 올랐다.
어떻게 쓰나
GRPO의 기여를 분리한 실험도 눈에 띈다. 세 번의 독립 실행에서 GRPO는 공유 SFT 체크포인트 대비 grid IoU를 0.024~0.029 끌어올린 반면, SFT를 한 에폭 더 돌린 경우의 개선은 0.001에 그쳤다. 보상 항을 하나씩 빼보면 Dice 보상만 써도 IoU가 0.296에서 0.320으로 올라 개선의 대부분을 설명한다. 전체 보상은 IoU 0.324, F1 0.506, SRCC 0.601을 낸다. 점수 보상은 주 스위트의 점수 상관도에는 측정 가능한 변화를 주지 않았고 F1을 0.481에서 0.506으로 소폭 올리는 데 그쳤으며, 형식 보상은 모든 변형이 이미 파싱에 성공했기 때문에 효과가 관측되지 않았다. 저자들은 두 항을 파싱 실패나 점수 이탈에 대비한 안전장치로 남겨둔다고 밝힌다. GRPO 이후 정밀도는 0.415에서 0.466으로, 재현율은 0.545에서 0.552로 함께 올랐다.
전제와 한계
격자 해상도 선택의 근거도 수치로 제시된다. 학습된 픽셀 IoU는 N=12와 N=16에서 0.235와 0.231로 비슷하다가 N=32에서 0.192로 떨어진다. 반면 주석 충실도(모델 없는 픽셀 IoU)는 N=16이 0.615로 N=12의 0.535보다 높고, 95퍼센타일 출력 길이는 N=32의 1,926 토큰에 비해 471 토큰으로 짧다. 즉 N=16은 모든 지표를 최대화한 선택이 아니라 공간 디테일과 출력 길이 사이의 절충이다. 같은 예산의 위치 추정 전용 비교에서는 바운딩 박스가 F1 0.463으로 희소 셀의 0.397보다 높았지만, 저자들은 텍스트 형식의 단순함과 셀 단위 보상 계산의 직접성 때문에 셀 표현을 택했다고 설명한다.
실무 관점에서 이 논문이 주는 것은 이미지 평가를 '점수 하나'에서 '점수 + 근거 영역 + 사람이 읽는 설명'으로 확장하는 하나의 구체적 설계도다. 출력이 자유 서술이 아니라 파싱 가능한 구조화 텍스트이므로, 평가 결과를 자동 파이프라인에 넣거나 보상 신호로 재활용하기 쉽다. 조건 이미지를 여러 장 받는 생성·편집 과제를 같은 모델로 처리하고, 점수만 원할 때와 위치까지 원할 때를 지시문으로 전환할 수 있다는 점도 실용적이다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, 검증에 쓰인 백본은 Qwen3-VL-8B 하나뿐이라 다른 VLM이나 다른 스케일에서 같은 효과가 나는지는 알 수 없다. 둘째, 16×16 격자는 작은 결함을 놓칠 수 있고 불규칙한 경계를 거칠게만 근사한다. 셋째, MMRB2 선호도 평가에서는 text-to-image 성능은 경쟁력 있었지만 편집 정확도는 범용 VLM 베이스라인보다 약했다.
저자들이 직접 밝힌 한계도 분명하다. 모델 선택이 단일 백본에 묶여 있고, 공개된 평가기들과의 비교가 아키텍처·학습 데이터·학습 절차의 효과를 분리하지 못한다. 파서가 만드는 설명은 예측된 점수와 결함 격자에 충실할 뿐 그 정확성을 독립적으로 검증하지 않으며 결함의 원인도 짚지 않는다. 또한 GRPO가 일부 깨끗한 이미지 부분집합에서 오탐을 늘릴 수 있어, 강한 결함 탐지와 보수적인 정상 이미지 인식 사이의 트레이드오프가 존재한다. 윤리 성명에서도 이 모델이 정상 콘텐츠를 결함으로 표시하거나 실제 결함을 놓칠 수 있으니, 점수와 격자, 설명은 인간 판단을 대체하는 것이 아니라 보조하는 용도로 쓰라고 못 박는다.