UFO는 다중 모달 이미지 생성의 조건 동시 정렬을 원자 단위로 평가하는 틀이다.
UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation
무엇인가
이 논문이 다루는 것은 주제 기반 커스터마이징(subject-driven customization)의 평가다. 이 작업은 텍스트와 특정 주체의 참조 이미지를 입력으로 받아, 텍스트가 편집하지 않은 주체의 시각적 속성은 유지하면서 텍스트 의미에 맞는 새 이미지를 생성하는 것을 목표로 한다. 이미지 편집과 달리 주체의 자세와 위치가 자유롭게 바뀌기 때문에 시각적 정렬을 판정하기 어렵고, 텍스트 조건과 시각 조건을 동시에 만족했는지 따지는 것은 더 어렵다. 기존 평가는 임베딩 기반(CLIP, DINO)과 MLLM 기반(VIEScore, DreamBench++) 두 갈래인데, 저자들은 두 갈래의 공통 한계를 각 모달 조건을 따로따로 평가한다는 점으로 지목한다. 이는 다중 모달 생성의 동시 조건 정렬 목표와 모순되며 인간 평가와의 일치도를 떨어뜨린다. 구체적으로 텍스트가 요구한 수정(예: 머리색 변경)을 무시한 이미지에 높은 점수를 주는 위양성, 반대로 텍스트 편집을 제대로 반영했지만 참조 이미지와의 시각적 유사도가 떨어졌다는 이유로 낮은 점수를 주는 위음성이 발생한다.
어떻게 동작하나
해법으로 제안하는 UFO는 전 조건 정렬을 동시에 평가하는 최초의 통합(Unified) 프레임워크라고 저자들은 주장한다. 핵심은 원자화된 평가 연쇄(Atomized Chain-of-Evaluation) 패러다임이며 절차는 네 단계다. 첫째, 전 조건 정렬을 세밀하고 서로 분리된 원자 평가 단위(AEU, Atomic Evaluation Unit)의 순차적 연쇄로 분해한다. 둘째, 각 AEU를 모달 관련성 등급으로 분류한다. 셋째, 각 AEU를 VQA 질의 또는 전용 함수 호출로 점수화한다. 넷째, 적응적 중요도 가중치로 모든 AEU 점수를 집계해 해석 가능한 종합 점수를 만든다.
무엇과 다른가
세부를 풀면 이렇다. AEU 분해 단계에서는 참조 이미지와 참조 텍스트를 VLM에 넣고 주체 고유의 시각 특징과 텍스트 편집 제약을 함께 추론하게 한 뒤, 국소 구체 구성요소 수준과 전역 추상 속성 수준이라는 두 계층에 걸쳐 AEU 연쇄를 만든다. 모달 관련성 분류 단계에서는 각 AEU에 image-only, text-only, text-and-image 중 하나의 등급을 부여해, 각 속성이 올바른 조건 유형에 대고 평가되도록 한다. 점수화 단계에서는 각 AEU를 VQA 질의로 바꿔 참조 텍스트, 참조 이미지, 생성 이미지를 VLM에 넣고 Yes 또는 No를 받아 1 또는 0으로 매핑한다. 얼굴 정체성 일관성처럼 전용 도구가 유리한 항목에는 ArcFace를 호출해 s_i = 1 - d_ArcFace(I_ref, I_gen) 으로 [0,1] 범위의 연속값을 얻는다. 마지막 집계 단계에서는 참조 이미지와 텍스트 지시에 대한 VLM 추론으로 각 AEU에 1에서 5 사이의 음이 아닌 가중치 w_i를 부여하고, Score(I_gen) = Σ w_i·s_i / Σ w_i 로 가중 평균을 낸다. 참조 텍스트가 색 변경을 언급하면 색 관련 단위의 가중치가 커지는 식이며, 덜 중요한 속성이 어긋나면 최종 점수에 미치는 영향이 제한된다.
어떻게 쓰나
벤치마크도 함께 제안한다. 기존 커스터마이징 벤치마크는 텍스트와 시각 조건 사이의 상호작용 유형이 부족하고 충돌하는 조건 쌍이 적어, 자유 형식 생성에서 모델이 감당해야 하는 복잡성을 반영하지 못한다는 것이 저자들의 진단이다. UFO-Bench는 단단한 물체, 부드러운 물체, 사람, 전신 캐릭터, 동물, 로고, 장면의 7개 범주에 걸친 86개 참조 이미지로 구성되며, 범주별 계층적 프롬프팅 전략으로 3단계 편집 난이도를 두고 전체의 81.97%를 충돌 조건 쌍으로 채웠다. 편집 패러다임은 네 가지다. 비편집은 주체의 고유 속성을 바꾸지 않고 복잡한 환경에 재배치하는 과제, 국소 편집은 소품이나 행동 같은 상호작용 요소를 추가하는 과제, 전역 편집은 화풍이나 재질을 통째로 바꾸는 과제, 복합 편집은 전역 스타일 변환과 국소 요소 추가를 동시에 요구하는 가장 엄격한 단계다.
전제와 한계
실험은 GPT-4o(2024-05-13 버전)를 판정 모델로 고정해 진행했다. 평가 대상은 폐쇄형 모델 Nano Banana와 Doubao(Seadream4.5 기반), 오픈소스 모델 Qwen-ImageEdit-2509, UNO, OmniGen2, Bagel이다. 베이스라인은 LLM 기반 VIEScore, DreamBench++와 비LLM 기반 CLIP-I, CLIP-T, DINO다. 각 참조-프롬프트 쌍을 4번 샘플링해 모델당 총 2,640개 인스턴스를 생성했다. 결과는 Doubao가 총점 0.7439로 가장 높았고, 오픈소스 Qwen-Image가 0.7252로 Nano-Banana를 앞섰다. Qwen-Image는 비편집 0.7635와 전역 편집 0.7836에서 Doubao를 약간 앞서기도 했지만 국소 편집에서 0.6532로 눈에 띄게 떨어졌다. 저자들은 이를 오픈소스 확산 아키텍처가 전역 의미 변화는 잘 잡지만 정밀한 텍스트 유도 편집은 상용 모델보다 약하다는 공통 한계로 해석한다.
인간 판단과의 상관도는 무작위로 뽑은 100개 테스트 케이스, 6개 모델의 600개 이미지에 대해 사람이 1위부터 6위까지 순위를 매기고, 지표가 만든 순위와의 Spearman 상관계수를 케이스별로 계산해 평균을 내고 Fisher Z 변환을 적용하는 방식으로 측정했다. CLIP-T는 -0.1996으로 음의 상관을 보였고, CLIP-I와 DINO는 약 0.3에서 0.4 사이의 약한 양의 상관에 그쳤다. VIEScore와 DreamBench++는 0.55를 넘겨 개선됐지만 국소 편집 항목에서는 약 0.58에 머물렀다. UFO는 0.6889로 가장 높았고 기존 지표 대비 평균 15.25% 향상됐다. 절제 실험에서 가중치를 모두 1로 균일화하면 상관계수가 0.6889에서 0.6253으로, AEU 분해 없이 생성 이미지를 VLM에 직접 넣어 단일 총점을 내면 0.6889에서 0.5752로 떨어졌다.
개발자 관점에서 쓸모는 세 가지다. 첫째, 개인화 이미지 생성 모델을 비교할 때 CLIP-T 같은 전역 텍스트-이미지 유사도가 음의 상관(-0.1996)을 보인다는 실증 수치를 근거로 삼을 수 있다. 둘째, 평가 파이프라인을 직접 만들 때 조건별로 분리된 평가 단위를 정의하고, 각 단위가 어느 모달에 의존하는지 명시하고, 얼굴 정체성처럼 전용 도구가 강한 항목은 함수 호출로 떼어내는 설계를 그대로 참고할 수 있다. 셋째, 81.97%가 충돌 조건 쌍인 UFO-Bench는 모델이 정체성 보존과 텍스트 편집 사이에서 어떤 트레이드오프를 하는지 드러내는 스트레스 테스트로 활용할 수 있다.
한계와 전제는 저자들이 직접 밝힌다. UFO는 자유 형식 다중 모달 생성 전반에 적용 가능한 틀이라고 말하면서도, 이 논문에서는 기본적이고 잘 정의된 개인화 이미지 생성 설정에 초점을 맞췄다고 명시한다. 이 기본 설정에서의 정확한 평가가 더 복잡한 다중 이미지, 다중 턴 생성 시나리오를 위한 필수 토대라는 전제이며, 그 확장 시나리오에서의 성능은 이 논문에서 검증되지 않았다. 또한 판정 모델로 GPT-4o 한 버전을 고정해 썼고, AEU 분해와 가중치 부여 자체를 VLM 추론에 의존하는 구조라는 점이 방법의 구성상 전제로 서술돼 있다.
관련 논문
- 멀티모달 LLM의 시각-텍스트 정렬 점수는 내용 통합의 증거가 아니라 착시일 수 있다13개 멀티모달 LLM에서 시각 토큰을 가우시안 노이즈로 바꿔도 CKA·SVCCA·MIR 같은 정렬 점수는 거의 변하지 않았다. 공유 MLP 하향 투영이 만든 가짜 정렬을 분리하는 PA 갭을 제안하고, 내부 정렬은 과제 정확도와 함께 읽어야 함을 보인다.
- InGuard는 생성 파이프라인 내부 표현으로 T2I 안전성을 높인다.T2I 파이프라인 안쪽에서 텍스트 임베딩과 중간 latent를 검사해 NSFW 생성을 막는 InGuard를 제안한다. 5개 오픈웨이트 모델에서 안전률 97.9~98.8%를 기록하며 기존 외부 가드레일보다 파라미터와 연산을 줄였다.
- OLLM의 모달리티 편향과 증거 형태 편향을 분리한 Tri-PvP 벤치마크Tri-PvP는 비전·오디오·텍스트가 충돌하는 8,000개 샘플 벤치마크로, 기존 평가가 뒤섞어 온 양상 편향과 증거 형태 편향을 분리해 측정한다. 5개 OLLM을 평가한 결과 비전 편향과 증거 형태별 비대칭이 드러났다.