선호도와 루브릭 보상을 조합해 텍스트-이미지 모델을 사후학습한다

Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards

HF Daily2610.02967

Yuanhao Ban, I-Hung Hsu, Anastasios Angelopoulos2026-10-02

무엇인가

최신 텍스트-이미지 생성 모델은 시각적 품질이 크게 올라갔지만, 사후학습으로 더 개선하기는 어렵다. 인간 선호는 미학, 구도, 프롬프트 충실도, 텍스트 렌더링, 제약 준수 등 여러 축으로 나뉘어 있어 단일 보상 신호로 전부 담기 어렵기 때문이다. 기존 PickScore, HPSv2/v3, ImageReward 같은 선호 보상은 사용자가 좋아하는 전반적 품질을 잘 잡지만, 쌍대 투표에 드물게 나타나는 객체 포함 여부나 프롬프트별 제약에는 약하다. 반대로 공간 추론, 텍스트 렌더링, 구성 정확성 같은 특화 보상은 좁은 능력만 본다. 논문은 이 둘을 단순 가중 평균하면 최적화가 불안정해지고 보상 해킹이 생긴다고 지적하며, 선호 보상과 루브릭 보상을 조합하는 사후학습 레시피를 제안한다.

어떻게 동작하나

보상 시스템은 네 부분이다. 첫째, 인간 선호 보상은 Arena에서 수집한 약 500만 쌍의 인간 쌍대 투표로 Bradley-Terry 목적함수를 학습한 모델이다. Qwen3.6-27B 백본에 선형 헤드를 붙여 스칼라 로짓을 내고, 밝기·대비·채도 지터와 가우시안 노이즈를 넣어 저수준 통계에 대한 견고성을 높인다. 공개 모델 PickScore도 대안으로 쓴다. 둘째, 루브릭 충실도 보상은 LLM이 프롬프트를 의존성 있는 예/아니오 체크리스트로 분해하고 VLM 판정관이 답한 뒤 긍정 비율을 보상으로 삼는다. 1만 프롬프트에서 18만2천 개 질문을 만들고 gemini-3-pro-preview로 분해, Qwen3.6-27B로 판정한다. 셋째, 제약 보상은 부재 지향적으로 원치 않는 추가 요소나 배경·스타일 제한을 평가한다. 1만 프롬프트에서 2만6천 개 제약 질문을 만들고 준수 비율을 쓴다. 넷째, 보상 해킹 방지 루브릭은 단일 이미지로 판단 가능한 깨진 텍스트 같은 실패를 잡는 pointwise 탐지기와, 정책 출력을 고정된 베이스 모델 생성과 비교해 과도한 실사화 같은 상대적 드리프트를 잡는 reference-based 탐지기로 나뉜다. 위치 편향을 줄이려 두 순서로 판정한다.

무엇과 다른가

이질적인 보상을 합치는 핵심은 세 가지다. 먼저 각 보상 축을 배치 통계로 독립적으로 표준화해 한 축이 다른 축을 압도하지 않게 한다. 다음으로 프롬프트 조건 게이팅을 둔다. 제약 보상은 사용자 의도가 strict로 분류된 프롬프트에만 켜고, 해킹 탐지 보상은 해당 실패 모드가 그 프롬프트에 적용 가능할 때만 켠다. 예를 들어 인상주의 풍경화처럼 창작 여지가 큰 프롬프트에 제약 보상을 걸면 정당한 요소 추가를 벌하게 되므로 막는다. 마지막으로 해킹 탐지 신호를 추가 보상으로 더하지 않고 거부권으로 쓴다. 위반이 탐지되면 양의 선호 보상을 z_pref에서 [z_pref]_+만큼 깎아 0으로 만들고, 위반을 피해도 추가 보상은 주지 않는다. 최종 보상은 선호, 충실도, 게이트된 제약 보상의 합이며 모든 가중치는 1로 둔다. 이 보상을 DiffusionNFT의 그룹 상대 가중치로 바꿔 정책을 업데이트한다. 마지막으로 해킹 방지 없는 Stage 1과 해킹 방지가 있는 Stage 2의 LoRA 델타를 1대1로 평균하는 가중치 앙상블을 한다.

어떻게 쓰나

실험은 FLUX.2-dev와 Ideogram-4 두 프런티어 베이스 모델에서 한다. FLUX.2-dev는 32B 파라미터 rectified-flow 트랜스포머이고, Ideogram-4는 9.3B 파라미터 flow-matching 모델이다. DiffusionNFT로 LoRA 어댑터만 학습한다. FLUX.2-dev는 스텝마다 48개 프롬프트 그룹, 프롬프트당 24개 rollout, 10 샘플링 스텝, 512x512 해상도, CFG 4.0을 쓴다. Ideogram-4도 같은 그룹·rollout 예산에 guidance 7.0을 쓴다. 학습·검증 프롬프트는 Arena 실제 사용자 분포에서 뽑되 이미지 편집 요청, 너무 짧은 프롬프트, 비영어 프롬프트 등을 걸러 1만 학습, 1천 검증 프롬프트를 만든다. 평가는 MMRBv2 프로토콜을 따라 gemini-3.5-flash가 각 체크포인트와 고정 베이스 모델을 비교해 승률을 재고, 30·60·90·120·150 체크포인트 중 최고를 보고한다. GPT-5.4 판정관으로 전이성도 확인한다.

전제와 한계

주요 결과에서 Stage 1은 Arena RM 기준 승률 0.642, PickScore 기준 0.581을 기록했다. GPT-5.4 판정에서는 각각 0.561, 0.611이었다. 게이트된 제약 보상이 없는 Arena-T2I-Hard 베이스라인보다 Gemini-3.5-flash 기준 7.1%포인트, 4.9%포인트 높다. Stage 2는 해킹 방지 보상을 더한 것으로 Stage 1과 비슷한 수준이고, Stage 3는 두 Stage의 LoRA를 평균해 Gemini 승률을 Arena RM 0.6598, PickScore 0.6256으로 올려 두 부모를 모두 앞선다. 공개한 1K 서브셋으로는 PickScore 사용 시 Stage 1이 0.566, Stage 3가 0.615로 전체 1만 데이터에 근접했다. 절제 실험에서 의도 게이팅은 Arena RM 승률을 0.6046에서 0.6416으로, PickScore에서 0.5200에서 0.5810으로 올렸다. 해킹 탐지 적용 가능성 게이팅은 Arena RM에서 Gemini와 GPT-5.4 승률을 각각 0.1086, 0.0940 높였다. 해킹 방지를 추가 보상으로 주는 대신 단방향 거부권으로 쓰는 것이 Arena RM에서 0.5260에서 0.6346으로, PickScore에서 0.4194에서 0.5710으로 더 좋았다. 같은 Stage 2 체크포인트끼리 앙상블하는 것보다 Stage 1과 Stage 2를 섞는 교차 레시피 앙상블이 Arena RM 0.6435에서 0.6598로, PickScore 0.5610에서 0.6256으로 우수했다. 선호 데이터 규모도 중요해 보상 모델 학습 데이터가 1만 쌍일 때 0.537, 10만 쌍 0.607, 50만 쌍 0.611, 전체 약 560만 쌍 0.642로 올랐다.

Ideogram-4에는 텍스트 렌더링 성능이 사후학습으로 떨어지는 문제를 막기 위해 OCR 보상을 추가했다. 선호 보상만 쓰면 승률이 기준 이하였고, Arena-T2I-Hard는 0.4005로 여전히 베이스보다 낮았다. 의도 게이팅 제약 보상을 더한 Stage 1이 0.5526으로 기준을 넘었다. Ideogram-4에서는 뚜렷한 보상 해킹 실패 모드가 관찰되지 않아 Stage 2와 3를 적용하지 않았다. 실제 Arena 텍스트-이미지 리더보드의 라이브 블라인드 인간 비교에서 Stage 1 Ideogram-4는 Elo 1223.5를 기록해 모든 공개 오픈소스 모델을 앞섰고, 이전 최고인 Ideogram-4.0-Quality보다 19.5점 높았다. FLUX.2-dev는 베이스 1132.8에서 Stage 1 1190.3, Stage 3 1202.1로 올라 베이스보다 69점 높았다. 이 수치는 2026년 9월 4일 Arena 리더보드 스냅샷 기준이다.

개발자 관점에서 이 논문은 오픈 텍스트-이미지 모델을 실제 사용자 선호에 맞춰 개선하려면 단일 선호 점수만 최적화하면 안 된다는 실무 교훈을 준다. 프롬프트 충실도, 제약 준수, 텍스트 렌더링 같은 축을 루브릭으로 분리하고, 각 축을 독립 정규화한 뒤 필요한 프롬프트에만 게이트하며, 해킹 탐지는 보상이 아니라 거부권으로 쓰는 설계가 핵심이다. 또한 보상 모델의 인간 선호 데이터 규모가 하류 RL 성능으로 이어지고, 서로 다른 보상 레시피로 학습한 LoRA를 평균하는 값싼 앙상블이 효과가 있었다. 다만 LLM·VLM 판정관, 대규모 선호 데이터, DiffusionNFT 기반 RL 인프라가 필요하므로, 도입 전에는 자체 프롬프트 분포에서 게이트 분류 정확도와 판정 비용을 확인해야 한다. 보상 점수 상승이 실제 품질 상승을 보장하지 않으므로 블라인드 쌍대 인간 평가로 검증해야 한다.

저자들이 밝힌 한계는 분명하다. 두 개의 베이스 모델에서만 평가해 다른 모델 패밀리와 규모로의 일반화를 충분히 알 수 없다. 에이전트 워크플로나 도구 사용이 들어가는 다단계 상호작용은 평가하지 않았다. 충실도 질문 분해는 인간 주석자가 감사하지 않아 오류나 모호성이 남을 수 있다. 계산 제약 때문에 단일 랜덤 시드 결과만 보고한다. 따라서 이 레시피는 강한 베이스 모델을 추가 개선하는 데 유망하지만, 재현과 확장에는 추가 검증이 필요하다.