통합 모델이 스스로 이미지를 고치도록 궤적 단위 강화학습을 붙인 UMM-Reflection

Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

arXiv2609.35767v1

Yijia Fan2026-09-28조회 2

무엇인가

이 논문이 다루는 문제는 통합 멀티모달 모델의 자기 수정이다. 지시가 복잡해질수록 한 번의 렌더는 결함을 담는데, 텍스트-투-이미지 모델은 그 결함을 알아채지도 고치지도 못한다. 통합 모델은 이해와 생성을 한 네트워크에서 하므로 원리적으로는 자기가 그린 이미지를 보고 진단하고 다시 그릴 수 있다. 문제는 수정이 도움이 되는지가 렌더된 뒤에야 알 수 있다는 점이다. 그래서 반성 텍스트와 이미지 생성이 루프 전체에 걸쳐 함께 학습돼야 한다. 저자들은 반성 궤적에 대한 지도 미세조정(SFT)이 콜드 스타트는 되지만 성공률 높은 수리 경로를 찾지 못하고, 렌더러만 또는 한쪽 헤드만 최적화하는 순진한 RL은 이득의 대부분을 남겨둔다고 지적한다.

어떻게 동작하나

제안 방법 UMM-Reflection의 절차는 다음과 같다. 요청 c에 대해 모델이 먼저 이미지 x0를 만들고, 각 라운드 t에서 요청과 텍스트-이미지 이력, 현재 이미지 x_t를 관찰해 [THINKING], [ACTION], [EDIT] 태그로 구성된 구조화된 반성을 낸다. 행동은 edit 또는 done이며, edit이면 자연어 수정 지시 e_t를 담고 같은 모델이 x_{t+1} ~ flow(·|c, x_t, e_t)로 다음 이미지를 렌더한다. done이면 현재 이미지를 반환한다. 주 실험에서 수리 라운드는 최대 3회다. 검증기 점수는 정책 관찰에 절대 들어가지 않는다. 학습 데이터는 외부 모델로 합성한다. GPT-5.5가 비평가로 요청을 검증 가능한 제약으로 바꾸고 이미지를 검사해 반성과 원자적 편집 지시 또는 done을 쓰며, Qwen-Image가 초기 이미지를, Qwen-Image-Edit이 각 편집을 실행한다. BAGEL은 여기에 관여하지 않아 자기 실패 모드가 감독으로 다시 증류되지 않는다. 채택된 궤적은 29,529개로 one-shot 9,000, natural-repair 8,645, planned-progression 11,884이며, 프롬프트는 Puffin-4M, Poster100K, OmniEdit, AnyEdit, GEdit-Bench에서 왔고 평가 벤치마크와 겹치지 않는다. SFT는 반성 텍스트에 대한 자기회귀 손실과 편집 이미지에 대한 플로우 매칭 손실(L_SFT = L_AR + λ_img·L_FM)로 베이스 BAGEL 체크포인트에서 1에폭 수행한다.

무엇과 다른가

RL 단계의 핵심 설계는 세 가지다. 첫째, 공유 루트 샘플링이다. 요청마다 초기 이미지 하나를 뽑아 계산 그래프에서 분리하고, 그 동일한 루트 픽셀에서 K=16개의 완전한 반성 궤적을 샘플링한다. 초기 텍스트-투-이미지 생성에는 정책 그래디언트 신호가 가지 않는다. 형제 궤적이 같은 초기 이미지를 공유하므로 그룹 상대 어드밴티지가 운 좋은 첫 드로우가 아니라 반성 전략 자체를 비교하게 된다. 둘째, 보상이다. 동결된 검증기가 각 이미지에 0~1의 정렬 점수 q_t를 주고, Δ_t = q_{t+1} - q_t로 두어 R(τ) = q_T + α·Σ[Δ_t]_+ + β·S_multi(τ) - λ·Σ[-Δ_t]_+ - p·1[premature done]을 쓴다. 최종 점수 q_T, 라운드별 개선 보상, 퇴행에 대한 손상 페널티, 그리고 개선이 한 번의 요행이 아니라 여러 편집에서 왔을 때 추가 크레딧을 주는 S_multi 항이 들어간다. 하이퍼파라미터는 α=β=0.3, λ=p=0.5다. 셋째, 궤적 단위 어드밴티지다. A_i = clip((R(τ_i) - μ_R)/max(σ_R, 0.1), -1, 1)로 궤적마다 하나의 어드밴티지를 주고, 텍스트 채널과 플로우 채널이 이 동일한 A_i를 공유한다. 라운드별 크레딧을 주려면 라운드마다 K개로 분기해 K^N번 롤아웃(3라운드면 16^3 = 4,096)이 필요하고, PPO식 라운드별 크리틱은 다회차 이미지-텍스트 상태에 대한 가치 모델을 학습해야 해서 비현실적이다. 궤적 단위 어드밴티지는 GRPO의 K-샘플 비용을 유지하면서도 보상 안의 라운드별 진행 항이 개선한 라운드를 계속 보상한다. 각 채널은 동결된 SFT 참조 정책에 대한 KL 페널티를 갖고, 플로우 전이는 Flow-GRPO SDE 샘플러를 쓰며 활성 수리마다 연속된 확률적 전이 2개를 학습한다. 검증기와 참조 정책은 학습에만 쓰이고 추론 시에는 통합 모델만 돈다.

어떻게 쓰나

실험은 BAGEL 백본에서 진행한다. RL은 반성-SFT 체크포인트에서 시작해 GenEval 6개 계열에 걸친 3,000개 프롬프트 풀에서 업데이트당 루트 2개와 K=16 형제, 학습 디노이징 20스텝으로 1,000 업데이트 돈다. 평가는 프롬프트당 이미지 1장, 50 디노이징 스텝, 512², 최대 3회 수리다. GenEval 전체 553개 프롬프트에서 UMM-Reflection은 0.84로 BAGEL-Base 0.71, 반성 SFT 0.72를 앞선다(SFT 대비 +12). 이득은 조합을 고쳐야 하는 계열에 집중돼 position이 0.47에서 0.89로 +42.00, color binding +14.00, counting +10.00이다. 프롬프트 짝지은 비교에서 RL이 SFT를 109개에서 이기고 38개에서 지며(p<10^-8, McNemar), 초기 이미지만 비교하면 48대 32로 유의차가 없다(p=0.09). 즉 이득은 반성 라운드에서 나온다. 학습에 쓰지 않은 세 벤치마크로도 전이돼 WISE +10.97, CompBench +4.63, OneIG +3.48이다(SFT 단독은 OneIG에서 Base보다 약간 낮다). 테스트타임 스케일링에서 SFT의 3라운드는 GenEval 기준 약 +2에 그치고 1라운드 후 평탄해지지만, RL 후에는 1라운드만으로 +9가 오르고 3라운드까지 계속 오른다. 초기 이미지 정확도(R0)는 세 갈래 모두 70~73으로 비슷하다. 조건부 수리율은 SFT 20.59%에서 RL 1000 업데이트 64.94%로 오르고, 계열별로는 position +34, color_attr +17이 가장 크다.

전제와 한계

어블레이션은 다섯 가지 결론을 준다. 렌더러에 직접 Flow-GRPO를 돌린 T2I-RL(Base에서 1,000 업데이트)은 단일 샷 정확도를 71에서 76으로 올리지만 고칠 것이 남지 않는다. 학습하지 않은 Base를 3라운드 검사-편집에 강제로 통과시킨 Self-Agentic은 학습 없이 +5다. 반성 SFT는 +2다. 같은 29,529개 궤적의 최종 이미지로 Base를 미세조정하면 단일 패스 정확도가 75로 Base와 같아, SFT 이미지만으로는 생성기가 좋아지지 않는다. SFT 위에 궤적 RL을 얹으면 +11이고 수리율이 21%에서 65%로 3배가 된다. 직접 RL을 두 단계 앞에 두면 그 단일 샷 이득이 이어져 500 업데이트에서 81에 도달한다. 이득의 대부분은 500 업데이트 안에 온다(72 → 75, 79, 82, 1,000에서 84). 두 헤드를 모두 학습해야 한다는 점도 확인된다. 플로우 헤드만 학습하면 73, 수리율 22.8%로 SFT에 가깝고, 텍스트 헤드만 학습하면 78, 49.4%로 이득의 큰 부분을 회복하며, 공동 학습이 84, 64.9%로 최고 단일 헤드보다 6점 높다. 이득은 best-of-N 샘플링이나 편집 횟수 증가가 아니다. 같은 4장 예산에서 더 강한 T2I-RL 렌더러의 4장 중 하나를 고르는 Best-of-4는 80이고 UMM-Reflection은 84다(McNemar p≤0.04). SFT에 3라운드 편집을 강제해도 72로 강제하지 않은 SFT와 같다. Base를 4번 독립적으로 뽑아 모두 실패한 62개 프롬프트에서 RL 반성은 60%를 복구한다(SFT 12%). 다중 개선 항을 제거하면(β=0) 수리율은 유지되지만 초기 이미지가 73에서 63으로 나빠지고 79에 그친다.

모델 내부에서 무엇이 바뀌는지도 분석한다. 1,000 업데이트 RL 실행에서 프로토콜 준수는 첫 50 업데이트 안에 수렴해 무효 궤적이 1% 아래로 떨어지고 유지된다. 이후 보상 곡선은 수리 품질이 이끈다. 편집당 성공 수리가 11%에서 38%로 오르고, 처음부터 맞는 이미지의 손상률은 20%에서 10%로 내려간다. 학습 검증기 기준 최종 정확도는 81%이며 1,000 업데이트 안에 보상 붕괴나 프로토콜 퇴행은 없다. Base, SFT, RL 체크포인트로 553개 궤적을 재생해 보면 백본 자체의 정확성 판독은 거의 변하지 않는다. 이해 스트림에 대한 홀드아웃 선형 프로브는 세 체크포인트 모두 AUC 0.80~0.82다. 바뀌는 것은 이미지가 어디로 가는가다. 처음 실패한 이미지 중 그 판독의 밀집 통과 영역 안에 있는 비율이 RL에서는 3라운드에 걸쳐 34%에서 62%로 오르지만 SFT에서는 36%에서 42%에 그친다. 즉 RL은 모델이 이미 만들 수 있는 수정들 중에서 제대로 착지하는 것을 선택한다.

개발자 관점에서 이 논문의 실무적 의미는 명확하다. 이미지 생성 파이프라인에 자기 교정 단계를 넣을 때, SFT로 형식과 그럴듯한 수정을 가르치는 것과 실제로 성공하는 수정을 고르게 하는 것은 다른 문제다. 이 논문은 후자를 궤적 단위 결과 보상으로 처리하고, 추론 시에는 외부 비평가나 검증기를 완전히 제거한다는 점을 보여준다. 다만 학습 시에는 동결된 검증기와 참조 정책이 필요하고, 보상이 검증기 점수 차이에 의존하므로 검증기 품질이 곧 학습 신호의 품질이라는 점을 확인해야 한다. 또한 초기 텍스트-투-이미지 생성에는 정책 그래디언트가 가지 않으므로, 첫 이미지 자체의 품질 개선은 이 방법의 범위 밖이다.

저자들이 밝힌 전제와 한계도 분명하다. BAGEL은 단일 포워드 패스에서 인터리브된 텍스트-이미지 생성을 네이티브로 지원하지 않아, 각 라운드의 반성과 이미지를 새 턴으로 모델에 되먹이는 외부 컨트롤러로 다회차 루프를 구현했다. 라운드별 크레딧 배분은 K^N 롤아웃(3라운드 16^3 = 4,096)이나 다회차 이미지-텍스트 상태에 대한 가치 모델을 요구해 비현실적이므로 궤적 단위 어드밴티지로 대체했다는 것이 설계상의 타협이다. 주 실험의 수리 라운드 상한은 3회이며, RL 학습 프롬프트 풀은 GenEval 6개 계열 3,000개로 한정된다.