자기 생성 상태로 학습해 다중 턴 이미지 편집 붕괴를 막는다

On-Policy Self-Distillation for Multi-Turn Image Editing

HF Daily2609.35611

Liangbing Zhao, Le Zhuo, Mohamed Elhoseiny2026-09-28조회 2

무엇인가

이 논문이 다루는 문제는 명확하다. 명령 기반 이미지 편집 모델은 단일 턴에서는 좋은 성능을 내지만, 실제 편집 작업은 이전 턴의 출력 위에 다음 명령을 얹는 반복 구조다. 저자들은 여러 편집 모델에서 이 반복 편집이 급격히 무너지는 현상을 관찰하고, 몇 턴만 지나도 고주파 색 잡음, 구조 파편화, 심한 정체성 드리프트가 나타난다고 보고한다. 원인은 조건 분포의 학습·추론 불일치다. 학습 때는 깨끗한 원본 이미지에 조건화되지만 추론 때는 자기 출력에 조건화되며, 그 출력에 섞인 모델 유발 오차가 다음 턴의 입력으로 누적된다. 논문은 수정 없이 재현만 시키는 항등 명령에서도 턴마다 측정 가능한 드리프트가 생긴다는 진단을 제시하며, 이를 자기회귀 비디오 생성의 노출 편향(exposure bias)과 같은 성격으로 본다.

어떻게 동작하나

제안 방법 MT-OPSD는 다중 턴 주석이나 정답 편집 이미지, 외부 교사 모델 없이 이 불일치를 줄이는 온폴리시 자기 증류 프레임워크다. 학생과 교사 모두 같은 사전학습 모델에서 초기화하고, 학생은 자기 생성 상태에 조건화되며 교사는 깨끗한 원본 이미지에 조건화된다. 핵심은 모델 유발 오차 성분만 분리해내는 것이다. 이를 위해 "Make everything unchanged" 같은 항등 명령으로 현재 학생을 k턴 재귀 실행해 자기 생성 상태를 만든다. 의도된 내용은 그대로 두고 모델 오차만 누적시키는 통제된 롤아웃이라는 것이 저자들의 설명이다.

무엇과 다른가

학습은 두 갈래 목표를 고정 비율로 섞는다. 항등 브랜치는 항등 명령 아래에서 롤아웃 상태 자체를 목표로 삼아 추가 드리프트를 억제한다. 깨끗한 원본을 목표로 복원시키는 방식은 k턴 누적 오차를 한 턴에 고쳐야 해 최적화가 어렵기 때문에, 복원이 아니라 정지를 목표로 잡았다는 점이 구체적 설계 결정이다. 편집 브랜치는 같은 롤아웃 상태에 실제 편집 명령을 짝지어, 깨끗한 조건의 교사 예측과 학생 예측의 속도(velocity)를 학생이 실제로 지나간 노이즈 상태에서 소수 쿼리 스텝만 골라 정합한다. 여기에 두 가지 훈련 제어가 붙는다. 롤아웃 커리큘럼은 롤아웃 상태와 원본의 평균 픽셀 편차를 드리프트로 측정해, 일정 스텝 동안 임계값 아래로 유지될 때만 깊이를 한 턴 늘린다(상한 K_max=10, 실제로는 약 4턴에서 포화). 게이트 교사 승격은 개선된 학생 체크포인트를 VLM 판정으로 평가해 장기 지평 기준을 통과할 때만 교사로 승격하며, 교사는 승격 사이에 고정된다. VLM 판정은 체크포인트 선택에만 쓰이고 학습 목표나 보상으로는 쓰이지 않는다.

어떻게 쓰나

평가를 위해 LME-Bench를 새로 만든다. 100개 세션 × 10턴 = 1,000개 편집 명령으로, 세션마다 국소 편집 6개와 전역 편집 4개가 섞인다. 전역 편집은 인접하지 않게 배치하고 마지막 턴에는 쓰지 않아, 후반 국소 편집이 이미 전역 변형을 거친 이미지에 적용되도록 했다. 원본은 Z-Image-Turbo로 1024×1024 해상도, 10개 의미 범주에 균등 분포시켰고, 유효성 규칙 6개 군으로 모호하거나 불가능한 명령을 걸러낸 뒤 VLM 검사와 수동 검토를 거쳤다. 지표는 누적 성공률 SR@k와 지속적 시각 열화를 뜻하는 붕괴율 CR@k이며, GPT-4o가 매 턴 프롬프트 준수·이전 상태 일관성·화질을 채점한다.

전제와 한계

실험은 Qwen-Image-Edit-2511, FLUX.2-klein-base, FireRed-Image-Edit 세 백본에 LoRA(rank 32)를 붙여 수행하고, OmniEdit에서 약 2,000개 원본-명령 쌍을 쓰되 정답 편집 이미지는 쓰지 않는다. LME-Bench에서 세 오픈소스 베이스 모델의 SR@10은 0.03~0.15, CR@10은 0.25~0.61로 급락하는데, MT-OPSD는 SR@10을 0.38~0.52로 올리고 CR@10을 최대 0.04로 낮추면서 초반 턴 성능도 해치지 않는다. 학습 롤아웃이 약 4턴에서 포화되는데도 10턴 평가에서 이득이 유지된다는 점을 저자들은 강조한다. 학습 없는 기법들은 모델 의존적이어서 Emu Edit은 Qwen에서, VAE-LFA는 FireRed에서 효과가 있었고 FreqEdit은 장기 성능을 오히려 떨어뜨렸다. 5턴 MSE-Bench에서는 Qwen의 SR@5가 0.24→0.51, FireRed가 0.40→0.69로 오르고 FLUX는 0.49로 동률을 이뤘으며, 단일 턴 벤치마크 ImgEdit 점수는 세 모델 모두 큰 변화 없이 유지된다. 독점 시스템 중 GPT-Image-1은 심한 장기 열화를 보여 모든 턴과 지표에서 MT-OPSD에 밀렸고, Nano Banana는 붕괴가 드물지만 초반 전역 편집 실패로 SR이 낮으며, GPT-Image-2와 Nano Banana Pro는 장기 지평에서 여전히 더 강하다.

절제 실험은 각 구성 요소의 역할을 수치로 보여준다. 편집 브랜치를 빼면 SR@10이 0.00, CR@10이 0.80으로 편집 능력 자체가 무너진다. 항등 브랜치를 빼면 SR@10은 0.49로 오히려 약간 높지만 CR@10이 0.02→0.06, MSE-Bench SR@1이 0.98→0.85, ImgEdit이 4.49→3.88로 떨어지고 대상 외 콘텐츠를 계속 건드리는 과잉 편집 경향이 나타난다. 온폴리시 속도 정합을 교사가 만든 의사 목표에 대한 표준 플로 매칭으로 바꾸면 SR@5가 0.91→0.59, SR@10이 0.44→0.03, CR@10이 0.02→0.67로 베이스 모델보다 나빠진다. 롤아웃 깊이를 4턴으로 고정하면 SR@10이 0.44→0.17, CR@10이 0.02→0.19가 되고, 교사를 사전학습 초기값으로 고정하면 CR@10은 0.06으로 낮지만 SR@10이 0.19에 묶이며 ImgEdit은 절제 실험 중 가장 높은 4.55를 기록한다.

개발자 관점에서 이 논문의 실용적 의미는 두 가지다. 첫째, 반복 편집 에이전트나 편집 세션 UI를 만든다면 단일 턴 벤치마크 점수만으로 모델을 고르면 안 된다. 이 논문의 측정대로라면 단일 턴에서 멀쩡한 모델도 10턴 안에 성공률이 한 자릿수로 떨어질 수 있다. 둘째, 다중 턴 라벨 없이 자기 출력 롤아웃과 항등 명령만으로 LoRA 적응을 돌릴 수 있다는 점이다. 다만 항등 롤아웃이 내용을 보존한다는 전제 위에 서 있고, 교사 승격 판정과 최종 평가 모두 GPT-4o 판정에 의존하므로 자체 파이프라인에 옮길 때는 판정 모델과 임계값을 직접 검증해야 한다. 항등 브랜치를 빼면 편집이 과해지고, 편집 브랜치를 빼면 편집 자체가 죽는다는 절제 결과는 두 목표를 함께 튜닝해야 한다는 실무 지침으로 읽힌다.

이 논문은 별도의 한계 절을 두지 않았지만 본문에 드러난 전제는 분명하다. 자기 생성 상태는 항등 명령 롤아웃으로 만들기 때문에 의도된 의미 변화가 섞이지 않는다고 가정하며, 실제 편집 명령으로 롤아웃하면 오차와 의도가 얽혀 감독 신호가 흐려진다고 본다. 적응형 커리큘럼은 약 4턴에서 포화되므로 10턴 이상의 더 긴 지평에서 어떤 거동을 보이는지는 이 실험 범위 밖이다. 학습 없는 기법인 Emu Edit류는 거의 변하지 않은 픽셀을 되돌리는 방식이라 국소 편집에는 도움이 되지만 재스타일링·재조명처럼 대부분의 픽셀이 바뀌어야 하는 전역 변환에는 확장되지 않는다는 것이 저자들이 명시한 한계다. 또한 VINCIE 같은 별도 다중 턴 모델은 자체 백본에 얹을 수 없어 부록에서 따로 비교했고, GPT-4o는 학습 중 게이트 승격과 평가 양쪽에 쓰인다.