AutoRef가 다중 참조 이미지 생성 하네스를 자동으로 최적화한다
AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation
무엇인가
다중 참조 이미지 생성은 여러 장의 참조 이미지를 입력으로 받아 하나의 새 이미지로 합성하는 능력이다. 사용자가 인물, 사물, 의상, 배경, 스타일을 각각 다른 이미지로 지정할 수 있어 광고, 가상 착용, 콘텐츠 제작에 바로 쓸모가 있다. 문제는 합성이 어렵다는 점이다. 모델이 참조 속 피사체를 빠뜨리거나 중복시키고, 여러 피사체가 장면에 자연스럽게 어우러지지 못한 채 붙여넣기처럼 보이는 결과를 낸다. 최근에는 이미지 생성 모델과 추론 모델을 하네스로 묶은 이미지 생성 에이전트가 제안됐다. 하네스는 참조 이미지를 어떻게 해석하고, 프롬프트를 어떻게 구성하고, 후보를 어떻게 생성·평가하고, 최종 출력을 어떻게 고르는지를 규정하는 실행 가능한 프로그램이다. 그런데 다중 참조 생성에서는 참조마다 역할이 다르고(정체성, 배경, 스타일 등) 출력이 여러 기준을 동시에 만족해야 해서 하네스의 개선 지점이 많고, 어떤 변경이 얼마나 성능을 올릴지 예측하기 어렵다. 실제로 사람이 작성한 하네스들은 성능 편차가 매우 크다.
어떻게 동작하나
이 논문이 제안하는 AutoRef는 이미지 생성 모델과 추론 모델의 파라미터를 모두 동결한 채, 그 둘을 묶는 하네스 코드만 코딩 에이전트가 반복적으로 다시 쓰게 한다. 핵심 설계는 두 가지다. 첫째, 하네스 수정 제안에 피드백을 주는 태스크 집합과 후보를 선택하는 데 쓰는 태스크 집합을 분리한다. 검색 태스크를 서로 겹치지 않는 D_train과 D_val로 나누고, D_train의 점수·평가자 근거·실행 궤적·생성 이미지만 제안자에게 노출한다. D_val은 후보 선택에만 쓰이고 그 점수와 산출물은 제안자에게 절대 보이지 않는다. 둘째, 매 반복마다 하나의 하네스만 남기는 대신 D_val 기준 상위 B개를 유지하는 빔 서치를 돌린다. 실험에서는 B=2, K=4로 두고, 기본 생성기 하네스와 GEMS를 초기 빔으로 삼아 5회 반복했다.
무엇과 다른가
이렇게 찾아낸 AutoRef-Harness는 이미지를 3장 생성하고 나머지 결정은 모두 추론 모델이 내린다. 먼저 구조가 다른 두 프롬프트로 초안 A와 B를 만들고 더 나은 쪽을 남긴다. 그 승자에 대한 구체적 불만 목록을 만들어 초안 C를 생성한 뒤, 승자와 C 중 최종 하나를 고른다. 구성 요소는 네 가지다. 참조 접지 프롬프팅은 원본 지시문을 생성기에 그대로 넘기지 않고, 추론 모델이 요청된 각 요소를 해당 참조 이미지에 배정하는 프롬프트를 새로 쓴다. 구조적 다양성 확보는 초안 A가 장면을 피사체별로 서술하는 반면, 초안 B는 배경·스타일 참조를 캔버스로 삼아 나머지 피사체를 그 위에 그리게 하는 식으로 프롬프트 구조 자체를 바꾼다. 불만 기반 수정은 승자에 대해 최대 5개의 구체적 불만을 나열하되 각 불만이 어느 참조에 관한 것인지 명시하고 프롬프트를 고쳐 쓴다. 실패 인지 선택은 쌍대 비교 전에 참조 누락, 피사체 중복·추가, 배경 오류 같은 하드 실패 개수를 먼저 세고, 동점일 때만 추론 모델이 두 제시 순서 모두에서 승자를 정하게 하며 도전자가 양쪽 모두 이겨야 교체된다.
어떻게 쓰나
실험은 MultiBanana 벤치마크의 4참조 과제 229개를 48개 학습, 48개 검증, 133개 테스트로 나누고 Qwen3-VL-8B-Instruct를 평가자로 써서 진행했다. AutoRef-Harness는 오픈웨이트 FLUX.2 [klein] 4B를 10점 만점에 5.72에서 7.37로 끌어올려, 평가된 모든 오픈 모델을 앞서고 GPT-Image-1.5, Nano Banana Pro, Seedream 4.5 같은 상용 모델과 대등하거나 앞선 성능을 냈다. 재최적화 없이도 전이가 확인됐다. 같은 하네스를 더 큰 FLUX.2 [klein] 9B와 Qwen-Image-Edit-2511에 적용해도 성능이 올랐고, 학습에 쓰지 않은 3참조·5참조 설정에서도 일관되게 개선됐다. 검색에 전혀 쓰지 않은 OmniContext 벤치마크를 공식 GPT-4.1 평가자로 채점했을 때도 향상이 유지됐다. 추론 모델을 GPT-5.5에서 오픈웨이트 Qwen3-VL-32B로 바꿔도 5.72에서 6.90으로 올랐다.
전제와 한계
비교 실험도 여럿 제시된다. 사람이 작성한 하네스인 Best-of-3, GEMS, IPR, Idea2Img와 비교해 AutoRef-Harness가 4참조 테스트 분할에서 가장 높았고, 태스크당 이미지 생성 9회를 쓰는 Idea2Img는 3회를 쓰는 AutoRef-Harness보다도 낮았다. 하네스 최적화 방법론과의 비교에서는 같은 생성기·추론 모델·평가자 조건에서 AutoRef가 Meta-Harness와 Greedy Search를 앞섰고, AutoRef의 두 번째로 좋은 하네스조차 두 방법의 최종 하네스를 능가했다. 절제 실험에서 참조 접지 프롬프팅만 단독으로 쓴 경우 6.91(이미지 1장)로 3장을 쓰는 IPR의 7.02에 근접했고, 선택기만 바꾼 경우 6.15로 Best-of-3의 6.01과 비슷했지만, 같은 선택기가 전체 하네스 안에서는 0.44점을 더했다(7.37 대 6.93). 사람 평가에서도 4명의 평가자가 50개 과제씩 비교해 기본 생성기 상대 70% 승리(17% 패배), FLUX.2 [klein] 9B 상대 64% 대 24%, Seedream 4.5 상대 63% 대 27%, Nano Banana Pro 상대 46% 대 40%를 기록했다.
개발자 입장에서 이 논문의 실용적 요점은 모델을 파인튜닝하지 않고 추론 시점의 오케스트레이션 코드만 바꿔서 유의미한 성능 향상을 얻었다는 것이다. 이미 강한 이미지 생성 모델을 쓰고 있지만 참조 이미지 조합 품질이 불만족스러운 파이프라인이라면, 프롬프트 재작성, 후보 다양화, 불만 기반 수정, 실패 우선 선택이라는 네 축을 자체 하네스에 이식해볼 가치가 있다. 다만 도입 전에 확인할 것이 있다. AutoRef-Harness는 태스크당 이미지 3장을 생성하므로 지연과 비용이 늘고, 검색이 단일 VLM 평가자의 점수를 최대화하는 방향으로 이뤄졌으므로 자체 평가자와 상충하지 않는지 봐야 한다. 또한 하네스는 동결된 생성기가 낼 수 있는 범위를 넘지 못한다.
저자들이 밝힌 한계도 분명하다. 하네스는 동결 생성기의 사용 방식만 바꾸므로 생성기가 수용 가능한 초안을 전혀 못 만들면 선택을 아무리 잘해도 소용이 없다. 실제로 Qwen-Image-Edit-2511을 5참조에 적용한 경우가 그런 사례다. 또 검색은 단일 VLM 평가자의 점수를 최대화하는데, 그럼에도 OmniContext와 GPT-4.1 평가자로 전이됐다는 점은 저자들이 강조하는 관찰이다. 평가자와 제안자는 교체 가능하므로 더 강한 VLM과 코딩 에이전트, 분할 모델을 결합한 더 풍부한 평가자로 확장할 여지가 있다고 논문은 적고 있다. 코드와 AutoRef-Harness는 공개 저장소에서 받을 수 있다.