공간 캔버스에 생성 의도를 조립하는 포스터 생성 모델 Compo

From Prompting to Composing: A Spatial Canvas Interface for Poster Generation

HF Daily2610.12230

Yitong Wang, Fangyun Wei, Jinjing Zhao2026-10-08

무엇인가

이 논문이 푸는 문제는 포스터 생성에서 텍스트 프롬프트가 갖는 인터페이스로서의 한계다. 포스터는 본래 2차원 구조물로, 피사체·텍스트·로고·그래픽 요소가 의도된 위치를 차지하고 특정 정체성이나 시각 내용이 보존되어야 한다. 그런데 프롬프트는 이런 2차원 조형 의도를 1차원 단어 열로 인코딩하도록 요구하기 때문에 간접적이고 모호해진다. 저자들은 레이아웃 제어, 참조 기반 생성, 텍스트 렌더링, 이미지 편집이 각각 별도 기법으로 발전해 왔지만, 이들을 하나의 원리로 묶어 복합적인 그래픽 디자인에 적용하는 일은 아직 미개척 상태라고 지적한다.

어떻게 동작하나

제안하는 것은 Spatial Canvas Interface다. 사용자가 텍스트로 전체 포스터를 서술하는 대신, 2차원 공간 위에 생성 의도를 직접 배치한다. 이를 위해 네 가지 상보적 바인딩을 정의한다. Semantic Binding은 텍스트 개념을 특정 영역에 묶고, Identity Binding은 참조 이미지를 영역에 묶어 시각적 정체성을 보존하며, Text Binding은 정확한 문자열과 그 위치를 함께 지정하고, Pixel Binding은 그대로 보존해야 할 시각 콘텐츠를 직접 배치한다. 이 바인딩들은 한 캔버스 안에서 자유롭게 조합된다. 캔버스가 위치·참조 자산·보존 픽셀·바인딩 종류를 담는 시각 모달리티라면, Text Specifications는 요소별 세부 지시와 배경·스타일 같은 전역 설명을 담는 언어 모달리티다. 즉 의도 명세와 시각 생성을 분리하는 구조다.

무엇과 다른가

학습 데이터는 수작업 대신 자동 파이프라인으로 만든다. 먼저 GPT-5.5, Claude Opus 4.6, Gemini 3.5 Flash로 포스터 테마·항목을 담은 콘텐츠 저장소와 시각 스타일 저장소를 구축하고, 샘플링한 자산을 구조화 명세로 조직한 뒤 자연어 프롬프트로 재작성해 Qwen-Image-2512, Z-Image, ERNIE-Image 같은 텍스트 렌더링에 강한 모델로 렌더링한다. 다음으로 생성된 포스터에서 SAM-3로 인스턴스를 분할하고, 필요하면 FLUX.2-klein-9B로 재조명·재포즈를 적용해 참조 자산을 만들며, Chandra-OCR-2로 렌더링된 텍스트와 그 공간 위치를 복원한다. 이렇게 약 20만 개의 표본을 모은 것이 Compo-200K다.

어떻게 쓰나

모델 Compo는 사전학습된 멀티모달 확산 트랜스포머(MMDiT)를 백본 구조 수정 없이 LoRA로 적응시킨다. 1단계 지도학습에서는 LongCat-Image-Edit과 Qwen-Image-Edit-2511을 각각 백본으로 쓰고, 동결된 Qwen2.5-VL이 캔버스와 텍스트 명세를 VL 토큰으로 인코딩하며 동결된 VAE가 캔버스와 타깃 포스터를 latent로 만든다. 확산 학습에서 노이즈가 더해진 타깃 토큰과 캔버스 토큰, VL 토큰을 MMDiT가 함께 처리하는데, 텍스트 브랜치가 VL 토큰을, 이미지 브랜치가 노이즈 타깃과 캔버스 토큰을 맡는다. 사전학습 구성요소는 동결하고 MMDiT에 붙인 LoRA만 최적화한다. 2단계는 DiffusionNFT를 이용한 강화학습으로, 바인딩별 충실도를 직접 최적화한다. 보상은 세 가지다. 텍스트 보상은 문장 정확도와 정규화 편집 거리(NED)로 렌더링 품질을 재고, 인스턴스 유사도 보상은 DINO-I·CLIP-I·CLIP-T를 결합해 시각적 충실도와 의미 정합성을 평가하며, 레이아웃 보상은 의도 영역과 생성 영역의 IoU를 측정한다. 문장 정확도는 논리 AND로 집계해 모든 바인딩 텍스트가 정확히 렌더링된 경우에만 1이 되도록 했다. 추론은 두 갈래다. 직접 추론에서는 사용자가 캔버스와 명세를 명시적으로 구성하고, 에이전트 모드에서는 고수준 자연어 요청을 에이전트가 요소 추출, 레이아웃 계획, 바인딩 선택, 필요 시 이미지 검색을 거쳐 계획된 캔버스와 명세로 변환한 뒤 Compo에 넘긴다.

전제와 한계

실험은 학습셋과 겹치지 않는 500개 표본 벤치마크에서 수행한다. 바인딩별 지표는 통일된 영역 매칭 프로토콜 아래에서 계산하는데, Semantic은 CLIP-T, Identity는 CLIP-I·DINO-I·CLIP-T, Pixel은 형태와 위치 불변을 전제로 SSIM을 추가하고, Text는 NED와 문장 정확도를 쓴다. SAM-3와 Chandra-OCR-2로 검출한 영역을 최고 IoU 기준으로 정답 영역에 매칭하고, IoU가 임계값 미만이면 해당 지표를 0으로 처리한다. 인스턴스 보존에는 평균보다 엄격한 M-DINO도 함께 보고한다. 저자들은 Compo-LongCat과 Compo-Qwen이 거의 모든 지표에서 범용 text-and-image-to-image 모델과 전용 포스터 생성 시스템을 능가한다고 주장하지만, 제공된 본문에는 표 1의 구체적 수치가 실려 있지 않아 개선폭 자체는 확인할 수 없다. 절제 실험에서는 텍스트 보상을 제거하면 텍스트 바인딩이 크게 나빠지고, 인스턴스 유사도 보상을 제거하면 픽셀·정체성 일관성이, 레이아웃 보상을 제거하면 IoU 관련 지표가 떨어지며, 모든 보상을 제거하면 전반 성능이 최저가 된다. 텍스트 보상 가중치는 w=0.75일 때 문장 정확도가 가장 높고 NED가 두 번째로 높았는데, w=0이나 0.25는 사소한 렌더링 오류에 높은 보상을 주어 감독이 약해지고, w=1은 초기 롤아웃에서 문장 정확도가 거의 0이 되어 보상이 지나치게 희소해진다. LoRA는 텍스트 브랜치와 이미지 브랜치 모두에 적용할 때 최고 성능을 냈다.

개발자 관점에서 이 논문의 핵심은 생성 모델 앞단에 캔버스라는 구조화된 중간 표현을 둔다는 발상이다. 프롬프트 한 줄로는 제어가 어려운 배너·광고 소재 자동화에서, 요소 위치와 참조 자산, 보존 픽셀, 렌더링할 문자열을 명시적 스키마로 관리하고 모델은 그 스키마를 해석만 하게 만들 수 있다. 에이전트 모드가 고수준 요청을 같은 스키마로 변환한다는 점은 LLM 기반 기획 에이전트와 이미지 생성기를 연결하는 파이프라인 설계와 직접 맞닿아 있다. 실무 도입 시에는 어떤 백본과 LoRA 어댑터에 의존하는지, 자동 생성 데이터의 편향이 결과에 어떻게 반영되는지, 그리고 학습 데이터가 생성 모델 산출물인 만큼 상업적 사용 시 라이선스와 초상·상표 관련 위험을 함께 검토해야 한다.

저자들이 밝힌 전제와 한계도 분명하다. 기존 포스터 데이터셋은 이 인터페이스가 요구하는 다양성과 세밀한 주석을 갖추지 못했고 대규모 수작업 구축은 비용이 과도하기 때문에, 학습 감독 전체를 자동 생성 파이프라인에 의존한다. 또한 기존 접근들은 제한된 참조 타입이나 태스크별 제어 모듈에 묶여 확장성이 떨어진다는 것이 이 연구의 출발점이다. Pixel Binding은 스타일과 조명 변화만 허용하고 형태와 공간 위치는 그대로 유지되어야 한다는 더 엄격한 보존 조건을 건다. 재현성을 위해 데이터 구축, 학습, 추론, 평가 설정을 본문 3.1~3.3절과 4절, 그리고 부록에 나눠 기술했다고 밝히고 있다.