FLAT은 이미지·텍스트를 1D 가변길이 정렬토큰으로 리샘플링해 검색·생성에 쓴다.

FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation

HF Daily2609.16591

Guangyu Sun, Shlok Kumar Mishra, Wentao Bao2026-09-15조회 4

무엇인가

이 논문이 겨냥하는 문제는 멀티모달 시스템이 표현 학습과 생성을 두 단계로 분리해온 관행이다. CLIP이나 DINO 같은 인코더를 대조 학습이나 자기지도 학습으로 먼저 만들고, 그 결과를 얼린 채 BLIP-2나 LLaVA 같은 I2T 모델의 어댑터에 연결하거나, Stable Diffusion·SDXL·SD3·PixArt·Sana처럼 얼린 텍스트 인코더를 T2I 조건으로 쓰는 구조가 표준이었다. 저자들은 이 분리가 생성 성능을 얼린 표현 뒤에 묶어두고, 생성 모델 학습 단계에서 다시 정렬 작업을 요구한다고 지적한다. 그래서 표현 학습과 생성을 처음부터 함께 최적화하되, 대조 학습 특유의 선형 보간 가능한 임베딩 공간은 유지하는 방향을 다시 검토한다.

어떻게 동작하나

방법의 골격은 다음과 같다. 입력 x(이미지 또는 텍스트)에 N개의 학습 가능한 register 토큰 R을 덧붙이고, 시스템 프롬프트 "Represent the input"과 함께 공유 멀티모달 인코더 f_enc에 넣는다. register 위치의 은닉 상태를 선형 투영해 표현 z = W_lat · f_enc(x, R) ∈ R^(N×d)를 얻으며, 두 모달리티가 같은 register와 같은 투영을 공유한다. 가변 길이를 만들기 위해 표현 z에 nested dropout을 직접 적용하는데, 매 배치마다 기하 사다리 K ∈ {1, 4, 16, 64, 256}에서 유지 길이 K를 뽑아 접두사 z_:K만 대조 손실과 두 디코더에 넘긴다. 연속 정수가 아니라 기하 사다리에서 뽑는 이유는 체감되지 않는 길이 차이에 최적화 스텝을 낭비하지 않기 위해서다. FlexTok이 꼬리 위치를 학습된 null 임베딩으로 패딩해 길이를 고정하는 것과 달리, FLAT은 접두사를 그대로 잘라 쓰는 쪽이 자사 학습 설정에서 더 나았다고 밝힌다. K는 학습 스텝당 한 번 샘플링해 모든 랭크에 전역 브로드캐스트하므로, 대조 목표와 생성 목표가 매 스텝 정확히 같은 접두사 위에서 동작한다.

무엇과 다른가

잘린 표현 z_:K는 e = RMSNorm(MLP(z_:K)) ∈ R^(K×h)로 각 디코더 입력 차원에 사상되고, I2T와 T2I용 MLP는 분리된 태스크별 파라미터를 쓴다. I2T 디코더는 표준 자기회귀 언어모델로, 이미지 소프트 토큰 e_img 앞에 "Describe the input" 시스템 프롬프트를 붙여 캡션을 생성한다. T2I 디코더는 연속 VAE 잠재를 디노이징하는 rectified flow 트랜스포머이며, 텍스트 소프트 토큰 e_txt가 크로스 어텐션을 통해 의미 조건으로 들어간다. 학습 목표는 세 가지의 합 L_total = λ_align·L_align + λ_txt·L_txt + λ_img·L_img다. 대조 손실은 대응하는 register 위치끼리의 late-interaction 점수 s_ij^(K) = (1/K) Σ_{n=1}^{K} (z_i,n^img)^T z_j,n^txt / (‖z_i,n^img‖₂‖z_j,n^txt‖₂)를 써서 I2T·T2I 양방향 대조 항의 평균으로 정의하고, 캡션 손실은 L_txt = -Σ_t log p_θ(y_t | y_<t, z_:K^img), 이미지 손실은 x̂_t = (1-t)x̂ + tε, v* = ε - x̂로 두고 L_img = E[‖v_φ(x̂_t, t, z_:K^txt) - (ε - x̂)‖₂²]로 쓴다. 구현은 표현 인코더와 텍스트 디코더를 Qwen3.5-2B 백본에 서로 다른 LoRA 어댑터로 얹고, 이미지 디코더는 SANA-1.6B에서 초기화했다.

어떻게 쓰나

생성 결과부터 보면, 사전학습만 마친 상태에서 T2I GenEval 71.1을 기록했고, 120K 이미지-텍스트 쌍으로 이미지 디코더를 8k 스텝 추가 학습한 뒤에는 프롬프트 재작성 없이 GenEval 0.83(83.1)에 도달했다. 같은 무재작성 프로토콜의 MetaQuery-L이 0.78이므로 이를 앞서며, 프롬프트를 추가로 재작성하는 7B 모델 두 개보다도 높다고 논문은 밝힌다. GenEval 범주별 분석에서는 K=1이 단일 객체·색상 같은 기초 의미는 잡지만 두 객체, 위치, 색상 바인딩 같은 관계·조합 과제는 K=1에서 거의 0(색상 바인딩 0.03)이고 K=4, K=16에서 급격히 회복해 0.67까지 오른다. I2T 쪽은 COCO Karpathy train+restval로 I2T 디코더 LoRA만 5k 스텝 파인튜닝해 BLEU-4 40.5, CIDEr 138.6을 냈고, K=1만으로도 CIDEr·METEOR·SPICE에서 CrossFlow나 SCD-Net 같은 베이스라인을 앞선다.

전제와 한계

검색과 표현 품질도 함께 보고된다. MS-COCO에서 Recall@5가 I2T 86.8 / T2I 75.8, Flickr30K에서 98.3 / 93.6이며, 사전학습만 한 제로샷 상태에서도 MS-COCO Recall@5가 I2T 69.1 / T2I 64.6이다. 주목할 점은 토큰 하나가 64차원이고 K=1이면 64차원, K=256이면 16,384차원인데, FLAT의 검색 성능은 K 전 구간에서 거의 변하지 않는다는 것이다. 반면 MRL·SAE·CSR 같은 적응적 차원 베이스라인은 K가 줄면 정확도가 급격히 떨어진다. 즉 256배 폭 축소에도 모든 지표가 약 1%p 안에서 유지되며, 첫 토큰이 전역 의미와 판별력을 충분히 담는다는 해석이 가능하다. ImageNet 선형 프로빙에서는 얼린 K=1 토큰에 단일 선형 분류기를 붙여 top-1 73.3%, K=16에서 81.2%를 기록해 순수 생성 잠재 공간보다 높고, 표현 인코더를 이미지 디코더와 함께 학습한 DREAM을 동일 차원에서 앞선다. 서론에서는 이 수치를 81.8로 언급하는데 본문 4.3.2의 81.2와 표기가 엇갈린다. 기하 분석에서는 CLIP·SigLIP2가 검색 성능이 좋아도 모달리티 갭이 남는 반면, FLAT은 register 토큰 하나로 CLIP의 중심 거리를 절반으로, 256 토큰 전체로 4분의 1로 줄인다. 이 정렬 덕분에 z_α = (1-α)z₁ + αz₂ 선형 보간, z_edit = z₁ - z₂ + z₃ 잠재 산술, CIRR에서의 제로샷 조합 검색이 별도 학습 없이 동작한다. 소거 실험은 비어 있지 않은 7개 손실 조합을 40k 스텝씩 학습해 K=256에서 비교했고, 세 손실을 모두 쓰는 구성이 5개 지표 전부에서 강하며 대조 손실과 생성 손실이 충돌하지 않고 상호 보강한다고 보고한다. 추가로 8개 연합에 대한 Shapley 값 분해로 손실 간 기여도를 정량화한다.

실무 관점에서 이 논문이 주는 시사점은 명확하다. 검색용 임베딩과 생성 조건을 별도 모델로 두고 정렬 비용을 치르는 대신, 하나의 인코더 패스에서 K만 바꿔 거친 결과부터 세밀한 결과까지 얻는 구조를 쓸 수 있다는 것이다. 특히 K=1에서도 검색 지표가 유지된다는 점은 벡터 DB에 64차원만 저장해도 된다는 뜻이라 저장·지연 비용 계산이 달라진다. 다만 논문이 제시한 SOTA 수치는 태스크별 파인튜닝 이후 값이라는 점을 반드시 확인해야 한다. T2I는 8k 스텝, I2T는 5k 스텝, 검색은 COCO 5k·Flickr30K 320 스텝의 별도 적응이 필요했고, 사전학습 제로샷 상태의 GenEval은 71.1, MS-COCO Recall@5는 69.1/64.6 수준이다. 또한 K를 기하 사다리 {1,4,16,64,256}에서 뽑고 스텝당 한 번 전역 브로드캐스트하는 설계, 접두사 절단이 FlexTok식 null 패딩보다 낫다는 결론은 모두 이 논문의 학습 설정에 국한된 선택이라는 점도 전제로 깔려 있다.

한계와 전제는 저자가 명시적으로 정리한 별도 한계 절이 이 원문 범위에는 없다는 점을 먼저 밝혀둔다. 대신 본문에서 확인되는 전제는 다음과 같다. 첫째, 단일 사전학습 단계만으로는 각 태스크의 SOTA에 도달하지 못하고 태스크별 파인튜닝이 필요하다. 둘째, 길이 샘플링을 연속 정수가 아닌 기하 사다리로 제한하며, 다른 샘플링 전략과의 비교는 부록 F.3으로 미룬다. 셋째, 표현 절단 방식의 우위는 부록 I의 자사 설정 비교에 근거한다. 넷째, 평가는 GenEval, MS-COCO Karpathy, Flickr30K Karpathy, MMEB CIRR 테스트 분할에 집중되어 있고, 다국어 프롬프트와 비디오 모달리티로의 제로샷 일반화는 부록 G로 분리되어 있다. 또한 서론의 ImageNet 선형 프로빙 81.8과 본문의 81.2처럼 동일 지표의 표기가 문서 내에서 일치하지 않는 부분이 있으므로, 인용 시에는 어느 절의 수치인지 확인하는 편이 안전하다.