Multimodal Flow가 언어와 이미지를 하나의 연속 플로우로 통합 생성한다

Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

arXiv2609.40362v1

Hongyuan Tao2026-09-30조회 18

무엇인가

통합 멀티모달 모델은 지금까지 두 갈래로 발전해 왔다. 하나는 이미지를 시각 토큰으로 양자화해 언어와 같은 이산 범주 시퀀스에 넣는 완전 이산 방식이고, 다른 하나는 언어는 이산적으로 예측하면서 이미지는 확산·플로우로 생성하는 하이브리드 방식이다. 논문은 전자의 문제를 시각 양자화 병목으로 지목한다. 토크나이저가 버린 세부 정보는 모델이 복원할 수 없다는 것이다. 후자는 시각 양자화는 피하지만 언어와 시각이 서로 다른 목적함수와 샘플링 절차를 따르게 된다. 두 패러다임 모두 연속적인 시각 상태와 모달리티 공통의 생성 과정을 동시에 제공하지 못한다는 것이 이 논문의 출발점이다.

어떻게 동작하나

제안하는 Multimodal Flow는 언어와 시각을 각자의 임베딩 공간에 그대로 둔 채 하나의 Flow Matching 목적함수로 묶는다. 텍스트는 길이 B(주 모델에서 8)의 연속 블록으로 잘라 각각 독립적으로 인코딩하고, 이미지는 하나의 시각 청크로 인코딩해 공간 구조를 보존한다. 이렇게 만들어진 단위를 하이퍼청크라고 부르며, 텍스트 청크는 원래 토큰 순서를 유지한다. 구현에서는 동결된 SigLIP 2와 T5-small을 인코더로, 사전학습된 이미지 디코더와 별도로 학습한 텍스트 디코더를 디코더로 쓴다. 두 디코더는 플로우 사전학습 동안 동결된다.

무엇과 다른가

백본은 청크 인과(chunk-causal) 구조다. 전체 청크 시퀀스의 결합분포를 p(C)=∏p(c_k|c_<k)로 분해해, 목표 청크를 예측할 때 앞선 청크는 모두 보이고 미래 청크는 가려지며 청크 내부 위치들은 동시에 모델링된다. 각 목표 청크에는 z_t = t·x + (1-t)·ε 형태의 선형 확률 경로를 적용하고, 백본은 노이즈가 섞인 상태와 시점 t, 앞선 청크를 조건으로 깨끗한 종점을 예측한다. 이 예측을 속도장으로 변환해 회귀하는 것이 손실함수다. 청크 순서와 청크 내부 위치는 MRoPE로 인코딩하고, 청크 인과 마스크를 건 공동 셀프 어텐션으로 시각·텍스트 청크 간 상호작용을 처리하되 피드포워드 네트워크는 모달리티별로 분리한다. 학습 시에는 여러 목표 청크를 한 번의 순전파로 병렬 예측하고(각 청크는 독립적으로 샘플링된 타임스텝을 받는다), 추론 시에는 청크를 순차 생성하며 앞선 청크의 KV를 캐시한다. 조건부 생성에는 동일한 classifier-free guidance를 쓰는데, 조건 청크가 있을 때와 없을 때의 예측을 γ로 외삽한다.

어떻게 쓰나

사전학습은 텍스트만 있는 데이터(연속 텍스트 블록, 첫 청크는 무조건부), 이미지만 있는 데이터(조건 없는 시각 청크), 그리고 이미지-텍스트 쌍을 양방향 순서로 모두 섞는다. 텍스트 청크 뒤에 이미지를 두면 텍스트→이미지, 이미지 청크 뒤에 텍스트를 두면 이미지→텍스트가 된다. 과제가 바뀌어도 청크 인터페이스와 인과 분해, 연속 목적함수는 그대로이고 청크 내용·순서·목표 모달리티만 달라진다. 다운스트림 파인튜닝도 같다. VQA에서는 시각 청크와 질문 청크가 접두부, 답변 청크가 목표가 되고, 텍스트→이미지 생성에서는 프롬프트 청크가 접두부, 이미지가 목표가 된다.

전제와 한계

실험은 1.6B 플로우 백본을 150B 토큰으로 처음부터 학습한 MF-1을 중심으로 한다. 모든 결과는 5B 토큰의 공동 파인튜닝을 거친 동일 체크포인트를 쓴다. MF-1은 GenEval 0.821, DPG-Bench 83.44를 기록했고 VQAv2·MMBench·POPE 평균 75.3을 냈다. 논문은 이를 통합 모델 중 가장 강한 조합 생성 성능과 가장 좋은 장문 프롬프트 정렬로 평가하며, 훨씬 많은 데이터로 학습된 통합 모델들과 경쟁력이 있다고 주장한다. 처음부터 학습한 통합 모델인 Muddit, D-DiT는 일관되게 앞서고, 사전학습 LLM에서 초기화한 동급 모델과는 비슷한 수준이라는 설명이다. 데이터·최적화·파라미터 예산을 맞춘 통제 비교에서는 완전 이산 모델과 하이브리드 모델을 모두 앞섰다. 특히 시각 경로와 백본 설계를 공유하되 텍스트를 자기회귀적으로 모델링하는 Transfusion 스타일 하이브리드가 가장 가까운 비교 대상이었다. 혼합 사전학습의 전이 효과도 수치로 제시된다. 1.6B 아키텍처에서 총 학습 토큰을 맞춘 조건에서 무작위 초기화 대비 SeedBench가 31.6에서 62.4로, MMBench가 36.0에서 67.2로 올랐다. 0.6B·1.2B·1.6B 세 규모 모두 학습이 길어질수록 플로우 목적함수와 언어 PPL이 낮아지고 GenEval·CLIPScore가 올라갔으며, 규모가 클수록 언어 모델링과 이미지 캡셔닝 이득이 컸다.

설계 분석도 실무적으로 유용하다. 시각 표현 공간으로는 DINOv2가 이미지 생성 점수가 가장 높았고, SigLIP2는 GenEval·DPG-Bench는 낮지만 CIDEr와 CLIPScore가 더 높아 생성과 캡셔닝의 균형이 좋았다. 재구성 지향 VAE 잠재(FLUX.2 VAE, SD-VAE)와 원본 픽셀 패치는 이 학습 예산에서 의미론적 임베딩보다 두 과제 모두 뒤처졌다. 계산 구조에서는 공유 어텐션 투영과 모달리티별 어텐션 투영이 비슷했지만, FFN을 공유하면 성능이 떨어졌고 특히 이미지 조건 텍스트 생성에서 손해가 컸다. CFG는 텍스트→이미지와 이미지→텍스트 양쪽에 같은 메커니즘을 적용할 수 있었고, 캡셔닝은 guidance scale 3, 텍스트→이미지 생성은 5에서 가장 좋았다.

개발자 입장에서 이 논문의 의미는 이미지 토크나이저를 포기하지 않으면서도 이해와 생성을 한 백본에서 처리하는 선택지가 실험적으로 뒷받침됐다는 점이다. 다만 시각 표현을 무엇으로 잡느냐가 생성 품질과 캡셔닝 품질을 갈랐고, FFN 공유 여부가 성능을 좌우했으므로, 그대로 재현하기보다는 자신의 데이터 규모에서 인코더 선택과 FFN 분리 여부를 먼저 확인하는 편이 좋다. 코드와 모델은 공개돼 있다.

저자들이 명시한 한계는 분명하다. 결론부에서 더 긴 인터리브 시퀀스, 비디오, 기타 구조화된 모달리티로의 확장은 향후 과제로 남겨 두었다. 또한 시각·텍스트 인코더와 디코더는 사전학습된 것을 동결해 쓰므로, 표현의 상한이 해당 코덱에 묶인다. 표현 공간 비교 결과도 특정 학습 예산에서의 관찰이라는 전제를 달고 있다.