PixelUMM이 인코더 없이 이미지와 영상 이해·생성을 픽셀 공간에서 통합한다
PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation
무엇인가
통합 멀티모달 모델(UMM)은 이미지와 영상을 이해하고 생성하는 능력을 한 시스템에 넣으려 하지만, 이해와 생성에 서로 다른 시각 표현을 쓰는 관행이 발목을 잡아 왔다. BAGEL 같은 모델은 이해용으로 ViT 특징을, 생성용으로 VAE 잠재를 함께 넣는다. 문제는 같은 조건 이미지를 두 표현으로 넣으면 시각 컨텍스트 길이가 대략 두 배가 되고 attention과 메모리 비용이 커진다는 점이다. 이미지·영상 프레임·대화 턴이 쌓이는 긴 컨텍스트와 멀티턴 대화에서 특히 불리하다. 게다가 VLM 사전학습은 보통 단일 시각 스트림을 쓰기 때문에 VAE 토큰을 추가하려면 데이터 파이프라인과 학습 레시피를 크게 바꿔야 한다. 픽셀 공간 생성 연구(JiT, PixelDiT)는 잠재 인코딩 단계 자체를 없애는 대안을 제시했지만, 이를 영상으로 확장하는 일은 간단하지 않다. 영상 생성은 첫 프레임을 따로 인코딩하는 causal 3D VAE를, 영상 이해는 샘플링된 프레임을 이미지 인코더로 독립 처리하는 관행을 쓰기 때문이다.
어떻게 동작하나
PixelUMM은 이 문제를 원시 픽셀을 공통 인터페이스로 삼아 푼다. 이미지 H×W×3는 겹치지 않는 16×16 패치로, 영상 F×H×W×3는 4×16×16 튜블릿으로 잘라 각각을 단 하나의 선형 계층으로 백본 은닉 차원 d에 사영한다. 이해용과 생성용 투영이 따로 존재하고, 깨끗한 입력은 이해용, 손상된 생성 타깃은 생성용 투영을 통과한다. 출력은 RMSNorm 뒤 선형 투영으로 되돌린 다음 unpatchify하며, 출력 투영은 영-초기화된다. 결과적으로 비전 인코더도, VAE도, 이산 시각 토크나이저도 없다. 픽셀과 백본 사이의 변환은 1층 선형 투영과 결정적 patchify/unpatchify뿐이다. BAGEL이나 SenseNova-U1과 달리 명시적 타임스텝 임베딩과 타임스텝 조건 AdaLN도 쓰지 않는다. 노이즈 낀 픽셀만 주고 손상 수준을 스스로 추론하게 하며, 타임스텝은 학습 타깃 구성과 샘플링에만 쓴다. 백본은 Qwen3 디코더 전용 트랜스포머에서 초기화하고, Mixture-of-Transformers 구조로 토큰 수준 하드 라우팅을 한다. 각 블록은 라우트별 정규화, QKV/출력 투영, FFN을 갖되 모든 토큰이 같은 멀티모달 self-attention에 참여한다. 텍스트와 깨끗한 시각 토큰은 이해 라우트, 노이즈 시각 토큰은 생성 라우트를 탄다.
무엇과 다른가
네 가지 과제(텍스트, 이미지 이해, 이미지 생성, 영상 이해·생성)는 ChatML로 직렬화하고, 시각 입력과 생성 타깃은 대화 안에서 원시 픽셀 토큰 구간을 차지한다. 어텐션은 텍스트 내부에서는 causal, 각 시각 블록 내부에서는 bidirectional이다. 이미지는 하나의 양방향 아일랜드가 되고, 희소 영상 프레임은 시간 순서대로 정렬된 아일랜드가 되어 뒤 프레임이 앞 프레임을 볼 수는 있어도 그 반대는 안 된다. 밀집 영상 구간은 하나의 튜블릿 블록을 이룬다. 위치 인코딩은 NEO와 SenseNova-U1의 3축 Native RoPE를 따라 어텐션 헤드의 절반을 시간축에, 나머지를 높이와 너비에 1/4씩 배분한다(θ_H=θ_W=10^4, θ_T=10^6). 텍스트 손실은 assistant 토큰에만 적용하는 교차엔트로피에 제곱근 시퀀스 길이 정규화를 붙이고, 픽셀 손실은 JiT를 따라 z_t=(1−t)x+tε로 손상시킨 뒤 깨끗한 픽셀을 예측하되 velocity 공간에서 오차를 계산한다(t̄=max(t,0.05)). 전체 손실은 텍스트·이미지·영상 손실을 단계별 가중치로 합친다.
어떻게 쓰나
학습은 6단계로 진행된다. Joint Stage 1에서 텍스트 전용 과제와 이미지 이해(I2T), 이미지 생성(T2I)을 256×256 해상도로 15만 스텝 학습하고, Gen Stage 1에서 T2I와 T2V를 20만 스텝 더 한다. Und Stage 1은 텍스트와 네이티브 해상도 이미지 이해를 10만 스텝, Und Stage 2·3은 영상 이해를 224×224로 2만 스텝, 448×448로 1만 5천 스텝 추가한다. 마지막 Joint Stage 2에서 모든 과제를 2만 스텝 함께 학습하며 T2I·T2V는 512×512, 영상 이해는 448×448을 쓴다. 이미지 이해 데이터는 FineVision, 영상 이해는 VideoChat-Flash 학습 컬렉션과 LLaVA-Video-178K, 생성은 공개 실사·합성 데이터에서 가져왔다.
전제와 한계
논문의 상당 부분은 설계 선택을 통제 실험으로 비교하는 데 할애된다. 이미지 패치 크기 실험에서 16×16과 32×32를 같은 시퀀스 길이 예산으로 비교했더니, 32×32가 스텝당 네 배 많은 이미지를 처리하는데도 수렴이 더 느렸고 16×16이 후반 학습 구간 내내 더 낮은 MSE를 유지했다. 영상 튜블릿 실험에서는 p32/t4, p32/t2, p16/t4, p32/t1 네 가지를 비교해 시공간 압축이 약할수록 T2V 손실이 낮았고 p32/t1이 가장 낮았다. 그런데도 최종 모델은 Wan2.2 같은 영상 VAE의 관례에 맞춰 p16/t4를 채택한다. 압축률은 p16/t4와 p32/t1이 1,024픽셀을 토큰 하나로, p32/t4가 4,096픽셀을 토큰 하나로 만드는 범위다. 디코더 실험에서는 CFG 스케일 6 부근에서 선형 헤드가 저질감 영역에 격자 모양 아티팩트를 만든다는 점을 확인하고 합성곱 헤드 세 가지를 비교했다. 96×176×320 기준 선형 헤드가 133 GFLOPs·12.6M 파라미터인데, Wan 스타일 업샘플-합성곱 헤드는 2,274 GFLOPs(17.1배)·18.3M, T-S PixelShuffle은 1,279 GFLOPs(9.6배)·52.9M, S-T PixelShuffle은 747 GFLOPs(5.6배)·15.1M이었다. T-S와 S-T는 손실 0.02 부근까지 수렴한 반면 Wan 스타일은 0.05 위에 머물렀고, 패치 경계 상승폭은 선형 헤드가 공간 1.078·시간 1.160으로 가장 컸다. 저자들은 PixelShuffle이 손실과 아티팩트 억제 사이에서 더 나은 절충이며 T-S가 S-T보다 약간 낫다고 정리한다.
픽셀 공간과 VAE 공간 학습을 1만 스텝까지 비교한 실험에서는 VAE 공간 손실이 픽셀 공간의 약 4.3배로 기록됐지만, 서로 다른 예측 공간의 손실이라 픽셀 공간 학습이 더 빠르다는 증거는 아니라고 선을 긋는다. 실제로 클리핑 전 전역 그래디언트 노름은 거의 같았고 픽셀 공간 손실은 간헐적으로 스파이크를 보였다. 모델 크기 실험에서는 8B 모델이 1.7B와 같은 레시피·전역 배치 256에서 약 3분의 1 스텝으로 비슷한 손실에 도달했다(MSE 0.060이 14K 대 40K 스텝, CE 0.50이 10K 대 31K 스텝). GPU 수를 8에서 128로 늘린 실험에서는 CE가 손실 1.0에 도달하는 스텝이 17.5K에서 2K로 약 9배 줄었지만, MSE가 0.065에 도달하는 스텝은 23K에서 17K로 1.3배 줄어드는 데 그쳤다. 시각 조건화 실험에서는 깨끗한 이미지·영상 조건을 이해 전문가로, 노이즈 타깃을 생성 전문가로 보내고 공유 어텐션으로 상호작용하게 하는 단일 스트림 인터페이스를 영상까지 확장했다. 8개 과제로 1만 5천 스텝 다중과제 파인튜닝을 한 뒤 이해 성능을 비교했더니 BLINK +2.37, CV-Bench +2.27, SEED-I −5.41로 이미지 벤치마크는 엇갈렸고, 영상 벤치마크 4개는 dense_mode에서 0.89~3.49점, sparse_mode에서 1.00~3.49점 모두 올랐다. 영상 이해 인터페이스 비교에서는 4 FPS 튜블릿을 쓰는 dense_mode가 1 FPS 프레임 독립 처리를 쓰는 sparse_mode보다 일관되게 낫지 않았다. MVBench는 +0.07점이었고 Video-MME는 −0.22점, LongVideoBench는 −0.68점, LVBench는 변화가 없었다.
Joint Stage 2 이후 벤치마크에서 PixelUMM은 이미지 이해(Table 5), 영상 이해(Table 6), 이미지 생성(Table 7), 영상 생성(Table 8·9) 전반에서 베이스라인과 비슷한 수준의 성능을 냈다고 보고한다. 다만 모델마다 학습 데이터가 달라 이 결과만으로 어느 아키텍처가 우월한지, 어느 쪽이 더 빨리 수렴하는지는 입증할 수 없다고 저자들이 명시한다. 개발자 입장에서 이 논문의 실용적 가치는 두 가지다. 첫째, 비전 인코더와 VAE를 이중으로 유지하며 컨텍스트 길이와 KV 캐시에 부담을 겪는 팀이라면 픽셀 공간 단일 인터페이스가 VLM 사전학습 파이프라인을 그대로 재사용할 수 있는 선택지가 된다. 둘째, 패치 크기·튜블릿 크기·디코더 헤드·프레임 샘플링률 같은 설계 변수의 트레이드오프가 수치와 함께 제시돼 있어, 비슷한 구조를 직접 만들 때 출발점으로 삼을 수 있다. 특히 합성곱 디코더 헤드가 아티팩트를 줄이는 대신 연산량이 5.6~17.1배 늘어난다는 점, 4 FPS 튜블릿 입력이 1 FPS 프레임 입력보다 영상 이해에서 이점이 없다는 점은 실제 서빙 비용을 좌우하는 관찰이다.
저자들이 밝힌 한계는 분명하다. PixelUMM은 어텐션만 공유할 뿐 이해 전문가와 생성 전문가의 파라미터를 완전히 통합하지 않았고, 향후 과제로 이 둘을 더 온전히 합치는 MoE 아키텍처를 제안한다. 또 더 큰 공간 패치(p=64)와 더 긴 시간 튜블릿(τ=8)이 학습과 생성 품질을 해치지 않고 작동하는지도 미검증 상태로 남겨 두었다. 벤치마크 비교는 학습 데이터가 모델마다 달라 아키텍처 우열을 결론짓지 못하며, dense_mode의 이점도 확인되지 않았다. 픽셀 공간과 VAE 공간의 손실 차이(4.3배)는 서로 다른 공간의 값이라 학습 효율 비교로 읽으면 안 된다는 것도 저자들이 직접 못 박은 전제다.