시각 인코더를 뺀 멀티모달 사전학습은 10^22 FLOPs 부근에서 역전한다

How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining

HF Daily2609.35457

Lin Chen, Bolin Ni, Qi Yang2026-09-28조회 3

무엇인가

대부분의 멀티모달 LLM은 대규모 이미지-텍스트 데이터로 미리 학습된 시각 인코더를 붙여 언어 모델에 의미 있는 시각 표현을 공급한다. 반면 인코더 없는 MLLM은 시각 인코더를 제거하고 투영된 이미지 패치를 디코더에 직접 넣어 원시 픽셀에서 시각 표현을 학습한다. 구조가 단순하고 통합적이라는 장점은 여러 연구에서 확인됐지만, 이런 모델이 규모가 커질 때 어떤 스케일링 거동을 보이는지는 체계적으로 규명되지 않았다. 이 논문은 그 빈틈을 채우기 위해 두 아키텍처의 스케일링 법칙을 같은 조건에서 비교한다.

어떻게 동작하나

비교는 11개 희소 MoE 언어 모델 래더 위에서 이뤄진다. 총 파라미터 1.1B~44B, 활성 논임베딩 파라미터 71M~2.4B 범위이며, 두 모델군은 데이터 믹스, 최적화 설정, 시각 토큰 단위(granularity)를 공유한다. 인코더 기반 모델은 사전학습된 SigLIP 2 ViT로 이미지를 인코딩한 뒤 ConvPool 어댑터와 프로젝터를 거쳐 모든 토큰에 인과적 어텐션을 적용하고, ViT는 디코더 크기와 무관하게 같은 크기를 유지한 채 함께 학습된다. 인코더 없는 모델은 원시 이미지 패치를 패치 프로젝션으로 디코더에 매핑하되, 이미지 내부의 시각 토큰끼리는 양방향 어텐션을, 나머지는 인과적 어텐션을 쓴다. 완전 인과적 변형도 별도로 실험한다. 분석은 Chinchilla식 IsoFLOP 프로파일로 예산마다 모델 크기와 토큰 수를 바꿔가며 검증 손실을 이차 함수로 피팅해 최적점 M_opt, D_opt를 찾고, M_opt ∝ C^a, D_opt ∝ C^b (a+b=1) 할당 법칙과 L*(C)=E+KC^-γ 프런티어를 추정하는 방식이다. 효율 이득은 같은 손실에 도달하는 데 필요한 컴퓨트 비율 EG^C와 그 지점의 토큰당 FLOPs 비율 EG^M로 측정하며, 컴퓨트는 시퀀스 길이에 따라 커지는 어텐션 항을 포함한 디코더 FLOPs를 기준으로 센다.

무엇과 다른가

첫 번째 결과는 컴퓨트 최적 할당의 변화다. 텍스트 목표에서는 두 아키텍처의 모델 할당 지수가 거의 같다(인코더 없음 a=0.427, 인코더 기반 a=0.422). 그러나 멀티모달 목표에서는 인코더를 제거하면 a가 0.464에서 0.570으로 올라가 최적점이 더 큰 모델 쪽으로 이동한다. 부트스트랩 80% 구간은 각각 [0.546, 0.595]와 [0.458, 0.472]이며, 시각 토큰에 인과적 어텐션을 쓰는 변형에서도 a=0.557로 같은 경향이 유지된다. 저자들은 이를 인코더 없는 모델이 시각 표현 학습과 언어 모델링을 동시에 떠안느라 디코더 용량을 더 요구하기 때문이라고 해석한다.

어떻게 쓰나

두 번째 결과는 규모에 따른 역전 예측이다. 텍스트 목표에서 두 손실-컴퓨트 곡선은 거의 겹치고 손실-컴퓨트 지수도 0.0973 대 0.0979로 사실상 같으며, EG^C는 약 0.98, EG^M은 약 0.99로 거의 평평하다. 멀티모달 목표에서는 측정 범위 내내 인코더 없는 모델이 같은 손실에 더 많은 컴퓨트를 요구하지만, 손실이 컴퓨트에 대해 더 빠르게 감소해 격차가 좁혀진다. 같은 손실 지점에서 인코더 없는 모델은 더 큰 디코더를 선호해 EG^M ≈ 0.80, 즉 토큰당 FLOPs가 약 1.25배다. 피팅된 법칙을 외삽하면 교차점은 6.1×10^21 FLOPs(80% 구간 [4.2×10^21, 1.0×10^22])로, 최근 대형 모델의 사전학습 컴퓨트(예: Kimi K2.5 약 10^25 FLOPs)보다 세 자릿수 이상 아래다. 5배 오버트레이닝을 가정하면 교차점은 1.2×10^22 FLOPs(구간 [8.4×10^21, 2.0×10^22])로 늦어지고, 최대 예산에서 EG^C는 0.62에서 0.52로, EG^M은 0.80에서 0.74로 낮아진다. 이는 인코더 없는 모델이 큰 디코더를 선호하기 때문에 고정된 모델 크기에 토큰만 더 쓰는 오버트레이닝이 상대적으로 불리하다는 뜻이다. 텍스트 목표에서는 오버트레이닝 후에도 두 비율이 1% 미만으로 변해 여전히 대등하다.

전제와 한계

주제별로 쪼개면 격차의 크기와 좁혀지는 속도가 크게 다르다. 측정 범위 안에서는 모든 주제에서 인코더 없는 모델이 덜 효율적이지만, 외삽했을 때 STEM이 가장 먼저 따라잡고(최대 예산에서 이미 거의 동등), Charts가 그 뒤를 잇고, GUI·OCR·Caption은 훨씬 늦다. STEM은 텍스트와 기호, 단순 도형 중심이고 차트도 기호적 내용으로 환원되기 쉬워 예측이 주로 언어와 추론에 달려 있는 반면, 캡션은 자연 이미지의 풍부한 표현을, GUI와 OCR은 세밀한 공간·텍스트 지각을 요구해 사전학습 인코더가 주는 사전 지식의 가치가 크다.

세 번째 결과는 디코더가 시각 인코딩을 어떻게 대신하는지에 대한 내부 분석이다. 인코더 기반 모델의 멀티모달 손실은 매끄럽게 감소하지만, 인코더 없는 모델은 초반에 완만하다가 짧은 구간에서 급격히 떨어진다. 8B 모델의 12번째 층에서 시각 토큰에 대한 어텐션은 0.217에서 0.645로 뛰어 인코더 기반 모델에 근접한다. 저자들은 손실이 텍스트 토큰에만 걸리기 때문에 시각 토큰은 텍스트가 주목할 때만 학습 신호를 받고, 처음에는 무시되다가 쓸모 있어진 뒤에야 학습이 가속된다고 본다. 양방향 어텐션 실험에서는 텍스트 목표에서 인과적 어텐션이 약 1% 컴퓨트 이득(EG^C=1.011)을 주지만 그 이득은 컴퓨트가 커지면 줄고, 멀티모달에서는 인과적 어텐션이 평균적으로 약간 나쁘며(EG^C=0.990) 양방향의 이득이 규모와 함께 커진다. 층별 표현의 코사인 유사도를 보면 인코더 없는 모델의 시각 토큰은 훨씬 이른 층에서 입력에서 멀어지는 반면 텍스트 토큰 궤적은 두 구조가 비슷해, 얕은 층이 사실상 암묵적 시각 인코딩 단계 역할을 한다. 전문가 라우팅에서는 MaxVio로 측정한 불균형이 시각 토큰에서 인코더 없는 모델이 일관되게 더 높고 분산도 크며, 텍스트 토큰에서는 두 구조가 비슷하다. 일부 전문가가 ViT가 제공하던 시각 전용 파라미터 역할을 떠맡는다는 해석이다.

저자들이 명시한 전제와 한계도 분명하다. 10^22 FLOPs 교차점은 측정 범위 밖에서도 피팅된 법칙이 유지된다는 가정, 시각 인코더 크기를 고정한다는 가정, 그리고 환원 불가능한 손실이 데이터 분포만으로 결정된다는 가정 위의 외삽이다. 컴퓨트는 디코더 FLOPs를 주 지표로 삼았으며, 부록에서는 시각 인코더 FLOPs를 포함해도 결론이 유지되고 오히려 인코더 없는 모델의 상대 효율이 더 강해진다고 밝힌다. 또한 저자들은 인코더 없는 모델이 언어용으로 설계된 디코더를 그대로 물려받기보다 네이티브 시각 표현 학습에 맞춘 디코더 아키텍처와 학습 전략의 탐색이 필요하다고 제안한다.

실무 관점에서 이 논문이 주는 판단 기준은 이렇다. 사전학습 예산이 10^22 FLOPs 근처 또는 그 이상이고, 캡션·OCR·GUI처럼 지각 집약적인 과제 비중이 낮으며 STEM·차트처럼 언어 추론 중심의 멀티모달 과제가 많다면 인코더 없는 통합 구조가 매력적인 선택지가 된다. 반대로 소규모 학습이거나 지각 집약 과제가 핵심이라면 사전학습 인코더를 붙이는 편이 여전히 유리하다. 도입을 검토할 때는 오버트레이닝 비율(고정 모델 크기로 토큰을 더 쓰는 배포 지향 학습)이 인코더 없는 쪽에 불리하게 작용한다는 점, 주제별 격차가 최대 수 orders만큼 벌어진다는 점, 그리고 시각 토큰에 양방향 어텐션을 허용하는 마스크 설계가 규모가 커질수록 이득이라는 점을 함께 확인해야 한다.