MLLM이 답하기 전에 3D 장면을 상상하도록 가우시안 요약 토큰을 학습시킨다
Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering
무엇인가
다중 시점 이미지로부터 3D 세계를 추론하는 일은 여전히 멀티모달 대형 언어모델(MLLM)의 약점이다. 단일 이미지나 연속 영상은 사람 수준에 근접했지만, 시점이 다른 여러 장을 함께 주고 진짜 3D 추론을 요구하면 가장 큰 모델도 사람에 못 미친다. 기존 접근은 크게 두 갈래였다. 하나는 시점 간 픽셀 수준 대응을 강화하는 쪽으로, 점군 좌표를 패치 특징에 심거나(Video-3D-LLM, LLaVA-3D), 조감도 마커를 렌더링하거나(GPT4Scene), 시점 간 재구성 프리텍스트를 붙이거나(Ross3D), 대응 관계로 특징을 증류한다(3DRS). 다른 하나는 CUT3R·VGGT 같은 3D 재구성 파운데이션 모델의 특징을 MLLM 이미지 특징과 융합하는 쪽(VLM3R, G²VLM, 3DThinker)이다. 논문은 두 계열 모두 세밀한 픽셀 수준 3D 신호에 의존하는데, 그 이득이 크지 않다고 지적한다.
어떻게 동작하나
저자들은 인간의 공간 인지로 눈을 돌린다. 인지 연구에 따르면 사람은 픽셀 단위 대응이나 조밀한 깊이 맵을 머릿속에 유지하지 않는다. 여러 시점의 장면을 보면 시점 간에 공통으로 등장하는 물체를 식별하고, 그것을 앵커로 시점 사이의 거친 기하 관계를 추론한 뒤, 장면의 압축된 3D 배치를 머릿속에서 조립한다. 즉 추론을 떠받치는 표현은 물체 수준이고 근사적이다. Imagine3D-LLM은 이 과정을 흉내 낸다. 이미지 토큰 뒤에 소수의 학습 가능한 가우시안 요약 토큰을 덧붙이고, 이 토큰들을 3D 가우시안 스플래팅(3DGS) 파라미터로 디코딩한다. 각 요약 토큰은 3D 가우시안 한 묶음을 만들어 장면의 일부를 설명한다.
무엇과 다른가
구조에는 두 가지 의도적 설계가 들어간다. 첫째, 이미지 특징에서 직접 가우시안을 뽑지 않고 전용 요약 토큰에서 뽑는다. 그래야 모델이 2D 이미지 내용을 이미지 정렬된 가우시안으로 복사붙여넣기 하는 것을 막고 실제 기하를 복원하게 된다. 둘째, 요약 토큰 수를 이미지 토큰 수보다 훨씬 적게 두는 정보 병목을 건다. 이 제약 아래에서는 시점 간에 겹치는 내용이 공유 토큰으로 합쳐질 수밖에 없고, 어떤 물체가 여러 시점에 걸쳐 반복되는지, 그것이 하나의 3D 배치 안에서 어떻게 맞물리는지를 모델이 따져야 한다. 구현은 LLaVA-Video-7B 기반이고 이미지 한 장이 210토큰, 32장 입력이면 이미지 토큰이 6720개인데 요약 토큰은 2592개(장당 81개)만 쓴다. 토큰 하나가 가우시안 32개를 디코딩하며, 28층 LLM의 중간층인 14층 은닉 상태에서 뽑아 3층 MLP 가우시안 헤드로 넘긴다.
어떻게 쓰나
학습 목표는 세 가지를 결합한다. 언어모델링 손실이 텍스트 토큰의 자기회귀 예측을 감독하고, 재구성 손실이 디코딩된 가우시안을 입력 시점에서 미분 가능 래스터화로 렌더링해 원본 프레임과 MSE·LPIPS로 비교한다. 여기에 ZipSplat이라는 사전학습된 압축 가우시안 추정기를 교사로 두고 증류를 더한다. 요약 토큰 위치의 은닉 상태를 교사의 정제된 쿼리 토큰과 코사인 유사도로 정렬하고, 학생이 디코딩한 가우시안 파라미터를 교사 예측과 L2로 맞춘다. 순수 광도 감독만으로는 LLM을 통과하는 학습이 지나치게 느리다는 것이 증류를 넣은 이유이며, 교사는 학습 시에만 쓰이고 동결된다.
전제와 한계
실험은 ScanNet 계열 6개(SQA3D, Real-3DQA, ScanQA, Scan2Cap, ScanRefer, Multi3DRefer)와 3D 인지·추론을 세 단계로 나눠 평가하는 SPAR-Bench, 총 7개 벤치마크에서 이뤄졌다. 학습 데이터는 ScanNet 기반 데이터셋에 SPAR-7M에서 뽑은 10만 개 하위셋을 더했고, 16대의 GH200으로 유효 배치 64, 1에폭을 돌렸다. 결과적으로 기존 최강 3D LMM인 Ross3D를 거의 모든 벤치마크에서 앞섰고, 언어 지름길 과적합을 벌점으로 설계한 Real-3DQA에서 최고 성능을 냈다. SPAR-Bench에서는 모든 인지 단계에서 1위로, 7B 백본으로 72B급 모델을 29점 이상 앞섰고, 가장 강한 공간 인지 베이스라인인 3DThinker-7B도 전체 5.2점 차로 눌렀다. 특히 물체 수준 시점 간 추론을 요구하는 중간 단계 분할에서 51.5에서 67.0으로 15.5점 올랐다.
절제 실험은 설계 선택을 뒷받침한다. 가우시안을 디코딩할 층을 7·14·21로 바꿔보면 중간층인 14가 일관되게 가장 좋았다. 증류를 빼면 재구성 손실이 1에폭 뒤에도 크게 남아 그래디언트가 재구성 쪽으로 쏠리고 언어 목표가 덜 최적화되는데, 4에폭까지 늘리면 증류를 넣은 1에폭 모델에 거의 도달한다. 즉 이득의 본체는 재구성이지 더 긴 학습이 아니다. 교사 토큰을 그냥 입력에 넣거나 증류만 하고 재구성은 빼면 베이스라인과 비슷한 수준에 머문다. 재구성 손실이 요약 토큰으로 하여금 이미지 토큰에 능동적으로 주의를 기울여 3D 파라미터 추정에 필요한 시각 증거를 뽑아내게 만들고, 그 과정이 모델 내부 표현을 바꾼다는 설명이다. 요약 토큰 수를 1296·2592·5184로 늘려보면 너무 적으면 용량이 부족하고 너무 많으면 병목이 약해져 양쪽 다 성능이 떨어진다.
분석 파트는 부수 효과를 보여준다. 재구성 손실은 요약 토큰에만 걸리는데도 LLM의 이미지 특징 자체가 더 3D를 인지하게 된다. 한 시점의 질의 점과 다른 시점 이미지 특징 사이의 어텐션 맵이 더 날카롭고 공간적으로 집중되며, 중간층 이미지 토큰 은닉 상태의 주성분 3개를 RGB로 시각화하면 베이스라인의 잡음 같은 특징과 달리 같은 물체가 시점에 관계없이 같은 색으로 인코딩된다. 또 학습된 요약 토큰을 K-means로 군집화해 각 군집이 디코딩한 가우시안을 보면, 군집 하나가 의자 같은 물체 하나를 모든 시점에서 안정적으로 국소화한다. 물체 수준 군집 감독을 전혀 주지 않았는데도 나타난 창발적 그룹화다.
개발자 관점에서 이 논문의 실무적 시사점은 3D 인지 MLLM을 만들 때 픽셀 단위 기하를 정답처럼 알려주는 대신, 답변 전에 장면을 압축 표현으로 재구성하는 보조 목표를 넣는 편이 낫다는 것이다. 다중 시점 입력을 쓰는 로봇 조작, embodied AI, AR/VR 장면 이해 파이프라인이라면 이미지 토큰 뒤에 요약 토큰을 붙이고 렌더링 손실로 감독하는 구조를 그대로 참고할 수 있다. 다만 도입 전에 확인할 것은 세 가지다. 요약 토큰 수가 성능을 좌우하는 병목이라는 점, 디코딩 층을 중간층으로 잡아야 한다는 점, 그리고 순수 광도 감독만으로는 수렴이 느려 별도의 교사 모델 증류가 사실상 필요하다는 점이다. 학습 비용도 16대 GH200에 1에폭이라는 규모이므로 자원 계획에 반영해야 한다.
한계와 전제는 논문이 명시적으로 밝힌 범위 안에서 읽어야 한다. 이 방법은 시점이 알려진 다중 시점 이미지를 입력으로 받고 그 시점에서 렌더링해 재구성 손실을 계산하므로, 시점 정보가 없거나 이미지가 한 장뿐인 상황은 전제에서 벗어난다. 학습 시점에만 쓰이는 ZipSplat 교사 모델에 의존한다는 점도 전제다. 저자들은 주 목표가 신규 시점 합성이 아니라 3D 추론이라고 못 박고, 재구성 품질과 계산 비용 사이의 절충을 의도적으로 택했다고 설명한다. 학습 데이터가 ScanNet 계열에 SPAR-7M 10만 개를 더한 구성이라는 점, 그리고 논문에 제시된 범위에서는 별도의 한계 절이 없다는 점도 함께 봐야 한다.