국소·전역 재구성을 QA로 배우고 공간 CoT로 추론하는 2단계 VLM 훈련법
SpatialSpeak: QA-Native Reconstruction with Local and Global Context for Spatial Chain-of-Thought Reasoning
무엇인가
다중 뷰 이미지를 입력받는 비전언어모델(VLM)에 3D 기하 사전지식을 넣으려는 시도는 많았지만, 정답만 주는 학습은 중간 단계의 기하 추정값과 그것을 답 도출에 어떻게 쓰는지를 직접 감독하지 않는다. 저자들은 정량적 공간 질문일수록 정확한 기하 추정과 그 추정을 활용한 추론이 모두 필요하다고 보고, VLM이 먼저 국소 기하와 전역 장면 맥락을 다중 뷰 재구성으로 함께 배운 뒤 공간 체인오브소트(CoT)를 배우면 감독 효과가 커진다는 가설을 세운다. 이를 검증하기 위한 2단계 프레임워크가 SpatialSpeak이다.
어떻게 동작하나
1단계 QA-Native Reconstruction Pretraining(QA-RP)은 두 종류의 질의를 모두 텍스트 질의응답으로 정식화한다. 국소 질의는 특정 프레임의 2D 점을 빨간 십자로 표시하고 그 점의 3D 좌표를 첫 프레임 카메라 좌표계로 답하게 한다. 정답 좌표는 ScanNet 깊이 맵과 알려진 카메라 외부 파라미터로 계산한 상대 회전·이동 변환 결과다. 전역 질의는 모든 프레임에서 보이는 객체 인스턴스를 열거하고 각 객체의 의미 라벨과 3D 중심을 같은 첫 프레임 좌표계로 예측하게 한다. 객체는 첫 등장 프레임 순서, 같은 프레임 안에서는 좌에서 우, 위에서 아래 순으로 정렬해 출력 시퀀스를 결정적으로 만든다. 두 과제 모두 별도 3D 회귀 헤드나 기하 손실 없이 표준 다음 토큰 예측 손실로만 학습되며, 이 QA 네이티브 설계가 기하 예측과 이후의 자기회귀 추론 인터페이스를 일치시킨다.
무엇과 다른가
2단계 CoT-VC(Spatial Chain-of-Thought with Visual Compensation)는 1단계 체크포인트에서 출발해, 질문과 관련된 객체를 식별하고 그 기하 추정값을 명시적으로 서술한 뒤 계산을 거쳐 답을 도출하도록 훈련한다. CoT 데이터는 ScanNet에 3D 객체 주석을 붙여 거리·크기·개수·가장 가까운 객체 네 가지 질문 유형에 대해 결정적 생성기로 만든다. 거리는 두 객체 중심 간 거리에서 각 바운딩 박스의 평균 반변 길이를 근사 반지름으로 빼는 방식으로 추정하고, 상대 오차가 임계값 τ 이하면 신뢰(High), 아니면 비신뢰(Low)로 라벨링한다. 응답 형식은 3D 추론 체인 뒤에 신뢰도 토큰을 붙이고, High면 기하 기반 답을, Low면 한계를 인정하고 시각 관찰로 보정한다는 문구와 함께 정답을 출력하도록 감독한다. 이 네 유형에 포함되지 않는 질문(예: 상대 방향)은 직접 정답 감독을 유지해 전체 과제 분포를 보존한다.
어떻게 쓰나
ReVSI 절제 실험에서 두 요소를 모두 뺀 베이스라인은 52.4점, QA-RP만 적용하면 55.9점, CoT-VC만 적용하면 55.0점, 둘을 결합하면 62.8점으로 베이스라인 대비 10.4점 향상됐다. QA-RP가 있을 때 CoT-VC의 이득은 6.9점으로, 없을 때의 2.6점에서 크게 늘어난다. 재구성 감독을 분해하면 전체 62.8점 대비 전역 객체 중심 질의를 뺀 경우 59.9점, 국소 포인트 질의를 뺀 경우 59.3점, 둘 다 뺀 경우 55.0점이었다. 신뢰도 임계값은 τ=0.3이 62.8점으로 가장 높았고 τ=0.1은 59.6점, τ=0.5는 59.5점이었다. CoT만 넣고 시각 보정을 빼면 58.5점으로, 시각 보정이 추가로 4.3점을 기여한다.
전제와 한계
주요 벤치마크에서도 수치가 뒷받침된다. ReVSI 평균 62.8점으로 비교 대상 중 최고인 SpatialStack-4B(54.1)를 8.7점 앞서고, 7개 과제 중 5개에서 최고 기록을 냈다. 객체 개수 세기 64.9 대 36.3, 방 크기 66.0 대 54.4, 상대 거리 71.9 대 62.9가 대표적 차이다. VSI-Bench 일반 학습 설정에서는 63.3점으로 Omni-View-7B(55.4)를 7.9점 상회했고, 학습 데이터를 확장한 설정에서는 4B 백본으로 73.0점을 기록해 GeoThinker-8B(72.6)를 넘었다. SPAR-Bench는 평균 76.0점으로 SpatialStack-4B(72.0)와 GeoThinker-8B(68.2)를 각각 4.0점, 7.8점 앞선다. 별도로 ScanNet 검증 200장면에서 1단계 모델의 포인트맵 정확도를 측정했는데, 정렬 없이 Acc./Comp. 오차 8.9/9.3cm로 CUT3R(13.7/12.7cm)과 MapAnything(36.3/28.4cm)보다 낮았고, GT Sim(3) 정렬 후에는 5.0/5.0cm로 MapAnything(5.7/6.2cm)보다는 낮지만 CUT3R(4.7/4.6cm)보다는 약간 높았다.
실무 관점에서 이 논문의 핵심은 훈련 레시피다. 구현은 Qwen3-VL-4B를 초기화로 쓰고 비전 인코더와 MLP 프로젝터는 동결한 채 LLM 파라미터만 미세조정한다. 1단계는 1에폭, 전역 배치 32, 최대 학습률 5e-6, 2단계는 1에폭, 전역 배치 64, 최대 학습률 1e-5이며 코사인 스케줄, 워밍업 비율 0.03, 가중치 감쇠 0.01, 클립당 32프레임을 공통 설정으로 쓴다. 즉 외부 재구성 모델의 특징을 주입하는 대신, 재구성 자체를 텍스트 QA로 바꿔 기존 자기회귀 학습 파이프라인에 그대로 얹는다는 점이 재사용하기 쉬운 부분이다. 다만 1단계 학습 데이터는 ScanNet 깊이 맵과 카메라 외부 파라미터로 3D 정답을 만들어야 하므로, 자체 데이터에 적용하려면 이 좌표 변환 파이프라인과 첫 프레임 좌표계 규약을 먼저 갖춰야 한다.
저자들이 명시한 전제와 한계도 분명하다. 기하 기반 계산은 근사일 수 있어 도출된 답이 항상 정답과 일치하지 않으며, 그래서 신뢰도 라벨과 시각 보정 단계를 넣었다. CoT 템플릿은 거리·크기·개수·가장 가까운 객체 네 유형만 다루고 나머지 유형은 직접 정답 감독으로 처리한다. 신뢰도 임계값 τ는 0.3이 실험적으로 선택된 하이퍼파라미터다. 또한 ScanNet 재구성 평가에서 GT Sim(3) 정렬을 적용하면 CUT3R과의 격차가 좁아지거나 역전되므로, 정렬 없는 조건에서의 우위와 정렬 후 조건에서의 결과를 구분해서 읽어야 한다.