3D 기하 단서를 교사에게만 주는 증류로 VLM 공간 추론을 고친다

Distilling Routed 3D Privilege for Spatial Reasoning in Vision-Language Models

HF Daily2610.12355

Hongxing Li, Yixin Li, Dingming Li2026-10-08

무엇인가

VLM은 거리·방향·배치를 판단하는 공간 추론에서 계속 약하다. 원인은 입력에 있다. RGB 프레임은 기하학적 증거를 직접 주지 않으므로 모델이 외형만으로 깊이와 레이아웃을 추측해야 한다. 기존 접근은 두 갈래다. 하나는 기하 인코더나 재구성 도구를 추론 시점에 붙이는 명시적 3D 방법으로 아키텍처 변경과 지연 비용을 낸다. 다른 하나는 공간 QA 데이터로 지도 미세조정이나 결과 기반 강화학습을 하는 훈련 기반 방법으로, 추론은 RGB만으로 유지되지만 최종 정답만 감독하므로 추론 사슬 중간의 깊이 순서 오류나 좌우 반전을 국소화해 고치지 못한다. 저자들의 진단은 오류의 기원이 지각에 있다는 것이다. 깊이를 잘못 판단하면 그 위에서 추론은 일관되게 틀리고, 그 오류는 장면의 실제 기하만이 교정할 수 있는데 공간 훈련 코퍼스의 3D 스캔이 바로 그 기하를 이미 갖고 있다.

어떻게 동작하나

제안 방법 GPD(Geometry-Privileged Distillation)는 이 기하를 훈련 시점의 특권 정보로 쓴다. 온폴리시 자기증류(OPSD)를 확장한 구조로, 같은 VLM이 두 역할을 한다. 학생은 RGB 관측과 질문만 조건으로 받아 응답을 샘플링하고, 교사는 여기에 특권 문맥을 추가로 받아 그 응답을 토큰 단위로 다시 채점한다. 배포되는 모델은 RGB만 쓴다.

무엇과 다른가

특권은 오프라인에서 만든다. 각 훈련 예제에 대해 깊이, 의미 분할, 조감도(BEV) 세 가지 단서를 텍스트 요약으로 변환한다. 3D 주석이 정렬되어 있으면 그것에서 직접 뽑고, 없으면 Depth Anything 3로 깊이를, Grounded-SAM-2로 인스턴스 마스크와 라벨을 추정하며, BEV는 신뢰할 만한 카메라 포즈와 장면 레이아웃이 있을 때만 포함한다. 핵심은 질문 조건부 라우팅이다. 개수 세기 질문은 의미·가시성 단서에, 거리와 내비게이션 질문은 깊이와 BEV에 의존하므로 모든 모달리티를 무차별로 넣으면 잡음이 섞인다. 기본 VLM이 질문마다 관련 부분집합 r(q)를 골라 장면 문맥을 만들고, 여기에 참조 정답을 붙여 교사 특권을 구성한다. 손실은 GRPO에 특권 KL을 더한 형태다. 토큰 위치마다 교사와 학생의 로그확률 차이를 구하고 exp(Δ)−Δ−1로 역방향 KL을 단일 샘플 추정한 뒤, 정답이 틀린 궤적(R<0.5)에만 적용하고 마이크로배치 스칼라를 1.5에서 자른다. 최종 목적식은 GRPO 손실에 λ를 곱한 증류 손실을 더한 것이고 λ는 0.003이다.

어떻게 쓰나

실험은 Qwen3-VL-Instruct 2B·4B 백본에서 VSI 10K, SPAR 4K, MindCube 1K 훈련 샘플로 1 에폭, 학습률 1e-6, 롤아웃 그룹 8로 진행했다. 4B에서 VSI-Bench 57.1로 베이스 대비 1.7, GRPO 대비 0.7, 정답 특권 OPSD 대비 1.4 포인트 높다. MindCube·SPAR-Bench·MMSI-Bench·ViewSpatial 평균은 37.6으로 GRPO보다 1.9, OPSD보다 6.1 포인트 높다. 개별로는 MindCube 38.0(GRPO 33.0), SPAR 43.4(41.4), MMSI 29.4(28.7)이다. 2B에서는 VSI 51.7, 추가 4개 평균 33.6으로 GRPO 대비 0.9, OPSD 대비 3.4 포인트 앞선다.

전제와 한계

절제 실험은 설계 선택을 뒷받침한다. 정답만 특권으로 주면 평균 40.2, 라우팅된 3D 텍스트만 주면 40.5, 둘을 합치면 41.5로 두 정보원이 상보적이다. 전체 3D 텍스트를 다 넣으면 39.8로 라우팅보다 1.7 포인트 낮고, 라우팅된 이미지는 40.4로 라우팅된 텍스트보다 1.1 포인트 낮다. 특권 KL을 모든 궤적에 적용하면 40.6으로 틀린 궤적만 쓸 때보다 0.9 포인트 떨어진다. λ는 0.001에서 39.6, 0.003에서 41.5, 0.004에서 40.2, 0.005에서 39.6이다. 제로샷 사전 실험에서는 RGB만 쓴 베이스라인 49.1에 대해 전체 3D 이미지 47.4, 라우팅 이미지와 전체 텍스트 48.3이 모두 아래였고 라우팅 텍스트만 52.2로 3.1 포인트를 냈다. 라우팅 분포는 개수 세기가 의미 맵, 절대 거리가 깊이, 방 크기가 BEV, 상대 방향이 의미와 BEV로 기하 직관과 맞는다. 훈련 곡선에서는 GPD가 GRPO보다 이른 시점에 더 높은 엔트로피 정점을 찍고 이후에도 정확도 우위를 유지한다. 특권 내재화 검증에서 RGB 추론만으로 GPD 56.3 대 GRPO 54.9였고, 테스트 시점에 3D 텍스트를 주입했을 때 얻는 이득은 GPD 0.6, GRPO 2.1로 GPD가 기하 단서에 덜 의존하게 됐음을 시사한다.

개발자 관점에서 이 논문은 추론 파이프라인을 바꾸지 않고 훈련만 손보려는 팀에 직접적인 선택지다. 3D 센서나 재구성 도구를 서빙에 넣는 비용 없이 이미 갖고 있는 3D 주석이나 추정 모델로 교사 신호를 만들 수 있다. 다만 확인할 점이 있다. 특권은 오프라인에서 한 번 만들어 고정하므로 훈련 데이터의 3D 품질이 성능 상한을 정한다. 라우터는 기본 VLM이 질문별로 모달리티를 고르는 방식이라 라우팅 품질이 곧 증류 품질이다. λ와 오류 게이트 임계값은 민감해서 논문 설정인 0.003과 0.5를 출발점으로 삼되 자체 검증셋에서 스윕하는 편이 안전하다.

한계도 분명하다. BEV 단서는 신뢰할 만한 카메라 포즈와 장면 레이아웃이 있을 때만 포함되므로 그런 정보가 없는 데이터에서는 깊이와 의미만 쓴다. MindCube처럼 정렬된 3D 정답이 없는 경우 깊이와 의미를 추정 모델로 근사한다. 저자들이 검증한 범위는 2B·4B 두 규모와 5개 벤치마크이며 그보다 큰 백본이나 다른 도메인으로의 일반화는 확인되지 않았다. 배포 모델이 RGB만 쓴다는 것은 장점이지만, 훈련 시점에는 3D 특권 생성 파이프라인이 필요하다는 전제가 따른다.