SpaceCast-Bench는 예측 공간 추론에서 인간과 모델의 격차를 보여준다
SpaceCast-Bench: Evaluating Predictive Spatial Reasoning in Vision-Language Models
무엇인가
기존 공간 추론 벤치마크는 대부분 공간 지각, 즉 입력에 이미 보이는 관계를 읽어내는 능력을 측정한다. 논문이 지적하는 문제는 그다음 단계다. 로봇이 책 밑에 깔린 봉투를 꺼내야 하고 그 위에 컵이 놓여 있다면, 책을 밀었을 때 컵이 함께 밀린다는 사실을 미리 예측하고 컵을 먼저 옮기는 계획을 세워야 한다. 이런 예측 공간 추론은 관측으로 장면을 구성하고, 개입이 장면을 어떻게 바꾸는지 시뮬레이션하고, 보지 못한 결과 상태에 대해 추론하는 능력이다. 저자들은 이를 직접적이고 진단적으로 평가하는 첫 벤치마크 SpaceCast-Bench를 제안한다.
어떻게 동작하나
벤치마크는 관측–변환–추론(observe–transform–infer) 틀을 따른다. 초기 장면 S0을 변환 이전 시점의 RGB 뷰 순서열로만 관측하고, 자연어로 주어진 변환 T와 공간 질의 q가 주어졌을 때 모델은 관측되지 않은 결과 상태 S1 = F(S0, T)에서 q를 평가해야 한다. 이를 위해 모델은 관측을 통합해 S0의 관련 부분을 복원하고, T를 적용해 S1을 얻고, S1에서 q를 평가하는 세 가지 잠재 연산을 수행해야 한다. 데이터는 ScanNet 134개, ScanNet++ 48개 장면에서 나온 RGB-D 스캔으로 구축했으며, 각 인스턴스의 표면 기하, 3D 중심, 축 정렬 바운딩 박스를 메시에서 도출한다. 여기에 표면 접촉, 지지 중첩, 의미적 호환성으로 부모–자식 간선을 제안하는 방향성 부착 그래프를 만들고, 각 자식은 최대 하나의 부모를 갖는다. 이 그래프의 추이적 폐쇄가 국소 개입 시 함께 움직이는 객체를 결정한다.
무엇과 다른가
뷰 체인 구성은 두 앵커 뷰가 각자 배정된 질의 객체 그룹만 노출하고 상대 그룹은 노출하지 않도록 상호 의미적 분리 조건을 만족하게 고른다. 두 앵커는 깊이 검증된 통로로 연결되며, 연속한 뷰 쌍은 통로와 최소 10% 겹치고 반대편 앵커로 전진해야 하며, 어떤 브리지 뷰도 두 그룹을 동시에 다시 노출해서는 안 된다. 16개 과제 유형은 세 단계로 나뉜다. L1 정적 지각은 변환을 항등으로 두고 단일·다중 뷰에서 방향, 거리, 가시성·폐색, 부착 구조를 묻는다. L2 국소 예측은 객체 하나를 이동·회전·제거하고 부착 종속 객체를 함께 옮긴 뒤, 나머지 장면은 그대로 둔 상태에서 질의 관계를 평가한다. L3 전역 예측은 전체 레이아웃에 강체 요 회전을 적용해, 관측 카메라 시점과 분리된 장면 표현을 요구한다. 관계 라벨은 3D 기하에서 직접 계산한다. 방향은 바닥면에 투영한 중심 벡터를 8개 수평 섹터와 위·아래로 해석하고 카메라 중심·객체 중심·세계 중심 좌표계로 표현하며, 거리는 메시 점 샘플링으로 근사한 최단 표면 간 거리를 4개 범주로 나누고, 가시성·폐색은 카메라 중심에서의 메시 광선 추적으로 판정한다. 품질 관리는 자동 필터와 10명 주석자의 최소 2회 독립 검토를 결합했고, 조정 전 단일 정답 문항의 쌍별 일치도는 98.9%, 부착 체인 문항의 정확 집합 일치는 91.8%였다.
어떻게 쓰나
최종 벤치마크는 182개 장면, 16개 과제 유형에 걸친 3,862문항이다. ScanNet이 134개 장면에서 718문항, ScanNet++가 48개 장면에서 3,144문항을 기여했다. 단계별로는 L1이 1,368문항, L2가 1,709문항, L3가 785문항이며, L2·L3 중 2,217문항은 변환 후 질의 관계가 바뀌고 277문항은 유지된다. 21개 모델(독점 9종, 범용 오픈웨이트 6종, 공간 특화 6종)을 평가한 결과 인간 성능 87.2%에 대해 최고 모델인 Gemini 3.5 Flash가 58.0%에 그쳤고, Gemini 3 Flash 56.7%, Qwen3.7-Plus 55.3%, Claude Sonnet 4.6은 36.0%였다. 범용 오픈웨이트 최강인 Qwen3.5-27B는 39.3%로 최고 독점 모델보다 18.7pp, 인간보다 47.9pp 낮다. 공간 특화 모델은 25.7~29.1%로 무작위 기준선 25.9% 근처에 머물러, 모든 독점·범용 모델보다 낮았다. 단계별로는 Gemini 3.5 Flash가 L2에서 L1 대비 21.8pp, Qwen3.7-Plus가 20.6pp, Qwen3.6-Flash가 18.3pp 떨어졌지만 L3에서는 오히려 회복해 각각 69.4%, 66.6%를 기록했다. 반대로 공간 특화 모델은 L3에서 급락해 SenseNova-SI-1.2가 L2 30.5%에서 L3 16.1%, Cambrian-S-7B가 28.8%에서 17.1%로 떨어졌다. 관계 유형별로는 부착이 가장 높았고(Qwen3.7-Plus 80.4%, GPT-5.6-Luna 74.2%, Qwen3.5-27B 68.0%), 폐색이 그다음, 방향과 거리가 가장 어려웠다. 공간 특화 모델은 부착에서 유난히 낮아 SenseNova-SI-1.2가 13.4%, SpatialLadder가 9.3%였다. 방향 기준 좌표계 중에서는 세계 중심이 가장 강했고(Qwen3.7-Plus 58.4%), 객체 중심이 일관되게 가장 약했다(Qwen3-VL-4B는 카메라 중심 39.3% 대 객체 중심 16.2%).
전제와 한계
추가 분석은 몇 가지 통념을 흔든다. CoT 프롬프팅은 일관된 이득을 주지 않았고, 모델 계열과 단계에 따라 효과가 갈렸다. 브리지 뷰를 제거하면 세 기준 좌표계 모두에서 정확도가 떨어졌으며, 세계 중심 방향에서 39.9%에서 34.6%로 5.3pp 하락해 장면 수준 표현 유지에 특히 중요했다. 외부 공간 증거 실험에서는 명시적 3D 증거가 생성된 결과 이미지나 영상보다 훨씬 안정적이었다. BEV 이미지와 텍스트 3D 메타데이터를 주면 독점 모델이 30.7pp, 오픈웨이트 모델이 10.9pp 향상됐지만, 공간 특화 모델은 3D 메타데이터에서 오히려 3.3pp 하락했다. 월드모델 증거는 효과가 작고 불일치했는데, 국소 개입 문항 600개를 수동 감사한 결과 Qwen-Image-Edit 사용 시 오답의 80.3%, GPT-image-2 사용 시 38.3%가 아티팩트, 객체 누락, 변형, 스케일·원근 불일치 같은 생성 실패와 연관됐다. 생성이 성공한 뒤에도 합성된 종점을 원래 다중 뷰 증거와 정합시키는 두 번째 병목이 남는다.
학습 실험은 Qwen3-VL-4B를 대상으로 했다. 벤치마크와 장면이 겹치지 않는 데이터로 16개 과제 유형을 모두 생성해, 모든 과제를 함께 샘플링하는 Mixed SFT와 L1을 먼저 학습한 뒤 L1 리플레이와 함께 L2·L3를 학습하는 Staged SFT를 비교했다. SFT는 언어 모델 선형 계층과 멀티모달 정렬기에 rank-32 LoRA를 붙이고 비전 인코더는 동결했다. 결과는 Mixed SFT 64.8%, Staged SFT 65.7%로 기준 34.0%에서 크게 올랐다. Staged SFT는 국소 성능을 51.3%에서 54.0%로 끌어올렸고, Mixed SFT는 전역 과제에서 73.1% 대 70.8%로 약간 앞섰다. GRPO는 37.7%에 그쳤는데, 과제 난이도 때문에 일관된 보상 신호를 얻기 어려웠다고 저자들은 해석한다. 도메인 외 전이에서는 6개 벤치마크 매크로 평균이 Staged SFT 38.1%, Mixed SFT 37.2%, 기준 모델 33.5%였고, DSI-Bench +10.2pp, SPARTQA +6.0pp, CLEVRER +5.8pp, VSI-Bench +4.7pp의 이득을 냈지만 MindCube는 기준보다 약간 낮았다.
개발자 관점에서 이 논문의 실용적 신호는 두 가지다. 첫째, 정적 공간 지각 성능이 좋다고 해서 상태 갱신 능력으로 이어지지 않는다. 공간 특화 파인튜닝을 거친 모델들이 무작위 수준에 머물렀다는 결과는, 기존 공간 학습 데이터가 국소 지각 특징을 강화할 뿐 전역 공간 인식과 개입 후 추론을 가르치지 못한다는 뜻이다. 둘째, 모델에 3D 구조를 명시적으로 제공하는 것이 생성 모델로 미래 장면을 상상하게 하는 것보다 훨씬 신뢰할 만하다. 다만 이득은 범용 모델에 한정되며, 3D 증거에 낯선 특화 모델은 오히려 성능이 떨어진다. 벤치마크와 학습 데이터 생성 파이프라인은 GitHub와 HuggingFace에 공개돼 있다.
저자들이 밝힌 전제와 한계도 분명하다. 데이터는 공개된 ScanNet과 ScanNet++를 각자의 이용 약관에 따라 사용했고, 사람의 개입은 벤치마크 검증과 기준선 평가로 제한했으며 민감한 개인정보는 수집하지 않았다. 벤치마크는 가상의 공간 변환을 다룰 뿐 실제 물리 시스템을 조작하지 않는다. 그럼에도 평가된 모델들은 여전히 신뢰할 수 없으며, 그 출력을 안전이 중요한 구현 환경에 배치할 준비가 됐다는 증거로 해석해서는 안 된다고 저자들은 명시한다.