LVLM 공간 추론의 조기 확정을 줄이는 단계별 소프트 추론

Soft Spatial Reasoning

HF Daily2609.38717

Rafi Ibn Sultan, Md. Sajid Alam Chowdhury, Saleh Zare Zade2026-09-30조회 2

무엇인가

LVLM은 공간 추론을 대개 사고사슬(CoT)로 수행한다. 중간 추론을 이산 언어 토큰의 자기회귀 열로 표현하는 방식인데, 논문은 이를 하드 씽킹(hard thinking)이라 부른다. 문제는 정답 해석이 아직 불확실한데도 매 스텝 하나의 토큰을 확정해야 한다는 점이다. 저자들은 이를 조기 이산화(premature discretization)라고 명명한다. 예로 빨간 공이 노란 의자에 대해 어디 있느냐는 질문에서, 모델이 공중에 떠 있는 물체와 의자 위 물체 중 무엇이 공인지 확정하지 못한 채 의자 위 물체를 공으로 굳히면 이후 추론이 그 위에 쌓여 정답이 'in front'가 아니라 'on'으로 나온다. 한 번의 잘못된 토큰 선택이 나머지 CoT 전체로 전파되는 것이다. 사람은 모든 생각을 언어로 명시하지 않고도 공간 문제를 풀 수 있다는 점이 대비로 제시된다.

어떻게 동작하나

제안하는 Soft Spatial Reasoning은 LVLM의 공간 과제에 소프트 씽킹을 도입하는 후처리(post-training) 프레임워크다. 각 중간 추론 스텝에서 단일 토큰을 고르는 대신, 어휘 토큰 임베딩들의 가중 혼합으로 연속적인 소프트 상태 s를 만든다. 구체적으로 각 스텝에서 정책이 낸 로그 확률에 Gumbel 잡음을 더해 점수 z를 만들고, 온도 τ로 조절한 softmax를 top-K 후보에만 적용해 혼합 가중치 p를 얻은 뒤 s = Σ p_k E_k로 상태를 구성한다. 온도가 낮으면 최고 점수 토큰 쪽으로 수렴하고, 높으면 여러 후보 임베딩에 가중치가 퍼진다. 추론 스텝이 끝나면 최종 답변은 다시 이산 토큰으로 생성한다. 소프트 상태는 개별 토큰을 선택하지 않으므로 표준 토큰 우도비를 쓸 수 없어, 기록된 점수 벡터 z에 대한 Gumbel 재모수화 우도를 정의해 GRPO의 확률비를 계산한다.

무엇과 다른가

핵심 구성 요소는 소프트함의 정도를 스텝마다 바꾸는 컨트롤러 AdaptSoft다. 저자들의 전제는 소프트함이 항상 좋은 게 아니라는 것이다. 여러 후보를 남기면 유용한 공간 해석이 보존되지만, 후보들이 서로 충돌하는 공간 관계를 함의하면 섞는 순간 이후 추론을 방해한다. AdaptSoft는 해당 스텝의 최종층 은닉 상태 h(누적된 추론 맥락)와 다음 토큰 분포의 섀넌 엔트로피(예측 불확실성, 초기 정책에서 추정한 평균·표준편차로 표준화)를 입력으로 받는다. 은닉 상태는 층 정규화 후 고정 랜덤 행렬로 8차원까지 투영해 저장 비용을 줄이고, 표준화 엔트로피와 이어 붙여 2층 MLP에 넣는다. MLP 스칼라 출력 u로 온도를 τ = τ0 + Δ·tanh(u)로 정하며, 0 < Δ < τ0 조건으로 항상 양수를 유지한다.

어떻게 쓰나

AdaptSoft 학습에는 스텝별 신용 할당이 필요하다. GRPO의 롤아웃 단위 이점은 어느 스텝에서 소프트함을 어떻게 해야 하는지 구분해 주지 않는다. 그래서 그래디언트 정렬 목적함수를 도입한다. 샘플링한 롤아웃 배치를 참조 부분집합과 최적화 부분집합으로 나누고, 참조 쪽 GRPO 손실의 LVLM 출력층 가중치 그래디언트 G_ref와 최적화 쪽 각 소프트 스텝의 그래디언트 g_i,t를 구해 프로베니우스 내적 α_i,t를 정렬 점수로 삼는다. 이 점수의 음의 합을 최소화하면 참조 그래디언트와 정렬되는 온도가 선호된다. 롤아웃 내 평균 온도 그래디언트를 빼서 스텝 간 차이를 강조하고, 이 중심화 그래디언트를 컨트롤러로 역전파한다. 중간 추론 주석이나 외부 평가자 없이 스텝 수준 신용을 얻는 것이 요점이다. LVLM 정책 자체는 GRPO로, AdaptSoft는 이 정렬 손실로 함께 후처리 학습된다.

전제와 한계

실험은 Qwen3-VL-8B-Thinking 백본을 OmniSpatial 학습 분할에서 2에폭 학습해 구성했다. GRPO는 프롬프트당 롤아웃 8개, 배치 64, 배치당 옵티마이저 업데이트 2회, LVLM 학습률 1e-6, KL 계수 1e-3, AdaptSoft 학습률 1e-3이다. OmniSpatial 테스트에서 가중 평균 정확도로 비독점 모델 중 1위를 기록하며 InternVL3-14B를 3.74%p, SoFar를 4.54%p, LaCoT를 4.02%p 앞섰다. 같은 백본·같은 후처리 설정에서 하드 씽킹 대비 기본 소프트 씽킹은 1.01%p 오르는 데 그쳤지만, 적응형 소프트함은 여기에 2.75%p를 더 얹었다. 기하 추론 범주에서는 하드와 기본 소프트가 모두 25.00이었는데 적응형은 34.84였고, 운동 분석은 55.85에서 62.14로 올랐다. 백본 대비로는 10개 범주 전부에서 향상됐고 교통 분석에서 21.61%p 상승했다.

제로샷 전이도 보고된다. 학습에 쓰지 않은 SpatiaLab에서 48.71로 기존 최강 오픈웨이트 모델 LVR을 2.93%p 앞섰고, 같은 백본 비교에서 적응형 소프트함이 기본 소프트 씽킹보다 1.85%p 높았다(하드→기본 소프트는 0.65%p). 범주별로는 상대 위치 +3.30, 공간 내비게이션 +3.37이 방향 +0.49, 크기·척도 +0.79보다 훨씬 컸다. 제한된 시점에서 보이지 않는 공간 관계를 추론하는 MindCube에서는 가중 평균 38.13으로 비독점 모델 최고점이자 백본 대비 4.51%p 향상이며, 세 가지 설정 모두에서 개선됐다. 절제 실험에서는 AdaptSoft의 스텝별 그래디언트 정렬을 롤아웃 수준 과제 이점으로 바꿨을 때 평균 4.07%p 하락(가설 추론 6.52%p 하락)으로 가장 컸고, 은닉 상태 제거 3.53%p, 예측 불확실성 제거 2.11%p, 그래디언트 중심화 생략 1.57%p 순이었다.

개발자 관점에서 이 논문은 공간 추론 파이프라인의 실패 모드를 '토큰 하나를 잘못 고르면 이후가 전부 오염된다'는 조기 확정 문제로 규정하고, 그 완화책을 추론 시점이 아니라 후처리 학습으로 가져온다. 이미 GRPO 계열로 LVLM을 튜닝하고 있다면 소프트 상태 구성, Gumbel 재모수화 우도비, 그래디언트 정렬 손실 세 가지를 추가하는 형태로 얹을 수 있다. 다만 소프트함이 만능이 아니라는 저자들의 진단은 실무적으로 중요하다. 충돌하는 공간 해석을 섞으면 오히려 해가 되므로, 온도를 스텝마다 학습으로 정하게 하는 컨트롤러와 그 학습 신호가 이 방법의 본체이지 임베딩 혼합 자체가 아니다. 도입 시에는 백본·데이터 분할·롤아웃 수 같은 설정을 그대로 맞춰야 위 수치를 재현할 수 있고, 특히 기하·운동처럼 후보 해석이 갈리는 범주에서 이득이 큰지부터 확인하는 편이 좋다.

저자들이 밝힌 한계는 AdaptSoft가 시각 증거 자체의 불확실성을 명시적으로 측정하지 않는다는 점이다. 현재 컨트롤러가 보는 불확실성은 언어 생성 쪽 다음 토큰 엔트로피뿐이라, 이미지가 애매해서 생기는 모호함은 반영되지 않는다. 향후 과제로 각 CoT 스텝에서 시각적 불확실성을 함께 넣어 소프트함이 시각 증거와 언어 생성 양쪽의 모호함을 반영하도록 하는 방향을 제시한다.