SpatialOPSD가 코딩 에이전트 흔적을 도구 없는 공간 추론으로 내재화한다
SpatialOPSD: Self-Distilling Spatial Intelligence from Verified Coding Agent Traces
무엇인가
공간 추론은 2D 관측에서 잠재된 3D 속성을 추론하는 일이라 멀티모달 LLM에게 근본적인 난제다. 최종 답은 검증할 수 있어도 중간 기하 추론 단계는 자동으로 주석을 달거나 검증하기 어렵다. 이 검증 불가능성이 표준 학습 패러다임을 막는다. 답 수준 지도학습(SFT)은 공간 이해를 암묵적이고 취약하게 남기고, 명시적 Chain-of-Thought 지도는 확장 비용이 감당하기 어렵다. GRPO 같은 강화학습은 탐색으로 주석 병목을 우회할 수 있지만, 검증 가능한 중간 단계가 없어 값비싼 콜드스타트 데이터와 희소한 결과 보상에 의존해야 한다. 최근의 공간 코딩 에이전트는 코드 실행 인터페이스와 외부 기하 도구를 붙여 이 검증 문제를 우아하게 해결하지만, 그 대가는 추론 시점으로 전가된다. 디코딩과 도구 실행의 반복 루프가 높은 지연과 인프라 비용을 만든다.
어떻게 동작하나
논문의 출발점은 관찰 하나다. Qwen3.5-9B로 같은 벤치마크에서 네 가지 설정을 비교했더니, 도구를 쓰는 공간 코딩 에이전트가 일반 CoT 프롬프트를 크게 앞서는 것은 물론이고, 에이전트의 실행 흔적을 조건으로 붙여 CoT를 생성하기만 해도(도구 호출 없이) 전체 에이전트의 공간 추론 능력에 맞먹었다. 이 흔적들은 생성된 근거를 구체적 공간 분석에 접지시켜 3D 지각 개념 언급을 1.8배, 반사실적 운동 개념 언급을 1.6배로 늘렸다. 문제는 이 방식도 추론 시점에 외부에서 생성된 흔적에 의존한다는 점이다.
무엇과 다른가
SpatialOPSD는 이 이점을 학습 시점의 감독으로 옮긴다. 하나의 MLLM이 교사와 학생을 겸하되 정보 접근이 비대칭이다. 교사는 검증된 에이전트 흔적을 특권 정보로 조건에 받고, 학생은 원입력 x만 본다. 학생이 스스로 생성한 롤아웃에 대해 토큰 단위 KL 발산으로 교사 분포를 따라가게 하는 온폴리시 자기 증류(OPSD)이며, 롤아웃은 stop-gradient로 고정되고 그래디언트는 학생 가지만 흐른다. 특권 정보를 만들기 위해 SpatialClaw 같은 공간 코딩 에이전트를 오라클로 배치한다. 이 에이전트는 깊이·분할·카메라 포즈 같은 기하 프리미티브를 갖춘 지속적 파이썬 커널 위에서 추론 단계, 코드 셀, 실행 관측을 반복 생성하고, 최종 예측이 정답 대비 결정적 검증을 통과한 흔적만 보존한다. 사람 주석 없이 MindCube 학습 분할 10,000개 중 5,008개의 검증된 흔적이 확보됐다.
어떻게 쓰나
특권 정보는 네 가지로 구성해 비교한다. 전체 흔적(full-trace), 요약(summary), 사실(fact), 의도(intent)다. 요약이 교사-학생 엔트로피 격차가 중간 정도로 유지되며 가장 좋은 성능을 냈고, 전체 흔적은 격차가 너무 커 최적화를 방해했으며 사실 변형은 학습 후반 격차가 커졌다. 여기에 Repetition-Aware Distillation을 결합한다. 토큰 4-gram 매칭으로 학생 롤아웃에서 자기 반복 구간과 특권 정보 전사 구간을 탐지한다. 특권 n-gram은 입력 x와 특권 정보 I에는 있지만 x에는 없는 n-gram 집합으로 정의하고, 롤아웃의 n-gram이 여기 속하거나 앞서 롤아웃에 등장하면 플래그한다. 길이 32 이상 연속 플래그 구간에 속한 토큰만 마스킹하고, 마스킹된 토큰은 증류 손실에서 제외한 뒤 대신 unlikelihood 페널티를 준다. 반복 루프는 모델 확신도가 1에 가까워 로그 항과 그래디언트가 발산하기 쉬워 엡실론 1e-6으로 클램핑한다. 페널티 가중치는 0.1을 쓴다. 마스킹된 증류는 탐지된 반복·전사 바깥의 감독을 보존하고, unlikelihood는 플래그된 이어쓰기를 억제하는 상보적 역할을 한다.
전제와 한계
실험은 MindCube-Tiny와 ViewSpatial-Bench에서 이뤄졌다. Qwen3.5-9B 베이스라인을 45.9에서 51.9로 끌어올렸고, 특히 타자 중심 변환에서 두드러져 Among 항목은 +11.7을 기록했다. 같은 조건의 SFT 47.6, GRPO 48.2를 모두 앞선다. 도구를 반복 호출하는 교사 SpatialClaw의 57.3 대비 91%를 도구 없는 단일 순전파 한 번으로 유지했다. 9B 크기로도 GPT-5를 능가하고 Gemini-3-Pro와의 격차를 좁혔다. 학습에 없던 OOD 벤치마크 네 개(BLINK, OmniSpatial, MMStar, Video-MME)에서도 평균 64.7%로 SFT와 GRPO를 앞서고 CoT 베이스라인 64.4%를 소폭 넘겼다.
추가 실험도 촘촘하다. 학생 규모를 2B, 4B, 27B로 늘려 평균 정확도가 각각 40.6→42.8, 46.4→50.2, 50.6→54.2로 2.2, 3.8, 3.6포인트 올랐다. 검증의 효과는 뚜렷하다. 검증 없이 10,000개 흔적을 다 쓰는 것보다 정답이 일치하는 5,008개만 쓰는 쪽이 MindCube-Tiny에서 4.9포인트, ViewSpatial에서 0.5포인트 더 좋았다. 흔적의 양보다 질이 중요하다는 뜻이다. 에이전트 종류에도 강건해 SpatialClaw와 pySpatial 흔적 모두 베이스 모델을 개선했고 pySpatial이 비슷하거나 약간 더 좋았다. 어블레이션에서는 마스킹 단독이 평균 정확도가 가장 높았고 unlikelihood 단독이 특권 정보 누출을 더 많이 줄였으며, 둘을 합치면 바닐라 OPSD 대비 누출이 크게 감소했다.
개발자 관점에서 이 논문의 실용적 가치는 도구 호출을 걷어낸다는 데 있다. 지속적 파이썬 커널과 기하 도구를 매 추론마다 돌리는 대신, 단일 순전파로 에이전트 성능의 대부분을 얻는다. 학습 데이터가 같은 MLLM이 생성한 흔적에서 나오므로 도구 보조 데이터 생성에서 더 강한 독립 모델로 가는 자기 증류 루프가 성립한다는 점도 눈여겨볼 만하다. 실무에 적용한다면 특권 정보를 어떤 형태(요약이 가장 좋았다)로 압축할지, 검증을 통과한 흔적만 남기는 필터를 어떻게 걸지, 반복·전사 마스킹의 n-gram 크기와 최소 구간 길이, 페널티 가중치를 어떻게 잡을지를 먼저 확인해야 한다. 정성 분석에서는 GRPO가 시점 이동을 단순 1D 이동으로 뭉개는 반면 이 방법은 다축 궤적을 분리하고, 바닐라 OPSD가 없는 도구 흔적을 환각해 오류를 정당화하는 것과 달리 깊이·상대 위치 같은 관측 가능한 단서에 추론을 접지시켰다.
논문은 별도의 한계 절을 두지 않았지만 본문에서 전제와 주의점이 드러난다. 저자들은 정량 분석에 쓴 어휘 마커 빈도와 롤아웃 커버리지가 표현 스타일의 변화를 측정할 뿐 내재적 추론 능력을 측정하는 것은 아니라고 명시한다. 또 2B와 4B 학생은 자체 코딩 에이전트·도구 사용 능력이 부족해 9B 교사의 검증된 흔적으로 학습했고, 27B만 27B 교사 흔적을 썼다. SFT 베이스라인은 Qwen3.7-plus가 같은 5,008개 전부에 대해 정답 CoT를 만들지 못해 10,000개 중 4,459개로 학습했으므로 세 방법의 학습 데이터 조건이 완전히 동일하지는 않다. 마지막으로 검증을 통과한 흔적만 쓰기 때문에 학습 데이터 커버리지가 에이전트의 정답률에 묶인다는 구조적 제약이 남는다.