SuperNav가 MLLM 파인튜닝 없이 임의 장면 내비게이션을 수행한다
SuperNav: An Agentic Navigation System for Any Task in Any Scene
무엇인가
범용 서비스 로봇은 낯선 환경에서 다양한 인간 요청을 처리하는 내비게이션 능력을 필요로 한다. 요청은 특정 물체 찾기, 여러 목표를 순서대로 방문하기, "쉴 곳 찾기" 같은 상위 수준 요구 충족하기까지 다양하다. 논문은 여기서 두 가지 일반성을 구분한다. 다른 요청에 적응하는 과제 일반성(task generality)과 학습·개발 중 보지 못한 환경에서도 작동하는 장면 일반성(scene generality)이다. 기존 모듈형 제로샷 시스템은 사전학습 비전언어모델로 관측과 목표의 의미 관련도를 평가해 탐색 점수에 반영하지만, 언제 모델이 개입하고 탐색이 목표 확인으로 넘어가며 실행이 끝나는지는 과제별 로직이 정한다. 요청이 물체 범주 찾기에서 특정 인스턴스 식별, 다중 목표 방문, 추상적 요구 충족으로 바뀌면 이 워크플로도 함께 바꿔야 한다. 반대로 종단간 방법은 내비게이션 지시문과 궤적 쌍으로 비전언어모델을 파인튜닝해 행동을 예측하는데, 관측·지시문·행동 사이의 연관을 학습하는 방식이라 새로운 시각적 외형, 공간 배치, 상호작용 조건에서 그 연관이 유효한지에 전이가 달려 있다. 논문은 교차 환경 평가에서 평가 대상 방법들의 과제 완수 격차가 상당하다고 보고한다.
어떻게 동작하나
SuperNav의 핵심 발상은 MLLM에게 요청 해석, 장면 이해, 의사결정을 맡기고 운동 실행은 내비게이션 도구에 위임하되 MLLM의 범용 능력을 보존하는 것이다. 사전학습 MLLM에 내비게이션 전용 파인튜닝 없이 특화된 에이전트 하네스를 씌운다. 하네스는 에이전트 루프를 중심으로 구성된다. 초기화가 세션을 열고 첫 관측을 반환하면 MLLM이 요청된 목표와 완료 조건을 해석하고, 이후 각 단계에서 현재 문맥과 과제 진행 상황을 보고 관측, 이동, 목표 상태 갱신, 관련 Skill 읽기 중 하나를 고른다. 도구 반환값과 검색된 지침이 다음 결정을 위한 문맥에 들어가므로 실행 피드백이 계획을 바꿀 수 있다. 예를 들어 후보에 접근한 뒤 새 이미지를 검사해 요청 충족 여부를 판단하고, 완료를 기록하거나 탐색을 계속한다.
무엇과 다른가
의사결정을 물리적 운동에 연결하는 것이 통합 시각점(visual-point) 인터페이스다. 관측 도구는 로봇 헤딩 기준으로 front, right, back, left 라벨이 붙은 RGB 이미지 4장을 반환하고, MLLM은 PointNav(d,[u,v])로 목적지를 지정한다. 여기서 d는 시점을, u,v는 이미지 좌상단에서 정규화한 가로·세로 좌표이며 둘 다 0과 1 사이 값이다. 후보 물체 위의 점을 찍거나 바닥의 보이는 점을 찍어 목표에 접근하거나 새 시점을 얻는다. 도구가 내부적으로 이동을 실행하고 새 4시점 이미지, 실행 상태, 간단한 진단을 반환하므로 매 이동 후 별도 관측 호출이 필요 없다. 운동 백엔드는 교체 가능하다. Geo-based Executor는 깊이, 카메라 캘리브레이션, 포즈로 선택한 점을 환경 위치에 연결하고 도달 가능한 목표까지 경로를 계획·추종한다. Learned Executor는 NoMaD의 목표 조건 생성 정책 설계에서 착안해 목적지 이미지 목표를 참조 관측의 표시된 점으로 바꾸고, 선택된 이미지-점 쌍과 최근 RGB 관측으로 국소 변위 증분과 정지 신호를 예측한다. 선택한 시점 쪽으로 회전한 뒤 한 번의 도구 호출 안에서 짧은 예측 운동 구간을 반복 실행한다. 두 백엔드 모두 시각적 목적지를 받고 실행 피드백과 함께 관측을 반환하므로 에이전트는 같은 결정 워크플로를 유지한다.
어떻게 쓰나
Navigation Skills는 재사용 가능한 내비게이션 경험을 절차적 지침으로 정리한 것으로, 적용 상황, 확인할 증거, 권장 단계, 연결 참조를 담은 Markdown 패키지다. 번들에는 메인 내비게이션 Skill, 백엔드별 도구 사용 지침, 탐색·복구·입구 찾기 참조가 포함된다. 하네스는 Skill 이름과 설명을 노출해 MLLM이 필요한 패키지를 찾아 지침이나 참조를 결정 문맥에 넣게 한다. 지침은 어디를 탐색할지, 어떻게 복구할지, 언제 끝낼지라는 세 가지 반복 결정을 다룬다. 탐색 지침은 확인한 영역, 보이는 통로, 불확실한 분기를 기록해 나중을 위한 대안을 남기라고 요구하며, 재방문은 저장된 복귀 경로가 아니라 시각적 인식에 의존한다. 복구 지침은 이동 실패 후 점이나 경로를 바꾸고, 후보 확인이 어려우면 물러서고, 유리가 접근을 막으면 입구를 찾으라고 권한다. 완료 지침은 후보의 외형, 요청된 관계, 주변 문맥을 확인한 뒤 검증된 목표를 기록하고 남은 요청을 계속하라고 한다. Skill은 문맥에 들어가 결정에 영향을 줄 뿐 환경 능력을 추가하지 않고 행동 순서나 의미 판단을 프로그램적으로 강제하지 않는다. 진행 도구는 MLLM이 대기·발견 목표를 조회하거나 갱신하게 하고, 종료 도구는 달성·차단 판단을 기록하고 세션을 닫는다. 이 기록은 MLLM의 보고이며 독립적 의미 검증이 아니고, 벤치마크 점수는 이 선언과 별개로 성공을 평가한다. 긴 지평 실행을 위해 목표 기록이 미완·완료 항목을 유지하고 텍스트 상호작용 이력이 확인 영역, 후보 단서, 실패 시도를 보존한다. 커지는 이미지 문맥을 통제하려고 하네스는 한 이미지가 처리되고 더 새 관측으로 대체되면 이후 요청에서 그 이미지의 미디어 페이로드를 제거한다. 텍스트 이력, 과제 상태, 이미지 경로는 남기고 MLLM은 필요하면 워크스페이스에서 이전 이미지를 요청할 수 있다.
전제와 한계
실험은 GPT-5.6 Terra를 Geo-based Executor 또는 Learned Executor와 함께 쓰고 SR(%)과 SPL(0~1)을 보고한다. Habitat-GS와 AI2-THOR에서 NaVid, UniNaVid, StreamVLN, OmniNav의 Action Former와 비교하며 각 베이스라인의 원래 입력과 이력 메커니즘을 유지한다. InteriorGS 장면 기반 인스턴스 벤치마크는 단일 물체 과제 150개와 2~5개 목표의 순서형 다중 물체 과제 150개로 구성되고, 도착은 승인된 목표 시점까지 navmesh 측지 거리 1m 미만, 성공은 명시적 STOP을 요구한다. SuperNav는 단일 물체 내비게이션 78.00%, 수요 기반 내비게이션 59.50% 성공률을 기록했고, 각각 가장 강한 베이스라인인 UniNaVid와 OmniNav의 Action Former는 34.00%, 37.50%였다. 두 백엔드는 다중 물체 성공률이 같았지만 Geo-based Executor가 더 효율적인 경로를 냈다. 수요 기반 평가는 Demand-Bench의 AI2-THOR 과제 200개를 1~8개 순서 단계로 적응해 평가하며, 각 단계의 허용 2m 바운딩 박스 영역에 순서대로 들어가고 물체 재사용 없이 명시적으로 정지해야 성공이다. 두 백엔드 모두 SR과 SPL에서 베이스라인을 앞섰고 Geo-based Executor가 가장 멀리 진행했지만 긴 시퀀스는 여전히 어렵다. HM3D에서는 120 에피소드 HM3D-OVON val-unseen 부분집합과 1,000개 HM3Dv2 검증 에피소드로 범주 수준 내비게이션을 평가했다. OVON 전용 학습이나 적응 없이 1m 임계값에서 SR 73.33%, SPL 0.4105를, 더 엄격한 0.25m 임계값에서 SR 68.33%, SPL 0.3837을 기록했다. Learned Executor는 Geo-based Executor의 성공률 상당 부분을 유지했지만 경로 효율을 잃었다.
하네스 절제 실험에서는 Geo-based Executor를 고정하고 Navigation Skills를 제거하거나, 에이전트 지향 도구를 전방 시점만 보는 상호작용으로 바꾸거나, 직접 포인팅 대신 언어 그라운딩과 후보 선택(Grounding Motion Tool)으로 대체했다. Navigation Skills 제거는 전방 시점만으로 제한하는 것보다 SR을 더 많이 떨어뜨렸고, 특히 엄격한 임계값에서 그랬다. Skill을 유지한 채 전방 시점만 쓰면 SR과 SPL이 줄고 명시적 회전이 상당히 많이 필요했다. 외부 그라운딩은 에이전트의 직접 점 선택을 개선하지 못했고, 하네스를 고정한 채 Terra(high)를 Astra(medium)로 바꾸면 SR과 SPL이 모두 향상됐다. 실제 배포는 4시점 RGB와 LiDAR 기반 기하 실행을 갖춘 Unitree Go2에서 이뤄졌으며, SuperNav는 막힌 통로에서 경로를 수정하고 목표를 검증하며 목표 사이를 전환했다.
실무 관점에서 이 논문이 주는 신호는 내비게이션 성능을 모델 파인튜닝이 아니라 인터페이스와 하네스 설계로 끌어올릴 수 있다는 주장이다. 목적지를 저수준 행동 시퀀스가 아니라 이미지 위의 한 점으로 표현하면, 같은 결정 워크플로를 유지한 채 기하 기반 실행기와 학습 기반 실행기를 갈아 끼울 수 있다. 경로 계획·추종 모듈을 이미 갖춘 로봇 스택이라면 그 위에 MLLM 의사결정 계층을 얹는 형태를 검토할 만하다. 성공 판정을 MLLM의 자기 보고에 맡기지 않고 별도로 채점하는 구조, 처리된 이미지의 페이로드만 문맥에서 잘라내는 미디어 전용 프루닝, Skill을 문맥 주입으로만 쓰고 강제하지 않는 설계는 그대로 참고할 만한 패턴이다. 결과를 재현하려면 임계값(1m 대 0.25m)과 STOP 요구, 베이스라인별 평가 프로토콜 차이를 확인해야 한다.
저자들이 밝힌 한계는 분명하다. SuperNav는 의미 판단을 기반 MLLM에 의존하므로 그 모델의 능력에 제약된다. 기하 실행은 사용 가능한 지도나 장면 기하에 의존한다. MLLM 추론은 계산 비용과 상당한 지연 변동을 유발해 과제 소요 시간을 예측하기 어렵게 만든다. 수요 기반 평가는 관련 목표로의 순서형 내비게이션을 측정할 뿐 그 이면의 활동 완수를 측정하지 않는다. 더 많은 실제 환경으로 평가를 확장하고 긴 내비게이션 시퀀스의 신뢰성을 높이는 것이 향후 과제로 남아 있다.