LIT는 자세 감독 잠재 인터페이스로 시각-행동 지름길을 끊는다
Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models
무엇인가
이 논문은 사전학습된 비전-언어 또는 비디오 백본과 행동 전문가(action expert)를 결합한 로봇 파운데이션 모델이 학습 분포 안에서는 잘하지만 시각 분포 변화에서 성능이 떨어지는 문제를 다룬다. 저자들은 행동 전문가가 시연 데이터에서 행동과 우연히 상관된 과제 무관 시각 단서를 활용하는 '시각-행동 지름길(vision-action shortcut)'을 핵심 원인으로 본다. 시연의 시각적 다양성이 낮으면 이런 의존이 심해지고, 시점·외관·센서 조건이 바뀌면 일반화가 무너진다. 반대로 시각 표현에는 행동 생성에 필요한 공간 정보도 들어 있으므로, 과제 무관 변화에는 둔감하게 만들면서 과제 관련 공간 변화에는 반응하도록 시각 정보 사용을 제약해야 한다. 기존 표현 강화나 단계적 행동 사전학습은 정보를 더 넣거나 이미지 없이 사전학습할 뿐, 행동 전문가가 시각 정보를 어떻게 쓰는지 직접 제약하지 않는다는 것이 저자들의 문제의식이다.
어떻게 동작하나
LIT는 모델 구조에 독립적인 2단계 전략이다. 1단계에서는 이미지를 전혀 쓰지 않고 공간 목표 조건의 행동 사전을 학습한다. 정책은 시각 관측 o_t, 언어 l, 로봇 상태 s_t를 받아 길이 H의 행동 청크 A_t를 예측하는데, 각 시연 청크의 종단 로봇 상태를 목표 g_t=[p_{t+H}; r_{t+H}; q_{t+H}]∈R^8로 정의한다. 여기서 p는 월드 프레임 말단효과기 위치 3차원, r은 축-각도 방향 3차원, q는 그리퍼 관절 위치 2차원이다. 동결된 백본은 언어와 로봇 상태만 처리해 각 결합 층의 의미 표현 H_sem을 만들고, 학습 가능한 3층 MLP가 g_t를 목표 토큰 G_t로 인코딩해 H_sem과 이어 붙인 C_l,t로 행동 전문가를 조건화한다. 행동 생성은 각 프레임워크의 네이티브 목적함수를 유지하며, 논문은 플로우 매칭 목적을 예로 들어 노이즈가 섞인 행동 청크와 목표 속도를 구성하고 L_prior= E||v_hat - v*||^2를 최소화한다. 이때 행동 전문가 파라미터 θ와 SE(3) 인코더 η만 갱신되고 백본과 모달리티 인코더는 동결된다.
무엇과 다른가
2단계는 1단계 행동 전문가를 초기값으로 쓰고, 시각 조건을 오직 자세 감독 잠재 인터페이스를 통해서만 넣는다. K=100개의 학습 가능한 잠재 토큰 Z^0가 각 정책 입력에 대해 공유되고, 각 결합 층에서 자기어텐션, 의미 크로스어텐션, 시각 크로스어텐션을 차례로 거쳐 갱신된다. 잠재 토큰이 쿼리를 제공하고 백본의 언어·상태 표현과 시각 표현이 키·값을 제공한다. 파라미터 효율을 위해 연속한 m개 결합 층이 인터페이스 어텐션 파라미터를 공유하되 각 층의 백본 표현에는 접근한다. 갱신된 토큰은 각 아키텍처의 네이티브 조건화 방식으로 행동 전문가 층을 조건화하고, 행동 손실 L_act는 1단계와 같은 방식으로 계산된다. 추가로 MLP 디코더가 최종 잠재 토큰에서 1단계에 쓴 것과 동일한 종단 목표 g_t를 복원하도록 L_pose=||g_hat - g||^2를 걸고, 전체 손실은 L_act + 0.3 L_pose다. 2단계에서는 백본과 모달리티 인코더, 행동 전문가, 잠재 토큰과 인터페이스 어텐션, MLP 디코더를 함께 최적화한다. 추론 시에는 잠재 인터페이스는 활성화되지만 1단계 자세 인코더와 2단계 자세 디코더는 제거되어, 시각 관측·언어·로봇 상태만 필요하다.
어떻게 쓰나
실험은 LIBERO와 LIBERO-Plus에서 과제 성공률로 평가한다. LIBERO는 Spatial, Object, Goal, Long 네 스위트의 40개 과제에서 과제당 50회 롤아웃, 총 2,000 에피소드로 측정한다. LIBERO-Plus는 카메라 시점, 센서 노이즈, 로봇 초기 상태, 언어 지시, 객체 배치, 조명, 배경 텍스처의 일곱 가지 과제 보존 교란 아래 제로샷 일반화를 보며, 10,030개 교란 인스턴스를 각 1회 롤아웃하고 일곱 차원의 비가중 평균을 Overall로 보고한다. 모든 모델은 원래 LIBERO 시연만으로 학습하고 LIBERO-Plus에 적응 없이 평가한다. 아키텍처는 VLA인 Pi0.5, MolmoAct2와 WAM인 FAST-WAM, ImageWAM 네 가지이며, 베이스라인과 LIT는 같은 사전학습 백본과 무작위 초기화 행동 전문가에서 출발한다. 저자들은 사전학습된 VLA/WAM 정책 체크포인트를 미세조정하지 않았고, 따라서 베이스라인 수치가 논문에 발표된 미세조정 결과와 직접 비교되지는 않는다고 명시한다. 분포 내 LIBERO 평균 성공률은 Pi0.5 87.75→91.80, MolmoAct2 93.50→94.10, FAST-WAM 97.60→98.10, ImageWAM 98.10→98.40으로, 어떤 아키텍처에서도 평균 성능 저하가 없었다.
전제와 한계
LIBERO-Plus 제로샷 일반화에서 LIT는 네 아키텍처 모두 Overall을 끌어올린다. MolmoAct2는 63.62→71.92로 오르며 센서 노이즈 +21.74점, 객체 배치 +15.71점을 기록했고, Pi0.5는 68.97→79.67로 오르며 카메라 시점 +22.01점, 센서 노이즈 +12.05점, 객체 배치 +9.11점을 보였다. FAST-WAM은 51.44→60.63으로 카메라 시점 +27.43점, 센서 노이즈 +19.19점, ImageWAM은 83.02→86.89로 로봇 초기 상태 +12.38점, 객체 배치 +5.95점을 얻었다. 전체 28개 아키텍처-교란 비교 중 26개가 개선됐고, 2.11%포인트를 넘는 하락은 없었다. 실제 로봇에서는 MolmoAct2 베이스라인과 비교해 Keep LEGOs, Wipe trash, Transfer egg 세 과제를 과제당 100개, 총 300개 시연으로 단일 다중과제 정책을 학습했다. 분포 내에서는 과제당 25회, 총 75회, 각 OOD 조건에서는 과제당 10회, 총 90회 롤아웃했다. 세 과제 합산 성공률은 ID 74.7→88.0, Lighting OOD 53.3→70.0, Camera OOD 30.0→46.7, Distractors OOD 50.0→63.3으로 모두 개선됐다. Transfer egg는 ID 52.0→92.0, Lighting OOD 30.0→90.0, Distractors OOD 20.0→90.0이었고, Wipe trash는 ID에서 베이스라인과 동률이면서 Camera OOD가 10.0→80.0으로 올랐다.
행동 분석에서 LIT는 교란 아래에서도 행동-이미지 어텐션이 과제 관련 로봇-객체 영역에 더 집중되는 경향을 보였다. 반사실 개입 실험에서 과제를 보존한 시각 교란(방해물 추가, 흐림)을 주면 베이스라인 궤적은 크게 벗어나지만 LIT는 깨끗한 경우와 가깝게 유지됐고, 목표를 바꾸면 베이스라인은 원래 목표로 계속 가는 반면 LIT는 새 목표로 방향을 바꿨다. 학습 동역학은 1단계 행동 손실이 10K 스텝 후 0.029, 2단계 자세 복원 손실이 20K 스텝 후 0.003에 도달했고, 같은 총 학습 예산에서 LIT가 20K 시각 학습 스텝 만에 베이스라인이 30K 스텝에서 도달한 것보다 낮은 행동 손실을 보였다. 절제 실험에서 1단계를 생략하면 OOD 71.92→68.23(-3.69), 자세 감독을 빼면 71.92→68.86(-3.06)이었으며 특히 센서 노이즈 70.77→60.02, 배경 텍스처 94.42→88.38로 떨어졌다. 행동 전문가가 백본 시각 표현에 직접 접근하게 하면 LIBERO는 94.25 대 94.10으로 비슷하지만 LIBERO-Plus는 71.92→67.74(-4.18)로 하락했다. 1단계와 자세 감독을 모두 빼면 65.70으로 베이스라인 대비 +2.08에 그쳤고, LA4VLA에서 영감을 받은 단계적 학습은 65.46, 베이스라인에 자세 감독만 추가한 경우는 65.45로 각각 LIT보다 6.46, 6.47%포인트 낮았다. 저자들은 이 결과가 잠재 인터페이스, 이미지 없는 공간 목표 행동 사전, 자세 감독의 결합이 필요함을 지지한다고 해석한다.
개발자 관점에서 LIT는 사전학습 백본과 행동 전문가를 분리해 가진 VLA/WAM 구조에 삽입 가능한 학습 전략이다. 다만 1단계 조건화와 2단계 복원 목표로 각 시연 행동 청크의 종단 SE(3) 말단효과기 자세와 그리퍼 상태 라벨이 필요하므로, 이런 라벨이 없는 데이터셋에는 그대로 적용하기 어렵다. 추론 시에는 목표 자세가 필요 없고 시각·언어·로봇 상태만 쓰므로 배포 파이프라인 부담은 늘지 않는다. 통합할 때는 각 아키텍처의 네이티브 조건화 메커니즘에 맞춰 잠재 토큰 차원과 인터페이스 어텐션 공유 주기 m을 정하고, 전체 최적화 스텝을 1·2단계에 나눠 배분해야 한다. 또한 이 논문은 사전학습된 정책 체크포인트를 미세조정하지 않고 원래 LIBERO 시연만으로 학습한 설정을 쓰므로, 이미 미세조정된 VLA/WAM 체크포인트에 LIT를 얹을 때 같은 이득이 보장되는지는 별도 검증이 필요하다. 저자들이 밝힌 한계는 더 큰 규모의 실제 로봇 평가가 아직 열려 있다는 점이며, 향후 더 크고 다양한 로봇 시연 데이터셋과 더 넓은 과제·환경으로 확장해 평가할 계획이라고 쓴다.