2D VLA에 3D 기하를 이식해 '보고 행동하게' 만든 Bridge3D
Bridge3D: Enabling Vision-Language-Action Models to See and Act in 3D
무엇인가
로봇 조작용 VLA(Vision-Language-Action) 모델은 대규모 멀티모달 사전학습 덕분에 과제 일반화는 잘 해내지만, 관측이 2D RGB 중심이라 정밀한 공간 조작에서 약하다. 이 논문은 이 불일치를 3D perception-to-action gap이라고 부르고 두 지점의 병목으로 나눈다. 하나는 지각 병목으로, VLM에서 나온 시각 토큰이 공간 기하 정보를 본질적으로 갖지 않는다. 다른 하나는 행동 병목으로, 정밀한 행동 생성에는 명시적 기하 유도가 필요하다. 기존 3D 강화 연구들은 대부분 지각 측 표현을 풍부하게 만드는 데 그쳐 행동 생성을 metric 3D 작업공간에 접지시키지 못했다는 것이 저자들의 문제 진단이다.
어떻게 동작하나
제안하는 Bridge3D는 사전학습된 2D VLA 위에 얹는 계층적 3D 강화 프레임워크로, 두 전략을 결합한다. Implicit Fusion(IF)은 3D 기하 사전지식을 시각 토큰에 녹여 3D로 보기를 담당하고, Explicit Conditioning(EC)은 원시 포인트 클라우드 기하를 3D 의미 필드로 유지한 채 행동 디노이징에 연결해 3D로 행동하기를 담당한다. 여기에 layer-wise linear probing으로 EC를 꼭 필요한 블록에만 넣는다.
무엇과 다른가
IF는 이중 스트림 토큰 인코딩으로 시작한다. 여러 시점의 RGB 관측 I = {I_v}에 대해 의미 스트림은 사전학습 VLM 인코더 Φ_VLM이 z_v^VLM ∈ R^(L×C)를 뽑고, 기하 스트림은 3D 비주얼 지오메트리 파운데이션 모델 VGGT가 z_v^3D ∈ R^(L×D)를 뽑는다. 카메라 파라미터가 명시적으로 주어지지 않아도 VGGT는 다중 시점 관측을 공동 처리해 상대적 구조 의존성을 포착한다. 두 스트림은 패치 수준으로 정렬되고, 2층 MLP로 된 잔차 어댑터 Γ: R^D → R^C가 기하 토큰을 VLM 잠재 공간으로 사상한다. 최종 융합은 z_v^fuse = z_v^VLM + Γ(z_v^3D)라는 토큰별 덧셈 한 줄이다. 이 가벼운 구조 덕분에 VLM의 사전학습 표현 공간을 보존하면서 세밀한 기하 단서만 주입된다.
어떻게 쓰나
EC는 먼저 3D 의미 필드를 만든다. 로봇 머리 카메라의 RGB-D 관측에서 Grounded-SAM으로 인스턴스 마스크를 얻어 로봇과 조작 대상 물체만 남기고, DINOv3로 조밀 특징 맵을 추출한 뒤 D³ Fields 방식으로 2D 특징을 3D로 들어올려 각 공간점 p_i에 의미 특징 f_i를 붙인다. 연산 효율을 위해 조작 관련 점은 N_m = 1,536개, 배경 점은 N_e = 256개로 다운샘플링한다. 다음으로 행동 전문가(action expert) 안에서 행동 은닉 상태 f_act를 양팔 조작을 위해 두 스트림으로 나누고, 엔드이펙터 임베딩 e_arm으로 FiLM 변조를 적용한다: f_act^ = γ(e_arm) ⊙ f_act + β(e_arm). 어텐션의 쿼리와 키에는 3D Rotary Position Embedding을 걸어 Q = RoPE_3D(f_act^, P_ee), K = RoPE_3D(F_pts, P), V = F_pts로 만든다. 여기서 P_ee와 P는 각각 로봇 좌표계의 엔드이펙터 좌표와 장면 포인트 클라우드 좌표다. 마지막으로 공간 크로스 어텐션 CrossAttn = Softmax(QK^T/√d)V를 통해 행동 은닉 상태가 3D 필드 점들을 질의하게 함으로써 행동 생성이 metric 3D 공간에 묶인다. 포인트 클라우드를 압축 표현으로 인코딩하지 않고 원시 기하를 그대로 유지하는 것이 이 설계의 핵심이다.
전제와 한계
EC를 모든 디퓨전 블록에 넣지 않는 이유는 layer-wise linear probing 실험에서 나온다. VLA 백본을 얼려둔 상태에서 각 디퓨전 블록의 은닉 상태로 로봇 엔드이펙터의 3D 좌표를 예측하는 선형 릿지 회귀를 학습시키면, 예측 오차는 초기 층에서 낮게 유지되다가 7번과 11번 층 사이에서 급격히 올라간다. 저자들은 깊은 층의 표현이 고수준 행동 모델링으로 이동하면서 기하 인식이 점진적으로 열화된다고 해석하고, 공간 크로스 어텐션 모듈을 7~11번 블록에만 삽입한다.
실험은 양팔 조작 시뮬레이션 벤치마크 RoboTwin 2.0에서 진행했다. 정밀 공간 지각과 세밀 조작이 필요한 대표 과제 10개를 골라 성공률(SR)을 주 지표로 쓴다. RDT와 GR00T-N1.5 두 백본에 Bridge3D를 얹었고 π0, Spatial Forcing, PointVLA, 3D Diffusion Policy 등과 비교했다. 모든 정책은 Aloha-AgileX embodiment에서 과제당 깨끗한 장면 50개 시연으로 학습하고, 깨끗한 설정과 무작위화 설정에서 각각 100회 시험한다. 파인튜닝 시 VLM 백본은 고정하고 잔차 어댑터와 행동 전문가만 최적화하며, AdamW에 학습률 1×10^-4, RTX 4090 4장을 쓴다. 결과적으로 Bridge3D는 RDT와 GR00T-N1.5 대비 각각 26.1%, 34.6%의 상대 개선을 냈다. 깨끗한 설정에서 RDT-Bridge3D는 평균 성공률 84.8%로 3D 제어 전용 정책인 3D Diffusion Policy(82.8%)를 앞서고, Spatial Forcing(77.1%)과 PointVLA(76.0%)보다 최대 8.8%포인트 높다. 무작위화 설정에서는 두 백본 대비 28.7%, 54.7% 상대 개선으로, Spatial Forcing이 얻은 9.5% 개선을 크게 웃돈다. 초록 기준으로는 RoboTwin 2.0에서 π0를 14.0%포인트 앞선다.
데이터 효율 실험은 Grab Roller 과제에서 시연 2, 5, 10, 25, 50개로 10,000 iteration씩 학습해 비교했고, RDT-Bridge3D가 약 6.1배 적은 학습 샘플로 74% 성공률에 도달했으며 50개 시연에서는 98%를 기록했다. 구성 요소 절제에서는 베이스라인 78.8%에 대해 IF 단독 90.4%, EC 단독 92.0%, 둘을 합친 경우 95.6%(상대 21.3% 개선)로 두 전략이 상보적임을 보였다. 층 선택 절제에서는 7~11번 블록에 넣었을 때 79.4%로 가장 좋았고, 초기 층이나 더 깊은 층에 넣으면 이득이 미미하거나 성능이 떨어졌다. 포인트 의미 특징을 제거하면 세밀한 기능 조작 과제에서 8.0% 하락했고, PointNet++ 같은 포인트 클라우드 인코더를 도입하면 모든 과제에서 성능이 떨어졌는데, 저자들은 특징 집계 과정이 정밀한 공간 기하 구조를 훼손한다고 본다. 실세계에서는 KEENON XMAN-R1 양팔 휴머노이드(RealSense D435 머리 카메라 + D405 손목 카메라 2개)로 Insert Flower, Hang Mug, Put Object Cabinet, Sweep Trash, Place Cup Rack, Clear Trash 6개 과제를 과제당 50회 이상 시험했고, RDT-Bridge3D가 RDT 백본 대비 평균 성공률 42.9% 상대 개선을 냈다. 센티미터급 정밀도가 필요한 Insert Flower에서는 성공률이 거의 두 배가 됐다. 초록 기준으로 실세계에서 Spatial Forcing을 11.7%포인트 앞선다. 높이 변화 일반화 실험(Click Bell, 학습 시 없던 1cm·3cm·5cm 이동)에서도 2D VLA 베이스라인은 이동이 커질수록 성능이 급락한 반면 Bridge3D는 안정적으로 수행했다.
실무 관점에서 이 논문이 주는 신호는 두 가지다. 첫째, 2D VLA를 버리고 3D 네이티브 정책을 처음부터 학습하는 대신, VLM 백본을 얼려둔 채 잔차 어댑터와 행동 전문가만 학습하는 방식으로 3D 능력을 얹을 수 있다는 점이다. 둘째, 3D 강화를 지각 쪽에만 걸면 부족하고 행동 생성 단계에 명시적 기하 접지를 넣어야 하며, 그 삽입 위치는 감이 아니라 층별 선형 프로빙으로 정해야 한다는 점이다. 다만 도입 전에 확인할 것이 있다. 이 방법은 머리 카메라의 RGB-D와 포인트 클라우드를 추가 입력으로 요구하고, 3D 의미 필드 구축에 Grounded-SAM과 DINOv3 같은 외부 모델을 파이프라인에 넣는다. 즉 추론 시점에 depth 센서와 세그멘테이션·특징 추출 모듈이 함께 돌아가야 하므로 지연시간과 캘리브레이션 비용을 따져야 한다. 또한 층 선택 실험은 RDT 백본에서 얻은 결과이고, 시뮬레이션 10개 과제와 실세계 6개 과제로 평가 범위가 제한적이다. 원문에는 별도의 한계 절이 없어, 저자가 명시적으로 밝힌 한계는 이 정도의 전제 수준이다.