장기 상상과 실시간 손 조작을 비동기 확산으로 분리한 LiMA

LiMA: Bridging Long-term Imagination to Real-time Dexterous Manipulation via Asynchronous Diffusion

arXiv2609.28431v1

Ning Chen2026-09-23조회 18

무엇인가

이 논문이 다루는 문제는 손가락이 여러 개 달린 양팔 로봇의 조작(dexterous manipulation)에서 장기적 예견과 빠른 반응 제어를 동시에 만족시키는 것이다. 저자들은 기존 접근을 두 갈래로 나눠 비판한다. Vision-Language-Action(VLA) 모델은 고수준 추론에는 능하지만 물리 동역학과 공간 지각을 세밀하게 이해하지 못하고, World-Action Model(WAM)은 반복적 생성 때문에 추론 지연이 크다. 그 결과 모델의 의도가 빠르게 변하는 물리적 접촉 변화에 적응하지 못하는 시간적 불일치(temporal misalignment)가 생긴다는 것이 이 논문의 출발점이다. 기존 WAM도 두 종류로 나뉘는데, 비디오 모델로 미래 관측을 상상해 조건으로 쓰는 Inverse Dynamics Model 계열은 시각적 상상과 행동 예측의 결합이 느슨하고, 이미지와 행동을 하나의 디노이징 과정에서 함께 생성하는 통합 WAM 계열은 잠재 특징 공간이 지나치게 길어져 고주기 반응 요구를 감당하지 못한다고 지적한다.

어떻게 동작하나

제안 방법 LiMA는 의도 계획과 반응 실행을 분리한 비동기 이중 시스템 생성 프레임워크다. 두 개의 DiT로 구성되며, 느린 쪽인 Future Dreamer는 사전학습된 Cosmos-Predict2-2B에서 초기화해 과제 시연으로 미세조정하고, 시각 토큰을 주 디노이징 스트림으로 삼되 언어 임베딩은 Adaptive Layer Normalization(AdaLN)으로 Transformer 활성값을 변조하는 비대칭 조건 설계를 쓴다. Dreamer는 장기 의도 표현 Z_int = [Z_future_vis, Z_future_act], 즉 상상된 다시점 시각 잠재와 거친 매크로 행동 사전값을 출력한다. 빠른 쪽인 Motion Refiner는 1B 파라미터 Transformer를 처음부터 학습시킨 것으로, 상상된 시각 잠재·거친 행동 사전값·실시간 고유수용 상태를 분리해서 조건으로 받고 근시점 행동 청크와 단기 자기중심 시각 잠재 Z_out = [Z_out_act, Z_out_vis]를 예측한다. 거친 행동 사전값은 행동 지평선 방향으로 복제해 보정 궤적의 초기값으로 쓰고, 상상된 시각 사전값은 온라인 시각 토큰과 국소 적응 변조층에서 결합한다. 결합식은 T_mod = γ(Z_future_vis) · LayerNorm(T_vis) + β(Z_future_vis)이며, γ와 β는 상상된 시각 사전값에서 예측한 아핀 스케일·시프트다. 입력 통합에서는 Wan2.1 시공간 VAE 토크나이저로 다시점 프레임을 시각 토큰으로 압축하고, 동결된 T5-XXL로 언어 임베딩을 뽑으며, 로봇 고유수용 상태는 별도 투영층 없이 구조적 반복 패딩으로 시각 특징 차원에 맞춰 상태 토큰으로 만든다.

무엇과 다른가

두 시스템을 잇는 핵심이 Latent Schrödinger Bridge Coupling이다. 일반 확산이 비구조적 가우시안 사전분포에서 출발하는 것과 달리, 여기서는 Dreamer의 의도 표현 Z_int를 경계 X1로, 정답 실행 잠재 Z_out(0)을 경계 X0로 두고 두 분포 사이의 엔트로피 정규화 최적 수송 경로를 만든다. 중간 상태 Z_out(t)는 조건부 가우시안 사후분포 q(Z_out(t) | Z_out(0), Z_int) = N(Z_out(t); μ_t(Z_out(0), Z_int), Σ_t I)에서 샘플링되고, Refiner는 L_refine = E[||Ẑ_out(0) − Z_out(0)||²] 목적함수로 의도 조건이 걸린 중간 상태에서 깨끗한 실행 잠재를 직접 복원하도록 학습된다. 추론 시에는 정답 경계가 없으므로 Z_out(1) ~ N(Z_int, σ1²I)로 의도 조건 사전분포에서 보정을 시작한다. 비동기 실행은 주기 ΔT로 제어하는데, t mod ΔT = 0인 갱신 스텝에서만 Dreamer가 관측과 언어 지시를 처리해 의도를 새로 만들고, 그 사이 스텝에서는 Dreamer 추론을 건너뛰고 캐시된 의도를 쓰면서 Refiner만 최대 주기로 계속 돈다. 학습 목적함수는 L_total = L_dream + λ L_refine이며, 실시간 추론에서 인터페이스가 흔들려도 견디도록 확률 p_bni로 Z̃_int = Z_int + γ ε_noise (γ ≪ 1)를 주는 Boundary Noise Injection 정규화를 넣는다.

어떻게 쓰나

실험은 실제 로봇에서 수행했다. 두 대의 6자유도 UR5 팔에 22자유도 SharpaWave 다섯 손가락 손을 달고, 머리 장착 자기중심 시점 1대와 손목 장착 2대 등 Intel RealSense D435 카메라 3대로 인식한다. VIVE Tracker로 사람 손목 궤적을 잡아 UR5 말단 제어에 쓰고, MetaGlove Pro로 손가락 형상을 기록해 관절공간 기구학 리타게팅으로 22자유도 손에 매핑한다. 과제는 단기 2개(Stack Cup, Roll T-shirt)와 장기 양팔 조작 4개(Cook Rice, Make Sandwich, Make Coffee, Assemble Package)이며, 과제마다 전문가 원격조작 시연 100개를 모으고 실제 배포에서 과제당 20회 시행한다. 비교 대상은 VLA 계열 Gr00T N1.6, InternVLA-a1과 WAM 계열 VPP, Cosmos-Policy이고, 지표는 전체 완료를 보는 Success Rate(SR)와 세부 진행을 보는 Progress Success Rate(PSR)다. 결과적으로 LiMA는 전체 성공률 70.8%, 평균 서브태스크 성공률 78.9%를 기록했고, 단기 과제에서는 강한 VLA 베이스라인과 비슷한 수준을 유지하면서 장기·접촉 집약 과제에서 PSR과 실행 안정성 우위를 보였다. 지연은 Cosmos-Policy의 600ms에서 325ms로 줄어 45.8% 감소했는데, 이는 Dreamer를 Refiner 4회 갱신마다 한 번 새로 고치는 ΔT = 4 스케줄에서 T_avg = (T_Dreamer + 4 T_Refiner) / 4로 계산한 32스텝 행동 청크 생성 지연이다. 모든 방법은 동일한 NVIDIA H100에서 같은 배치 크기와 수치 정밀로 측정했고, 연산자 융합·모델 컴파일·양자화·엣지 최적화는 적용하지 않았다.

전제와 한계

어텐션 맵 분석에서는 단일 DiT인 Cosmos-Policy가 현재 조작과 덜 관련된 영역에도 가중치를 분산시키는 반면, LiMA는 Dreamer가 전역 공간 관계와 과제 맥락에, Refiner가 국소 조작 영역에 집중하는 계층적 분업을 보였다. 절제 실험에서는 미래 시각 의도를 제거했을 때 성능 하락이 가장 컸고, Refiner를 가우시안 노이즈에서 시작해 Dreamer 잠재를 교차 어텐션으로 주입하는 변형과 I2SB를 Flow Matching으로 바꾼 변형 모두 LiMA보다 낮았다. 구성 요소별로는 시공간 적응 변조를 빼면 SR이 80%에서 60%로, 다중 행동 토큰을 빼면 55%로 떨어졌고, 비동기 메커니즘을 제거하면 성공률은 오르지 않으면서 지연이 0.325초에서 0.45초로 늘었다. 브리지 디노이징 스텝은 5스텝이면 의도가 거칠어 성능이 떨어지고 15스텝은 지연이 크게 늘어, 10스텝이 실용적 절충으로 제시된다. 느린 쪽과 빠른 쪽의 연산 배분은 3:7이 가장 좋았다. 일반화 평가는 Cook Rice 과제에서 학습에 없던 배경, 새로운 물체 인스턴스, 학습에 없던 조명, 어수선한 장면 네 가지 시각 교란으로 20회씩 시행했고, LiMA가 모든 조건에서 더 높은 성공률을 보였으며 특히 새로운 물체 인스턴스에서 70% 성공률을 유지했다.

개발자 관점에서 이 논문의 실무적 의미는 무거운 생성 모델을 로봇 제어 루프에 넣는 방법론에 있다. 무거운 월드모델을 매 제어 주기마다 돌리는 대신 ΔT 주기로만 갱신하고 그 출력을 구조적 사전분포로 캐시해 가벼운 보정기를 고주기로 돌리는 설계는, 지연 예산이 빡빡한 추론 서빙 구조에 그대로 옮길 수 있는 패턴이다. 다만 논문이 보고한 325ms는 개별 제어 동작 지연이 아니라 32스텝 청크 생성 지연이고, 연산자 융합·컴파일·양자화·다중 GPU 같은 배포 최적화가 전혀 들어가지 않은 수치라는 점을 감안해야 한다. 또한 성능 수치 대부분이 실제 로봇 20회 시행과 과제당 시연 100개라는 소규모 실물 실험이므로, 자신의 로봇·그리퍼·카메라 구성에서 재현성을 확인하려면 ΔT, 브리지 스텝 수, 느린 쪽과 빠른 쪽 연산 비율 같은 하이퍼파라미터를 다시 튜닝해야 한다.

저자들이 밝힌 한계는 명확하다. 심한 시각적 가림이나 시각적 변화가 거의 없는 상황에서는 성능이 떨어지는데, 이는 카메라 입력에 의존하는 Dreamer가 핵심 특징이 가려지면 정확한 궤적을 유지하기 어렵기 때문이다. 그래서 촉각 피드백을 통합하는 것이 다음 단계라고 본다. 햅틱 센싱이 시각적 불확실성을 보완해 접촉이 많은 상호작용을 더 견고하게 만들 수 있다는 것이다. 또한 보고된 지연은 연산자 융합, 모델 컴파일, 양자화, 다중 GPU 병렬화 같은 배포 특화 가속 없이 측정한 값이라 아키텍처 수준 비교에는 일관되지만 LiMA가 낼 수 있는 최대 효율은 아닐 수 있으며, 향후 융합 커널, 저정밀 추론, Dreamer와 Refiner의 병렬 실행, 하드웨어 인지 다중 GPU 배포를 연구하겠다고 밝힌다.

관련 논문