VLA 추론 지연을 2단계 비균일 디노이징으로 줄인다

Toward Real-Time VLAs: Stage-Aware Two-Step Flow Denoising and System-Level Evaluation

HF Daily2609.39822

Di Wu, Rongtian Shen, Ping Liu2026-10-03조회 1

무엇인가

이 논문은 Vision-Language-Action(VLA) 모델이 안고 있는 시간 스케일 불일치를 다룬다. VLA 정책은 낮은 주기로 추론하지만 로봇은 높은 주기로 연속 제어를 해야 한다. 비동기 추론·실행으로 계산과 실행을 겹쳐도, 새 액션 청크는 추론 시작 시점의 관측에 조건화되므로 로봇이 그 청크를 실제로 실행할 때는 상태가 이미 달라져 있다. 저자들은 이 문제를 모델 계산만의 문제가 아니라 관측 획득, 통신 스케줄링, 물리 응답까지 포함한 종단간 타이밍 문제로 규정하고, 먼저 지연을 어디서 얼마나 쓰는지 측정한다.

어떻게 동작하나

측정 결과는 모델 밖 지연이 무시할 수준이 아니다. 실제 로봇 시스템에서 주 카메라 타임스탬프 오프셋은 17.690ms, 이미지 리드아웃 지연은 32.817ms, 고유수용성 상태 피드백 지연은 26.4±6.2ms, 명령에서 실제 모션까지의 응답 지연은 15.3±5.4ms였다. 캘리브레이션은 30fps 시각 획득과 100Hz 상태 기록으로, 로봇이 작은 진폭의 사인파 관절 운동을 하는 동안 디스플레이 타임코드와 ArUco 마커를 RealSense로 촬영해 위상 관계로 각 성분을 분리하는 방식이다. 모델 쪽은 NVIDIA RTX 4090 D(24GB)에서 JAX로 표준 10-NFE Flow가 첫 JIT 컴파일을 제외한 620회 추론 평균 61.557ms를 쓴다. 즉 추론을 빠르게 하는 것만으로는 관측과 물리 상태 사이의 어긋남을 없앨 수 없다.

무엇과 다른가

제안 방법의 핵심은 Flow Matching 디노이징 단계가 균질하지 않다는 관찰이다. 모델 파라미터·언어 조건·초기 노이즈를 고정하고 10-NFE 추론의 속도장 궤적을 기록해 보면, 초기·중간 단계에서는 속도장의 RMS 크기와 인접 속도장 사이 각도가 대체로 안정적이지만 종단 단계에서는 크기 변화가 커지고 각도가 상승한다. 그래서 저자들은 적분 구간을 [1, τ]와 [τ, 0]으로 나누고 τ=0.3으로 고정한다. 1단계는 길이 0.7의 긴 구간을 표준 Flow Matching으로 한 번에 전진시켜 대략적인 액션 청크를 만들고, 2단계는 남은 0.3 구간에서 SnapFlow의 단축(shortcut) 정련 메커니즘을 그대로 가져와 종단 잔차와 세부를 복원한다. 두 단계 모두 같은 액션 전문가가 조건 c를 공유한 채 수행하되, 목표 시간 s를 달리해 국소 속도 예측(s=t)과 구간 평균 속도 예측(s=0)을 구분한다. 속도는 C=20으로 클리핑한다. 학습은 배치 단위로 표준 Flow Matching 분기와 2단계 분기를 같은 확률로 선택하고, 2단계 손실은 1단계 예측에 stop-gradient를 걸어 종단 정련 손실이 1단계로 역전파되지 않게 한 뒤 MSE(v(1), v(1)*) + 0.1·MSE(v̄(2), v̄*τ→0)로 구성한다. 1단계 손실 가중치는 1.0이다. 결과적으로 함수 평가 횟수(NFE)가 10에서 2로 줄고 평균 모델 추론 시간이 61.557ms에서 21.956ms로, 2.804배 빨라지며 64.33% 감소한다. 다만 두 단계가 각각 완전한 스테이지 계산을 수행하므로 NFE 5분의 1이 실행 시간 5분의 1을 뜻하지는 않는다고 저자들은 명시한다.

어떻게 쓰나

시스템 쪽으로는 로봇의 관측 획득·고속 제어와 GPU 정책 계산을 분리한 분산 실시간 프레임워크를 만든다. 로봇 측 Collector/RobotIO가 오버헤드 카메라, 손목 카메라 2대, 로봇 상태를 모아 최신 관측을 계속 캐싱하고, 추론 스레드가 설정된 주기로 스냅샷을 읽어 요청을 조립한다. 호스트가 다르면 TCP 소켓이나 WebSocket, 같으면 공유 메모리를 쓴다. 클라이언트는 지연 추정치로 각 청크의 유효 인덱스를 정해 핸드오버·블렌딩·인덱싱을 처리하고, 별도 발행 스레드가 제어 주기로 개별 명령을 보내 저속 추론과 통신 대기가 고속 제어를 막지 않게 한다. 추론·액션 발행·로봇 제어 주기를 독립적으로 설정할 수 있고, 센서 타임스탬프와 액션 출처(provenance)를 기록해 핸드오버 재구성과 계층별 오류 위치 파악을 지원한다.

전제와 한계

실험은 π0.5를 공통 베이스 정책으로, Agilex Piper 양팔 플랫폼(팔 관절 12차원 + 그리퍼 2차원, 640×480 RGB 30fps 카메라 3대)에서 장기 양팔 티셔츠 접기 과제로 수행한다. 작은 보라, 큰 분홍, 중간 빨강 세 셔츠에 대해 각 기법을 옷마다 10회씩, 기법당 30회, 총 180회 물리 시행을 돌린다. 비교 대상은 Naive Asynchronous Execution, Temporal Smoothing, Inference-time RTC, Training-time RTC, Legato, VLASH 여섯 가지이며, 동기 추론과 Temporal Ensembling은 프레임워크 검증용 참조 구성으로 물리 비교에서 제외한다. 평가 지표는 성공률, 평균 실행 시간, 시간당 성공 과제 수(Q = R_succ × 3600/T̄), 성공률의 95% Wilson 신뢰구간, 그리고 이전 청크의 시간 정렬 예측과 실제 발행 액션의 차이로 정의되는 Tail Gap·Switch Gap이다. 저자들이 보고한 결론은 학습 기반 기법 중에서는 Legato가, 학습 없는 기법 중에서는 Temporal Smoothing이 과제 성공·완료 시간·액션 연속성·가속도 평활도에서 가장 강하다는 것이다. 2단계 비균일 샘플링을 대표 실행 기법과 결합하면 각각 1.676배, 2.804배의 추론 속도 향상을 얻으면서 과제 성능은 소폭만 떨어진다. 다만 제공된 본문 발췌에는 기법별 성공률·평균 시간의 구체적 수치가 제시되지 않았다.

개발자 관점에서 이 논문의 실용적 가치는 두 가지다. 첫째, VLA 배포에서 추론 시간만 최적화하는 것으로는 부족하다는 체크리스트를 실측 수치와 함께 제공한다. 카메라 타임스탬프 오프셋, 이미지 리드아웃, 고유수용성 피드백, 명령-모션 응답 지연을 각각 캘리브레이션해야 하며, 하드웨어별 클럭 의미와 손목 카메라 타이밍 차이는 별도 보정이 필요하다고 명시한다. 둘째, NFE를 줄이는 스케줄 자체가 재사용 가능한 아이디어다. 전체 구간을 한 번에 압축하는 대신 초·중간 구간은 표준 Flow로 길게, 종단 구간만 단축 정련으로 짧게 처리하는 1 → 0.3 → 0 스케줄은 Flow Matching 기반 월드-액션 모델에도 확장 가능하다고 저자들은 본다. 코드와 프로젝트 페이지가 공개되어 있어 자체 로봇 스택에 붙여 볼 수 있다.

한계와 전제도 분명하다. τ=0.3은 현재 구현에서 고정한 값이며 적응적으로 조정하지 않는다. 실험은 기법 간 짝지은(paired) 설계가 아니어서 방법 간 유의성 검정을 하지 않았고, 성공률은 Wilson 신뢰구간으로만 보고한다. 2단계 샘플링은 과제 성능을 소폭 희생하는 대가를 치르며, 두 단계가 각각 완전한 스테이지 계산을 하므로 NFE 감소가 시간 감소로 그대로 이어지지 않는다. 또한 이 연구는 VLA에 초점을 맞췄고, 향후 과제로 추론 속도·샘플링 예산·액션 핸드오버 전략을 적응적으로 조정하는 추론-실행 스케줄의 공동 최적화를 남긴다.