로봇 파운데이션 모델의 행동 생성을 한 번의 순전파로 끝내는 K-MF
Kinematic MeanFlow: One-Step Action Generation Policy for Robotic Foundation Models
무엇인가
로봇 파운데이션 모델(RFM)은 시각 관측과 언어 지시, 고유수용 상태를 조건으로 미래 행동 청크를 생성하는 범용 조작 정책을 목표로 한다. 현재 주류 RFM은 flow matching으로 순간 속도장을 학습하고, 추론 시 여러 디노이징 스텝을 반복해 노이즈를 행동으로 바꾼다. 문제는 이 반복 순전파가 만만치 않은 비용이라는 점이다. 논문은 GR00T-N1.6을 예로 들어 행동 헤드 지연이 데스크톱 GPU(L40)에서 전체 추론 시간의 약 40%, 로봇 엣지 플랫폼(Jetson Orin)에서 최대 50%를 차지한다고 측정한다. 즉 행동 헤드가 RFM의 의사결정 주파수를 사실상 결정하고 있으며, 디노이징 스텝 수를 줄이는 것이 핵심 과제라는 것이다.
어떻게 동작하나
저자들은 이미지 생성에서 1스텝 생성을 가능케 한 MeanFlow를 RFM에 그대로 적용하면 성능이 붕괴한다는 것을 먼저 보고한다. 원인을 추적한 결과 RFM의 속도장에서만 나타나는 두 가지 동역학을 발견한다. 첫째, 국소 가속도(Δu/Δt)가 디노이징 초반에는 안정적이다가 후반(t<0.3)에 급격히 치솟아 t=1에서 초기값의 76배에 도달한다. 둘째, 샘플 간 가속도 크기의 산포가 디노이징이 진행될수록 넓어지며, 이 산포의 정도는 학습 데이터의 태스크 다양성과 강하게 상관된다. MeanFlow는 현재 모델이 추정한 시간 미분항을 stop-gradient로 되먹이는 부트스트래핑 구조인데, 후반의 급증과 확대되는 산포가 이 피드백 루프를 오염시켜 손실 지형을 스파이크 형태로 불안정하게 만든다. 논문은 이 손실 이상치가 주로 r<0.3 구간에 몰려 있다는 점에서 기존 이미지 생성 문헌이 보고한 불안정성과 다르다고 강조한다.
무엇과 다른가
제안 방법인 Kinematic MeanFlow(K-MF)는 운동학적 항등식에서 출발한다. 임의의 중간점 c∈(r,t)에 대해 구간 [r,t]의 평균 속도는 두 하위 구간 [c,t]와 [r,c]의 평균 속도의 볼록 결합과 정확히 같다는 성질이다. 이를 이용해 K-MF는 MeanFlow 목표식의 시간 미분항 d/dt·u(t,r)을 d/dt·u(t,c)와 d/dc·u(c,r) 두 항으로 분리한다. λ=(c-r)/(t-r)로 두면 학습 목표는 u_K-MF = v_t − (t−r)[(1−λ)²·sg(dπ_θ/dt) + λ²·sg(dπ_θ/dc)]가 되고, 손실은 이 목표에 대한 평균제곱오차다. 첫 번째 항은 초반 디노이징에서 안정적인 추정을 보장하고, 두 번째 항은 후반 구간의 보정만 전담한다. 또한 c 지점에서 한 번 더 추정하는 것이 앵커 역할을 해, 확대되는 산포의 영향을 줄이고 전 구간에 걸친 오차 증폭을 완화한다.
어떻게 쓰나
중간점 c를 정하는 방식으로 세 가지 전략을 비교한다. λ를 균등분포에서 뽑는 랜덤 샘플링, λ=0.5로 고정하는 중간점 고정, 그리고 3층 MLP G_φ(t,r)로 λ를 학습하는 전략이다. 학습형 전략은 별도의 생성기 손실 L_gen(φ)을 쓰는데, 가중치 ω = 1 + γ·exp(−1/(‖Δu‖+ε))에서 γ를 학습 동안 −0.5에서 0.5로 선형 증가시켜, 초반에는 분리 추정이 전체 추정과 구별되도록 하고 후반에는 자기일관성을 회복하도록 유도한다. 구현에서는 순방향 자동미분(dual number) 기반 JVP로 시간 미분을 한 번의 순전파 안에서 계산하고, 두 하위 구간의 미분을 배치 차원으로 이어 붙여 동시에 평가하며, 타임스텝 r용 임베딩 레이어를 추가해 t와 r 임베딩을 합산한다.
전제와 한계
실험은 네 개 데이터셋에서 이뤄진다. LIBERO(2K 궤적), BridgeData V2(53K), Fractal(87K), COMPASS 기반 포인트 내비게이션(658개)이며, Sim2Sim은 LIBERO와 PointNav, Real2Sim은 SimplerEnv를 통한 Fractal과 BridgeData V2에서 평가한다. GR00T-N1.6은 파인튜닝, SimVLA-S는 처음부터 학습하는 두 패러다임을 다룬다. 롤아웃은 GR00T-N1.6 200회, SimVLA-S 500회 수행한다. 비교 대상은 다단계 flow matching, MeanFlow, 그리고 구간 분할 계열의 α-Flow와 안정화 계열의 MVP다. 파일럿 실험에서 MeanFlow는 그래디언트 클리핑에 더해 점진적 타임스텝 샘플링과 충분한 반복이 필요한 까다로운 레시피를 요구했고, 약 60K 반복에서 성능이 포화된 뒤 과적합으로 하락했으며, 그렇게 해도 2스텝 생성에서 겨우 합리적 수준에 도달해 표준 flow matching에는 못 미쳤다. α-Flow와 MVP는 그런 레시피 없이도 동작했지만 1스텝으로 밀어붙이면 MVP는 실행 가능한 행동을 만들지 못했고 α-Flow는 뚜렷한 성능 저하를 보였다.
본 실험에서 K-MF는 LIBERO의 GR00T-N1.6 파인튜닝과 SimVLA-S 처음부터 학습 양쪽에서 다단계 flow matching 및 2스텝 MeanFlow와 대등하거나 앞서는 성능을 냈다. Fractal, BridgeData V2, PointNav에서도 다단계 flow matching보다 대부분의 설정에서 높은 성공률을 기록해, 데이터 규모와 태스크, 로봇 embodiment를 넘나드는 일반화를 보였다. 중간점 전략 비교에서는 학습형이 가장 좋았고, 중간점 고정은 파인튜닝 상황에서 빠르게 적응하는 실용적 선택이었으며, 랜덤 샘플링은 명확히 뒤처졌다. 학습된 λ가 구간 폭 t−r과 강한 상관을 보인다는 점에서, K-MF의 효과는 다양한 분할에서 오는 증강이 아니라 시간 미분 추정의 개선에서 나온다고 저자들은 해석한다. 효율 측면에서 flow matching 기준선의 종단간 지연 중 행동 헤드가 43~73%를 차지했고, K-MF는 L40과 Jetson Orin, eager 및 compiled 모드 전반에서 행동 헤드 지연을 67.5~74.4%, 종단간 지연을 30.3~54.9% 줄였다. 학습 비용은 MeanFlow 대비 학습 시간 7.5~13.6%, 최대 GPU 메모리 2.5% 이내의 추가 부담이고, flow matching 대비로는 GR00T-N1.6 33%, SimVLA 27% 수준이다. 다만 개별 태스크별 성공률 수치는 본문에 표로 제시되어 있지 않고 표 참조로만 언급된다.
개발자 관점에서 이 논문의 실질적 의미는 추론 예산이다. 행동 헤드가 전체 지연의 절반 가까이를 먹는 구조에서 디노이징을 1스텝으로 줄이면, 같은 하드웨어로 제어 주파수를 크게 올리거나 더 저렴한 엣지 보드로 옮길 수 있다. 특히 Jetson Orin 같은 로봇 탑재 보드에서의 30~55% 종단간 지연 감소는 배포 가능성 자체를 바꾸는 수치다. 도입을 검토한다면 먼저 자신의 데이터 다양성 수준에서 국소 가속도 산포가 얼마나 커지는지 확인해야 한다. 논문의 분석에 따르면 태스크 다양성이 높고 데이터가 클수록 평균 속도 모델링이 어려워지므로, 대규모 이종 데이터를 다루는 팀일수록 K-MF의 이득과 학습 안정성 튜닝 부담을 함께 저울질해야 한다. 또한 기존 flow matching 체크포인트를 파인튜닝으로 전환할 때는 중간점 고정 전략이, 처음부터 학습할 때는 학습형 전략이 출발점으로 제시된다.
저자들이 밝힌 한계는 두 가지다. 첫째, K-MF는 flow matching 대비 추가 학습 비용을 발생시킨다. 다만 추론 효율을 감안하면 전체 학습 비용은 합리적 범위라는 것이 저자들의 주장이다. 둘째, 평가가 전신 제어(whole-body control)나 정교한 손 조작(dexterous manipulation)을 포함하지 않는다. 이 두 영역은 현재 RFM에게도 여전히 어려운 문제라는 점을 인정하고 있다.