행동 복제의 다중 모드 표현은 정규화 강도와 샘플러 매끄러움이 결정한다

Understanding Multimodality in Generative Behavioral Cloning

HF Daily2605.22493

Lorenzo Mazza, Massimiliano Datres, Ariel Rodriguez2026-09-30

무엇인가

행동 복제(behavioral cloning)는 전문가 시연의 관측-행동 쌍을 지도학습으로 맞추는 방법이지만, 같은 관측에 여러 개의 유효한 행동이 존재하는 다중 모드 상황에서 무너진다. L2 손실이나 단일 가우시안 헤드를 쓰면 최대가능도 해가 모드들의 조건부 평균으로 회귀하는데, 이 평균은 어느 모드의 지지집합에도 속하지 않는 경우가 많다. 논문이 드는 대표 예가 로봇 역기구학이다. 같은 말단 효과기 목표에 대해 관절 공간 해가 서로 떨어진 여러 갈래로 존재하는데, 평균을 취하면 어느 갈래에도 없는 관절 명령이 나오고, 한 갈래로 필터링하면 장애물이나 관절 한계 같은 제약 아래 필요한 대안을 잃는다. 최근 다중 모드 행동 복제는 단일 스텝 대신 짧은 행동 청크를 예측하며, 잠재변수 기반 방법과 행동공간 생성 방법의 두 갈래로 나뉜다. 이 논문은 두 갈래 각각에서 다중 모드성이 어떤 모델·학습 수량에 의해 통제되는지를 규명한다.

어떻게 동작하나

논문은 먼저 다중 모드성을 데이터의 성질로 정의한다. 각 관측 s에 대해 전문가 조건부 행동 분포의 지지집합이 유한개의 잘 분리된 유효 모드 집합 C_1(s)…C_K(s)(s)로 덮이고, 서로 다른 모드 사이의 거리 Δ(s)가 양수라고 가정한다. 각 시연 쌍 (s,a)에 모드 인덱스를 부여하는 라벨 함수 g(s,a)와 그로부터 유도되는 모드 라벨 확률변수 M을 정의하고, 조건부 모드 엔트로피 H(M|S)를 다중 모드성의 척도로 삼는다. 분석 대상은 두 계열이다. 하나는 잠재변수 정책으로, 사후 인코더 q_φ(z|a,s), 조건부 사전 p_ψ(z|s), 잠재 조건 디코더 π_θ(a|z,s)로 구성되며 β로 가중된 사후-사전 정규화 항을 목적함수에 넣는다. 다른 하나는 행동공간 생성 정책으로, 기저 잡음 U~N(0,I)를 결정론적 샘플러 G_θ(s,u)로 행동으로 운반하는 push-forward 분포를 쓴다. 확산·플로우 매칭 정책의 결정론적 샘플러가 이 틀에 포함된다.

무엇과 다른가

잠재변수 정책에 대한 핵심 결과는 모드 보존에 행동 조건부 잠재 정보가 필요하다는 것이다. 조건부 상호정보 I(A;Z|S)는 상태가 이미 결정하지 못한 행동 정보의 양을 나타내는데, 논문은 모드 복구 오류율 ρ(s)에 대해 파노 보정 하한 B_ρ를 정의하고 I(A;Z|S) ≥ B_ρ를 증명한다(명제 1). 모드 복구가 정확할수록, 즉 ρ가 작을수록 하한이 커진다. K(s)개 모드가 균등하고 오류가 0이면 I(A;Z|S) ≥ E[log K(S)]가 되어, 잠재변수가 모드 엔트로피만큼의 정보를 나눠야 한다(따름정리 1). 문제는 정규화다. 점별 KL 정규화 D(q_φ,p_ψ)를 쓰면 B_ρ̂ ≤ I(A;Z|S) ≤ C/β가 성립해서, β가 커질수록 보존 가능한 인증된 다중 모드성이 1/β 속도로 줄어든다(따름정리 2). 따라서 원하는 모드 복구 정확도 b_0를 얻으려면 β < C/b_0여야 한다. 저자들은 ACT의 기본값 β=10이 단일 모드 정책을 만들 가능성이 크다고 지적한다. 다만 이 붕괴 기준은 점별 KL 형태의 정규화에 특정되며, 집계(aggregate) 매칭 목적함수에는 같은 관계가 성립하지 않는다.

어떻게 쓰나

행동공간 생성 정책에서는 제약이 기하학적이다. 모드 C_k(s)가 정책 분포에서 τ-표현된다는 것을 π_θ(C_k(s)|s) > τ로 정의하고, τ-표현된 모드의 개수 N_θ^(τ)(s)를 센다. 샘플러 u↦G_θ(s,u)가 L_{θ,s}-립시츠라면 N_θ^(τ)(s) ≤ 1 + floor( 2(√(2π)|Φ^{-1}(τ)|+1) / (√(2π) τ) · L_{θ,s}/Δ(s) ) 라는 상한이 나온다(명제 2). 립시츠 상수가 작은 매끄러운 운반 사상은 서로 멀리 떨어진 여러 모드에 유의미한 확률 질량을 나눠줄 수 없다는 뜻이다. 많은 모드를 덮으려면 기저 공간에서 급격한 전환이 있거나, 행동 공간에 유효하지 않은 다리(bridge) 영역을 만들어야 한다. 립시츠 상수를 줄이는 정규화는 다중 모드성을 억제하는 방향으로 편향된다.

전제와 한계

실험은 정답 모드 라벨이 있는 2D 다중 모드 내비게이션 과제 4개(Circle, Sequential, Radial, Corridor)에서 이론을 검증한다. 다중 모드 데이터에서 모드 커버리지는 성공적 롤아웃의 필요조건이다. 결정론적 기준선은 네 과제 모두에서 유효하지 않은 평균 궤적으로 붕괴해 성공률 0을 기록했다. 그러나 충분조건은 아니다. 생성 정책들은 높은 유효 모드 커버리지를 회복했지만 가장 어려운 K=16 과제 두 개에서는 성공률이 0.37~0.52에 그쳤다. 명제 1의 하한은 실험에서도 성립했고, β가 작을 때 모드 정보 I(M;Z|S)는 H(M|S)에 가까웠지만 β가 커지면 급격히 줄면서 사후 샘플링 정책의 성공률이 0으로 붕괴했다. β 선택에 대해서는 β_max = L^0/b_0(ρ̄)라는 임계값을 제시하는데, 실험에서 D_KL < b_0(ρ̄)인 모든 실행은 ρ̂ > ρ̄였고 β_max 위의 실행은 원하는 모드 복구를 달성하지 못했다. 다만 β_max 아래에서도 실패한 실행이 여럿 있어 임계값 충족만으로 성공이 보장되지는 않았다. 립시츠 상한도 실측으로 확인됐다. Circle과 Sequential은 정규화 전환 민감도가 약 7.9와 17.7로 높고 보간 다리 비율이 무시할 수준이며 성공률이 1.00과 0.99였다. 반대로 Radial과 Corridor는 민감도가 2.63과 1.67로 낮고 다리 비율이 0.46과 0.55로 크며 성공률이 0.47과 0.41에 머물렀다. 모드 커버리지가 완전하거나 거의 완전한데도 그렇다.

로봇 시연 데이터에는 모드 라벨이 없어서, 논문은 근처 관측 상태에 대응하는 미래 행동 청크를 가우시안 혼합 모달 클러스터링으로 묶어 조건부 국소 모드 수와 엔트로피를 추정하는 휴리스틱을 제안한다. 이 추정기는 합성 벤치마크에서 실제 모드 수를 복원하며 검증됐다. 표준 로봇 시뮬레이션 벤치마크에 적용한 결과는 의외다. Push-T, UR3 BlockPush, LIBERO, Meta-World는 추정값이 1에 극히 가까웠고, 가장 다중 모드적인 Kitchen도 행동 지평 30에서 1.231에 불과했다. 반면 실제 수술 로봇으로 만든 이중 모드 조직 파지 데이터셋은 행동 지평이 충분히 길 때 의미론적 정답인 2에 근접했다. 정책 성능에서도 같은 패턴이 나온다. 추정 다중 모드성이 가장 높은 조직 파지에서 BCAT는 두 모드를 평균해 성공률 0을 기록했다. 반면 Sinkhorn-CWAE는 학습 중 단일 모드로 붕괴하고도 성공률 85를 유지했다. 거의 단일 모드인 시뮬레이션 데이터에서는 결정론적 회귀가 여전히 경쟁력이 있었고, 다중 모드 정책은 학습 동역학에 따라 성능을 올리기도 내리기도 했으며 추론 지연을 늘렸다. 저자들은 동시대 연구를 인용해 플로우 기반 정책의 이점이 데이터에 있다고 가정된 다중 모드 행동 분포의 표현보다 지도 반복 계산과 학습 시 잡음 주입에서 온다고 본다.

실무적으로 이 논문은 두 가지를 확인하라고 요구한다. 첫째, 정책이 다중 모드 데이터를 다뤄야 한다면 CVAE 계열에서 β를 기본값으로 두지 말고, 원하는 모드 복구 오류 수준에서 β_max를 추정한 뒤 실제 학습된 정책이 그 오류를 달성하는지, 총 손실이 붕괴 기준선 L^0 아래인지 확인해야 한다. ACT의 기본 β=10은 이 기준에서 단일 모드 정책을 만들 가능성이 크다. 둘째, 플로우·확산 샘플러를 쓸 때는 기저-행동 사상의 립시츠 상수와 모드 간 거리의 비 L/Δ를 측정해야 한다. 이 비가 작으면 모드 커버리지가 좋아 보여도 유효하지 않은 다리 영역에 확률 질량이 실려 롤아웃 성공률이 떨어진다. 또한 정책을 평가하기 전에 데이터 자체의 조건부 다중 모드성을 진단하는 것이 합리적이다. 시뮬레이션 벤치마크 대부분이 거의 단일 모드라면, 다중 모드 생성 정책의 복잡도와 추론 지연을 정당화할 근거가 약하다.

저자들이 밝힌 한계는 명확하다. 결과가 학습 과정과 독립적이라는 점이다. 따름정리 2는 원하는 다중 모드 성질을 가진 최적해가 존재하기 위한 필요조건을 줄 뿐, 학습이 그 최적해를 찾는다는 보장은 하지 않는다. 명제 2도 낮은 립시츠 샘플러의 구조적 한계를 지적할 뿐이다. 게다가 립시츠 거동을 벌하는 흔한 정규화는 정책을 모드 붕괴 쪽으로 편향시킬 수 있다. 향후 과제로는 시각 특징만 주어졌을 때 모드 수를 추정하는 방법, 샘플러 매끄러움과 모드 보존을 균형 잡는 학습 절차, 그리고 로봇 시뮬레이션에서 관찰된 제한적 조건부 다중 모드성이 대규모 실제 로봇 데이터셋에도 해당하는지에 대한 연구를 제시한다.