MM-Future는 미래장면과 주행행동을 여러모드로 동시생성하는 월드-액션모델이다

MM-Future: Multi-Mode Joint World-Action Modeling for Autonomous Driving

arXiv2609.20377v1

Shuai Liu2026-09-17조회 5

무엇인가

이 논문이 다루는 문제는 자율주행에서 의사결정과 장면 진화가 서로 얽혀 있다는 점이다. 종단간 자율주행은 센서 관측을 궤적이나 제어 명령으로 직접 매핑하는 정책을 학습하는데, 월드-액션 모델(WAM)은 여기에 더해 주행 장면이 앞으로 어떻게 변할지를 함께 모델링한다. 저자들은 기존 WAM을 두 갈래로 나눈다. 캐스케이드 WAM은 장면 예측과 계획을 순차적으로 연결해 여러 모드를 만들 수 있지만 영향이 단방향이라 하류 변수가 상류 변수를 수정하지 못한다. 조인트 WAM은 하나의 생성 과정 안에서 장면과 행동이 양방향으로 상호작용하지만 보통 단일한 장면-행동 롤아웃 하나만 만든다. 즉 캐스케이드형은 모드 커버리지는 있고 양방향 결합은 없으며, 조인트형은 그 반대다. 논문은 비신호 교차로를 예로 든다. 같은 관측에서도 자차가 진입하면 상대 차량이 양보하고, 자차가 감속하면 상대가 들어와 자차의 대기가 강화되는 식으로 서로 다른 상호작용 결과가 나온다. 따라서 양방향으로 함께 진화하는 여러 개의 장면-행동 쌍이 필요하다는 것이 이 논문의 출발점이다.

어떻게 동작하나

MM-Future는 관측 O = (이미지 히스토리, ego 상태 히스토리, 상위 내비게이션 명령)가 주어졌을 때 M개의 장면-행동 모드 H_m = (τ̂_m, X̂+_m)를 생성하는 조건부 분포를 학습한다. τ̂_m은 T_a개의 미래 평면 ego 포즈(x, y, ψ)이고, X̂+_m은 C_f개의 미래 시공간 청크 각각이 d차원 N_x개 토큰으로 표현된 장면 롤아웃이다. 구조는 세 부분이다. 먼저 청크 단위 다시점 인코더가 조밀한 카메라 특징을 계획 지향 표현인 MM-Token으로 압축한다. 구체적으로 비주얼 백본이 카메라별 register 토큰 P_t^v를 뽑고, 시간축을 C개 청크로 나눈 뒤 청크 안의 모든 프레임·카메라 register 토큰에 N_x개의 학습 가능한 청크 쿼리 Q^(j)를 셀프 어텐션으로 상호작용시켜 갱신된 쿼리를 MM-Token X_j로 남긴다. 조밀한 패치 토큰은 이 상호작용 뒤 버려지고 RGB나 BEV 재구성 손실도 걸지 않는다. 대신 다중 모드 결합 월드-액션 목적함수가 토큰을 형성하므로, 제한된 토큰 예산이 미래 진화 예측과 계획에 유용한 단서를 담도록 유도한다. 청크 하나의 표현 전파 비용은 Σ_t Σ_v H×W/p²에서 N_x로 줄어든다. 학습 시에는 EMA(감쇠 0.999)로 갱신되는 타깃 인코더가 미래 이미지 시퀀스를 정지 기울기(stop-gradient)가 걸린 깨끗한 종단점 X̄+로 매핑한다.

무엇과 다른가

다음으로 양방향 상호작용을 담당하는 결합 조건부 플로우가 있다. 먼저 정답 궤적을 정규화된 미분 운동 (Δx, Δy, sinψ, cosψ) 4차원 토큰으로 인코딩하고, 정규화된 학습 궤적에 K-means를 적용해 각 클러스터의 경험적 평균과 분산으로 가우시안 혼합 노이즈(GMN) 분포를 만든다. 이 분포에서 M개의 행동 사전값 ε^a_m을 뽑고 각각에 독립적인 미래 토큰 노이즈 ε^x_m ~ N(0, I)을 짝지어 모드별 초기 장면-행동 소스를 구성한다. 각 모달리티 스트림 κ ∈ {a, x}는 독립적인 플로우 시간 ρκ를 갖고 선형 경로 z^κ = (1-ρκ)εκ + ρκ yκ를 따른다. 생성기 G는 깨끗한 과거 MM-Token, 노이즈가 섞인 미래 MM-Token, 노이즈가 섞인 행동 토큰 위에서 동작하는 모달리티 인지 Transformer로, 공유 어텐션으로 장면과 행동이 양방향 상호작용하게 하되 모달리티별 AdaLN 변조와 피드포워드 분기로 두 스트림의 통계를 분리해 보존한다. 비대칭 블록 마스크는 과거를 깨끗한 프리픽스로 취급해 과거 쿼리는 과거 키만 보고, 행동과 미래 쿼리는 과거를 보면서 서로 상호작용한다. 모드 차원은 배치 차원으로 접혀 모든 모드가 파라미터를 공유하지만 토큰을 교환하지는 않는다. 감독에는 Best-of-Many가 쓰인다. 학습 클립마다 실현된 결과가 하나뿐이라 모든 모드에 같은 종단점 감독을 걸면 예측이 하나로 수렴해버리므로, 디코딩된 궤적이 정답과 가장 가까운 모드 m_win 하나를 고르고 그 인덱스를 두 스트림에 공통으로 적용해 L_BoM = Σ_κ λ_κ ||û^κ_mwin - u^κ_mwin||²만 감독한다. 이기종 인덱스 공유가 장면-행동 대응을 보존한다. 추론 시에는 학습된 속도를 짧은 오일러 스케줄로 적분해 M개의 쌍을 얻는다.

어떻게 쓰나

마지막으로 미래 조건부 제안 스코어러가 후보 중 가장 합리적인 궤적을 고른다. 정지 기울기가 걸린 궤적들을 제안 쿼리로 임베딩해 셀프 어텐션으로 비교하고, 과거 MM-Token에 크로스 어텐션으로 조건화한 뒤, 두 번째 디코더가 각 쿼리를 오직 자기와 짝지어진 미래에만 조건화한다. 미래 어텐션은 모드에 대해 블록 대각 형태라 모드 m의 점수는 X̂+_m만 볼 수 있고 다른 모드의 예측 미래는 볼 수 없다. 출력 모듈이 PDMS 구성요소별 로짓 ℓ_m을 예측하고, 공식 학습 시 의사 시뮬레이터가 계산한 타깃 y_m과의 BCEWithLogits로 L_score = (1/M) Σ BCEWithLogits(ℓ_m, y_m)을 계산한다. 궤적 제안과 미래 MM-Token에는 정지 기울기가 걸려 생성기가 채점을 쉽게 만들려고 출력을 바꾸는 것을 막는다. 전체 목적함수는 L = L_BoM + λ_s L_score이고, 온라인 MM-Encoder·결합 생성기·스코어러를 함께 최적화하며 타깃 인코더는 EMA로만 갱신한다. 추론은 과거 다시점 관측 인코딩, M개 쌍의 장면-행동 토큰 플로우 적분, 공유 히스토리와 상상된 미래로 각 궤적 채점, 최고 점수 궤적 반환 순서로 진행된다.

전제와 한계

실험은 NAVSIM과 HUGSIM에서 수행했다. NAVSIM navtrain으로 학습해 NAVSIM-v1 navtest에서 PDMS 94.0, NAVSIM-v2 navtest에서 EPDMS 91.5를 기록했다. v1에서는 가장 강한 WAM 베이스라인인 DriveFuture를 3.3점 앞섰고, 가장 강한 종단간 베이스라인 DrivoR(trainval)을 0.3점 앞섰다. 학습 데이터를 맞춘 train-only 설정에서도 DrivoR(train) 93.1 대비 93.4로 0.3점 높아, 이득이 추가 학습 데이터 때문만은 아님을 보였다. v2에서는 전체 최강 베이스라인 UniTeD를 1.4점, WAM 최강 베이스라인 DriveFuture를 1.6점 앞섰다. v1에서 EP 91.6으로 최고를 기록하면서 NC·DAC·TTC도 경쟁력 있게 유지했고, v2에서는 TTC 98.6으로 최고이면서 EP 92.2로 근접 최고를 기록해 주행 진행과 충돌 안전을 함께 지켰다. HUGSIM에서는 HUGSIM 미세조정 없이 제로샷으로 옮겨 평가했는데, 각 계획 궤적이 이후 관측에 영향을 주는 폐루프 환경에서 평균 HD-Score 32.3으로 최근 WAM 방법인 Latent-WAM을 3.4점 앞섰다. 특히 Medium 난이도에서 RC 51.5, HD-Score 40.0으로 최강 베이스라인을 각각 9.0점, 10.5점 초과했다.

어블레이션은 세 축을 확인한다. 다중 모드 생성에서 가설 수를 1개에서 32개로 늘리면 PDMS가 행동 전용 생성에서 84.1에서 92.3으로, 쌍 생성에서 85.1에서 92.9로 올랐다. 같은 가설 수에서 장면-행동 쌍 생성은 단일 모드에서 PDMS를 1.0점, 16·32 모드에서 각각 0.6점 개선했다. 32개 가설에서 쌍을 지으면 NC·DAC·TTC가 각각 0.5, 0.1, 1.2점 오르고 EP는 0.2점 내려가, 총 이득이 주로 더 안전한 제안 생성에서 나오며 진행성은 소폭 희생됨을 보였다. 상호작용 설계에서는 모달리티 인지 양방향 변형이 PDMS 92.9, NC 98.8, TTC 95.5로 최고이면서 DAC 98.3으로 공동 최고를 기록해, 단방향 Mixture-of-DiT와 양방향 단일 DiT를 각각 0.4점, 0.6점 앞섰다. 또한 미래 MM-Token이 모드 불변으로 붕괴하지 않고 짝지어진 행동과 함께 변한다는 것을 확인했는데, 좌측 최단·우측 최단 행동과 짝지어진 미래가 유사 행동 쌍보다 RMS 거리 17.3%, 코사인 거리 38.9% 더 분리됐다. 미래 조건부 스코어링은 생성기를 고정한 채 PDMS를 92.9에서 93.3으로 올리고 NC·DAC·TTC·EP를 각각 0.1, 0.2, 0.5, 0.1점 개선했으며, TTC 개선이 가장 커서 제안별 미래 맥락이 안전하지 않은 상호작용을 걸러내는 데 주로 기여함을 시사한다. 수렴 측면에서는 M=16과 M=32가 3.8k 스텝에서 검증 PDM 0.80에 도달한 반면 M=1은 17.5k 스텝이 필요했다. 효율은 NVIDIA H800 한 장, 배치 1, bf16 기준으로 측정했고 16개 가설이 정확도-효율 절충이 좋으며, 미래 조건부 스코어링은 지연을 사실상 추가하지 않는다. 본 표에 쓰인 모델은 64개 제안으로 233ms 지연이다. 구현은 2초 히스토리를 받아 2Hz로 4초를 예측하고, 전방·전좌·전우·후방 카메라 336×560 해상도를 쓰며, 2프레임 청크를 64개의 256차원 MM-Token으로 압축한다. 장면-행동 Transformer는 16층 폭 1024, AdamW 25 에폭, 배치 64, 학습률 2×10⁻⁴, 가중치 감쇠 0.01, 손실 가중치는 행동/장면/스코어링 1.0/0.1/1.0이다.

개발자 관점에서 이 논문의 실무적 의미는 계획 모듈의 후보 생성과 선택을 분리해 설계하라는 신호다. 궤적 후보를 여러 개 뽑되 각 후보에 자기만의 미래 장면을 짝지어 함께 진화시키고, 선택 단계에서는 히스토리와 그 후보의 예측 미래를 함께 보고 점수를 매긴다. 특히 미래 어텐션을 모드별 블록 대각으로 제한해 다른 모드의 상상이 점수에 새지 않게 한 점, 제안과 미래 토큰에 정지 기울기를 걸어 채점 과제를 쉽게 만들려는 단축을 막은 점은 그대로 차용할 만한 설계다. 또한 조밀한 비디오 잠재나 BEV 그리드를 매 모드·매 지평마다 굴리는 대신 계획 지향 토큰으로 압축하는 접근은 모드 수가 늘어날 때 비용이 급격히 커지는 문제를 다루는 실용적 선택이다. 다만 233ms 지연은 64개 제안 기준이라는 점, 그리고 폐루프 이득이 Medium 난이도에 집중됐다는 점은 실제 차량 탑재를 검토할 때 확인해야 할 항목이다.

저자들이 밝힌 한계는 명확하다. MM-Token이 순수하게 암묵적이어서 인코딩된 장면 정보를 해석하기 어렵다는 점이다. 향후 연구로 보조 인지 모듈을 붙여 계획에 관련된 장면 구조를 시각화하고, 투명성을 높여 실패 진단을 가능하게 하겠다고 밝혔다. 그 외에도 학습 클립마다 실현된 결과가 하나뿐이라는 감독 상의 제약을 Best-of-Many로 우회하고 있으며, 미래 이미지는 학습 시 타깃 X̄+를 만드는 데만 쓰이고 추론 시 조건으로 들어가지 않는다는 점이 전제로 깔려 있다.

관련 논문