ME-World가 여러 에이전트의 1인칭 영상을 하나의 세계로 묶는다
Multi-Agent Egocentric World Model with Fine-Grained Embodied Interaction
무엇인가
1인칭 시점의 세계 모델(world model)은 에이전트의 행동을 조건으로 미래 관측을 예측하지만, 대부분 단일 에이전트만 다룬다. 실제 체화(embodied) 환경에서는 여러 에이전트가 같은 공간에서 행동하고 서로 상호작용하며 물체와 환경의 상태를 함께 바꾼다. 기존 다중 에이전트 세계 모델은 이동, 카메라 제어, 이산 명령 같은 거친 행동만 조건으로 받아 손·팔·몸·시선처럼 세밀한 상호작용을 다루지 못했다. 이 논문은 다중 에이전트 1인칭 세계 모델링을 여러 에이전트가 세밀한 행동으로 상호작용하는 하나의 세계에서 동기화된 ego 스트림을 생성하는 문제로 정식화하고, 시점 간 행동 일관성, 공유 환경 일관성, 상호작용이 유발한 상태 변화의 일관된 전파라는 세 가지 요구사항을 제시한다.
어떻게 동작하나
제안 방법 ME-World는 세 축으로 이 문제를 푼다. 첫째, 각 스트림을 독립적으로 생성하지 않고 사전학습된 비디오 확산 트랜스포머(DiT, Cosmos-Predict2.5 2B 멀티뷰) 안에서 모든 에이전트의 잠재 시퀀스를 토큰 차원으로 이어 붙여(Z_gen = [Z(1); …; Z(N)]) 공동으로 디노이징한다. 모든 스트림에 동일한 RoPE를 적용해 시공간 위치를 공통 좌표계에 정렬하고, 학습 가능한 에이전트 임베딩으로 스트림을 구분하며, 텍스트는 스트림별 별도 cross-attention 경로를 쓴다. 둘째, shared action conditioning으로 각 스트림을 자기 행동만이 아니라 모든 에이전트의 움직임에 조건화한다. 행동은 몸 동작과 머리 동작으로 분해되는데, 몸 동작은 자기 손·팔이 보이는 스켈레톤 맵으로, 머리 동작은 카메라 광선을 담은 Plücker ray map으로 인코딩된다. 각 프레임의 포즈 조건은 자기 스켈레톤 맵과 다른 에이전트의 3D 바디 포즈, 상대 카메라 기하를 목표 영상 평면에 렌더링해 만들고, ray map은 공유 정준 좌표계로 표현해 시점 간 기하 비교가 가능하게 한다.
무엇과 다른가
셋째, shared environment memory가 주변 세계가 어떻게 보여야 하는지를 고정한다. 모든 에이전트의 관측 이력을 모은 공유 풀에서, 스트림 정렬 기하 메모리 경로는 목표 시점을 가장 많이 덮는 이력 이미지를 골라 목표 ray 조건으로 워핑하고, SAM3로 동적 에이전트 영역을 마스킹해 워핑된 RGB 조건과 가시성 마스크를 만든다. 이 경로는 기하 정렬된 증거를 주지만 덮인 영역만 제약하고 원래 외형을 버린다는 한계가 있어, cross-stream anchor memory 경로가 이력 이미지를 워핑하지 않은 채 공유 앵커 토큰으로 붙인다. 앵커는 이전 앵커가 덮지 못한 목표 시점 영역을 최대화하도록 탐욕적으로 K개를 선택해 모든 ego 스트림이 같은 앵커에 어텐션할 수 있게 한다. 최종 DiT 입력은 생성 잠재와 앵커 특징을 이어 붙인 Z_joint = [Z_gen; Z_ref]가 된다.
어떻게 쓰나
학습은 사전학습 모델을 rectified flow 목적함수로 파인튜닝하는 방식이다. 비디오 VAE와 텍스트 인코더는 동결하고 DiT와 조건 모듈만 학습하며, AdamW, 학습률 3×10⁻⁵, 전역 배치 크기 4, A100 GPU 4장을 사용한다. 추론은 35 디노이징 스텝과 classifier-free guidance 스케일 7.0을 쓴다. 데이터는 단일 에이전트 위주인 기존 1인칭 데이터셋의 한계를 메우기 위해 실제 다중 ego 데이터와 다양한 에이전트 구성·환경·상호작용을 담은 합성 다중 ego 데이터를 결합했다.
전제와 한계
평가에서 저자들은 기존 지표가 공유 입력 조건만으로도 일관성이 생길 수 있다는 점을 지적하며 새로운 shared-world consistency 지표를 제안한다. S_env는 워핑된 이력이 지원하지 않는 영역에서 두 ego 스트림이 같은 환경을 그리는지 DINOv3 특징 유사도로 재고, S_update는 워핑 이력 대비 변화가 감지된 영역이 시점 간 일관되게 갱신됐는지 측정하며, 합성 벤치마크에서는 SAM3로 상대 에이전트를 추출해 정답 캐릭터의 멀티뷰 참조 특징과 최대 코사인 유사도로 S_id를 계산한다. 여기에 카메라 제어(Trans. Err, Rot. Err), 자기 행동 제어(Hand-F1, Hand-mIoU), 상대 에이전트 행동 제어(Full-Body-F1, PCK@10), 비디오 품질(PSNR, SSIM, LPIPS, FVD)을 함께 본다. 비교 대상은 멀티뷰 생성 모델(GEN3C, AnyView-DVS), 단일 ego 세계 모델(EgoSim, JointControlVideo), 일반 세계 모델(DreamX-World, LingBot-World)이며, 추가로 MultiWorld, Solaris, γ-World, MetaWorld를 같은 백본·데이터·shared action conditioning으로 재구성해 통제 비교한다. 저자들은 ME-World가 실제·합성 벤치마크에서 공유 세계 일관성, 행동 제어, 정체성 보존, 비디오 품질을 모두 개선했다고 보고하고, 다중 에이전트 베이스라인 중에서는 MetaWorld가 상대적으로 강한 일관성과 품질을, Solaris와 γ-World가 체화 설정에서 더 큰 성능 저하를 보였다고 적는다. 다만 제공된 원문에는 표의 구체적 수치가 실려 있지 않아 개선폭을 숫자로 확인할 수는 없다. 절제 실험에서는 공동 생성이 없으면 스트림 간 외형·환경이 발산하고, shared action conditioning이 없으면 시점 간 행동이 어긋나며, shared environment memory가 없으면 배경이 스트림마다 달라진다고 정리한다.
실무적으로 이 논문은 VR, 로봇 협업, 체화 AI 시뮬레이션처럼 여러 주체가 같은 공간을 공유하는 생성형 시뮬레이터를 만들 때 참고할 만하다. 여러 시점의 영상을 각각 생성한 뒤 사후에 맞추는 대신 토큰 시퀀스를 공유해 한 번에 디노이징하고, 다른 에이전트의 포즈를 목표 시점에 렌더링해 조건으로 넣는 설계는 시점 간 불일치를 줄이는 실용적 패턴이다. 도입을 검토한다면 두 에이전트 실험에 국한된 설정인지, 학습에 A100 4장과 합성 데이터 파이프라인이 필요한지, S_env·S_update 같은 지표를 자체 데이터에 맞게 구현할 수 있는지를 먼저 확인해야 한다.
저자들이 밝힌 전제와 한계는 다음과 같다. 정식화는 N개 에이전트로 일반화되지만 실험은 2인 에이전트 사례로 제시되며, 정체성 일관성 지표 S_id는 서로 다른 캐릭터 외형을 가진 합성 벤치마크에서만 보고된다. 또한 학습에는 하나의 세계 상태를 공유하는 동기화된 다중 ego 데이터가 필요한데, 기존 1인칭 데이터셋은 에이전트 수, 시점 다양성, 상호작용, 외형 변화를 충분히 담지 못해 실제·합성 데이터를 섞어야 했다. 결론에서 저자들은 행동과 관측의 공동 모델링을 통한 계획, 더 큰 집단을 위한 효율적 에이전트 간 통신과 메모리, 실시간 상호작용 시뮬레이션을 향후 과제로 남긴다.