WOVEN이 시각 전이 추론을 MLLM의 공용 훈련 원시능력으로 제시한다
WOVEN: Weaving Visual World Modeling into Multimodal LLMs
무엇인가
다중모달 대형 언어모델(MLLM)은 이미지 인식과 언어 조건부 추론에서는 성능이 좋지만, 시각적 변화가 개입하는 과제에서는 여전히 신뢰할 수 없다. 카메라 회전을 잘못 판단하고, 물리 법칙을 위반하는 결과를 예측하고, 과제 목표와 충돌하는 행동을 추천하고, 비디오 프레임 순서를 틀린다. 저자들은 이 실패들이 서로 다른 과제처럼 보여도 결국 같은 구조를 공유한다고 본다. 행동 a가 초기 시각 상태 s를 결과 상태 s'로 연결하며, 결과 예측·행동 역추론·대안 행동 추론은 모두 같은 (s, a, s') 삼중항에 대한 서로 다른 추론이라는 것이다. 즉 행동 조건부 시각 전이 추론의 공통 결손이 공간·신체·물리·시간 추론 실패를 관통한다는 가설이다. 기존 벤치마크들은 이런 결손을 각각 따로 기록할 뿐, 장면·행동·추론 연산을 축으로 통제 비교를 할 수 없게 되어 있다.
어떻게 동작하나
그래서 논문은 WOVEN(World modeling via controllable video gENeration)이라는 훈련 소스 겸 벤치마크를 만든다. 핵심은 모든 문항을 세 축으로 라벨링하는 것이다. 장면 유형 20종(실내·실외 균등, 주방·거실·공원·해변 등), 행동 유형 5종(외생적 수동 물리 사건 Exo와, 카메라 이동 Perc·물체 검사 Insp·이동 Navi·물체 조작 Mani의 네 가지 에이전트 주도 행동), 추론 유형 8종을 4개 패밀리로 묶는다. 인과 역학(순방향 Fwd·역방향 Inv), 반사실 추론(제거 Rmv·치환 Sub), 물리 모델링(결과 예측 Otm·단서 예측 Cue), 시간 일관성(순서 Ord·인접성 Adj)이다. 데이터는 실제 비디오가 통제된 행동도, 같은 초기 상태에서의 대안 결과도 주지 못하고 시뮬레이터는 사실성과 다양성이 부족하기 때문에, 비디오 생성 모델 Wan2.2-I2V-A14B로 롤아웃을 합성한다. 두 원칙을 지킨다. 결과 상태와 중간 상태는 프롬프트에 명시하지 않고 롤아웃이 만들어내게 하고(세계모델 격리), 같은 초기 상태에서 서로 다른 행동으로 여러 독립 롤아웃을 생성해 대안 결과를 확보한다(반사실 롤아웃). 이렇게 만든 4지선다 문항은 30개 템플릿으로 표현을 다양화하고, 오답지에는 '방향 반전', '중력 위반' 같은 오류 유형 라벨을 붙여 세밀한 오류 분석이 가능하게 했다. 전체 36,076문항은 훈련 22,728, 검증 2,508, 그리고 세 개의 테스트 세트로 나뉜다. 분포 내 테스트 6,228(훈련과 같은 18개 장면의 새 전이), 장면 OOD 테스트 3,496(훈련에서 뺀 식당·해변), 상태 교란 테스트 1,116(초기 상태의 공간 배치나 외형만 바꾸고 행동과 문항은 고정해, 모델이 행동의 전형적 효과가 아니라 실제 상태를 모델링하는지 확인)이다.
무엇과 다른가
먼저 38개 최전선 MLLM을 평가해 결손의 크기를 정량화한다. 가장 강한 GPT-5.4가 분포 내 정확도 65.8%로, 사람 기준선 92.3%(주석자 3인 평균)에 크게 못 미친다. 그다음 세 모델은 57.8~63.2%에 머문다. 이 격차는 모델 패밀리마다 반복되고 스케일을 키워도 닫히지 않는다. 구조도 일관된다. 모든 모델에서 시간 인접성이 순서 판단보다 어렵고(25.3~28.0% 대 30.8~63.4%), 반사실 제거가 치환보다 어렵고(54.8~66.7% 대 64.5~76.0%), 외형 변화보다 기하 변화에서 정확도가 더 크게 떨어진다(33.3~62.7% 대 79.2~95.5%).
어떻게 쓰나
학습 가능성과 전이는 수치로 확인된다. Qwen2.5-VL-3B-Instruct를 전체 훈련 세트로 지도 미세조정하면 분포 내 정확도가 26.4%에서 89.3%로 오르고, 훈련에 없던 장면에서도 88.2%를 기록한다. 훈련 세트는 행동 유형과 추론 패밀리 조합으로 나눈 11개 통제 서브셋(각 약 2,000문항)으로 구성되는데, 각 서브셋도 분포 내 정확도를 6.1~25.3%p 끌어올리고 훈련하지 않은 행동 유형에서도 성능이 오른다. 외부 전이는 전체 세트 기준 26개 벤치마크 중 12개를 개선하며 SAT에서 최대 24.0%p를 얻는다. 서브셋은 각 2,000문항뿐인데도 벤치마크별로 가장 좋은 서브셋을 고르면 개선 범위가 22개로 늘고 최대 27.3%p까지 오른다. 반면 정적 지각과 일반 비디오 QA에 해당하는 4개 벤치마크는 어떤 훈련으로도 개선되지 않는다. 데이터 효율도 눈에 띈다. 약 7시간 분량의 생성 비디오로 얻은 이득이, 같은 백본을 125,000시간 비디오로 중간 학습시킨 Orca보다 공간 추론 벤치마크에서 더 크다.
전제와 한계
논문은 여기서 한 걸음 더 나아가, 이 이득이 여러 서브셋의 별개 효과 합이 아니라 하나의 공용 능력에서 나온다는 것을 보이려 한다. 근거는 두 가지다. 첫째, 어떤 서브셋이든 훈련하지 않은 행동 유형의 WOVEN 정확도를 올린다. 순방향 예측만 훈련해도 반사실 치환과 제거가 각각 48%p, 25%p 오른다. 둘째, WOVEN 정확도를 많이 올린 서브셋일수록 외부 벤치마크 평균 이득이 크다(r=0.86). 11개 서브셋의 전이 프로파일은 모두 양의 상관을 보여 대체로 같은 벤치마크를 개선한다. 인과성은 훈련 데이터를 직접 개입시켜 검증한다. 훈련 예산을 2,000문항으로 고정한 채 SAT, ActionEQA, CLEVRER 세 과제에서 과제 전용 데이터의 30~50%를 WOVEN 서브셋으로 교체해도 정확도가 그대로 유지되며, 교체분을 단순 삭제한 대조군보다 높다.
가장 실무적인 산출물은 통제 비교에서 뽑아낸 훈련 레시피다. 첫째, 감독 데이터는 행동·장면·도메인이 아니라 가르치는 추론 연산을 기준으로 고른다. 같은 추론 패밀리를 가르치는 서브셋들은 잔차 프로파일 상관이 +0.32로 비슷하지만, 행동 유형만 공유하는 서브셋은 아무것도 공유하지 않는 경우와 다를 바 없다(-0.22 대 -0.23). 둘째, 견고성을 원하면 시각 상태를 크게 바꾸는 감독을 고른다. 인과 서브셋의 견고성 이득은 카메라 이동 +1.7, 물체 검사 +3.0, 내비게이션 +13.6, 물체 조작 +23.2, 수동 물리 사건 +29.9 순으로 커진다. 셋째, 시간 과제와 에이전트 주도 과제는 직접 감독한다. 전이는 시간 패밀리와 나머지 세 패밀리 사이, 그리고 수동 물리 사건과 에이전트 행동 사이의 경계를 넘지 않는다. 실제로 수동 물리 사건 서브셋은 WorldPrediction을 -10.2, ActionEQA를 -1.7 떨어뜨린다. 넷째, 상태 전이가 없는 정적 지각 같은 능력은 별도 감독이 필요하다. 이 레시피는 사전 등록 방식으로 검증된다. 에이전트 행동 질문에서 레시피대로 구성한 혼합이 다른 구성보다 1.5~4.7%p 높고(p≤0.03), 카메라 이동 질문에서도 카메라 행동에 맞춘 혼합을 +0.6%p 앞선다(p=0.04). 반대로 수동 물리 질문에서는 외생 행동 위주 혼합이 앞선다(-0.5, p=0.04).
개발자 관점에서 이 논문의 쓸모는 두 가지다. 하나는 진단이다. 영상 이해, 로봇 조작, GUI 에이전트, 시뮬레이션 기반 계획 같은 과제에서 모델이 실패할 때 그 원인을 '장면 인식 부족'이 아니라 '행동 조건부 상태 전이 추론 부족'으로 재해석할 수 있다. 다른 하나는 데이터 설계다. 파인튜닝 데이터를 모을 때 도메인이나 행동 유형을 맞추는 대신, 그 과제가 요구하는 추론 연산(순방향 예측인지, 반사실 치환인지, 시간 인접성인지)을 기준으로 감독을 고르라는 것이 이 논문의 핵심 처방이다. 또한 과제 전용 데이터의 30~50%를 전이 데이터로 대체할 수 있다는 결과는 라벨링 비용이 큰 프로젝트에서 예산 배분 근거가 된다. 다만 정적 지각처럼 전이가 끊기는 영역은 별도 데이터를 반드시 남겨둬야 한다.
한계와 전제는 저자들이 명시한 범위 안에서 분명하다. 전이는 시간 패밀리와 나머지 세 추론 패밀리 사이, 그리고 수동 물리 사건과 에이전트 주도 행동 사이의 경계를 넘지 않으므로, 이 두 경계를 넘나드는 과제에는 레시피가 그대로 적용되지 않는다. 상태 전이가 없는 정적 지각·일반 비디오 QA 4개 벤치마크는 어떤 훈련으로도 개선되지 않았고, 저자들도 이런 능력에는 자체 감독이 필요하다고 결론짓는다. 또한 감독 신호 전체가 비디오 사전학습 생성 모델(Wan2.2-I2V-A14B)의 롤아웃에 의존하므로, 그 생성 모델의 전이 사전(prior)과 품질이 데이터의 성격을 규정한다. 실제 비디오가 통제된 행동과 대안 결과를 주지 못하고 시뮬레이터는 사실성·다양성이 부족하다는 것이 합성 롤아웃을 택한 이유이자, 동시에 이 방법의 전제 조건이다. 제시된 본문에는 별도의 한계 절이 포함되어 있지 않아, 그 밖의 저자 명시 한계는 확인할 수 없다.