ProAR가 자기회귀 비디오 모델에 목표 지향 추론을 심는다

ProAR: Learning Prospective Reasoning with Autoregressive Video Models

HF Daily2610.03664

Linghui Shen, Tinghui Zhu, Sheng Zhang2026-10-02

무엇인가

자기회귀 비디오 모델은 프레임이나 청크를 인과적으로 생성해 긴 영상과 실시간 스트리밍에 강하지만, 다음 청크 예측만 최적화하는 훈련 목표 때문에 근시안적이고 반응적인 생성에 묶인다. 논문은 미로 탐색, 퍼즐 풀기, 물리 과정 시뮬레이션, 구현 제어처럼 생성된 영상 자체가 추론 과정이 되는 '비디오 네이티브 추론'을 다룬다. 이 설정에서는 국소적으로 그럴듯한 시각 품질보다 목표 완수와 중간 상태의 타당성이 중요하다. 그런데 다음 청크 예측은 현재 청크가 최종 목표에 기여하는지, 유효한 다음 전이를 가능하게 하는지를 직접 감독하지 않는다. 추론 시 각 청크는 히스토리에 추가되면 수정할 수 없어 초기 오류가 누적되고, 국소적으로 그럴듯한 궤적이 목표에서 벗어난다.

어떻게 동작하나

저자들은 이 문제를 '전망적 추론(prospective reasoning)'의 부재로 규정한다. 관측된 이력으로부터 가능한 미래 결과와 상태 전이를 예측하고, 그 예측으로 현재 생성을 이끄는 능력이다. 여기서 두 가지 시간 스케일의 요구가 나온다. 장거리에서는 최종 결과를 예상해야 하고, 단거리에서는 의미 있는 진전을 만드는 다음 전이를 예상해야 한다. ProAR는 이 둘을 각각 Outcome guidance와 Transition guidance로 구현한다.

무엇과 다른가

Outcome guidance는 "무엇을 달성해야 하는가"에 답한다. 각 자기회귀 스텝에서 모델은 현재 청크와 목표 프레임(최종 프레임)을 함께 디노이징한다. 두 입력은 같은 flow-matching 타임스텝 t로 노이즈화되고, 공유 백본이 한 번의 forward pass로 두 스트림의 velocity를 예측한다. 핵심은 비대칭 어텐션 마스크다. 목표 토큰은 깨끗한 히스토리와 자기 자신만 보고 노이즈가 낀 현재 청크는 보지 못한다. 반대로 현재 토큰은 목표 토큰을 참조한다. 이 target-first 의존 구조가 불확실한 현재 상태가 목표 믿음을 오염시키는 것을 막으면서, 예측된 목표가 현재 생성을 이끌게 한다. 훈련 중 모든 스텝의 목표 브랜치는 같은 정답 최종 프레임으로 감독되고, 추론 시에는 생성된 현재 청크만 히스토리에 추가되며 목표 믿음은 다음 스텝에서 확장된 히스토리로 다시 추정된다.

어떻게 쓰나

Transition guidance는 "다음에 무엇이 일어나야 하는가"에 답한다. 핵심 아이디어는 현재 표현이 다음 단계를 미리 예상해야 한다는 것이고, 이를 미래 표현 자기정렬로 구현한다. teacher-forcing 훈련에서는 모든 노이즈 청크가 병렬로 디노이징되므로, 깨끗한 다음 청크의 hidden state가 같은 forward pass 안에 이미 인코딩되어 있다. 이것이 오염되지 않은 다음 단계 정보를 담은 teacher가 되고, 노이즈가 낀 현재 청크의 hidden state가 student가 된다. 백본 15번 블록에서 두 표현을 추출하고, 3개 transformer 블록짜리 경량 predictor가 student를 teacher로 매핑한다. 토큰별 코사인 거리 손실을 쓰고 teacher에는 stop-gradient를 적용해 그래디언트가 predictor와 백본의 student 쪽으로만 흐르게 한다. 외부 표현 인코더도, 추가 백본 forward pass도 필요 없다. 추론 시에는 predictor를 완전히 제거하므로 전이 안내는 추론 비용을 전혀 늘리지 않는다. 전체 손실은 현재 청크 생성 손실에 λ_goal=0.25를 곱한 목표 손실, λ_align=0.01을 곱한 정렬 손실을 더한 형태다.

전제와 한계

평가는 세 벤치마크에서 이뤄졌다. VBVR에서 지각·공간 추론을 주로 평가하는 10개 태스크(Concentric Ring, Outline Match, Stable Sort, Star Match, Domino Chain, Ball Eater, Grid Shift, Pipe Puzzle, Slide Puzzle, Balancing Vessels)를 골랐고, 공식 데이터 생성기로 태스크당 테스트 예제를 5개에서 50개로 늘려 총 500개를 썼다. VideoRLVR은 Maze, FlowFree, Sokoban 3개 게임으로 추상 추론을 평가한다. WorldArena는 RoboTwin 2.0의 양팔 조작 50개 태스크로 구현 추론 적용 가능성을 본다. 베이스라인은 양방향 Wan2.2-TI2V-5B와 그 SFT 변형, Seedance 2.0, 그리고 같은 Wan2.2 백본을 causal attention과 teacher forcing으로 자기회귀화한 Standard AR이다.

VBVR 10개 태스크에서 Standard AR의 평균 점수는 0.663으로 양방향 Wan2.2 SFT의 0.736보다 낮았다. ProAR는 0.801로 Standard AR 대비 20.8% 상대 개선을 냈고, Seedance 2.0보다 0.174, Wan2.2 SFT보다 0.065 높다. 태스크 단위로는 10개 중 8개에서 Standard AR을 앞섰고 Stable Sort +0.330, Pipe Puzzle +0.122, Slide Puzzle +0.543의 큰 폭 개선이 있었다. VideoRLVR에서는 Standard AR이 이미 양방향 베이스라인과 그 강화학습 변형을 앞섰는데, ProAR가 평균 성공률을 50.97에서 52.97로, 평균 정밀도를 61.56에서 67.17로 올렸다. Sokoban 정밀도는 40.18에서 47.62로 뛰었고, 성공률은 Maze 82.70, FlowFree 30.20, Sokoban 46.00을 기록했다.

학습 효율도 개선됐다. ProAR는 2,500 스텝 만에 평균 0.708에 도달해, Standard AR이 10,000 스텝을 다 써서 얻은 0.663을 넘어선다. 전이 안내를 7,500 스텝에 켠 뒤에는 10,000 스텝에서 0.7666에서 0.8010으로 추가 상승했다. 구성 요소를 분리한 ablation에서 VBVR 평균은 outcome만 쓸 때 0.786, transition만 쓸 때 0.683, 둘을 합쳤을 때 0.801이었다. VideoRLVR 평균 정밀도도 outcome만 64.82, transition만 63.50, 전체 67.17로 같은 경향을 보였다. 전이 정렬을 처음부터 켜는 것(Step 0)은 7,500 스텝에 켜는 것보다 비슷하거나 약간 나빴는데, 저자들은 훈련 초반에는 백본이 태스크 영역의 안정적인 표현을 갖추지 못해 내부 teacher 목표가 유용하지 않다고 본다. 구현 추론 확장에서 ProAR는 WorldArena EWMScore 60.95를 기록해 Standard AR의 60.43을 앞섰고 9개 구성 지표 중 8개를 개선했다(Depth Accuracy 88.42→91.11, Instruction Following 80.88→81.96, Interaction Quality 73.12→73.86, Trajectory Accuracy 41.74→42.34).

실무적으로 이 논문은 자기회귀 비디오 생성이나 월드 모델을 퍼즐·내비게이션·로봇 조작처럼 목표 달성이 중요한 태스크에 붙일 때 참고할 만하다. 훈련 설정은 AdamW, 학습률 5×10⁻⁶, 전역 배치 16, 청크 크기 4프레임(VBVR·VideoRLVR)과 8프레임(WorldArena), 2~4장의 NVIDIA B200이다. 추론 비용 관점에서는 현재 청크마다 목표 프레임 1개를 같은 forward pass에서 함께 디노이징하는 부담만 남고 정렬 predictor는 제거된다. 다만 원문은 별도의 한계 절을 두지 않았고, 저자가 명시한 전제는 다음과 같다. 전이 정렬을 늦게 켜야 한다는 결론은 훈련 초반 백본 표현의 유용성에 대한 가정에 기대고, 표현을 중간 블록(15번)에서 뽑는 선택은 추론 능력이 중간 DiT 블록에 국소화된다는 근거에 따른 것이며 레이어별 ablation은 부록에 있다. 추론 시에는 정답 미래 상태에 접근할 수 없어 동적으로 갱신되는 목표 프레임 예측과 학습된 예측 표현에 의존한다. WorldArena의 EWMScore 60.95는 표시된 방법 중 두 번째로 높은 값으로 계산량이 큰 양방향 베이스라인을 앞서지는 못했고, 평가는 시뮬레이션 벤치마크에 한정된다.