HiPhy가 다중 물리 원리 영상 생성을 계층적 강화학습으로 정렬한다

HiPhy: Hierarchical Alignment for Physically-Plausible Multi-Principle Video Generation

arXiv2610.02197v1

Tahira Kazimi2026-10-01

무엇인가

비디오 확산 모델은 화질과 시간적 일관성에서 큰 진전을 이뤘지만, 여전히 운동량·유체 역학·재질 같은 기초 물리 법칙을 위반하는 영상을 만든다. 저자들은 이를 시각 능력의 부족이 아니라 표현(representational)의 공백으로 본다. 모델이 텍스트가 주어졌을 때 프레임 우도를 최대화하도록만 학습돼, 물리적 메커니즘을 추론하지 않고 학습 데이터의 그럴듯한 패턴을 재현한다는 것이다. 문제는 여러 물리 원리가 한 영상에서 동시에 작동할 때 더 선명해진다. "사과가 물에 떨어진다"에는 강체 역학과 유체 역학이 함께 얽혀 있는데, 기존 방법은 영상당 단일 물리 원리만 감독한다. 저자들은 이런 복합 프롬프트에서 두 가지 실패 모드를 관찰한다. 하나는 원리 누락(Principle Omission)으로 사과는 사실적으로 떨어지지만 물은 잠잠한 경우이고, 다른 하나는 시간적 지름길(Temporal Shortcutting)로 물보라가 충격에서 왕관 형태로 진행하지 않고 정지된 분사 효과로 렌더링되는 경우다.

어떻게 동작하나

HiPhy는 이 문제를 계층적 정렬 문제로 정식화한 강화학습 프레임워크다. 동결된 텍스트-투-비디오 모델 G가 있고, 사용자 프롬프트 q가 n개의 동시 물리 원리를 담고 있을 때, 정책 π_θ가 생성한 프롬프트 p를 G에 넣어 만든 영상이 n개 원리 모두를 올바른 하위 단계 순서로 담도록 GRPO로 π_θ를 학습한다. 핵심 설계는 이중 수준 목적이다. 지역(local) 보상은 각 물리 원리를 시간순으로 정렬된 트리로 분해해 단계별 진행을 감독하고, 전역(global) 보상은 장면 전체의 물리적·의미적 일관성을 보장한다. 백본을 재학습하는 대신 프롬프트 수준에서 물리적 시간 구조를 드러내는 편이 표본 효율이 높다는 것이 저자들의 판단이다.

무엇과 다른가

구체적 절차는 다음과 같다. 먼저 VideoPhy2와 WISA-80k에서 단일 원리 프로세스를 추출해 1~3개 이벤트 조합을 만들고, LLM으로 비현실적 동시 발생을 걸러 50K 프롬프트 학습셋과 1K 프롬프트 평가셋 MultiPhyBench를 구축한다. 각 원리에는 단계 노드로 이뤄진 시간순 계층 트리 T*(i)가 의사 라벨로 붙는다. 예컨대 "사과가 물에 떨어져 잠긴다"는 낙하 → 접촉 시 물보라 → 잠김으로 나뉘고, 물보라 노드는 다시 충격 → 왕관 형성으로 확장된다. 학습 중에는 생성 영상에서 VLM 추출기 R로 관측 트리 T^(i)를 뽑고, 헝가리안 할당으로 참조 트리와 레벨별 1:1 매핑을 만든다. 유사도 행렬의 각 원소는 SBERT 문장 임베딩 코사인 유사도와 VLM 판정을 α=0.5로 섞어 계산한다. 이 매핑으로 세 점수를 낸다. 정렬 점수는 매칭된 리프 노드의 평균 유사도, 완전성 점수는 임계값 τ=0.65를 넘긴 리프의 비율, 순서 점수는 매칭된 내부 노드마다 자식들이 참조 순서대로 나타난 비율을 구해 기하평균한 값이다. 부모 단계가 실패하면 그 하위 단계는 전부 누락으로 처리하는 논리적 의존성을 둔다. 원리별 계층 보상 R_hier는 이 세 점수의 평균이다. 전역 보상은 HPSv2 화질 점수, VideoPhy2 판정기의 물리 상식 점수와 의미 정렬 점수를 각각 0.33 가중치로 선형 결합한다.

어떻게 쓰나

학습에서는 프롬프트마다 G=4개의 롤아웃을 뽑아 n개의 계층 보상과 1개의 전역 보상을 얻는다. 고분산 스트림이 그래디언트를 지배하지 않도록 각 스트림을 그룹 내에서 독립적으로 정규화하고, 지역 스트림 합은 원리 수 n에 따라 분산이 커지지 않도록 1/√n로 스케일한 뒤 배치 단위 정규화를 거쳐 GRPO의 클리핑 목적에 넣는다. 이 프레임워크는 아키텍처 수정 없이 어떤 텍스트-투-비디오 모델에도 붙는 플러그앤플레이 후처리 학습이며, 오픈소스 Wan2.1과 블랙박스 VEO3 양쪽에서 검증됐다.

전제와 한계

실험은 NVIDIA H200 2장에서 SFT 50회 후 GRPO 약 2000회로 진행했고, 학습률은 SFT 2×10⁻⁵, GRPO 2×10⁻⁷, 그룹 크기 4, 배치 8, 추론은 가이던스 6에 40스텝·81프레임이다. 비교 대상은 추론 시 최적화(Predict-and-Perturb), 반복적 LLM 프롬프트 개선(PhyT2V), 파인튜닝(WISA)이다. VideoPhy2에서 물리 +10%, 정렬 +16%, PhyWorldBench에서 물리 약 +30%, 의미 +45%를 기록했고, 논문 기여 문단에서는 기존 물리 인지 베이스라인 대비 물리 상식 최대 44%, 의미 정렬 최대 80% 향상을 주장한다. 원리 수가 늘수록 격차는 벌어진다. 1개에서 3개 프로세스로 가면 PnP와 PhyT2V는 물리 상식 점수의 약 절반을 잃고 동시 만족(PC & SA) 점수가 20 아래로 떨어지는데, HiPhy는 약 50을 유지한다. VBench의 Dynamics와 Appearance 축은 Wan2.1과 동등하거나 앞선다. 사람 평가(n=50, 프롬프트 30개, 1~5 리커트)에서도 모든 지표에서 앞섰고 텍스트 정렬 격차가 가장 컸다. 추론 오버헤드는 약 2.4초로 사실상 베이스 모델과 동일하다.

절제 실험은 두 보상 계열이 상호 보완적임을 보여준다. 전역 보상만 쓰면 의미 정렬과 화질은 좋지만 개별 프로세스가 시간에 따라 어떻게 전개되는지에 대한 세밀한 신호가 없어 물리 상식이 약해진다. 지역 보상만 쓰면 다중 프로세스 장면의 물리 상식은 오르지만 프롬프트 의미와 시각적 일관성에 대한 앵커가 없어 의미 정렬과 동적 정도가 떨어진다. 스트림별 정규화로 둘을 결합한 구성이 최고 성능을 낸다. 백본 일반화 실험에서는 "동전이 탁자 위에서 나선을 그리며 춤춘다" 같은 프롬프트에 Wan과 VEO 모두 거의 정지된 동전을 만들지만, HiPhy를 붙이면 두 백본 모두 나선 궤적을 복원한다.

실무에서 이 방법은 영상 생성 백본을 갈아엎지 않고 물리적 그럴듯함을 끌어올리는 후처리 단계로 쓸 수 있다. 다만 지역 보상이 SBERT와 VLM 판정기(Qwen2.5-VL-7B) 품질에 직접 의존하고, 임계값 τ=0.65와 혼합 계수 α=0.5 같은 하이퍼파라미터에 민감할 수 있으므로 자체 도메인에서 판정기 신뢰도와 비용을 먼저 확인해야 한다. 학습 데이터 50K 프롬프트와 MultiPhyBench, 코드·체크포인트는 공개 예정이라고 밝혔다.

저자들이 명시한 한계는 두 가지다. HiPhy는 동결된 백본을 쓰므로 최종 충실도가 백본 생성기의 시각적 능력에 상한이 묶인다. 또한 물리 인지 생성은 교육·과학 시각화·임바디드 AI에 유용하지만, 더 그럴듯한 영상은 허위정보와 비동의 콘텐츠의 위험을 키우므로 출처 추적 도구와 책임 있는 공개 관행이 필요하다고 덧붙인다.