언어를 물리 표현으로 삼아 비디오 월드 모델의 물리 위반을 줄인다
Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model
무엇인가
비디오 월드 모델은 시각적으로 그럴듯한 영상을 만들면서도 물체가 갑자기 변형되거나 사라지고, 충돌 결과가 비상식적이며, 유체가 부자연스럽게 흐르고, 인과 사건의 순서가 뒤바뀌는 식의 물리 법칙 위반을 자주 저지른다. 기존 연구들은 자연어가 신뢰할 만한 생성을 위한 물리 지식을 담기에 불충분하다고 전제하고 시각·잠재·수치·계획 기반 신호를 추가로 도입해 왔다. 이 논문은 그 전제를 다시 검토한다. 언어가 물리 과정의 표현으로 아직 충분히 활용되지 않았을 뿐, 언어 자체의 한계가 아닐 수 있다는 가설이다.
어떻게 동작하나
Physis-Lang은 물리 언어를 데이터 큐레이션, 모델 학습, 영상 생성 전 단계에 걸쳐 공유되고 최적화되는 표현으로 취급하는 자기 진화 에이전트 프레임워크다. 캡션 수준에서는 기존 캡션에 physics_reasoning 필드를 덧붙여 관련 개체, 원인, 상호작용, 지배 원리, 시간적 전개, 결과를 명시한다. 이 표현은 학습 감독으로도, 추론 시 이미지와 텍스트 조건의 프롬프트 확장으로도 재사용된다.
무엇과 다른가
핵심은 캡션 지침 자체를 진화시키는 루프다. 고정된 캡처러가 프롬프트 P_t로 캡션 C_t를 만들고, 물리 인식 크리틱이 점수와 진단 리포트 R_t를 내면, 진화 에이전트가 이를 근거로 P_{t+1}을 개정한다. 캡처러의 가중치는 업데이트하지 않는다. 크리틱은 캡션을 원자적 주장으로 분해해 정밀도와 재현율을 계산한다. 정밀도는 N_correct/(N_correct+N_incorrect), 재현율은 N_pass/N_ground-truth이며 F1은 두 값의 조화평균이다. PhysCapBench는 Physics-IQ와 YouTube에서 모은 246개 물리 영상과 3,794개 사람 검증 원자 주장(영상당 평균 15.4개)으로 구성되고, 주장은 원인·물리 법칙·결과를 중심으로 달린다. 루프는 20개 영상 개발셋에서 돌고 PhysCapBench 성능이 포화되면 멈춘다.
어떻게 쓰나
언어는 데이터 확보에도 쓰인다. GPT-5.5 기반 진단 에이전트가 생성 영상의 물리 실패를 강체 운동, 충돌, 유체 역학 같은 범주로 분류해 범주 수준 결핍 프로파일을 만들고, 이 프로파일로 대규모 영상 갤러리에서 물리 도메인 라벨이 붙은 영상을 검색한다. 시각적 유사도가 아니라 물리적 내용으로 검색한다는 점이 다르다. 검색된 영상은 재캡셔닝되어 학습셋에 추가된다. 추론 시에는 업샘플러가 짧은 프롬프트와 선택적 입력 이미지를 물리 인식 프롬프트로 확장하고, 장면별 physics_negative_prompt를 부정 조건으로 사용해 물리적 모순을 억제한다. 비용 문제 때문에 GPT 기반 캡처러와 업샘플러의 물리 추론 능력은 4B 비전언어모델 두 개(PhysThinker-C, PhysThinker-U)로 증류된다.
전제와 한계
실험은 183K 실제 영상(WISA-80K에서 필터링한 71K와 결핍 유도 검색으로 고른 112K)으로 Wan2.1-14B(T2V-14B와 I2V-14B를 각각)와 Cosmos3 계열 Edge-4B, Nano-16B, Super-64B를 아키텍처 변경 없이 파인튜닝했다. 평가는 VideoPhy-2, PhyGenBench(T2V), PhyGround, Physics-IQ Verified(I2V) 네 벤치마크에서 이뤄졌고, 비교 대상은 CogVideoX1.5-5B, Wan2.2-TI2V-5B, HunyuanVideo-1.5, Veo 3.1과 PhysVid, PhyGDPO, Self-Refinement, Kandinsky-WM, PhiZero다. VideoPhy-2와 PhyGenBench의 기존 오프라인 VLM 평가자는 GPT-5.5로 교체했다. Cosmos3-Nano 기반 결과에서 Physics-IQ Verified, PhyGround, PhyGenBench는 Veo 3.1을 앞섰고, VideoPhy-2 전체에서는 68.02 대 68.87로 0.85점 뒤졌지만 hard split에서는 62.36 대 58.43으로 3.93점 앞섰다. 백본 일반화에서는 Wan2.1-14B가 평균 7.05점, Cosmos3-Nano-16B가 6.22점 올랐고, Cosmos3 계열 내에서 Edge-4B 3.24점, Nano-16B 6.22점, Super-64B 5.02점의 평균 향상을 보였다.
절제 실험은 각 구성 요소의 기여를 분리한다. PhysCapBench F1은 1회차 78.64에서 9회차 87.82로 올랐다. Cosmos3-Nano를 고정하고 추론 캡션만 1·4·8·9회차 지침으로 바꾸면 PhyGenBench가 64.17에서 65.63, 65.83, 67.29로 상승했다. 검색 영상을 학습셋에 더하면 평균 3.01점이 올랐고, VideoPhy-2 범주별로는 화학 공정 +8.00, 파괴 역학 +7.45, 천 변형 +7.19점이었다. 물리 추론 프롬프트만으로 사전학습 모델이 61.67에서 63.33으로 오르는 제로샷 효과가 있었고, SFT는 +3.55와 +3.75점, 부정 지침은 +2.50과 +4.16점을 더했다. PhysThinker 파이프라인은 상용 모델 대비 평균 7.05, 6.76, 4.76점 향상을 내면서 외부 주석 비용을 24.12K달러에서 0.12K달러, 0달러로 낮췄다.
개발자 관점에서 이 논문의 실용적 요점은 물리적 그럴듯함을 별도 시뮬레이터나 보상 모델 없이 캡션 스키마와 데이터 검색으로 상당 부분 끌어올릴 수 있다는 주장이다. 영상 생성 파이프라인을 운영한다면 학습 데이터 캡션에 원인·법칙·결과를 명시하는 필드를 추가하고, 실패 유형을 범주화해 그 범주에 해당하는 영상을 역검색하는 방식이 저비용 개선책이 될 수 있다. 다만 추론 시 프롬프트 확장과 부정 프롬프트가 별도 모델을 요구하므로 지연과 비용을 함께 측정해야 한다.
원문 앞부분에는 별도의 한계 절이 없다. 대신 저자들이 명시한 전제가 곳곳에 깔려 있다. 진화 루프는 캡처러 가중치를 고정한 채 지침만 바꾸고, 20개 영상 개발셋과 사람이 검증한 참조 주장에 의존한다. 평가 판정도 GPT-5.5에 의존하며, 논문 스스로 시뮬레이션 기반 접근은 계산 비용이 크고 일반화가 제한적이라고 지적한다. PhysThinker로의 증류는 비용을 낮추는 대신 상용 모델 대비 향상 폭이 7.05점에서 4.76점으로 줄어드는 정확도-비용 트레이드오프를 안는다.