FracGen이 단일 이미지에서 물체의 인장 파괴 영상을 생성한다
FracGen: Learning How Objects Stretch and Tear with Physics-Informed Video Generation
무엇인가
물체가 깨지는 장면은 즉시 진위가 드러난다. 빵이 유리처럼 부서지거나 머그컵이 종이처럼 찢어지면 사람은 바로 어색함을 느낀다. 설득력 있는 파괴 생성 알고리즘은 최종적으로 깨진 형상뿐 아니라 물체가 어떻게 변형되고, 언제 파괴가 시작되며, 균열이 어떻게 전개되는지를 맞춰야 한다. 기존 연구는 강체 운동이나 단순 변형에 초점을 맞췄고 재료 파괴 메커니즘이 없었다. PhysGaussian은 물리적으로 근거한 변형을 만들지만 손상 모델이 없고, Fracture-GS는 충돌 MPM으로 파괴를 시뮬레이션하지만 재구성된 장면과 설정된 물리 조건을 요구한다. 이 논문은 재구성 없이 단일 사진과 재료·힘 조건에서 출발해 "여기를 당겨 끊어질 때까지 당기면 무슨 일이 일어나는가"를 생성하는 문제를 다룬다. 대상은 상당한 변형이 파괴에 선행하는 인장 파괴(stretch-to-tear)다.
어떻게 동작하나
학습 데이터를 만들기 위해 저자들은 FracSim을 구축한다. MPM(물질점법) 시뮬레이션에 연속체 손상 모델을 결합한 프레임워크로, 각 입자는 위치·속도와 함께 국소 변형을 담은 3×3 변형 구배 F를 갖는다. 여기서 회전에 불변하고 대변형에서도 유효한 Green-Lagrange 변형률을 계산하고, 변형 에너지 밀도에서 Kirchhoff 응력을 얻는다. 손상 변수 d는 변형 구배의 최대 특이값인 최대 주 신장률 λmax로 정의되며, λ_onset에서 손상이 시작해 λ_crit에서 완전 파괴에 이른다. 누적 최댓값을 취해 하중이 줄어도 손상이 되돌아가지 않게 만들고, 손상은 응력을 (1-d)배로 저하시켜 MPM 운동량 갱신에 되먹임된다. 렌더링에서는 3DGS 합성식의 구면조화 외관 항을 입자별 물리량으로 바꿔, RGB 프레임마다 속도(flow)·변형률·응력(von Mises)·손상을 픽셀 정렬 맵으로 함께 뽑는다. 이것이 FracPhys Map이며, 표준 렌더링 외에 추가 시뮬레이션 비용이 들지 않는다.
무엇과 다른가
FracGen 자체는 잠재 flow matching 비디오 생성기(Wan 2.1-1.3B-Control 기반)를 확장한 것이다. RGB 잠재와 4개 물리 맵 잠재를 높이 방향으로 이어 붙여 확장 잠재를 만들며, 이는 채널 방향 결합의 대안으로 파라미터를 늘리지 않는다. 조건 신호는 세 가지다. 인장 하중은 만능시험기(UTM)를 모사한 반대 방향 속도 신호를 프레임마다 움직이는 가우시안 블롭으로 렌더링하고 동결된 3D VAE로 인코딩해 16채널로 넣는다. 재료 물성(영률 E, 푸아송비 ν)과 파괴 물성(λ_onset, λ_crit)은 정규화해 공간·시간으로 브로드캐스트해 6채널을 쓰고, 나머지 10채널은 0으로 채운다. 첫 프레임은 원본 물체 이미지에 고정해 힘이 가해지기 전의 형상·질감·기하 사전을 모델이 추론하게 한다.
어떻게 쓰나
기술적 핵심은 물리 정보 손실이다. 등방성 선형 탄성의 후크 법칙과 손상에 의한 응력 저하에서 착안해, 잠재 공간에서 변형률 잠재로부터 응력 잠재의 근사 목표를 만든다. 두 개의 0으로 초기화된 1×1×1 합성곱이 잠재 채널 간 매핑을 학습하고, Lamé 파라미터는 각 샘플의 E와 ν에서 계산한다. 손상 잠재에는 시그모이드 게이트를 씌워, 게이트가 0에 가까우면 응력 잠재가 구성 방정식 근사와 일치하도록, 1에 가까우면 목표가 0 잠재에 가까워지도록 유도한다. 이는 VAE 좌표가 물리량을 직접 나타낸다고 가정하지 않는 잠재 공간판 응력 저하 사전이다. 최종 목적함수는 flow matching 손실에 이 정규화 항을 가중 합한 형태이며, 학습은 물리 조건부 RGB 영상, RGB와 FracPhys 맵의 결합 예측, 전체 목적함수 미세조정의 3단계로 진행된다.
전제와 한계
실험 데이터는 Objaverse와 SketchFab에서 고른 10개 물체다. 고신장 5개(고무 장난감)와 저신장 5개(크루아상, 케이크, 머핀, 빵, 빵 롤)로 인장 파괴의 두 재료군을 덮는다. 이 중 6개 물체의 시뮬레이션 결과로 4,212개 학습 샘플을 만들고, 4개를 홀드아웃해 힘·재료·파괴 조건을 바꾼 2,808개 테스트 샘플로 정량 평가한다. 베이스라인은 ForcePrompting, PhyCo, CogVideoX이며, PhysCtrl은 힘을 단일 벡터로 인코딩해 양방향 반대 힘을 표현할 수 없어 제외했다. 시각 품질은 FVD·LPIPS·PSNR로, 물리는 기존 상식 기반 지표 대신 새로 정의한 인장축 정합도(SAC), 손상 진행 정합도(DPA), 구성 일관성(R²_cons)으로 측정한다. 저자들은 FracGen이 모든 지표에서 베이스라인을 앞서며, 베이스라인은 사실적인 신장과 파괴 진행을 잡아내지 못한다고 보고한다.
절제 실험 수치도 구체적이다. 물리 조건부 RGB만 쓰는 1단계에서 FracPhys 결합 예측을 추가한 2단계로 가면 FVD가 298에서 290으로 개선되고 픽셀 정렬 물리 필드를 직접 들여다볼 수 있게 된다. 구성 손실을 더한 3단계에서 FVD는 290에서 266으로, DPA는 0.438에서 0.536으로 좋아진다. 물리 맵 전체 MSE는 0.0253에서 0.0175로 줄고, 구성 일관성 R²_cons는 0.378에서 0.902로 뛴다(정답 물리 맵의 참조값은 0.948). 다만 변형률 오차는 소폭 증가하는데, 저자들은 손실이 맵별 정확도보다 응력-변형률 결합을 우선하기 때문이라고 설명한다.
개발자 관점에서 이 모델의 실용적 의미는 시뮬레이션과 장면 재구성 없이 단일 이미지에서 파괴 영상과 물리 맵을 얻는다는 점이다. 게임·VFX의 파괴 애니메이션 프로토타이핑, 로봇 조작용 합성 데이터, 재료 응답 예측의 빠른 사전 탐색에 쓸 수 있다. 도입 전에 확인할 것은 학습 분포의 폭이다. 물체 10개, 인장 하중, 두 재료군에 한정된 데이터로 학습했으므로 다른 재료나 하중 형태에서의 일반화는 별도 검증이 필요하다. 또한 물리 맵은 절대값의 정확도보다 채널 간 일관성을 목표로 학습되었고, 추론은 다단계 확산 샘플링이라 속도가 제한된다는 점도 실제 파이프라인에 넣을 때 고려해야 한다.
저자들이 밝힌 한계는 명확하다. 이 연구는 인장 하중 하의 변형과 찢어짐만 다루며, 취성 파괴와 충격에 의한 파편화는 학습·평가 범위 밖이다. 해당 재료 유형으로 확장하려면 적절한 시뮬레이션 데이터와 파괴 모델이 필요하다. 모델은 학습 시뮬레이터의 가정을 그대로 물려받으므로 FracSim의 오류가 FracGen에도 반영된다. 다단계 확산 샘플링은 추론 속도를 제한하며, 소수 스텝 증류로 비용을 줄일 수 있지만 파괴 거동과 예측 물리 필드 간 일관성을 유지해야 한다는 조건이 붙는다.