Bi-FORK가 고차원 분기계의 다중 해 분포를 한 번에 생성한다

Bi-FORK: Generative Modeling of High-Dimensional Bifurcating Systems

arXiv2610.12449v1

Anna Zimmel2026-10-08

무엇인가

분기(bifurcation)는 제어 파라미터가 임계값을 넘을 때 해의 개수나 안정성이 질적으로 바뀌는 현상으로, 구조 좌굴부터 유체·기후 역학, 상분리까지 널리 나타난다. 문제는 대칭이 깨지는 분기점에서 하나의 입력이 여러 개의 똑같이 타당한 해를 갖는다는 점이다. 대부분의 학습 기반 물리 대리모델(surrogate)은 입력과 출력이 일대일이라는 가정 위에 세워져 있어, 이런 일대다 매핑을 판별적으로 학습하면 해 공간을 평균 내버리고 물리적으로 말이 안 되는 예측을 낸다. GAN·확산모델·플로우 매칭 같은 확률적 접근이 있었지만, 분기 구조 자체를 해 중복의 원인으로 직접 다루는 연구는 소수였고 그마저도 수백 자유도 규모, 작고 알려진 이산 대칭군에 머물렀다. 이 논문은 그 규모를 최대 26만 개 이산화 지점까지 끌어올리는 것을 목표로 한다.

어떻게 동작하나

Bi-FORK는 Bifurcation Flow-matching Over Repulsion-guided Kinematics의 약자로, 전체 궤적을 잠재 공간에서 한꺼번에 생성하는 프레임워크다. 먼저 오토인코더가 각 타임스텝의 응답을 잠재 토큰으로 압축한다. 포인트 클라우드 데이터에는 Perceiver 스타일 교차 어텐션을 써서 기준 형상 X^1과 응답 M^t를 L개의 잠재 토큰 Z^t로 매핑하고, 정규 격자 데이터에는 3D ViT를 쓴다. 디코더는 항상 같은 기준 위치 X^1에서 토큰을 질의해 복원하므로, 시간에 따라 변하는 정보는 전부 잠재 궤적에 담기고 공간 복원은 기준 형상에 고정된다. 그 위에서 잠재 플로우 매칭이 동작한다. 잠재 궤적 Z_1과 노이즈 ξ 사이에 Z_τ = τZ_1 + (1-τ)ξ로 확률 경로를 잡고, 네트워크 f_θ가 노이즈가 섞인 궤적, 플로우 시간 τ, 관측된 상태들, 제어 프로토콜 c를 입력받아 깨끗한 궤적 전체를 예측하도록 학습한다. 배치 내 쌍을 최적수송으로 연결해 경로 길이를 줄이고, 분기 시점을 나타내는 이진 마스크 b̂ ∈ {0,1}^T도 함께 예측한다. 추론 시에는 순수 노이즈에서 이 확률 흐름 ODE를 풀어 궤적을 얻는다. 궤적을 프레임 단위 자기회귀로 생성하지 않고 통째로 생성하기 때문에, 분기 선택이 공간과 시간에 걸쳐 일관되게 유지된다.

무엇과 다른가

문제는 생성 모델이 여러 모드 중 하나의 타당한 해를 내놓더라도, 샘플링만으로는 모드 분포를 제어할 수 없다는 점이다. 이를 위해 추론 단계에서 particle guidance를 쓴다. K개의 후보 궤적을 독립적으로 뽑는 대신 하나의 배치로 묶어 확률 흐름 ODE를 공동으로 적분하되, 각 스텝의 속도장에 샘플 간 반발항을 더한다. 반발은 모델이 예측한 분기 마스크 b̂가 1인, 즉 분기 이후 프레임에만 적용되며, 이 프레임들의 예측값을 마스킹해 펼친 뒤 궤적 간 거리를 가우시안 RBF 커널로 가중한다. 커널 대역폭은 쌍별 거리의 중앙값으로 잡고, 각 궤적의 변위력은 이웃에서 멀어지는 단위벡터들의 커널 가중 평균이다. 그래서 분기 프레임에서 서로 비슷한 궤적은 밀어내고 이미 구분된 궤적은 거의 건드리지 않는다. 갱신식은 v̂^(k) = w_vel·v̂_θ(Z_τ^(k), τ) + w_rep·b̂ ⊙ force^(k) 꼴이다. 저자들은 이를 고전적 deflation 기법의 병렬화된 유사체로 설명한다. 평가 지표는 두 갈래다. MCon-MAE는 각 샘플을 유클리드 거리로 가장 가까운 정답 모드에 배정한 뒤의 재구성 오차로 궤적 수준 정밀도를 재고, JSD는 예측된 모드 분포와 정답 모드 분포 사이의 차이로 각 해가 올바른 상대 빈도로 표현되는지를 잰다. 여기에 임계값을 넘는 샘플 비율인 기각률(rejection rate)과, 모든 정답 모드가 유효 샘플로 표현된 조건의 비율인 coverage를 더한다.

어떻게 쓰나

Beam3D는 축방향 압축을 받는 세장한 보 데이터셋으로, 임계 하중을 넘으면 회전 대칭이 깨지면서 방위각 φ ∈ [0, 2π] 방향으로 좌굴이 일어나 SO(2) 연속 궤도를 이룬다. 노드 수는 T=200일 때 11개 이하다. 비교 대상은 GeoTDM과 STFlow다. GeoTDM은 내장 등변성 덕분에 JSD가 가장 낮았지만 샘플의 99%를 기각했고 MCon-MAE도 가장 나빴다. STFlow는 기각률을 낮추면서 낮은 오차와 JSD를 유지했다. Bi-FORK는 기각률 0%를 기록하면서 MCon-MAE를 크게 개선했고, JSD도 등변 모델인 GeoTDM과의 격차를 좁힐 만큼 경쟁력 있는 값을 냈다. 끝점 분포를 눈으로 봐도 GeoTDM 샘플은 목표 원형 다양체를 벗어나 뭉쳐 있고 STFlow 샘플은 그 주위에 잡음처럼 흩어져 있는 반면, particle guidance를 뺀 Bi-FORK와 Bi-FORK 모두 목표 다양체를 정확히 따라간다. 추론 속도도 단일 조건에 180개 샘플을 만드는 데 3.95초로, STFlow보다 약 18배, GeoTDM보다 약 1,966배 빨랐다.

전제와 한계

기계 메타물질 데이터셋은 17개 벽지군(wallpaper group)에 걸친 주기적 다공성 재료의 좌굴 궤적을 담고 있으며, 조건에 따라 모드 수가 1, 2, 4개다. 여기서는 GeoTDM과 STFlow가 아예 쓸 수 없다. 두 모델 모두 기본적으로 완전 연결 그래프에 의존하는데 타임스텝당 노드가 Beam3D보다 약 160배 많아 계산이 불가능하고, 거리 임계값으로 희소 연결을 쓰더라도 전역 통신을 위해 그래프 지름만큼 메시지 패싱을 반복해야 해서 역시 불가능하다. 그래서 저자들은 변형 구배만으로 기준 형상을 전파하는 아핀(affine) 베이스라인과 비교한다. particle guidance 없는 Bi-FORK만으로도 정확도와 분포 coverage에서 아핀 베이스라인을 앞섰고, 모드별 JSD는 평균 예측으로 붕괴하지 않고 여러 모드를 복원했음을 보여준다. 전체 방법을 쓰면 coverage가 더 올라가, 샘플링한 테스트 케이스의 약 50%에서 네 개 모드를 모두 되찾았다. Allen-Cahn은 상분리를 기술하는 상장(phase-field) 데이터셋으로, 모든 궤적이 같은 균질 초기 상태에서 출발하고 조건은 ϵ과 μ 두 물리 파라미터뿐이다. particle guidance를 적용하면 MCon-MAE가 0.052에서 0.045로, 모드 JSD가 0.131에서 0.089로 낮아졌다. 이동(translation) JSD와 회전반사(rotoreflection) JSD는 두 변형에서 동일했다. ϵ=0.1로 고정하고 μ만 바꿔 보면, particle guidance 없는 모델은 주로 양의 분기에서 샘플링하고 음의 분기에 있는 여러 해를 놓치는 반면 Bi-FORK는 μ 전 구간에서 두 분기를 비슷한 밀도로 샘플링한다. 전체 규모는 최대 26만 개 이산화 지점이다.

실무적으로 이 논문이 건드리는 지점은 명확하다. 유한요소·유한체적 해석을 대체하려는 학습 기반 대리모델을 만들 때, 좌굴이나 상분리처럼 해가 갈라지는 영역에서는 MSE 계열 손실로 학습한 모델이 물리적으로 무효인 평균 해를 낸다는 것은 잘 알려진 함정이다. Bi-FORK는 그 함정을 궤적 전체를 잠재 공간에서 생성하는 방식으로 우회하고, 추론 시 반발 샘플링으로 한 번의 배치에서 서로 다른 분기를 뽑아낸다. 관심 있는 개발자는 세 가지를 확인하면 좋겠다. 첫째, 자신의 문제에서 분기 시점을 마스크로 예측하는 헤드가 실제로 맞는지(저자들은 Beam3D와 메타물질에서 이 마스크가 정확히 예측됐다고 보고한다). 둘째, 반발 강도 w_rep가 정확도와 다양성 사이에서 어떤 균형을 만드는지. 셋째, 대칭을 아키텍처에 심지 않고 데이터와 증강으로 배우게 한 선택이 자신의 대칭군에서도 충분한지다. 참고로 가장 큰 시스템들에 대해서는 기존 확률적 방법이 규모를 감당하지 못해 결정론적 아핀 베이스라인과 자체 절제 실험(ablation)만 비교했다는 점도 함께 봐야 한다.

저자들이 밝힌 한계는 세 가지다. 첫째, particle guidance는 정확도와 다양성을 맞바꿀 수 있다. 반발력이 이미 같은 유효 모드에 들어와 있는 샘플에도 작용해서, 그 샘플들을 해 다양체 밖으로 밀어낼 수 있다. 둘째, Allen-Cahn 평가는 필연적으로 불완전하다. 형태(morphology) 전체에 대한 분포를 알 수 없어서 모드 coverage JSD가 조건당 네 개의 시뮬레이션 실현과 그 부호 반전에만 의존하며, 모드·이동·회전반사 JSD를 따로 재는 것으로는 결합 분포의 coverage를 보장하지 못한다. 셋째, 대칭이 문제의 핵심임에도 모델은 이를 아키텍처에 강제하지 않고 데이터와 증강에서 배운다.