HamiFormer는 확산모델과 해밀턴전파를 섞어 장기물리예측오차누적을 줄인다.
HamiFormer: Dual-Expert Diffusion Fields with Affine Symplectic Maps
무엇인가
학습 기반 물리 시뮬레이터의 핵심 난점은 국소 동역학과 장기 예측을 동시에 맞추는 것이다. 한 스텝 예측기는 관측된 상태에서는 정확해도, 자기 출력을 다시 입력으로 넣는 재귀 적용에서는 점점 다른 입력 분포를 만나고 오차가 누적된다. 이 분포 이동 때문에 한 스텝 정확도만으로는 장기 신뢰성을 추론할 수 없다. PhysiFormer 같은 전체 윈도우 생성 예측은 미래 상태를 한꺼번에 수정해 먼 물리 시점까지 갱신한다는 대안이지만, 국소 상태 전파와 전체 윈도우 디노이징을 물리 시간축에서 조율하는 문제가 남는다. HamiFormer는 이 조율을 정면으로 다룬다.
어떻게 동작하나
제안 모델의 깨끗한 궤적 추정기는 두 전문가로 구성된다. 확산 전문가 D는 노이즈 낀 미래 블록 전체와 rectified-flow 시간 τ, 초기 상태, 속성을 읽고 전체 윈도우 후보를 낸다. 해밀턴 전문가는 학습된 스칼라 해밀턴 H와 학습된 잔차 r을 합친 H+r 후보를 만든다. 각 물리 엣지에서 라우터 가중치 g가 위치·운동량 성분별로 두 후보를 섞고, 이 혼합 상태가 다음 해밀턴 스텝의 전임자(predecessor)가 된다. 즉 혼합 출력이 곧바로 다음 전파 입력이 되어, 확산 기반 보정이 이후의 모든 구조적 전파를 바꿀 수 있다. 저자들은 이를 소프트 리셋이라고 부르는데, 전체 윈도우 확산 후보와 섞는 것이 상속된 자기회귀 오차의 직접 기여를 약화시키기 때문이다.
무엇과 다른가
반복되는 비선형 전파는 두 번째 난제다. 일반적인 비분리 해밀턴은 궤적 전체에 걸쳐 음함수 심플렉틱 오일러 풀이를 요구한다. PLAS(Parallel Local Affine Scan)는 캐시된 궤적 앵커에서 음함수 해밀턴 관계를 선형화하고, 물리 시간축에 걸쳐 병렬로 평가한 그래디언트와 헤시안으로 아핀 맵을 구성한다. 이 맵은 새로 혼합된 전임자에 작용하고, 비선형 잔차와 라우팅은 진화하는 혼합 이력에 반응한다. 앵커는 rectified-flow 스텝 사이에도 유지되어 디노이징 조건이 바뀌는 동안 정제 진행을 이어간다. 저자들은 정제를 K=1로 한 번만 워밍스타트해 쓰며, 각 PLAS-SymEuler 아핀 맵이 잔차 보정과 확산 혼합 이전 단계에서 심플렉틱 구조를 정확히 보존한다고 밝힌다.
어떻게 쓰나
잔차 보정과 전문가 선호는 동역학 영역마다 다르다. 작은 매끄러운 보정, 날카로운 충격, 이전 실수로부터의 복구를 하나의 공유 예측기가 모두 감당해야 하고, 소수의 큰 오차가 목적함수를 지배할 수 있다. Regime Model Tree는 학습된 특징 분할, 리프별 선형 잔차 리드아웃, 리프별 아핀 라우팅 보정을 사용한다. CART 기반 트리가 영역 리드아웃을 고르고, 계층적 릿지 페널티가 공통 선형 블록과 리프별 편차로 정보를 공유한다. 학습은 확산 손실과 해밀턴 손실을 합친 목적함수로 D와 H를 50,000 업데이트 공동 학습한 뒤 두 네트워크를 동결하고, 200 업데이트씩 네 단계(공유 잔차, 스칼라 라우터 두 단계, 영역 특화)로 총 800 업데이트를 수행한다. 샘플링은 N=20개의 rectified-flow 구간에 Heun 업데이트와 마지막 오일러 스텝을 쓰고, 처음 두 구간은 확산만으로 초기화한다.
전제와 한계
이론적으로 저자들은 세 가지를 제시한다. 정리 1은 학습된 H가 C²이고 앵커가 고정되며 B가 가역일 때 PLAS-SymEuler가 AᵀJA=J를 만족하고, C³이면 국소 심플렉틱 오일러 맵이 아핀 맵에 O(‖z−z_a‖²) 오차로 근사되며, 이차 해밀턴에서는 음함수 스텝이 정의되는 모든 곳에서 아핀 맵이 정확하다고 주장한다. 정리 2는 고정된 rectified-flow 조건에서 고유한 분기 일관 고정점이 존재하고 한 번의 갱신이 이차 국소 수렴과 K=1 워밍스타트 추적을 준다고 밝힌다. 명제 1은 확산 오차가 최대 U_D일 때 윈도우 내 물리 오차가 V_L + C_D(L)·U_D로 유계라는 유한 윈도우 오차 한계를 제시한다.
실험은 HamiBalls-1(닫힌 정사각형 안 5개 공, 중심에 스프링으로 연결, 비탄성 충돌, 중력 없음)과 HamiBalls-2(3차원 5~10개 공, 희소 스프링, 중력, 비탄성 충돌)에서 수행됐다. 192스텝 평가에서 HamiFormer는 HamiBalls-1 총 MSE 0.25071로 PhysiFormer 0.34029, HG-DPF 1.17966을 앞서 26.3%를 줄였고, HamiBalls-2에서는 0.69398로 최고 베이스라인 DiT 0.88309 대비 21.4%를 줄였다. 리셋 없는 분리 구간 비교에서 HamiBalls-2의 context-one Transformer-AR이 초반(0.17594 대 0.19223)은 앞서지만 49–96 구간(0.69344 대 0.78905)과 97–192 구간(0.94513 대 1.32430)에서 순위가 뒤집히고, 마지막 구간에서는 DiT 1.13762와 PhysiFormer 1.21766보다도 낮다. 적분기 절제에서 PLAS는 위상공간 RMSE 9.80×10⁻⁶을 0.794초에 달성해, 명시적 오일러의 4.85×10⁻⁴을 0.887초에 얻는 것보다 오차와 시간 모두 우수했다. PLAS-S는 0.743초, PLAS-DC-S는 0.949초로 SymEuler2의 1.275초보다 빠르면서 근접 정확도를 보였다.
구성 요소별 절제도 수치로 제시된다. 혼합 상태 피드백은 출력만 혼합하는 방식 대비 위상공간 MSE를 HamiBalls-1에서 12.6%, HamiBalls-2에서 16.7% 추가로 줄였다. 내부 확산 전용 모델과 비교하면 48 엣지에서 0.06629→0.04585(30.8%), 192 엣지에서 0.33863→0.25071(26.0%)이다. 모델 트리와 목적함수 절제에서는 Tree+Full이 PhysiFormer 대비 29.27% 감소로, Tree+Basic의 11.69%, Shared+Full의 8.42%를 크게 앞섰고 셀 승률 64.41%를 기록했다. 단일 전역 리드아웃(GL)은 같은 업데이트 예산에서 7.03% 감소에 그쳤다. 또한 배포된 단일 정제가 16회 정제 기준과 비교해 192개 HamiBalls-1 엣지에서 평균 양의 초과 손실 0.1903%로 정확도가 맞먹는다고 보고한다.
개발자 관점에서 이 논문의 실용적 포인트는 세 가지다. 첫째, 재귀 롤아웃의 오차 누적을 전체 윈도우 생성 모델과 구조적 전파의 혼합 피드백으로 다루는 설계 패턴은 시뮬레이터·시계열 롤아웃·월드 모델 어디에나 이식 가능하다. 둘째, PLAS처럼 미분 연산을 물리 시간축에서 병렬화하고 앵커를 rectified-flow 스텝 사이에 재사용하는 방식은 반복 정제 비용을 줄이는 구체적 구현 전략이다. 셋째, 영역별 리프 리드아웃과 라우팅 보정은 꼬리 오차와 전형 상태 정확도의 균형 문제를 다루는 방법이다. 다만 저자들이 밝힌 전제를 확인해야 한다. 평가는 물리 속성이 관측 가능하고 상태 지도가 주어지는 시뮬레이션 시스템에 한정되며, 향후 과제로 더 넓은 상호작용 법칙과 관측 양식, 제한된 관측에서의 물리 맥락 추론, 대규모 시스템을 위한 적응적 정제 예산을 꼽았다. 코드·데이터·가중치는 공개 저장소에 있다.