잠재 신경 대리모델의 장기 롤아웃 불안정은 압축이 아니라 훈련 방식에서 온다

Beyond Compression: Training Latent Representations for Stable Long-Horizon Rollout in Neural Surrogate Solvers

arXiv2609.30198v1

Andreas E. Robertson2026-09-24조회 9

무엇인가

시간 의존 편미분방정식(PDE)을 빠르게 푸는 신경 대리모델(surrogate solver) 중에서도, 전체 해상도 장(field) 대신 압축된 잠재 공간에서 시간 전개를 수행하는 잠재 동역학 모델(LDM)은 픽셀 공간 모델보다 2~3자릿수 빠르고 파라미터도 한 자릿수 적다. 문제는 이 방식이 순차 훈련(sequential training)을 따른다는 점이다. 먼저 오토인코더를 재구성 정확도만 보고 최적화하고, 그 다음 고정된 잠재 공간 위에서 별도의 동역학 모델을 학습한다. 이 논문은 바로 이 순차 훈련이 롤아웃 불안정의 원인이라고 주장한다. 압축 자체가 문제가 아니라, 롤아웃 과제를 한 번도 본 적 없는 표현이 만들어지기 때문이라는 것이다. 저자들은 이를 재구성·1스텝 예측 같은 기존 지표로는 진단할 수 없는 '과제 불일치(task misalignment)'로 규정한다.

어떻게 동작하나

제안하는 것은 아키텍처 최적화가 아니라 다섯 가지 훈련 수준 개입이다. 첫째, 평탄한 벡터 대신 공간 구조를 유지하는 웨이블릿 오토인코더를 쓰고 압축률을 500:1에서 64:1로 낮추며, 동역학 모델을 이미지형 잠재 표현에 맞춘 AViT(axial-vision transformer)로 교체한다. 둘째, Koopman 연산자 학습을 변형해 z_{t+1}=K z_t를 만족하는 커널 K(바이어스 없는 3x3 합성곱)를 오토인코더 훈련 중 함께 최적화하고, 다음 시점 재구성 항을 1:2로 약하게 벌점을 준다. K는 훈련 후 버리고 오토인코더만 남긴다. 셋째, 잠재 공간이 임의로 팽창하지 않도록 단위 가우시안 구조를 유도하는 KL 발산 정규화를 넣는다. 넷째, 인코딩 직후 Koopman 변환 전에 일정 분산 백색 가우시안 잡음을 주입하는 '해밍 잡음'과, AViT 입력에 잡음을 넣는 동역학 측 잡음 주입을 각각 적용한다. 다섯째, 사전학습된 AViT를 자기 예측으로 최대 3스텝 추가 롤아웃한 뒤 마지막 출력에만 손실을 계산하는 재귀(멀티스텝) 파인튜닝을 수행한다.

무엇과 다른가

이 논문의 핵심 진단 도구는 '디코더 민감도(decoder sensitivity)'다. 디코더 야코비안 J(z)에 대해 좌표별 RMS 민감도 s_j(z)를 계산해, 잠재 공간의 작은 오차가 복원된 장에서 얼마나 크게 증폭되는지를 측정한다(Hutchinson 방식 무작위 추정으로 근사). 값이 작으면 잠재 오차가 해 공간으로 투영되는 비율이 낮아 롤아웃이 안정된다. Koopman 제약과 해밍 잡음 주입은 각각 독립적으로 이 민감도를 낮추며, 저자들은 이를 장기 롤아웃 안정성의 주된 지렛대로 본다. 함께 쓰는 진단 지표로는 잠재 시계열의 꼬불꼬불함을 재는 분산 스케일 잠재 속도가 있다. 성능 지표는 RelMSE와 VRMSE이며, VRMSE=1은 목표장의 공간 평균을 예측한 것과 같은 오차, 즉 평균장 베이스라인이다.

어떻게 쓰나

실험은 성격이 다른 세 문제에서 이뤄졌다. Cahn–Hilliard 방정식 기반 스피노달 분해(1,000개 시뮬레이션, 384x384, 200스텝, 4개 물리 파라미터), Well 벤치마크의 활성 물질(225개 궤적, 256x256, 81스텝, 11개 결합 장, 미해결 고차 모멘트로 인한 클로저 문제), 그리고 원자 소성 고주기 피로다. 활성 물질에서 개입들을 누적하면 바닐라 LDM 대비 15스텝 롤아웃 오차가 43.2% 줄었다. 동역학 측 잡음 주입은 15스텝에서 추가로 20% 개선했지만 1스텝에서는 약 45% 악화됐다. 재귀 파인튜닝은 Δt=15에서 원시 오차를 0.60120에서 0.55802로 7.2% 줄였으나 단조롭지 않아, 첫 추가 스텝은 3.9% 해롭고 두 번째가 7.3%로 이득의 대부분을 냈다. Δt=1에서는 세 스텝 모두 각각 42.7%, 37.3%, 8.1% 악화됐다. 저자들은 1스텝과 15스텝 롤아웃이 정반대 이야기를 한다는 점을 강조하며, 1스텝 손실은 점별 정확도를 보상하는 반면 장기 안정성을 높이는 개입은 모델을 덜 정밀하고 더 관대하게 만든다고 설명한다. 즉 1스텝 예측은 장기 롤아웃 성능의 약한 지표다.

전제와 한계

효율과 외삽 결과도 구체적이다. 제안 모델은 전체 해상도 모델과 대등하거나 앞서는 정확도를 2자릿수 적은 부동소수점 연산과 절반의 GPU 메모리로 달성한다. Well의 목표치와 비교하면 1스텝 목표 0.1034에는 근접하고 15스텝 목표 2.11은 크게 상회한다. Walrus 등 파운데이션 모델과 비교하면 처음 20스텝 평균 VRMSE는 0.1262로 이 논문보다 낫지만, 20~60스텝에서 1.24로 급등해 장기 안정성은 이쪽이 우세하다. 다만 저자들은 아키텍처 최적화나 스케일링 없이 이뤄진 비교라 완전히 공정하지 않다고 명시한다. 고주기 피로에서는 2^9 사이클 이하만 학습에 쓰고 2^15 사이클까지 외삽했는데, 2^5 사이클의 문맥만 주어도 FIP(피로 지시 파라미터)를 10% 미만 오차로 예측하고 잠재 파괴 시점을 반차수 이내로 국소화한다. 55개 장을 모두 예측하는 변형보다 FIP 전용 변형이 더 우수했다.

개발자 관점에서 실무적 함의는 분명하다. 첫째, 잠재 공간을 수동적 병목이 아니라 동역학 설계 변수로 다뤄야 한다. 압축률을 공격적으로 올리는 것이 롤아웃 안정성을 보장하지 않으며, 오히려 공간 구조를 남긴 완만한 압축이 바닥 성능을 끌어올린다. 둘째, 검증 지표를 1스텝 재구성 오차로 잡으면 개선과 악화를 거꾸로 읽게 된다. 롤아웃 길이를 늘린 평가를 직접 최적화 목표로 삼아야 한다. 셋째, 잡음 주입 강도는 민감한 하이퍼파라미터로, 너무 적어도 많아도 훈련이 불안정해진다. 넷째, 잠재 공간이 이미지형 구조를 유지하면 Walrus 같은 실공간 사전학습 파운데이션 모델 체크포인트를 초기화에 재사용할 수 있다. 실제로 활성 물질뿐 아니라 사전학습에서 한 번도 본 적 없는 고주기 피로에서도 사전학습 Walrus가 무작위 초기화 모델보다 훨씬 적은 에폭으로 낮은 검증 오차에 도달했다.

저자들이 밝힌 한계와 전제도 짚어둘 필요가 있다. 이 연구는 훈련 전략에 집중한 나머지 광범위한 아키텍처 최적화를 의도적으로 배제했고, 파운데이션 모델과의 비교도 그 때문에 공정하지 않다고 스스로 인정한다. 개입들은 1스텝 정확도를 일관되게 희생시키며, 재귀 파인튜닝의 이득은 스텝별로 단조롭지 않고 1스텝에서는 오히려 해롭다. 15스텝을 넘어서면 정답과의 점별 대응은 깨지고, 모델은 해 다양체 위에 머무는 물리적으로 그럴듯한 예측을 내놓는 수준이 된다. 고주기 피로에서 FIP 장은 로그 시간 샘플링 때문에 다른 장에서 추정하지 않고 직접 예측해야 했으며, Walrus 실험은 범위가 제한된 소규모 부차 실험이다.