JEPA-Anything은 직교 예측 분해로 이질적 도메인을 잠재세계모델로 묶는다.
JEPA-Anything: Learning Predictive Models across Different Worlds
무엇인가
이 논문은 세계 모델링(world modeling)이 도메인마다 따로 발전해 온 문제를 다룬다. JEPA는 컨텍스트 인코더, 타깃 인코더, 예측기로 잠재 공간 예측을 하지만, 보통 하나의 타깃 임베딩과 하나의 예측 경로를 쓴다. 논문은 국소/전역 구조, 여러 개체, 서로 다른 스케일의 변화가 하나의 타깃에 섞이면 쉽게 예측되는 고분산 구조가 최적화를 지배하고 약한 예측 구조가 충돌하는 그래디언트를 받을 수 있다고 지적한다. 그래서 ‘하나의 잠재 세계 모델 인터페이스가 여러 인자로 서로 다른 구조의 예측 상태를 조직할 수 있는가’를 질문하고, 직교 예측 분해(OPF)에 기반한 JEPA-Anything을 제안한다. 시각, 생물학, 임상 궤적, 제어, 분자 동역학, 물리장, 날씨의 일곱 도메인을 같은 코어로 다룬다.
어떻게 동작하나
방법의 공통 인터페이스는 도메인 어댑터와 뷰 샘플러로 정의된다. 원시 관측 x를 어댑터 A_delta가 콘텐츠 토큰 H와 구조 디스크립터 S로 바꾸고, 뷰 샘플러 V_delta가 컨텍스트 인덱스 C와 타깃 인덱스 T를 고른다. 온라인 인코더는 z_c=f_θ(H_C,S_C)를, 타깃 인코더는 z_t=f_θbar(H,S)_t를 만든다. 타깃 인코더 파라미터는 θbar ← m θbar + (1-m)θ로 EMA 업데이트되고 그래디언트를 받지 않는다. |T|=1이면 기존 단일 벡터 JEPA가 된다. 도메인별 어댑터가 관측 기하를 처리하고, 그 뒤의 예측 코어는 모달리티 독립적으로 적용된다.
무엇과 다른가
OPF의 핵심은 타깃 공간을 K개의 상보적 부분공간으로 나누는 것이다. K개의 학습된 프로젝터 P_k ∈ R^{d×r}를 두고 Kr=d가 되게 한다. 정지 그래디언트를 적용한 타깃 z~_t=sg(z_t)를 각 프로젝터로 투영해 인자 좌표 z_t^(k)=P_k^T z~_t를 얻는다. 각 인자에는 전용 예측기 q_k가 있어 공유 컨텍스트 표현 z_c와 필요하면 타깃 디스크립터 s_t를 같은 r차원으로 매핑한다. 예측들을 이어 붙인 u_hat_t를 P^T의 무어-펜로즈 유사역행렬로 합성해 완전한 타깃 상태 z_hat_t=(P^T)^† u_hat_t를 만든다. P가 정확히 직교하면 z_hat_t=Σ_k P_k z_hat_t^(k)로 단순해진다. 학습 손실은 인자별 회귀 L_pred, 프로젝터 내부 정규직교와 프로젝터 간 직교를 요구하는 L_orth, 각 인자 좌표의 활동성을 유지하는 L_fac, 온라인 인코더의 붕괴를 막는 L_enc를 더한 L_OPF이며, 각 도메인의 기존 손실 L_base에 더해진다. 논문은 P_i^T P_j=0, P_k^T P_k=I_r이면 인자 공간이 직교 직합을 이루고 노름이 보존되며 z=Σ_k P_k P_k^T z로 정확히 복원된다는 명제와, 이 제약이 없으면 중복 방향 때문에 랭크 부족이나 큰 조건수가 생길 수 있다는 따름정리를 제시한다. 인자 정체성은 미리 정한 의미가 아니라 예측 가능성에서 창발한다.
어떻게 쓰나
학습된 상태는 세 가지 방식으로 쓰인다. 표현 모드에서는 온라인 인코더만 남겨 재사용 가능한 특징으로 읽고, EMA 타깃 인코더와 프로젝터, 예측 헤드는 버린다. 운영 세계 모델 모드에서는 프로젝터와 예측기를 유지해 다음 잠재 상태를 디코더, 플래너, 다음 전이 단계에 넘긴다. 인자 수준 분석 모드에서는 u_k(x)=P_k^T z_delta(x)로 인자 좌표를 진단 인터페이스로 쓴다. 실험도 이에 맞춰 세 그룹으로 나뉜다. 그룹 I은 시각, 단일세포, 질병 예측처럼 최종 readout에서 끝나는 평가, 그룹 II는 개입 조건부 시퀀스, 제어, 분자 동역학, 물리장, 날씨처럼 예측 상태를 반복 전이와 계획에 재사용하는 평가, 그룹 III은 생물학과 궤도 분석처럼 인자 좌표를 과학적 분석에 쓰는 평가다.
전제와 한계
그룹 I과 II에서 논문은 도메인 표준 베이스라인, 단일 타깃 JEPA 베이스라인, JEPA-Anything을 비교한다. 직접 비교에서는 어댑터, 인코더 구조, 컨텍스트-타깃 샘플러, 최적화 예산, 데이터 분할, 다운스트림 readout, 기존 손실을 고정하고 JEPA-Anything만 L_OPF를 추가한다. 시각 바인딩에서는 DINOv3 ViT-S(d=384)와 SigLIP2 Base(d=768)에 K=4, r=96과 r=192를 적용하고, 2차원 위치 디스크립터를 쓰는 블록 마스크 패치 예측으로 사전학습한다. 학습된 그리드 readout을 고정한 조건에서 JEPA-Anything은 DINOv3와 SigLIP2 모두에서 주입식 홀드아웃 셀 정확도(INJ)와 그리드 복구율을 높이고 붕괴율을 낮춘다고 보고한다. 구체 수치는 본문 발췌에 제시되지 않았다. 임상에서는 1,000개 이상의 임상 이벤트 예측을 다루며, 질병 실험은 직교 인자들을 예측해 하나의 미래 환자 상태를 합성하고 그 상태에서 이벤트 위험을 읽는다. 동역학 벤치마크에서는 10개 매칭 과제 모두에서 보고된 지표가 개선되었고, Interventional Pong의 단일 개입 예측 오차는 34.8% 줄었다.
제어 실험은 Hopper-v5, Walker2d-v5, HalfCheetah-v5에서 수행된다. 용량을 맞춘 단일 JEPA와 K=4 JEPA-Anything이 같은 데이터, 백본, 최적화 예산, 평가 프로토콜을 쓰고, 시드 {42,123,456,789,2026}로 학습하며 각 체크포인트를 동일한 환경 리셋 다섯 번에서 평가한다. K ∈ {1,2,4,8}로 가지 폭을 맞췄을 때 단일 JEPA 대비 학습 파라미터 차이는 0.000%, 0.006%, 0.126%, 0.246%이고 예측 헤드 FLOP 차이는 0.000%, 0.742%, 0.992%, 1.449%로, 파라미터 0.3% 미만, FLOP 2% 미만이다. 평균 CEM 리턴은 Walker2d와 HalfCheetah에서 JEPA-Anything이 더 높았지만 Hopper에서는 단일 JEPA가 더 좋아 계획 성능이 환경에 의존한다. 인자 활동 실험에서는 32차원 상태를 네 개의 8차원 부분공간으로 나누고, 홀드아웃 전이에서 릿지 프로브로 한 인자씩 다음 관측 변화 Δo_t=o_{t+1}-o_t를 예측한다. Hopper에서 F1–F4의 가장 읽히는 변화는 각각 발 각도 R^2=0.294, 몸통 높이 0.347, 몸통 각도 0.424, 다리 각도 0.310이었다. 인자별 표준편차는 Hopper 0.692–0.715, Walker2d 0.587–0.601, HalfCheetah 0.673–0.678로 모두 활성 상태였다. 한 인자를 학습셋 평균으로 바꾸면 세 환경 모두 20스텝 롤아웃 오차가 증가했고, HalfCheetah에서는 F1 또는 F3 마스킹이 다섯 시드 모두에서 리턴을 줄였으며 F2 또는 F4는 다섯 중 네 시드에서 줄였다.
분자 동역학에서는 액체 물, 결정질 α-석영, 기체상 파라세타몰, 벤젠을 대상으로 힘 없이 미래 원자 위치와 속도를 예측하는 TrajCast 스타일 등변 예측기를 쓴다. TrajCast-JEPA를 참조 조건으로 두고, JEPA-Anything은 같은 시스템 데이터, O(3)-등변 백본, 예측 구간, 지도 적응, 롤아웃 프로토콜을 유지하면서 사전학습에 OPF를 적용한다. l=1 섹터의 64채널 다중도 축에 d=64, K=4, r=16으로 OPF를 적용하고, l=1 기약표현이 세 성분을 가지므로 평탄화된 블록은 64×3=192개 스칼라 좌표가 되며 등변성을 보존하기 위해 P_k ⊗ I_3로 작동한다. 다섯 개 독립 학습 모델의 평균으로 한 스텝 변위 MAE와 100스텝 자유 자기회귀 후 중앙 최종 위치 RMSD를 보고하며, JEPA-Anything이 네 시스템 모두에서 가장 낮은 한 스텝 MAE와 100스텝 RMSD를 냈다고 주장한다. 구체적인 Å 값은 원문 표 9에 제시되지만 이 글에서 인용할 수 있는 수치는 제공되지 않았다. 그룹 III에서는 인자 좌표가 지명한 IL-18과 NT5E/CD73 차단 병용 개입이 Huh7–PBMC 공배양, 환자 유래 오가노이드, 종양 절편, 면역능 마우스에서 항종양 활성 증가로 실험적 지지를 받았다. 궤도 분석에서는 물리 레이블 없는 위치-속도 궤적에서 스펙트럼 분석으로 잠재 주파수와 궤도 장반경을 짝지어 케플러 관계 f ∝ a^{-3/2}를 높은 정밀도로 복구했고, 피팅 기울기는 -1.4991이었다.
개발자 관점에서 이 논문은 여러 도메인의 월드 모델을 하나의 학습 원리로 묶고 싶을 때 참고할 만하다. 도메인별 어댑터와 뷰 샘플러만 바꾸고, 공통 코어에서는 인자 수 K와 인자 폭 r, 직교·활동성 정규화, EMA 타깃, 유사역행렬 합성을 재사용하는 구조가 핵심이다. 표현 학습에서는 온라인 인코더를 재사용하고, 계획이나 롤아웃에서는 합성된 잠재 상태를 다음 전이에 넣는 식으로 같은 사전학습을 두 용도로 나눌 수 있다. 다만 인자 좌표가 곧 의미론적 원인 변수라는 보장은 없으므로, 단일 인자 프로브, 인자 마스킹, 외부 실험 같은 검증을 함께 설계해야 한다. 논문도 직교 인자만으로 인과 기제를 확립하지 못하고, 공유 예측 구조가 도메인 간 표현 정렬을 보장하지 않는다고 명시한다. 분포 이동 아래 불확실성 보정, 언제 학습된 모델을 실험 지침으로 신뢰할지, 새 증거가 빠진 구조를 드러낼 때 예측 인자를 어떻게 수정할지가 남은 과제다. 또한 계획 성능은 환경에 의존해 Hopper에서는 단일 JEPA가 더 나았고, 비지도 의미 분리 자체가 관측만으로 식별 가능하지 않다는 일반적 한계도 전제로 깔려 있다.