LimiX-2는 목표예측 넘어 변수간결합구조 학습하는 표형데이터파운데이션모델이다.

LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence

arXiv2609.17488v1

Xingxuan Zhang2026-09-15조회 4

무엇인가

이 논문이 다루는 문제는 구조화 데이터, 그중에서도 표형 데이터에 대한 범용 학습과 추론이 언어나 물리 세계에 비해 크게 뒤처져 있다는 것이다. 의료·금융·과학 발견에서 표형 데이터는 핵심적인데, 그래디언트 부스팅 트리(XGBoost, LightGBM, CatBoost), 딥러닝, 자동 앙상블 파이프라인은 데이터셋마다 별도 학습과 모델 선택이 필요하고 과제 간 지식 재사용이 제한적이다. 이를 해결하려는 흐름이 합성 과제로 사전학습하는 Prior-Data Fitted Network(PFN) 계열로, TabPFN, TabICL, TabFM, Mitra가 여기에 속한다. 저자들은 PFN의 표준 지도학습 정식화가 p(y | x, D_context), 즉 지정된 단일 목표 열의 사후 예측 분포만 근사한다는 점을 한계로 지목한다. 각 과제 안에서 직접 감독이 목표 열 하나에만 집중되어 변수 전체의 결합 분포를 명시적으로 모델링하지 못하고, 그 결과 다양한 데이터 추론 과제에서 능력이 제약된다는 것이다.

어떻게 동작하나

제안 방법의 핵심은 Contextual Mechanism Networks(CMN)라는 새 패러다임이다. 모델링 초점을 지정된 목표에서 변수들 사이 예측 의존성의 체계로 옮기고, 같은 데이터셋 위의 여러 조건부 예측 과제를 통해 p(x, y | D_context)라는 데이터 생성 과정의 결합 구조를 문맥 의존적으로 표현하도록 학습한다. 지도 예측은 주어진 증거로부터 관측되지 않은 양을 추론하는 더 넓은 프레임워크의 특수 사례로 재정의된다. 사전학습 목표는 Context-Conditional Masked Modeling(CCMM)으로, 목표 예측과 마스킹된 특징 재구성을 결합한다. 각 사전학습 에피소드는 테이블을 서로 겹치지 않는 문맥 행 집합과 질의 행 집합으로 나누고, 질의 행의 마스킹된 열 값들을 관측된 질의 특징과 문맥 집합을 조건으로 추정한다. 표본 축에서 질의 행은 문맥 행에만 어텐션하고 문맥 표현은 질의를 보지 않으므로, 질의 행 사이의 직접적·문맥 매개적 정보 교환이 차단되고 예측이 질의 배치 구성에 불변해진다. 이 하나의 조건부 인터페이스가 별도 파라미터 업데이트 없이 분류, 회귀, 마스킹 특징 재구성을 모두 지원한다.

무엇과 다른가

구조적으로 LimiX-2는 이전 세대의 셀 수준 표현 설계를 유지한다. 행 전체를 하나의 벡터로 압축하지 않고 각 셀을 별도 표현으로 인코딩해 변수 간 조건부 추론을 가능하게 한다. 임베딩 차원은 이전 LimiX-16M의 192, LimiX-2M의 96에서 256으로 확장됐다. 결측 셀은 열 인덱스와 타입에 무관한 단일 학습 임베딩을 공유하고, 열 정체성은 별도의 Discriminative Feature Encoding(DFE)이 담당한다. DFE는 s = d/4 차원 코드를 저랭크 변환 행렬로 임베딩 공간에 사상해 더하며, 열이 순서와 함께 순열되어도 어텐션이 우연한 순서에 의존하지 않도록 하고, 차원이 커지면서 생기기 쉬운 열 인덱스 지름길 암기를 억제한다. 목표는 K = 4개의 슬롯 임베딩으로 인코딩되고 과제 타입 임베딩이 각 슬롯에 더해진다. 백본은 24층의 이중축 트랜스포머로, 표본 축 어텐션은 각 특징 위치와 목표 위치에서 표본 간 정보를 전파하고, 특징 축 어텐션은 비대칭이다. 특징 표현은 목표와 다른 특징 표현에 어텐션할 수 있지만 목표 표현은 특징 표현에만 어텐션한다. 공유 MLP는 특징용과 목표용으로 분리된 SwiGLU 게이트 FFN으로 대체됐고, 교차 어텐션에서 K/V 헤드를 전부 사용하며 어텐션 로짓 크기를 제어하기 위해 길이 의존 스케일링 s_h = (1 + w_h log n) β_h를 적용한다. 예측 헤드는 깊이별로 붙는데, 마스킹 특징 재구성은 국소적 세부가 필요해 얕은 층 표현에, 분류와 회귀는 마지막 층 표현에 연결된다. 회귀는 평균제곱오차 대신 목표 범위를 B = 5000개의 순서 구간으로 나누고 각 구간 확률을 예측한 뒤 구간 중심값의 가중합으로 값을 도출한다.

어떻게 쓰나

사전학습 데이터는 전부 구조적 인과 모델(SCM) 기반 합성 데이터다. 파이프라인은 하이퍼파라미터 샘플링, 방향성 비순환 그래프(DAG) 생성, SCM 전파, 데이터 샘플링, 과제 적응의 다섯 단계로 구성된다. DAG는 연쇄·교란·콜라이더 같은 인과 모티프로 이루어진 국소 인과 구조를 여러 세분도에서 재귀적으로 확장해 만들고, 간선 재지향·국소 경로 대체·노드 수준 변환 같은 위상 제약 그래프 변환을 적용해 비순환성을 유지하면서 연결 패턴을 다양화한다. 함수 메커니즘은 MLP, CNN, 결정 트리에 더해 선형 사상, 커널 함수, 조각별 함수, 주기 함수, 곱셈 상호작용을 추가했고 이들을 합성할 수 있게 했다. 다중 부모 노드에는 단순 평균, 가중 집계, 신경 집계 같은 전략을 적용한다. 변수 샘플링은 다중 속성 선택 문제로 정식화해 그래프 구조와 통계적 성질이 서로 다른 과제를 확보하고, 과제 적응 단계에서 선형 스케일링, 단조 비선형 변환, 로그·지수 변환을 무작위로 조합하며 분류 과제는 연속 목표를 무작위 이산화해 클래스 빈도와 이산화 파라미터를 변화시킨다. 마스킹 패턴은 개별 셀, 질의 행 전체에 걸친 선택 열, 셀 블록의 세 가지를 섞어 고립된 값 복원부터 목표 열 예측, 결측 블록 재구성까지 다양한 세분도의 과제에 모델을 노출시킨다.

전제와 한계

실험은 표형 머신러닝 커뮤니티가 널리 쓰는 TabArena, TALENT, BCCO 세 벤치마크에서 수행됐다. 단일 사전학습 LimiX-2가 과제별 파라미터 업데이트 없이 분류, 회귀, 결측값 대체, 인과 발견을 지원하며, 데이터셋별로 학습된 전통 모델과 표형 파운데이션 모델을 모두 앞선다. 특히 모델 파라미터가 4배 작은데도 TabFM을 능가한다. BCCO 회귀에서 LimiX-2는 평균 순위 3.93의 TabFM, AutoGluon 1.6(EX, 4h) 3.97, TabPFN-3 5.16, EXAONE Tabular 5.20보다 앞서고, 이전 세대 LimiX-16M의 9.96에서 크게 개선됐다. 페어와이즈 비교에서 LimiX-2의 비대각 승률은 62%에서 94% 사이라 모든 베이스라인을 과반 과제에서 이긴다. TabFM에 65%, EXAONE Tabular에 67%, 나머지 표형 파운데이션 모델에 73~79%, 트리 기반과 신경망 베이스라인에는 81~94%의 승률을 기록했다. 메타특징 구간별로도 약 10^4 표본 규모와 10~100개 특징 구간에서 낮은 적합 순위를 유지한다.

인과 골격 복원 평가는 모델 내부 특징 어텐션 점수가 인과적 인접 관계와 비인접 관계를 구분하는지 확인하는 방식이다. 각 변수를 차례로 목표로 두고 나머지를 특징으로 주었을 때, 인과적 인식을 가진 모델이라면 목표와 인과적으로 인접한 특징에 어텐션을 집중할 것이므로 어텐션 점수를 임계값으로 잘라 희소 인과 골격을 얻는다. 연속 데이터셋 세 개(Sachs 단백질 신호 네트워크, UF 식품 생산 공정, CausalChamber 광 터널 시스템)와 이산 데이터셋 세 개(PATHFINDER 림프절 병리, DIABETES 혈당 조절, PIGS 유전 가계)에서 평가한 결과, LimiX-2는 평균 F1 0.7972로 6개 데이터셋 중 6개에서 F1 1위, 5개에서 최저 구조적 해밍 거리를 기록했다. 2위는 EXAONE Tabular로 F1 0.6591이다. 반면 TabFM, TabICLv2, TabPFN-3, Xiaomi-TabLDM처럼 특징 정보를 행 수준 표현으로 집계해 특징 그룹 수준에서만 어텐션을 계산하는 모델들은 세밀한 인과 관계 강도를 구분하지 못해 성능이 크게 떨어진다. 저자들은 이를 CMN과 셀 수준 표현이 인과 구조 인식에 중요하다는 증거로 제시하며, LimiX-2가 여러 설정에서 인과 발견 전용 방법과 대등하거나 능가하는 골격을 복원한다고 주장한다.

스케일링 연구는 12.5M에서 406.2M 파라미터 범위의 설정을 평가하고 E_i = α + β log2(N_i / 100) 형태의 로그 선형 법칙을 적합했다. 다섯 개 평가 계열 모두 R² 0.9617~0.9808, 잔차 RMSE 3.84~9.03 Elo를 기록했다. TabArena에서 Elo는 12.5M의 1766에서 406.2M의 1935로 올라 약 32.5배 확대에 169 Elo가 상승했고, 기울기는 파라미터 2배당 34.68 Elo로 다섯 계열 중 가장 가파르다. TALENT에서는 분류가 약 109 Elo, 회귀가 약 89 Elo 개선됐고, BCCO에서는 분류 56 Elo, 회귀 147 Elo가 올라 BCCO 회귀가 30.06 Elo/2배로 두 번째로 큰 계수를 보였다. 저자들은 406.2M까지 성능 포화의 명확한 증거가 없다고 밝힌다.

개발자 관점에서 이 논문의 실용적 의미는 명확하다. 데이터셋마다 모델을 새로 학습하고 하이퍼파라미터를 탐색하는 대신, 하나의 사전학습 모델을 추론 시점에 그대로 써서 분류·회귀·결측 대체를 처리하고 특징 어텐션에서 인과 골격 후보까지 얻을 수 있다는 주장이다. 다만 도입 전에 확인할 것이 있다. 첫째, 사전학습이 전적으로 SCM 기반 합성 데이터에 의존하므로 실제 업무 데이터의 분포가 생성 엔진의 가정에서 얼마나 벗어나는지 봐야 한다. 둘째, 인과 골격은 어텐션 점수 임계값으로 만들어지므로 임계값 선택에 민감할 수 있고, 저자들도 인과 발견 전용 방법과의 비교에서 "여러 설정에서" 대등하거나 능가한다고 표현해 모든 경우를 보장하지는 않는다. 셋째, 회귀가 5000개 구간의 확률 예측을 거치는 구조라 목표 범위가 극단적으로 넓거나 치우친 데이터에서 구간 해상도가 충분한지 검토해야 한다.

저자들이 명시한 한계와 전제도 분명하다. 2B 파라미터 규모로의 외삽 결과는 측정된 성능이 아니라 예측이며, 더 큰 모델은 다른 최적화·데이터 영역에 들어갈 수 있고 Elo 점수는 벤치마크 비교 풀에 의존한다. 또한 아키텍처, 사전학습 분포, 학습 연산의 차이 때문에 관측된 성능 격차를 전적으로 모델 설계 탓으로 돌릴 수 없다고 밝힌다. 스케일링 결론은 연구된 범위, 즉 406.2M 파라미터 이내에서 모델 용량이 견고하고 예측 가능한 축이라는 것에 한정된다.