TabFM-Auto는 고정된 표 형식 모델 주위에서 데이터 파이프라인을 진화시킨다
TabFM-Auto: Self-Evolving Pipelines for Tabular Foundation Models
무엇인가
표 형식 파운데이션 모델(TFM)인 TabPFN, TabICL, TabFM은 합성 테이블로 사전학습되어 새 테이블을 그래디언트 업데이트 없이 한 번의 순전파로 예측한다. 문제는 이 모델들의 어텐션 층이 부동소수점 크기와 범주 인덱스만 보기 때문에 systolic_bp나 ICD9_diagnosis 같은 컬럼 이름을 익명 컬럼 X_17과 똑같이 취급한다는 점이다. 컬럼 이름에서 도메인 공식을 유추하거나, 임상 코드를 계층으로 묶거나, 0이 결측 측정값을 인코딩한다는 사실을 알아낼 수 없다. TabFM+가 쌍별 교차 피처, SVD 투영, 다중 뷰 앙상블을 추가했지만 이런 연산은 컬럼이 무엇을 뜻하는지 모른다. 반대편에는 LLM 기반 MLE 에이전트가 있는데, 이들은 데이터셋마다 트리 앙상블이나 신경망을 처음부터 학습하는 스크립트를 고친다. 피처·아키텍처·하이퍼파라미터를 동시에 탐색하는 일은 노이즈가 커서 학습 분산이 작은 피처 이득을 덮어버리고 검증 과적합으로 이어진다.
어떻게 동작하나
TabFM-Auto는 이 둘을 붙인다. TabFM의 가중치 θ*는 고정한 채, LLM 에이전트가 그 주위의 데이터 파이프라인을 반복적으로 편집한다. 파이프라인은 P = (Φ_clean, Φ_feat, S_ctx, Ψ_post) 네 단계로 정의되고, 각각 preprocess(), engineer(), sample(), postprocess() 네 개의 모듈형 파이썬 함수와 TabFM에 넘기는 TABFM_KWARGS 설정 딕셔너리로 구현된다. 엔드투엔드 학습 스크립트를 다시 쓰는 대신 이 컴포넌트만 고친다. 탐색 절차는 이렇다. 학습 데이터를 3-fold 내부 교차검증으로 쪼개고 테스트 split은 건드리지 않는다. 각 후보 파이프라인에 대해 고정된 θ*로 3-fold 검증 지표 U_val의 평균을 최대화하는 P*를 찾는다. 모든 실행은 원본 테이블을 기본 설정으로 TabFM에 넣는 항등 파이프라인 P0에서 시작한다. θ*가 고정이므로 후보 평가에 그래디언트 학습이 필요 없고, 재학습 노이즈가 작은 피처 이득을 가리지 않으며, P0 대비 개선분은 전부 에이전트가 새로 쓴 파이프라인에서 나온다. 평가 하네스는 네트워크 접근과 held-out 테스트 split을 차단한 샌드박스에서 후보를 실행해 테스트 라벨이 에이전트 코드에 노출되지 않게 한다. 탐색이 끝나면 P*를 동결하고 공식 테스트 split에서 한 번 채점한다.
무엇과 다른가
네 단계는 각각 고정된 TFM의 특정 한계를 겨냥한다. Φ_clean(데이터 정제와 타깃 조건화)은 크기만으로는 읽을 수 없는 값의 의미를 다룬다. 0이 결측 측정값을 뜻하는 경우를 결측 지시자로 재코딩하고, 손상된 학습 행을 걸러내고, log(1+y)처럼 치우친 타깃을 압축하는 가역 변환 g(y_train)을 적용한다. Φ_feat(의미 기반 피처 엔지니어링)은 LLM의 도메인 지식이 들어오는 지점이다. 데이터셋 메타데이터를 도메인 비율·공식, 그룹 통계, 보조 파일 요약 같은 귀납적 피처와, 학습·테스트 입력을 합친 라벨 없는 transductive 피처(예: 엔티티 그래프 차수)로 번역한다. 공식을 컬럼 하나로 써 두면 TabFM이 그 공식을 컨텍스트 안에서 추론할 필요가 없어진다. S_ctx(컨텍스트 선택)는 TabFM이 최대 16,384행 테이블로 사전학습되어 그보다 큰 테이블에서는 성능이 떨어질 수 있고, 균일 서브샘플링은 희귀 클래스를 버린다는 문제를 다룬다. sample()은 클래스별 층화나 소수 클래스 오버샘플링으로 여러 컨텍스트 뷰를 만들고, 뷰별 예측을 결합해 하나의 컨텍스트 윈도에 담기지 않는 행까지 활용한다. Ψ_post(후처리와 출력 보정)는 g^-1로 회귀 예측을 원래 타깃 스케일로 되돌리고, 분류에서는 로그오즈를 학습 클래스 사전확률 쪽으로 이동시키거나 temperature·Platt 스케일링을 적용한다. TabFM+에 이미 있는 일반적 연산은 TABFM_KWARGS 설정으로 커버하고, 도메인 공식이나 클래스 균형 컨텍스트처럼 프리셋이 표현하지 못하는 부분만 코드로 쓴다.
어떻게 쓰나
TabArena 벤치마크 51개 데이터셋(분류 38개, 회귀 13개)에서 각 데이터셋은 3-fold 외부 교차검증을 3회 또는 10회 반복해 9개 또는 30개의 공식 train/test split을 만든다. 모든 fold에서 별도로 에이전트 탐색을 돌리는 것은 토큰과 GPU 비용이 감당하기 어려워서, fold 0의 학습셋에서 3-fold 교차검증으로 데이터셋당 한 번만 탐색하고(최대 96회 평가 또는 H100 한 장으로 6시간), P*를 동결한 뒤 모든 fold의 held-out 테스트 split에서 평가한다. 세 가지 에이전트 하네스(Claude Code, Codex, Antigravity)와 두 언어 모델(Claude Opus 5, Gemini 3.8 Flash)을 조합한 다섯 구성이 전체 상위 다섯 자리를 차지했고, 최고 구성(Codex + Opus 5)은 TabFM을 1785.3에서 2013.0 Elo로 끌어올렸다. 4시간 AutoGluon 1.5(extreme)의 1668.4 Elo보다 +272에서 +345 Elo 높다. 분류 38개에서는 TabFM 대비 +197.6 Elo 오른 1966.3 Elo를 기록했고 Antigravity + Gemini 3.8 Flash가 G-Mean 테스트 오류 0.0902로 가장 낮고 데이터셋 승수 16.11로 가장 많았다. 회귀 13개에서는 +467.0 Elo 오른 2512.9 Elo로 13개 전부에서 TabFM을 이겼고 oracle improvability는 0.00%였다. 다섯 번째 구성(Codex + Gemini 3.8 Flash)도 1940.1 Elo다. 공식 테스트 fold 기준 승률에서 Claude Code + Opus 5와 Antigravity + Gemini 3.8 Flash는 50.7% 대 49.3%로 맞섰고, TabFM 상대로는 각각 74.3%와 72.1%(회귀에서는 91.9%와 83.3%), AutoGluon 1.5(extreme) 상대로는 91.3%와 89.5%를 이겼다.
전제와 한계
에이전트가 실제로 무엇을 하는지도 분석했다. 두 구성의 102회 실행 중 97회(95.1%)에서 피처 테이블을 수정했다. 회귀에서는 피처 엔지니어링을 결측값 정제·타깃 변환과 묶어 G-Mean RMSE를 3.11~3.15% 낮췄고, 다중분류에서는 소수 클래스 컨텍스트 선택과 사전확률 보정을 묶어 G-Mean log-loss를 7.64~8.39% 낮췄다. 컬럼 이름이나 태스크 설명이 실제 물리·임상·경제 변수를 가리키는 17개 데이터셋(Cat. I)에서 두 에이전트 모두 스키마에서 바로 도메인 공식을 썼다. 예를 들어 airfoil_self_noise에서는 공력 Strouhal 수를 만들어 테스트 RMSE를 14.6~17.3% 낮췄고, 전체 공식 테스트 오류는 Opus 5 기준 7.3%, Gemini 3.8 Flash 기준 8.2% 줄었다. 이는 익명·일반 스키마 34개(Opus 5 기준, Gemini는 29개)에서 얻은 2.3~3.0% 감소의 약 3배다. 각 구성의 최대 오류 감소 10건 중 6건이 Cat. I에서 나왔다. 피처 테이블을 바꾸지 않은 5회 중 4회는 컨텍스트 샘플링이나 사전확률 보정으로 개선됐고, 하이퍼파라미터만 조정한 1회는 0.30% 나빠졌다. 검증이 테스트로 일반화되는지도 확인했다. 실행당 최대 15개의 중간 체크포인트를 공식 테스트셋에서 평가한 결과 P0에서 전체 예산까지 평균 테스트 오류가 4.0%(Opus 5)~4.7%(Gemini 3.8 Flash) 감소했고 G-Mean 오류는 4.19%와 5.05% 감소했다. 두 구성 모두 탐색 예산의 2.5%(약 3회 평가) 안에 TabFM+(1856 Elo)를 넘어섰고 전체 예산에서 1979~1993 Elo에 도달했다. TabFM 없이 같은 Antigravity 하네스와 Gemini 3.8 Flash, 6시간 예산으로 자유롭게 모델을 학습·앙상블한 코딩 에이전트는 1468.8 Elo로 TabFM-Auto의 1979.6 Elo보다 510.8 낮았다. TabFM의 사전학습 prior가 +316.5 Elo(1785.3까지), 파이프라인 탐색이 +194.3 Elo를 더한 셈이다. 전이 실험에서는 상위 세 구성의 최종 파이프라인을 수정 없이 다른 동결 TFM에 적용했는데(다른 모델이 지원하지 않는 NNLS 뷰 가중, 피처 교차, SVD 피처는 빼고 컨텍스트 크기만 유지), Claude Code + Opus 5의 파이프라인이 TabICLv2를 +143.3, TabPFN-3를 +130.8, EXAONE-Tabular를 +88.7 Elo 올렸다.
MLE-Bench의 표 형식 대회 8개(MLE-Bench-Tabular)에서도 평가했다. 공식 로컬 테스트 split을 쓰고 대회당 24시간 예산을 줬다. 여러 대회에서 핵심 신호가 지진파 파형, 위성 텔레메트리, 3D 분자 좌표 같은 보조 파일에 들어 있는데, 단일 테이블 예측기는 이를 직접 읽지 못한다. TabFM-Auto는 Φ_feat에서 이런 파일을 스펙트럼 에너지나 원자간 거리 같은 표 형식 피처로 요약해 메인 테이블에 조인한 뒤 TabFM을 호출한다. 데이터 처리와 예측 모델을 함께 탐색하는 외부 에이전트들(CAIR MARS+, MLEvolve, Famou-Agent 2.0, R&D-Agent, AIDE)이 일부 대회에서는 앞섰지만, 채점된 pairwise 매치 전체에서 TabFM-Auto가 집계 Elo 1위를 기록했다. 12개 외부 MLE 에이전트와의 매치에서 Claude Code + Opus 5가 1827 Elo로 1위(Kaggle 메달 4개), Antigravity + Gemini 3.8 Flash가 1734 Elo로 2위였다. Opus 5는 전체 채점 매치의 86.7%를 이겼고, 상위 5개 외부 에이전트 각각에 75~88%, 나머지에 83~100% 승률을 냈다.
실무 관점에서 이 논문이 주는 패턴은 명확하다. 예측 모델 자체는 건드리지 않고 그 주위의 데이터 파이프라인만 LLM 에이전트에게 맡기면, 그래디언트 학습 없이 후보를 빠르게 평가할 수 있고 재학습 분산 때문에 작은 개선이 묻히는 문제를 피할 수 있다. 컬럼 이름과 태스크 설명이 실제 의미를 담고 있는 의료·물리·금융 스키마에서 특히 효과가 크고, 익명화된 피처 테이블에서는 이득이 통계·관계형 피처 수준으로 줄어든다. 탐색된 파이프라인이 짧은 파이썬 함수라 읽고 검토할 수 있다는 점, 그리고 다른 TFM에 그대로 옮겨도 성능이 오른다는 점은 사내 파이프라인에 이식할 때 실질적인 이점이다. 다만 데이터셋마다 반복 검증 평가 비용이 들고, 테스트 라벨과 네트워크를 차단한 샌드박스 평가 하네스가 전제라는 점을 함께 확인해야 한다.
저자들이 밝힌 한계는 두 가지다. 익명 테이블에서는 이득이 일반적으로 더 작고, 파이프라인 탐색은 데이터셋마다 반복적인 검증 평가를 요구한다. 향후 방향으로는 데이터셋을 넘나들며 수집한 연산을 재사용 라이브러리로 만들어 새 테이블 탐색을 더 적은 평가로 웜스타트하는 것, 발견된 공식·정제 규칙·타깃 변환·관계형 피처를 사전학습에 넣어 스키마 인식 TFM으로 가는 것, 그리고 이미 보조 파일에서 파생 피처를 조인하고 있으니 다중 테이블 관계형 데이터베이스로 같은 탐색을 확장하는 것을 제안한다.