TIDES가 불규칙 시계열에서 선택성과 물리적 시간을 양립시킨다
TIDES: Implicit Time-Awareness in Selective State Space Models
무엇인가
실제 세계의 순차 데이터는 규칙적 격자 위에서 샘플링되지 않는다. 임상 관측은 측정이 지시될 때 도착하고, 웨어러블 기기는 깨어나거나 임계값을 넘을 때 샘플링하며, 금융 이벤트의 간격은 여러 자릿수에 걸쳐 있다. 관측 사이의 경과 시간 자체가 연속 과정에 대한 정보를 담고 있으므로 모델은 이를 올바르게 다뤄야 한다. 문제는 상태공간모델(SSM) 계보가 두 갈래로 갈라지면서 생긴다. S5 같은 연속시간 대각 SSM은 이산화 스텝을 물리적 관측 간격 Δ와 동일하게 두어(Δ̃≡Δ) 불규칙 타임스탬프를 네이티브로 처리하지만, 동역학이 선형 시불변(LTI)이라 토큰별 표현력이 제한된다. 반대로 Mamba 같은 선택적 SSM은 Δ̃를 입력의 학습된 함수로 만들어 토큰별 표현력을 얻는 대신, Δ̃가 더 이상 물리적 샘플링 간격이 아니게 된다. 실제 경과 시간은 입력 특징으로 이어 붙이는 수밖에 없고, 그 관계는 학습 분포 밖으로 외삽되지 않는다.
어떻게 동작하나
TIDES의 핵심 주장은 입력 의존성을 이산화 스텝에서 걷어내 대각 상태행렬로 옮기면 두 설계가 양립한다는 것이다. 구체적으로 Δ̃는 S5처럼 물리적 시간 간격으로 고정하고(Δ̃≡Δ), 대신 각 모드의 감쇠율 Re(Λ)와 입출력 투영 B, C를 입력의 함수로 만든다. 진동 주파수에 해당하는 Im(Λ)는 정적으로 둔다. 저자들은 진동 주파수를 토큰마다 변조하는 것은 해석이 불가능하고, 매 스텝마다 자신의 동역학 기저를 재정의하는 셈이라 일관된 연속시간 신호에 대응하지 않는다고 설명한다. 이 배치에서 선택성은 이산화 스텝이 아니라 연속시간 생성기에 존재하므로, 표현력을 잃지 않으면서 Δ̃를 붕괴시키지 않는다. 저자들은 이를 선택적 암묵적 시간 인지(selective implicit time-awareness)라고 부른다. 시간은 네트워크의 표현이 아니라 아키텍처의 이산화가 처리한다.
무엇과 다른가
구현은 세 개의 선택성 헤드로 이뤄진다. Re(Λ_k)=W_Λ u_k + Re(Λ_0), B_k = W_B u_k + B_0, C_k = W_C u_k + C_0 형태의 아핀 사영이며, 편향 항은 S5의 HiPPO 기반 값으로 초기화하고 사영 가중치는 0으로 초기화한다. 이렇게 하면 학습이 잘 조건화된 HiPPO 재귀에서 출발해 선택성을 매끄러운 섭동으로 학습한다. B와 C의 사영은 파라미터 수 문제 때문에 저랭크로 분해한다(W_B = W_B,up W_B,down). P=128, H=128 같은 설정에서 조밀 사영 하나가 나머지 SSM보다 파라미터가 많아지므로, 비용을 O(PH²)에서 O(rPH)로 낮추고 병목으로 정규화 효과도 얻는다. Λ 헤드는 출력 차원이 P라서 완전 랭크로 둔다. 여기에 Mamba의 depthwise convolution·SiLU·게이팅에 대응하는 잔차 GLU 블록 사영을 선택적으로 추가하고(기본값 d_Λ=d_enc=0), 이산화 직전에 Re(Λ_k)에 RMSNorm, B_k와 C_k에 복소수 변형 RMSNorm을 적용해 학습을 안정화한다. Re(Λ)는 -exp(θ) 또는 -1/(θ²+1/2) 같은 재매개변수화로 항상 안정 반평면에 머물게 한다.
어떻게 쓰나
설계 논증은 Fading Flash라는 통제된 진단 실험으로 뒷받침된다. 40개 검출기 행에 희소한 섬광이 떨어지고 각 검출기는 지수적으로 감쇠하는데, 검출기는 감쇠율이 다른 세 구역(느림·중간·빠름)으로 나뉘고 전역 시계 Δ가 전체 궤적을 늘리거나 압축한다. 이 설정은 두 축을 분리한다. LTI 모델은 하나의 고정된 판독으로 세 감쇠율을 동시에 표현할 수 없고, Δ를 입력의 함수로 학습한 모델은 학습 범위 밖 시계 속도로 외삽하지 못한다. 실험에서 S5는 표현력이 부족해 LTI 바닥에 머물렀고, Mamba 대역은 학습 Δ 분포는 잘 맞췄지만 범위 밖에서 오차가 급격히 커졌으며, TIDES는 세 목표 감쇠율에 고유값을 정확히 배치하면서 넓은 Δ 범위에서 강건했다.
전제와 한계
대규모 실험에서 TIDES는 UEA 다변량 시계열 분류 6개 데이터셋에서 최고 평균 정확도를 기록해 Mamba-3를 평균 약 1.5포인트 앞섰고 6개 중 2개에서 1위를 차지했다. Physiome-ODE 회귀(50개 불규칙 시계열 예측 데이터셋)에서는 평균 순위 2.40으로 LinODEnet(2.62)을 앞서며 데이터셋별 승수는 16/50으로 동률이었다. 다만 평균 순위 차이의 부트스트랩 95% 신뢰구간은 [-0.87, +0.34]로 0을 포함한다(다소 TIDES 쪽으로 치우침). EigenWorms에서 관측 밀도를 바꾸는 random drop 실험에서는 TIDES가 최고 평균 정확도 0.739를 내고 r_test 전 구간에서 평탄하게 유지된 반면, Mamba·Mamba-2·Mamba-3는 r_test≤0.7까지는 대등하다가 r_test=0.9에서 약 0.7에서 0.4~0.6으로 무너졌다. Im(Λ)까지 입력 의존적으로 만든 변형은 도움이 되지 않고 오히려 약간 해로웠다. 천문·농업·뉴로모픽·기후의 네이티브 불규칙 8개 데이터셋에서는 TimeSen2Crop, EuroCropsML(p=0.0015), USHCN에서 최고 보고 결과를 냈고, SHD와 SSC에서 Event-SSM을 앞섰다. 변광성 벤치마크에서는 MACHO에서 iTCN과 동률, ASAS-SN에서 근소하게 아래였으며(8개 분할 평균 쌍별 차이 +0.13±0.32와 -0.36±0.17), DVS128에서는 갱신된 Event-SSM보다 약간 낮았다. 전체 실험은 A100 약 5,000 GPU-시간을 사용했다.
개발자 관점에서 이 논문의 실용적 메시지는 이산화와 표현력을 분리하라는 설계 원칙이다. 물리적 샘플링 간격 Δ_k는 연속시간 생성기를 이산 재귀로 바꾸는 규칙을 통해서만 들어가야 하고, 표현력은 연속시간 생성기 자체에 두어야 한다. 이 분리가 모델을 표현력 있게 만들면서 동시에 샘플링 체제 변화에 외삽 가능하게 만든다. 불규칙 임상·센서·시뮬레이션 시계열, 특히 웨어러블처럼 스트림이 불규칙하게 도착하고 센서가 끊겼다 재개되는 자원 제약 환경에 적합하다고 저자들은 본다. 다만 실제 도입 전에 확인할 것은 하이퍼파라미터 탐색 비용이다. 저랭크 랭크 r, 사영 깊이 d_Λ·d_enc, Λ 재매개변수화 선택이 추가로 튜닝 대상이며, 구현이 하드웨어 인지 커널이 아닌 일반 병렬 스캔을 써서 실측 지연 시간 비교는 아키텍처 수준으로 읽어야 한다.
저자들이 밝힌 한계는 분명하다. TIDES를 언어모델링이나 규칙 격자 장거리 벤치마크에서 평가하지 않았으므로 결과는 불규칙 시간 영역에 주로 해당하며, Mamba의 범용 대체재라고 주장하지 않는다. Fading Flash는 실패 모드를 분리하기 위한 통제된 진단이지 실세계 이점의 증거가 아니며, 그 근거는 UEA와 Physiome-ODE에서 온다. 입력 의존적 Im(Λ)가 나쁜 선택성 대상이라는 주장은 개념적이며 경험적 검증이 제한적이고 형식적 표현력 결과를 제공하지 않는다. 향후 방향으로는 Δ_k가 벽시계 시간이 아니라 호 길이 같은 임의의 연속 파라미터를 인코딩하는 경우로의 확장, 다음 관측 지점을 결정하는 능동 샘플링과의 결합, 재학습 없이 임의의 미래 스텝에서 예측하는 anytime forecasting의 열화 특성 규명을 제안한다.