저차원 잠재공간 칼만 추적으로 다시 설계한 온라인 학습, AURA
Online Learning via Learned Latent Bayesian Tracking
무엇인가
이 논문이 푸는 문제는 분포가 시간에 따라 변하는 환경에서의 온라인 학습이다. 데이터 생성 분포가 연속적으로 표류하거나 급격히 바뀌는 상황에서 모델은 스트리밍 샘플로부터 빠르게 적응해야 하고, 동시에 계산·지연 예산은 빡빡하다. 원리적으로 매력적인 접근은 온라인 학습을 베이지안 상태 추적 문제로 보는 것, 즉 모델 파라미터를 시간에 따라 진화하는 상태 벡터로 취급하고 칼만 계열 필터로 순차 갱신하는 것이다. 필터는 단일 스텝 예측-보정으로 불확실성을 전파하는 원리적 절차를 준다. 문제는 현대 딥모델의 파라미터 공간에서 직접 필터링하는 비용이 상태 차원에 대해 최소 제곱, 보통 세제곱으로 늘어난다는 점이다. 그래서 기존 방법들은 공분산 구조를 대각이나 저랭크(DLR)로 제약하거나, 미리 정한 파라미터 부분집합·수동 설계 동역학으로 표현 자체를 제한해 왔다. 저자들은 병목이 필터 자체가 아니라, 필터링을 효율적으로 수행하면서도 모델 표현력을 잃지 않을 저차원 동역학 표현의 부재라고 진단한다.
어떻게 동작하나
제안 방법 AURA(Adaptive Update through Representation Adaptation)는 적응을 원래 파라미터 공간이 아니라 학습된 저차원 잠재공간에서 수행한다. 목표 파라미터 θ*_t를 잠재 상태 z_t ∈ R^m (m ≪ d)와 lifting map G: R^m → R^d로 표현해 θ*_t = G(z_t)로 둔다. 잠재 상태의 진화는 선형 동역학 z_{t+1} = F z_t + v_t로 모델링하며, F는 대각 행렬, v_t는 공분산 Q를 갖는 프로세스 노이즈이고 F = γI (γ<1)인 OU형 동역학도 허용한다. 관측은 OneHot(y_t) = f_{G(z_t)}(x_t) + w_t로 두는데, 교차엔트로피 학습에서 최적 확률 예측기의 불일치는 영평균이고 추정치와 비상관이라는 논거로 w_t를 영평균·공분산 R의 관측 노이즈로 취급한다(부록 B에서 정당화). 온라인 적응은 이 잠재공간에서 확장 칼만 필터(EKF)로 이루어진다. 매 시점 예측 단계에서 ẑ_{t|t-1} = F ẑ_{t-1}, Σ_{t|t-1} = F Σ_{t-1} F^T + Q를 계산하고, 보정 단계에서 칼만 이득 K_t = Σ_{t|t-1} H_t^T (H_t Σ_{t|t-1} H_t^T + R)^{-1}를 이용해 ẑ_t = ẑ_{t|t-1} + K_t(OneHot(y_t) − f_{G(ẑ_{t|t-1})}(x_t))로 갱신한다. H_t는 z ↦ G(z) ↦ f_{G(z)}(x_t) 합성의 야코비안이다. 적응된 전체 파라미터는 θ_t = G(ẑ_t)로 복원한다. 즉 샘플 하나당 한 번의 야코비안 계산과 한 번의 추적 스텝, 그리고 lifting map 순전파만 수행한다.
무엇과 다른가
핵심은 이 잠재 표현을 사람이 설계하지 않고 오프라인에서 메타학습한다는 점이다. lifting map G는 학습 가능한 신경망 ψ_G로, 대각 상태 전이 F와 노이즈 공분산 Q, R까지 함께 φ = {ψ_G, F, Q, R}로 묶어 메타학습 대상으로 둔다. 오프라인에는 여러 개의 비정상 T-길이 궤적 데이터셋이 주어지고, 각 궤적을 하나의 적응 태스크로 취급한다. 각 시점의 첫 샘플을 support, 나머지 샘플을 query로 사용해, 유도된 온라인 적응기가 궤적 전체에서 낮은 누적 예측 손실을 내도록 목적함수 (8)을 최소화한다. EKF 재귀와 lifting map이 모두 미분 가능하므로 온라인 적응 궤적을 통과해 역전파하는 end-to-end 최적화가 가능하다. 저자들은 이를 "빠른 적응에 맞춘 파라미터 공간의 잠재 기하학을 학습하는 것"으로 해석한다. 스텝당 복잡도는 O(n + m²)로, 파라미터 수 d에 대해 최소 제곱으로 늘어나는 파라미터 공간 필터링보다 훨씬 저렴하다. 설계 변수는 잠재 차원 m, F의 구조(예: 스케일 항등행렬 제약), lifting map의 아키텍처다.
어떻게 쓰나
첫 번째 실험은 시간에 따라 변하는 손상(corruption) 스트림에서의 이미지 분류다. MNIST-C, CIFAR-10-C, CIFAR-100-C를 ResNet-18, Wide ResNet-28-10, ResNet-29 백본으로 평가했고, 각 테스트 스트림은 1000 스텝, 스텝마다 100개 손상 입력을 주며 그중 최대 15개에 정답 라벨이 붙는다. 비교 대상은 무적응 모델, 스트리밍 지도 학습인 Online GD와 EKF-FC(마지막 분류층 파라미터 공간 베이지안 추적, CIFAR-100-C에서는 d≈10^5라 전체 공분산이 불가능해 대각 근사), 그리고 배치 단위 TTA 방법인 BN-Test, BN-EMA, BN-Alpha, ROID다. 본문에 따르면 AURA는 MNIST-C와 CIFAR-10-C에서 최저 오류를 기록하며 배치 기반 베이스라인 전부를 앞섰고, 프레임당 5개 수준의 적응 샘플만 사용했다. CIFAR-100-C에서는 전체 2위이면서 스트리밍 베이스라인인 Online GD, EKF-FC를 크게 개선했다. ROID가 CIFAR-100-C에서 최저 오류를 냈지만, 그 손실이 현재 프레임의 배치 통계(다양성·확신도 가중, 클래스 사전 EMA)에 의존해 여러 비라벨 샘플을 요구하므로 스트리밍과 구조적으로 양립하지 않고, 버퍼링 시 버퍼 크기에 비례하는 지연이 생긴다. FLOPs 대비 정확도를 비교한 실험에서는 AURA가 파라미터 공간 적응을 비용-정확도 평면에서 지배했고, 잠재 차원 m을 키우면 초기에는 성능이 오르다가 포화되고 과잉 파라미터화·추정 잡음으로 약간 나빠질 수 있었다. 다만 표 1의 구체적 오류율 수치는 본문 텍스트에 제시되지 않고 표에만 담겨 있다.
전제와 한계
두 번째 실험은 무선 수신기다. 단일 안테나 사용자 3명, 수신 안테나 5개인 상향링크 다중 사용자 검출에 DeepSIC 신경 수신기를 쓰고, QuaDRiGa의 3GPP Indoor Office 시나리오로 채널 실현을 얻는다. RF 프런트엔드 비선형성을 tanh로 모델링한 비선형 채널도 함께 평가한다. 베이스라인은 Online GD와, 전체·대각·DLR 공분산을 쓰는 파라미터 공간 EKF 변형(BONG)이다. 온라인 평가는 150 프레임 동안 진행되며 처음 4개 프레임은 동기화용으로 프레임당 64개 라벨 파일럿을 주고, 이후 추적 구간에서는 프레임당 6개 라벨 파일럿만으로 적응한 뒤 나머지 심볼에 대해 BER을 측정한다. 결과적으로 AURA는 선형·비선형 두 시나리오 모두에서 SNR 스윕 전 구간 최저 BER을 달성했고 시간에 따른 추적 안정성도 더 좋았다. 저자들은 특히 전체 파라미터 베이지안 필터링 대비 이득이 크다는 점을 들어, 성능 향상이 베이지안 업데이트 자체가 아니라 학습된 저차원 잠재 적응 공간에서 업데이트하기 때문이라고 주장한다. 부록 E에는 소프트웨어 정의 라디오 플랫폼에서 밀리초 단위로 자기적응하는 신경 WiFi 수신기 개념 검증도 포함되어 있다.
개발자 관점에서 이 논문이 유용한 지점은 지연 예산이 극단적으로 빡빡한 실시간 적응이다. 오프라인에 배포 환경의 분포 이동을 반영한 라벨된 비정상 궤적을 확보할 수 있고, 배포 시에는 샘플당 한 번의 업데이트로 예측을 내보내야 하는 경우(무선 물리계층, 스트리밍 비전, 엣지 추론)에 맞는 구조다. 도입 시 확인할 것은 잠재 차원 m과 lifting map 파라미터 수 n이 실제 지연 예산에 들어오는지, F를 스케일 항등행렬로 제약할지 여부, 메타학습 궤적이 실제 배포 시의 이동을 대표하는지, 프레임당 라벨이 몇 개나 필요한지(실험에서는 5~6개 수준), 그리고 이 방법이 불확실성 정량화용이 아니라는 점이다. 구현은 공개 저장소에서 확인할 수 있다.
한계와 전제는 저자들이 직접 밝힌다. AURA는 베이지안 신경망 방법이 아니며 전체 예측 모델에 대한 사후분포를 유지하지 않는다. 베이지안 사후는 저차원 잠재 상태에만 국한되고, 예측 모델 파라미터는 θ_t = G(ẑ_t)로 결정론적으로 생성된다. 즉 베이지안 필터링을 불확실성 정량화가 아니라 효율적인 온라인 최적화의 구조적 장치로 사용한다. 방법 전체는 최적 모델 파라미터의 진화가 구조적 저차원 표현을 갖는다는 가설에 기대고 있으며, 과잉 파라미터 신경망의 상당한 중복성, Johnson–Lindenstrauss 보조정리 같은 고전적 차원 축소 결과, 그리고 정칙성 가정 아래에서 분포의 점진적 변화가 압축 표현의 매끄러운 변화를 유도한다는 관찰(부록 B)로 이를 뒷받침한다. 또한 오프라인 메타학습을 위한 라벨된 비정상 궤적 데이터셋 접근을 전제로 하고, EKF이므로 국소 선형화에 의존한다. 잠재 차원을 키우면 표현력은 늘지만 추정 잡음과 과잉 파라미터화로 이득이 포화되거나 약간 악화될 수 있다는 점도 실험에서 드러난 트레이드오프다.