Atomizer-IO는 관측을 원자로 다뤄 격자 가정을 걷어낸다
Atomizer-IO: Beyond Pixels, Patches and Grids
무엇인가
컴퓨터 비전 모델 대부분은 입력이 정규 격자 위에 있다고 가정한다. CNN과 ViT 모두 채널과 공간 배치가 미리 정해진 텐서를 다루며, RGB 이미지는 이 인터페이스에 잘 맞는다. 그러나 지구관측(EO)에서는 분광 내용, 공간 샘플링, 획득 시각, 기하까지 센서마다 달라진다. 단파적외선 측정과 SAR 후방산란은 텐서상 비슷한 위치를 차지해도 전혀 다른 물리량인데, 기존 구조는 측정의 정체성을 채널 위치로 암묵적으로 인코딩한다. 최근 EO 모델들은 결측 채널을 패딩하거나, 해상도를 리샘플링하거나, 불규칙 관측을 격자에 밀어 넣는 식으로 각 변동 축마다 별도 장치를 붙여 대응한다. 이 논문은 그 순서를 뒤집어 관측을 먼저 두고 구조를 나중에 유도하자고 제안한다.
어떻게 동작하나
핵심 표현 단위는 원자(atom)다. 각 관측은 측정값 v와 획득 메타데이터 u1…uJ로 기술되고, 토큰 f = [φ0(v), φ1(u1), …, φJ(uJ)]로 인코딩된다. φ들은 파장·해상도 같은 메타데이터 필드별 인코더이며, 토큰은 공간 위치 pi와 짝지어져 집합 F = {(fi, pi)}를 이룬다. 위치 pi는 토큰에 넣지 않고 공간 샘플러에서만 쓴다. 2D 래스터에서는 원자 하나가 한 화소·한 분광밴드·한 획득 시각의 측정이고, 3D 점군에서는 고도가 측정값이 되며 센서 식별자, 펄스 내 반사 위치, 반사 강도가 메타데이터가 된다. 채널 수나 격자에 의존하는 요소가 없어 LiDAR 반사와 영상 화소를 같은 입력 집합에 함께 넣을 수 있다.
무엇과 다른가
공간 샘플러는 질의 집합 Q와 문맥 집합 C 사이의 관계를 정한다. 인코더에서는 입력 원자가 문맥, 공간 잠재가 질의가 되어 각 원자를 가장 가까운 잠재에 배정하고, 이것이 보로노이 분할을 만든다. 디코더에서는 반대로 각 질의가 가장 가까운 k개의 잠재를 모은다. 정보는 질의 방향으로만 흐르고, 상대 오프셋 δ = pi − pj를 NeRF식 푸리에 특징으로 인코딩해 문맥 특징에 이어 붙인다. 인코더는 입력 관측 수에 비례해 L개의 공간 잠재를 균일 배치하고, 같은 초기화 h_init을 공유하는 잠재들을 국소 크로스어텐션으로 갱신한다. MLP와 어텐션 가중치를 잠재 전체가 공유하므로 파라미터 수는 L과 무관하다. 조밀한 문맥에서는 잠재마다 최대 m개 인덱스만 무작위 표집해 어텐션 비용을 묶는다. 15채널 512×512 입력을 쓰는 Sen1Floods11에서 전역 크로스어텐션으로 같은 수의 질의–문맥 상호작용을 맞추려면 입력 원자의 99.987%를 버려야 한다는 비교가 제시된다. 프로세서는 공간 잠재와 G개의 학습된 전역 잠재 위에 B개의 전역 셀프어텐션 블록을 쌓고, 잠재 간 공간 관계는 앵커 위치 기반 2D RoPE로 표현하되 학습된 압축 스케일을 쓴다. 시간축은 전용 모듈 없이 메타데이터로 처리하거나, 타임스텝별로 인코딩한 뒤 학습된 집계 토큰을 가진 소형 트랜스포머로 합칠 수 있다. 디코더는 요청된 위치마다 질의를 만들어 주변 잠재에 국소 크로스어텐션하고, 조밀 예측에서는 목표 위치에 함께 놓인 원자들을 추가로 참조한다(U-Net 스킵 연결에 해당).
어떻게 쓰나
실험은 격자 가정을 단계적으로 완화하며 진행된다. 먼저 감지 방식, 채널 수, 시계열 길이, 해상도, 입력 크기, 예측 문제가 모두 다른 8개 EO 데이터셋에서 ResNet50, ViT, RAMEN, UniverSat, Perceiver-IO와 비교했고, Atomizer-IO는 공간적으로 명시적인 과제에서 1위 4개, 2위 2개를 기록했다. 다만 EuroSAT, ForestNet처럼 공간성이 약한 분류에서는 Perceiver-IO 대비 우위가 없다고 저자들이 밝힌다. 결측 채널 실험(Sen1Floods11, BioMassters)에서는 여섯 가지 입력 구성 전반에서 평균 성능이 가장 좋았고, 특정 밴드나 센서 전체가 빠졌을 때 이점이 가장 컸으며 RGB만 남으면 이점이 거의 사라졌다. 출력 밀도 실험에서는 Zone-probe와 Quadtree 두 적응 전략으로 하나의 체크포인트가 다양한 추론 비용 구간을 커버함을 보였다. 격자를 완전히 제거한 LiDAR 실험(DALES, FRACTAL)에서는 3D 전용 설계 없이 DALES 3D 베이스라인 세 개를 앞서고 FRACTAL에서 최고 성능을 냈지만, KPConv와 SPT에는 뒤진다. 통제 실험으로 MNIST에서 RoPE를 제거하면 정확도가 99.37에서 29.48로 떨어지는 반면 Sen1Floods11에서는 mIoU가 93.17에서 92.42로만 줄어, 국소 관측 자체에 정보가 많은 과제는 공간 추론 의존도가 낮다는 점을 보였다. 학습 때 보지 못한 입력 기하에서는 배경 화소를 25%만 남겼을 때 Atomizer-IO가 94.93%를 유지한 반면 동일 파라미터 ViT는 72.17%로 떨어졌다.
전제와 한계
실무적으로 이 설계가 유용한 지점은 센서 구성이 고정되지 않은 파이프라인이다. 채널이 바뀔 때마다 모델을 다시 설계하거나 결측 밴드를 0으로 패딩하는 대신, 관측과 메타데이터를 그대로 원자로 넣고 위치만 물리 좌표로 주면 된다. 추론 비용을 학습 후에 조절할 수 있다는 점도 배포 단계에서 의미가 있다. 다만 도입 전에 확인할 것은 두 가지다. 첫째, 이점은 공간적 맥락이 중요한 과제에서 나타나며 공간성이 약한 분류에서는 범용 집합 기반 구조와 차이가 없다. 둘째, 어텐션 비용은 잠재당 표집 예산 m과 잠재 수 L에 좌우되므로 자기 데이터의 원자 수와 해상도에서 실제 처리량을 재봐야 한다.
저자들이 밝힌 한계도 분명하다. 출력 밀도를 줄이는 Zone-probe의 탐침 일치는 보장이 아니라 휴리스틱이며, 정확한 조밀 평가와 비용 절감 사이의 트레이드오프를 반영한다. 3D에서는 DALES에서 KPConv, SPT와의 격차가 남아 있어 기하 적응형 3D 잠재 분할, 계층적 추론, 더 정밀한 국소 3D 모델링이 향후 과제로 남는다. 애초에 3D 전용 구조를 능가하는 것이 목표가 아니라 프레임워크의 유연성을 보이는 것이 목표라고 명시한다. 또한 MNIST 실험은 공간 구조를 분리해 보기 위한 통제된 설정이며, 모든 모델을 사전학습 없이 처음부터 학습시켜 아키텍처 차이만 비교했다는 조건도 함께 기억해야 한다.