DINOv2 레지스터 토큰은 의미를, 고노름 패치 토큰은 질감을 맡는다
Decoding the Functional Roles of Register and High-Norm Patch Tokens in Vision Transformers
무엇인가
자기지도 Vision Transformer, 특히 DINOv2는 풍부한 시각 표현을 학습하지만 내부 토큰이 각각 무슨 일을 하는지는 잘 알려져 있지 않았다. 특히 배경처럼 정보가 적은 영역에서 L2 노름이 비정상적으로 큰 고노름 이상치 패치 토큰이 나타나는데, Darcet 등은 이런 신호를 흡수하도록 별도의 레지스터 토큰을 입력 시퀀스에 추가하는 아키텍처를 제안했다. 하지만 레지스터 토큰 자체가 무엇을 인코딩하는지, 이상치 토큰과 특징 공간이 겹치는지, 두 토큰이 기능적으로 다른 역할을 하는지는 규명되지 않은 채 남아 있었다. 이 논문은 그 빈칸을 겨냥한다.
어떻게 동작하나
방법의 골자는 토큰 종류별로 희소 오토인코더(SAE)를 따로 학습해 활성 공간을 비교 가능한 희소 특징 사전으로 분해하는 것이다. 표준 DINOv2(facebook/dinov2-small)와 레지스터가 추가된 DINOv2(facebook/dinov2-with-registers-small)의 layer-8 residual stream 활성값을 ImageNet-1k 이미지에서 추출하고, 토큰을 레지스터, 고노름 이상치 패치(레이어8 패치 토큰을 L2 노름 기준 상위 2.37%로 선택), 일반 패치 세 그룹으로 나눈다. 학습 전에는 각 토큰 부분집합에서 계산한 전역 스칼라 σ=√E[‖x‖²]로 활성값을 나눠 기대 제곱 노름을 1로 맞춘다. SAE는 인코더 f(x)=ReLU(W_enc(x−b_dec)+b_enc)로 희소 잠재를 만들고 디코더 x̂=W_dec·f(x)+b_dec로 복원하며, 손실은 재구성 제곱오차에 L1 희소 페널티를 더한 형태다. 품질은 토큰당 평균 비영 활성 개수(L0)와 분산 설명 비율(FVE)로 측정한다.
무엇과 다른가
해석은 세 갈래로 진행된다. 특징마다 상위 k=9 패치 활성값을 뽑아 해당 이미지 패치를 Gemma 3 비전언어모델에 넣어 캡션을 생성하고, UMAP으로 잠재 공간의 전역 구조를 시각화하며, DINOv2 활성값을 CLIP 공간에 투영해 텍스트 개념과의 정렬을 독립적으로 교차 확인한다. 인과 개입은 각 이미지에서 SAE 잠재의 상위 5개 활성 특징을 0으로 만든 뒤 디코딩하고, 최종 레이어 패치 토큰의 PCA 왜곡과 최종 트랜스포머 블록의 헤드 평균 self-attention 맵 변화를 측정하는 방식이다.
어떻게 쓰나
SAE 학습 결과에서 Register full 구성이 FVE 0.809로 가장 높은 분산 설명을 보였고, 코사인 유사도는 Base full이 가장 높았다. 특수 토큰만으로 학습한 SAE는 재구성이 원본 활성 벡터와 덜 정렬되어 약 0.63에 머물렀다. 모든 구성에서 죽은 뉴런 문제는 거의 없었고, 대부분의 잠재 특징은 거의 발화하지 않았지만 Outlier only와 Register only는 상대적으로 더 촘촘하게 발화했다. UMAP에서는 레지스터 특징이 고수준 의미 범주로 군집한 반면, 이상치 특징은 의미 다양성이 낮고 저수준 배경 구조와 질감에 몰렸다. 저자들은 이를 texture sink 가설이라 부르며, 이상치 토큰이 구조·질감 정보의 전용 저장소로 쓰여 주 패치 시퀀스의 의미 처리를 방해하지 않게 한다고 해석한다. CLIP 공간에서 다시 확인한 조직도 SAE-VLM 라벨과 강하게 일치해, 라벨이 VLM 편향의 산물이라는 반론을 밀어낸다.
전제와 한계
인과 실험의 수치가 이 논문의 핵심이다. 상위 5개 레지스터 유래 특징을 제거하면 표현 코사인 유사도가 48.17% 하락하고 attention 맵의 주 객체 국소화 능력도 함께 무너졌지만, 이상치 유래 특징을 제거하면 0.31%만 떨어져 약 150배 차이가 났다. 흥미롭게도 하위 5개 레지스터 특징을 제거해도 47.05%가 하락했다. 레지스터를 하나씩 평균 제거하면 1개일 때는 하락이 약 0.01로 미미하지만 2개째에서 약 0.50으로 급락하는데, 기본 4개 레지스터 기준으로 약 1개분의 안전 여유가 있다는 뜻이다. 이 임계를 넘으면 입력 이미지와 무관하게 동일한 잠재 인덱스 집합 {1153, 1454, 1554, 1389, 1460}이 상위 활성으로 올라오며, 저자들은 이를 Global Register Signature라 부른다. 즉 붕괴를 결정하는 것은 제거된 특징의 의미 정체성이 아니라 레지스터 시스템의 격리 용량을 초과했는지 여부다.
실무적으로 이 결과는 ViT 특징을 dense prediction이나 세그멘테이션, 검색에 쓰는 파이프라인에 직접 시사점을 준다. 레지스터 토큰은 부가적인 슬롯이 아니라 표현 안정성을 유지하는 분산 버퍼이므로, 레지스터가 있는 체크포인트와 없는 체크포인트의 특징 맵을 같은 파이프라인에 섞어 쓰면 안 된다. 레지스터 개수를 줄이거나 중간 레이어에서 잘라 쓰는 구성은 안전 여유 1개를 넘기는 순간 attention이 배경으로 새는 실패 모드를 겪을 수 있다. 또한 SAE로 특징 사전을 만들고 상위 활성 특징을 끊어 인과 효과를 재는 이 방법론은, 자기 모델의 특정 토큰·특징이 실제로 중요한지 디버깅하는 절차로 그대로 응용할 수 있다.
저자들이 밝힌 한계는 분명하다. 의미 분석과 인과 분석 모두 DINOv2 Small 체크포인트의 layer 8에 국한되며, 부속 artifact에 Small·Base·Large의 layer 4·8·11 SAE가 포함되어 있더라도 그것만으로 일반화가 입증되지는 않는다고 못 박는다. SAE는 제한된 컴퓨팅 예산으로 학습되어 더 강한 학습이 더 깨끗하고 안정적인 특징 사전을 줄 수 있고, 상위 활성 예시·VLM 설명·UMAP 같은 정성 도구에 부분적으로 의존하므로 완전한 기계론적 설명은 아니라고 인정한다. 개입 실험은 두 토큰의 기능 차이를 보여주지만 정보가 이 토큰들로 라우팅되는 회로나 그 라우팅이 사전학습 중 언제 나타나는지는 밝히지 못했다. 향후 계획으로 모델 스케일·레이어 복제, texture-routing 회로 추적, 사전학습 중 발생 시점 규명을 제시한다.