하나의 트랜스포머 블록을 반복 사용해 깊이별 전문가로 ViT를 대체한다

One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts

arXiv2610.12448v1

Adrian Bulat2026-10-08

무엇인가

표준 Vision Transformer는 L개의 블록을 각각 독립된 파라미터로 쌓는다. 그런데 ViT는 깊이에 따라 서로 다른 동작을 발달시키면서도 CNN보다 층 간 표현 유사성이 크다는 관찰이 있다. 이 논문은 그 긴장에서 출발해, 깊이별 스택을 하나의 순환 블록으로 대체하면서도 정확도에 필요한 깊이 의존 계산을 유지할 수 있는지를 묻는다. 기존 Raptor는 k개의 서로 다른 블록을 순환 적용하고 중간 교사 특징에 정렬했지만, 완전 공유(블록 하나)의 경우와 최종 출력만으로 증류하는 경우는 남겨두었다.

어떻게 동작하나

reViT의 구조는 다음과 같다. 어텐션, LayerNorm, 라우터, 전문가 뱅크를 모두 공유하는 하나의 pre-norm 모듈을 L번 반복한다. 깊이 t에서 정규화 좌표 s_t = t/(L-1)를 2층 MLP 라우터 ψ에 넣어 E개 전문가 로짓을 만들고, softmax(τ=1)로 혼합 계수 g_t를 얻는다. 이 계수는 이미지나 토큰이 아니라 깊이에만 의존하므로 모든 토큰이 같은 값을 쓴다. E개의 완전한 FFN 파라미터 집합(W1, b1, W2, b2)을 g_t로 가중 합성해 하나의 조밀 FFN을 만들고, 개별 전문가는 평가하지 않고 합성된 FFN만 모든 토큰에 적용한다. 즉 깊이를 따라 FFN 파라미터 공간의 연속 경로를 따라가며, L을 바꾸면 같은 경로를 다른 격자로 재샘플링할 뿐이다. 이 스케줄은 깊이에만 의존하므로 배포 시 L을 고정하면 온라인 라우팅·합성 없이 조밀 그래프로 물질화할 수 있고, 대신 깊이마다 FFN 하나씩 저장해야 한다.

무엇과 다른가

학습은 두 방식으로 이뤄진다. 지도학습에서는 DeiT III 레시피로 ImageNet-1k 분류 손실만 쓴다. 증류에서는 동결된 DINOv2 교사의 최종 post-LayerNorm 토큰 텐서와 학생의 최종 표현 사이의 원소별 MSE만 사용하며, Raptor와 달리 중간 특징 증류는 쓰지 않는다. E>1 모델에는 사용 균형 손실(게이트 엔트로피를 최대화), 라우터 z-손실, 전문가 다양성 손실(전문가 파라미터 벡터 간 코사인 유사도 제곱 페널티)을 더한다. 탄력적 깊이 학습에서는 이미지별 DropPath를 완전한 순환 스텝 단위로 적용하고, 남은 스텝을 다시 번호 매겨 좌표를 0에서 1로 펼친다. 추론 시에는 전역 깊이 L을 먼저 정하고 그 L에 맞춰 좌표 격자를 재계산한다.

어떻게 쓰나

지도학습 결과, 추론 FLOPs를 거의 맞춘 조건에서 E=4 reViT는 모든 스케일에서 4블록 Raptor를 0.1~0.2점 앞선다. reViT-B/16은 83.0%로 DeiT III의 82.8%를 넘고, reViT-L/16은 83.8% 대 84.1%로 약 7배 적은 파라미터를 쓴다. S/16 격차는 78.2% 대 79.9%로 더 크지만 전문가를 늘리면 좁혀진다. 저장 파라미터 절감은 초록에서 약 70%, 서론에서 E=4 reViT-B/16 기준 73%로 제시된다. DINOv2-B/14 교사에서 증류한 E=8 모델은 교사의 ImageNet 선형 프로브 정확도를 거의 유지하고 분류·ADE20k 분할·NYUv2 깊이 예측으로 전이된다.

전제와 한계

어떤 MoE 구성이 완전 깊이 재사용에 맞는지도 통제 실험으로 비교한다. 기준 조밀 FFN 대비 명목 FFN FLOPs 비율 U를 1로 고정한 예산에서 reViT가 78.2%, Lory 77.9%, SMEAR 77.7%인 반면 나머지 방법들은 67.8~70.6%에 머문다. U=4로 늘리면 MoEUT가 77.6%까지 따라온다. 증류에서도 U=1에서 reViT가 ImageNet·ADE20k·선형 깊이 헤드에서 가장 좋고, SMEAR만 MLP 헤드 RMSE에서 0.485 대 0.491로 앞선다. Qwen3 적응은 U=1에서 수렴하지 못해 결과를 보고하지 않는다. 저자들은 높은 U 설정이 전문가 수나 폭을 함께 바꾸므로 공통 스케일링 곡선이 아니라 각 방법의 제약 완화 테스트라고 명시한다.

탄력적 깊이 추론에서는 깊이 전용 게이트가 특징 전용 게이트를 크게 앞선다. L=12에서 깊이 전용 변형은 ADE20k 44.4 mIoU, ImageNet 선형 프로브 83.4%, NYUv2 RMSE 0.493인데, 특징 전용 대조군은 ADE20k 약 35.6 mIoU에 그친다. 깊이 전용은 L=16까지 세 지표 모두 개선되어 44.9 mIoU, 83.7%, 0.485를 기록하고 L=24에서도 44.7, 0.487로 근처를 유지한다. 반면 특징 전용 대조군은 L=12 이후 ImageNet과 ADE20k에서 거의 평평하고 NYUv2는 0.498에서 0.507로 나빠진다. 전문가 수를 E=1에서 8로 늘리면 S/16, B/16, L/16에서 각각 9.6, 6.8, 5.7점 오르고, 가장 큰 단일 개선은 모든 스케일에서 E=1→2 구간에서 나온다. E=4를 넘으면 추가 용량은 주로 S/16에 이득이 된다.

분석 파트는 학습된 깊이 프로그램이 무엇을 하는지 보여준다. 지배 전문가는 몇 번만 바뀌고 각각 연속된 깊이 구간을 차지하며, 전환부에서는 게이트가 겹치는 부드러운 혼합을 유지한다. 이 구간과 경계를 지정하는 목적함수는 없는데도 이런 구조가 나타나며, 교사 목표는 최종층 특징뿐이다. 게이트 열을 순열로 바꿔 전문가 배정만 뒤집으면 교사 CKA가 E=4에서 0.793→0.208, E=8에서 0.849→0.202로 떨어진다. 전문가 뱅크를 그대로 두는 것만으로는 교사 정렬이 유지되지 않고, 어느 전문가가 어느 깊이의 계수를 받는지가 중요하다는 뜻이다. 유효 랭크 분석에서는 E=8일 때 S/16이 전문가 7.7, 게이트 7.6, 합성 가중치 7.3으로 거의 모든 방향을 쓰는 반면, L/16은 6.2, 5.2, 4.0으로 합성 가중치가 더 적은 방향에 집중된다. 층별 LoRA 베이스라인은 77.6%로 reViT의 78.2%보다 낮으면서 7.3M 대 6.1M으로 더 많은 압축 파라미터를 저장한다.

실무 관점에서 이 설계의 핵심은 저장 용량과 실행 깊이를 분리한다는 점이다. 가중치 합성 방식은 E를 늘려도 깊이당 조밀 FFN 한 번만 평가하므로 U가 변하지 않아, 같은 추론 FLOPs 예산에서 파라미터를 늘리거나 줄일 수 있다. 또한 하나의 체크포인트로 여러 깊이를 지원하므로 엣지와 서버에 같은 모델을 다른 깊이로 배포할 수 있다. 다만 고정 깊이로 내보내면 깊이마다 합성 FFN을 저장해야 해 배포 저장량이 늘어난다. 저자들이 밝힌 전제도 확인해야 한다. Raptor와의 증류 비교는 중간 특징 대 최종 특징이라는 서로 다른 목적함수를 쓰므로 통제된 절제가 아니라 참조 비교다. 높은 U 설정들은 전문가 수·폭을 함께 바꿔 공통 스케일링 곡선이 아니고, 완전 가중치 공유 구조라서 DeepSeek-V3처럼 초기 층만 조밀 계산으로 남기는 설계는 적용할 수 없다. Qwen3 U=1 적응은 수렴 실패로 결과가 없고, Soft-MoE는 원래 MLP 블록 후반부에만 적용되지만 여기서는 모든 순환 스텝에 적용된다는 차이도 명시되어 있다.