VisionHOPE가 이미지 안에서 기억과 학습 규칙을 함께 진화시킨다

VisionHOPE: Visual Backbones as Self-Modifying Learning Systems

HF Daily2609.33325

Siran Peng, Tianshuo Zhang, Tianyu Fu2026-09-27조회 3

무엇인가

비전 백본은 CNN의 지역적 합성곱에서 ViT의 전역 자기어텐션, SSM의 입력 의존 상태 전이, TTT 레이어의 내부 학습기 적응으로 발전해 왔다. 이 흐름에서 시각 연산은 입력마다 점점 더 적응적으로 변했지만, 그 적응을 지배하는 규칙 자체는 학습된 백본에 의해 대부분 미리 정해져 있었다. 이 논문은 이미지를 처리하는 동안 기억하는 내용뿐 아니라 학습하는 방식까지 함께 바꿀 수 있는가라는 질문을 던지고, Nested Learning(NL)의 자기참조(self-referential) 원리를 비전 백본에 이식한 VisionHOPE를 제안한다.

어떻게 동작하나

VisionHOPE의 핵심은 이미지 안에서 함께 진화하는 다섯 개의 결합 메모리다. 콘텐츠를 저장하는 M^m, 키와 값 표현을 생성하는 M^k와 M^v, 학습률을 결정하는 m^η, 유지율(retention)을 결정하는 m^α가 그것이다. 각 메모리는 이전 상태로 현재 토큰 x_t를 변환해 키 k_t, 값 v_t, 학습률 η_t, 유지율 α_t를 만들고, 다시 자기 상태로 v_t를 변환한 자기 목표 v̂_t를 생성한다. 이 목표에 대한 L2 회귀 목적의 출력 공간 학습 신호 g_t를 기존 DGD 업데이트에 대입한 것이 SR-DGD(Self-Referential DGD)이며, 다섯 메모리가 서로의 업데이트 양을 만들어내는 연립 시스템을 이룬다. 쿼리 투영 W_q만 외부 파라미터로 고정되어 콘텐츠 메모리에서 출력을 읽는다.

무엇과 다른가

문제는 이 자기참조 업데이트를 그대로 쓰면 전이 행렬이 확장적(expansive)이 되어 학습이 발산할 수 있다는 점이다. 저자들은 키-값 불일치 δ_t = k_t - v_t를 도입해 전이를 분석하고, 두 가지 보완적 제어를 적용한다. 하나는 자기참조 주입의 크기를 부드럽게 제한하는 소프트 주입 상한(soft injection cap)이고, 다른 하나는 유지 전이의 스펙트럼 노름을 α_t 이하로 묶는 스펙트럼 클램프(spectral clamp)다. 이 두 제어 아래에서 유지 전이 A_t의 스펙트럼 노름은 α_t 이하, 자기참조 주입 B_t는 1-α_t 미만으로 각각 유계가 되며(Proposition 1), 전체 전이 T_t의 스펙트럼 노름이 1 미만이 되어 메모리 프로베니우스 노름이 토큰마다 비증가한다(Corollary 1). 청크 단위 계산에서도 같은 제어가 경계 상태에 대해 동일한 비확장성을 보장한다.

어떻게 쓰나

2차원 특징 맵을 다루기 위해 VisionHOPE는 NL의 청크 공식을 네 방향 스캔(→, ←, ↓, ↑)에 맞게 변형한다. 행 우선 스캔은 행 단위 청크(C=W), 열 우선 스캔은 열 단위 청크(C=H)를 사용해 청크 경계를 이미지 행·열에 정렬하고, 각 방향이 독립적인 다섯 메모리 상태를 유지한다. 네 방향 출력은 원래 격자로 복원된 뒤 학습된 채널별 스케일 λ_r로 융합된다. VisionHOPE 블록은 정규화 → 입력 투영 → 깊이별 합성곱 → VisionHOPE 연산자 → 출력 투영의 잔차 분기와 FFN 잔차 분기로 구성되며, 토큰 수에 선형으로 비례하는 비용을 갖는다.

전제와 한계

실험은 ImageNet-1K 분류(1.28M 학습, 50K 검증, 224×224 단일 크롭 Top-1), COCO 객체 검출·인스턴스 분할(Mask R-CNN, val2017, 1× 스케줄, 1280×800 FLOPs), ADE20K 의미 분할(UPerNet, 512×2048 FLOPs)에서 수행됐다. 비교 대상은 ConvNeXt, InternImage, MambaOut 같은 CNN 계열, Swin, DeiT, FasterViT, TransNeXt, RMT, SOFT++, MILA 같은 ViT 계열, VMamba, LocalVMamba, MambaVision, VSSD, Vim 같은 SSM 계열, H-ViT3, ViT3, Vision-TTT 같은 TTT 계열이다. 저자들은 계층적·평면적 백본 모두에서 모든 스케일 패널의 Top-1 최고 또는 동률 최고를 기록했고, COCO 세 스케일에서 box·mask AP 최고 또는 동률 최고, ADE20K에서 최고 mIoU를 냈다고 보고한다. 다만 본문 발췌에는 표의 구체 수치가 실려 있지 않아 개선폭을 숫자로 확인할 수는 없다. 효율 측면에서 DeiT의 상호작용 비용은 4ND²+2N²D로 토큰 수에 2차 항을 갖는 반면, VisionHOPE는 (5/4)ND²+232ND+1600D√N으로 선형에 가깝고, 활성화 메모리도 DeiT의 O(BND+BN²)와 달리 O(BND)다.

절제 실험은 P-VisionHOPE-S에서 수행됐다. 키·값 메모리의 이미지 내 진화(adaptive K/V)나 학습률·유지율 메모리의 진화(adaptive dynamics)를 제거하면 성능이 일관되게 떨어졌고, DGD의 키 의존 보정 항을 제거해도 마찬가지였다. 안정성 제어에서는 소프트 주입 상한을 제거하면 학습 초반 순전파가 수치적으로 발산했고, 주입 상한을 하드 클램프로 바꾸거나 스펙트럼 클램프를 부드러운 사상으로 바꾸면 안정적이긴 했지만 완전한 제어보다 효과가 떨어졌다. 스펙트럼 클램프를 아예 제거한 경우에는 이 설정에서 정확도가 변하지 않았는데, 저자들은 활성화율이 극히 낮기 때문일 수 있다고 설명한다. 방향성은 한 방향보다 두 방향, 두 방향보다 네 방향이 좋았고, 채널별 스케일과 방향별 초기 상태를 쓰면 추가 이득이 있었다.

개발자 관점에서 VisionHOPE는 고해상도 입력에서 ViT의 2차 비용을 피하면서 입력마다 학습 규칙까지 바꾸는 백본을 선형 비용으로 구성하려는 시도다. 다만 실제 도입 전에 확인할 점이 있다. 첫째, NL의 L2 회귀 업데이트는 행렬값 선형 메모리에 대해서만 명시적으로 유도되어 있어 VisionHOPE도 선형 L2 재귀를 채택한다. 둘째, 안정성 보장은 각 스캔을 따라 메모리 노름이 비증가한다는 조건부 결과이며, 스펙트럼 클램프는 실험에서 거의 발동하지 않아 실제 안정화 기여는 소프트 주입 상한 쪽이 클 수 있다. 셋째, 저자들은 별도의 한계 절을 두지 않았고, 테스트한 모델 스케일과 해상도 범위를 넘어서는 거동이나 실패 사례는 논문에서 다루지 않는다. 코드는 공개되어 있다고만 언급되고 본문 발췌에는 URL이 없다.