LoopVL이 순환 트랜스포머를 비전언어 모델로 확장한다
LoopVL: Recurrent Visual Intelligence
무엇인가
순환 트랜스포머는 Universal Transformer 이후 깊이 확장의 대안으로 다시 부상했지만, 기존 연구는 대부분 언어 모델에 머물렀다. 비전언어 모델에서는 사정이 다르다. 이미지는 명시적 공간 구조를 가진 후보 증거를 제공하고, 지시문이 그중 어떤 영역이 현재 질의에 relevant한지를 결정한다. 한 번의 시각-언어 상호작용이 끝나면 시각 토큰의 표현과 상대적 중요도가 모두 달라질 수 있으므로, 순환 계산은 단순히 계산 깊이를 늘리는 수단이 아니라 계속 진화하는 시각-언어 상태 위에서 작동해야 한다. 이 논문의 중심 질문은 이것이다. Loop Transformer를 비전언어 모델로 효과적으로 확장할 수 있는가.
어떻게 동작하나
LoopVL의 구조는 다음과 같다. 시각 인코더는 Penguin Vision Encoder를 동결해 쓰고, 패치당 1024차원 특징을 2층 GELU 프로젝터로 1536차원으로 사영해 시퀀스의 예약된 시각 슬롯에 넣는다. 언어 백본은 HRM-Text 오픈소스 프레임워크 위에 세워졌고, 서로 파라미터를 공유하지 않는 L 스택과 H 스택이 각각 16개 트랜스포머 층으로 구성된다. 스택 내부 파라미터는 반복 호출 사이에 공유된다. 기본 H2L3 설정의 실행 순서는 L→L→L→H(모델 루프 1) → L→L→L→H(모델 루프 2)이며, 여기서 L과 H는 개별 어텐션 층이 아니라 완전한 모듈 호출을 뜻한다. 따라서 백본이 저장하는 것은 16층 스택 두 개뿐이지만, 한 번의 완전한 순전파는 128번의 트랜스포머 층 호출을 수행한다. H 상태는 스케일된 입력 임베딩에서 초기화되고 L 상태는 0으로 초기화되어 모델 사이클 간 유지된다. 각 사이클이 시작될 때 초기 투영 시각 임베딩에서 가져온 고정 앵커를 H 상태의 시각 위치에 다시 주입하는데, 질의 조건부 토큰별 시각 게이트와 학습 가능한 사이클별 스케일이 그 강도를 조절한다. 시각 토큰은 이미지 그리드의 행·열 좌표를 쓰는 2차원 공간 RoPE를, 텍스트 토큰은 두 좌표가 동기적으로 진행해 사실상 1차원 RoPE와 같아지는 2차원 좌표를 쓴다. 어텐션에는 PrefixLM 마스크가 적용된다. 학습에서는 선택적 역전파를 쓴다. 역전파 웜업 동안 활성 그래프가 마지막 두 호출(L6, H2)에서 마지막 다섯 호출(L4, L5, L6, H1, H2)로 확장되고, 앞선 L1~L3는 그래디언트 계산에서 제외된다. 순전파에서는 모든 호출이 실행된다.
무엇과 다른가
순환이 실제로 값을 하는지는 동일한 0.14T 토큰 예산으로 학습한 세 개의 비순환 Transformer-VL 베이스라인과 비교해 확인한다. Transformer-VL 1B는 32층·은닉 1536으로 LoopVL과 고유 층 수와 은닉 차원이 같지만 각 층을 한 번만 실행한다. Transformer-VL 4B (Deep)는 78층·은닉 1792로 깊이를, Transformer-VL 4B (Wide)는 32층·은닉 2816으로 너비를 늘린 모델이다. LoopVL은 32층 Transformer-VL 1B를 모든 벤치마크에서 앞서는데, MMStar는 55.33에서 63.47로, RealWorldQA는 55.29에서 70.98로, ChartQA는 51.12에서 74.52로 올라간다. 고유 층 수는 같은데 실행 깊이가 32회에서 128회 호출로 늘어난 효과다. 더 중요한 것은 약 1B 규모 언어 백본을 유지하면서 더 큰 밀집 모델에 근접하거나 앞선다는 점이다. 두 대형 모델의 추정 학습 FLOPs가 각각 2.89×10^21과 2.99×10^21인 반면 LoopVL은 2.47×10^21이다.
어떻게 쓰나
시각 토큰을 루프 안에서 계속 갱신하는 것이 핵심 설계다. 인코더 특징은 처음에는 개별 패치를 기술하지만, 순환 언어 백본에 들어간 뒤에도 해당 은닉 상태가 계속 업데이트된다. 파라미터 공유는 각 순환 단계의 변환을 고정하지만, 각 호출이 받는 상태는 계속 변한다. 첫 사이클이 시각 상태를 바꾸고 나면 같은 공유 모듈이 다음 호출에서 다른 입력을 받아 다른 시각 업데이트와 어텐션 배분을 낼 수 있다. 시각 위치가 이미지 패치와 공간적으로 대응되므로, 같은 물리적 층을 사이클별로 정렬해 시각 증거가 어떻게 재배분되는지 직접 관찰할 수 있다. 논문은 LogicVista, RealWorldQA, VMCBench-DEV, MMStar에서 네 조건을 비교한다. 표준 학습·추론을 쓰는 Normal이 네 평가 모두에서 가장 높고, 첫 사이클은 그대로 두고 이후 시각 상태 갱신을 막은 추론 전용 통제들과, 첫 사이클에서만 시각 상태 갱신을 허용하고 학습·검증·생성 전반에 같은 읽기 전용 규칙을 적용해 별도로 재학습한 변형이 그보다 낮다. 재학습 변형은 H2L3 스케줄과 두 개의 16층 공유 스택, 최종 H 상태 readout을 그대로 유지한 채 첫 사이클 경계에서 L/H 시각 상태 참조를 저장하고, 두 번째 사이클에서 writeback 후 각 참조로 복원하며, 모듈 내부의 시각 잔차 상태도 어텐션과 피드포워드 갱신 후 복원한다. 시각 토큰은 남아서 읽히지만 비시각 상태는 계속 갱신된다.
전제와 한계
학습 파이프라인은 텍스트 사전학습 75B 토큰(HRM-Text 공개 데이터 레시피 60B + 자체 큐레이션 15B)에서 출발한다. 시각 언어 정렬 단계는 LLaVA-559K WebDataset에 0.33B 토큰을 쓰고, 최대 시퀀스 길이 2048, 이미지당 256~1024개 시각 토큰을 쓰며 인코더와 언어 백본을 동결한 채 시각 인터페이스만 학습률 10^-3, 전역 배치 256으로 최적화한다. 멀티모달 중간학습 단계는 OneVision-1.5 Mid-Training-85M에 49B 토큰을 쓰고, 최대 시퀀스 길이 3072, 전역 배치 128, 언어 백본 학습률 2×10^-5, 프로젝터 10^-4로 둘 다 갱신한다. 이후 지도 미세조정은 16.81B 토큰(OneVision-1.5 Instruct-22M 13B, OneVision Spatial-4M 3B, LLaVA v1.5 Mix665K 0.55B, Vision-R1-Cold 0.26B로 각각 약 77.3%, 17.8%, 3.3%, 1.5%)을 쓰고, 이어 GRPO 기반 시각 강화학습을 Vision-R1-RL 0.006B 토큰으로 수행하며 최대 생성 길이를 2048에서 4096으로 늘리는 점진적 사고 억제 훈련을 적용한다.
평가는 일반 이해, 환각, 수학, 과학에 걸친 16개 벤치마크 패밀리에서 VLMEvalKit과 공식 스크립트로 수행하고, greedy 생성으로 단답 과제는 최대 32토큰을 쓴다. 논문이 보고하는 흥미로운 관찰은 루프를 거치며 시각 어텐션이 뚜렷하게 이동하는 Visual Aha Moments다. 다만 저자들은 6.4절에서 어텐션 맵을 인과적 설명이 아니라 배분 진단으로 취급한다고 명시한다. 어텐션 맵은 쿼리가 특정 위치에 더 많은 가중치를 준다는 것을 보여줄 뿐, 그 위치를 통해 전달되는 정보나 최종 응답에 대한 필요성을 확립하지 않는다. 반사실적 어텐션 실험은 크게 다른 어텐션 분포도 예측을 보존할 수 있음을 보였고, 어텐션 분포가 헤드 출력만으로 유일하게 복원되지 않을 수도 있다. 따라서 visual aha moment는 그 좌표계에서의 증거 재배분을 기술하는 용어이며 심리적·인과적 전제를 추가하지 않는다.
실무 관점에서 이 논문이 남기는 가장 중요한 경고는 회계의 문제다. 순환 계산은 저장된 파라미터 수와 토큰당 실행되는 변환 횟수를 분리하므로, 파라미터 저장량이 같다고 학습 FLOPs나 wall-clock 비용이 같지 않다. 파라미터 수, FLOPs, 지연시간, 처리량, 메모리는 특히 소수 파라미터를 여러 순차 단계에 재사용할 때 서로 어긋날 수 있다. 저자들은 LoopVL이 선행 연구 Loopie의 처리량 값이나 메모리 결과, compute-matched 결론을 상속하지 않는다고 못 박는다. 동결 시각 인코더, 가변 시퀀스 길이, 선택적으로 활성화되는 역전파 그래프, 인터페이스 계산 때문에 별도의 회계가 필요하다는 것이다. 또한 데이터 경계도 중요하다. 내부 순환은 실행 연산을 늘리지만 서로 다른 데이터 제시 횟수를 늘리지는 않으며, 원본 레코드·분할된 응답·반복 제시·유효 시퀀스 토큰·감독 대상은 각각 다른 회계 범주다. 평가 비교 역시 동일한 과제 변형, 프롬프트, 디코딩 프로토콜을 요구한다.
저자들이 밝힌 한계는 분명하다. 추론 지향 후보정 실험이 주로 수학 추론에 집중되어 있고, 제한된 데이터 설정에서 장문 추론이 반복 토큰이나 반복 추론 구간에 빠져 유효한 해에 도달하지 못하는 경우가 있다. Visual Aha Moments를 연구하기 위한 더 일반적인 Model-Loop 아키텍처의 매칭 컨트롤은 계산 제약 때문에 학습하지 못했으며, 관찰된 사이클 간 어텐션 이동이 서로 다른 역전파 경로와 시각 앵커-게이트 제거 후에도 지속되지만 이것이 Model-Loop 계산에 본질적으로 연관된 것인지 LoopVL 특유의 다른 설계 선택에 의존하는 것인지는 완전히 확립되지 않았다. 또한 HRM-Text 기반의 계층적 순환 구조 하나만 특성화했고, 동결 시각 인코더를 쓰는 이미지 기반 과제만 다뤘다. 다중 이미지 이해, 비디오, 상호작용·에이전트 환경은 탐색하지 않았으며, 추론 스윕은 길이 외삽이나 적응적 정지 규칙, 무제한 테스트타임 스케일링을 확립하지 않는다.