ReaLVR가 잠재 시각 추론을 이미지 근거에 묶는다

Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

HF Daily2609.34563

Xi Xiao, Tianchen Zhao, Youngeun Kim2026-09-28조회 5

무엇인가

이 논문은 잠재 시각 추론(LVR)이 실제로 이미지 근거를 보존하는지 의심하는 데서 출발한다. LVR은 멀티모달 대형 언어모델이 모든 추론 단계를 문장으로 쓰는 대신 연속 잠재 토큰으로 중간 계산을 수행하게 하는 방식인데, 텍스트 CoT와 달리 잠재 추론은 직접 관찰할 수 없어 잠재 토큰이 무엇을 학습했는지 감독하기 어렵다. 저자들은 잠재 토큰의 행동과 표현을 통제 실험으로 분석해 잠재 증거-크레딧 격차(latent evidence-credit gap)를 확인한다. 정답을 바꾸는 이미지 교란에 대해 잠재 토큰이 거의 반응하지 않는다는 것이다. 즉 최종 정답 정확도만으로는 잠재 토큰이 답에 필요한 시각 증거를 담고 있는지 판단할 수 없다.

어떻게 동작하나

원인 진단은 학습 절차에 있다. 2단계 LVR 학습에서 1단계는 ROI 주석을 시각 목표 임베딩 시퀀스로 매핑하고, 교사 강제 하에 디코더 은닉 상태가 그 목표를 재구성하도록 잠재 상태를 시각 감독으로 초기화한다. 그러나 2단계 RL과 추론에서는 이런 목표 없이 자유 실행(free-running) 잠재 궤적을 생성한다. 표준 GRPO는 생성된 텍스트만 최적화하고, 정책 재생 시 샘플된 잠재 벡터는 고정 컨텍스트로 취급되어 잠재 궤적 자체에는 역전파가 흐르지 않는다. 결과적으로 정답 보상은 어느 위치에 더 강한 시각 감독이 필요한지, 그 위치가 어떤 증거를 보존해야 하는지에 대한 직접 신호를 주지 못한다.

무엇과 다른가

ReaLVR은 이 격차를 모델 자신의 자유 실행 잠재 궤적에 시각 증거 감독을 얹어 메운다. 온폴리시 증류 원리에 따라 현재 모델로 잠재 궤적을 다시 생성하고 그 재귀 과정에 그래디언트를 유지한다. 감독 위치는 정답 대비로 정한다. 하나의 미분 가능한 잠재 스팬을 만든 뒤 정답과 행동 정책에서 샘플링한 오답들을 각각 교사 강제로 이어 붙이고, 답변 내용 토큰들의 잠재 위치별 어텐션을 디코더 레이어·헤드·내용 위치에 걸쳐 평균해 읽기값 r_t(y)를 얻는다. 정답 읽기값에서 오답 평균 읽기값을 뺀 양의 차이 γ_t = [r_t+ − r_t−]+ 가 선택적 크레딧이 되고, 가중치는 w_t = η/K + (1−η)γ_t 로 정규화된다. 유효한 오답이 없으면 γ_t = 0이 되어 균일 감독만 남는다. 보존할 내용은 시각 대비로 정한다. ROI 마스크로 시각 토큰을 마스킹 평균한 양성 프로토타입과, 불일치 예시에서 같은 방식으로 뽑은 음성 프로토타입 집합을 만들고, 잠재 상태가 양성과 더 유사하고 가장 가까운 음성과는 덜 유사하도록 마진 g_t = sim(z_t, p+) − max sim(z_t, p−) 를 키운다. 증거 손실은 Σ sg(w_t)[m_ev − g_t]+ 로, 가중치에 stop-gradient를 걸어 가중치를 낮춰 손실을 회피하는 지름길을 막는다. 최종 목적함수는 기존 GRPO 목적에 λ_ev 가중치로 이 손실을 더한 형태이며, 비전 인코더와 커넥터는 동결한다. 추론 시에는 원래 LVR 아키텍처와 절차로 K개의 잠재 토큰을 생성하고 답을 디코딩하며, 두 감독 분기는 학습에서만 쓰인다.

어떻게 쓰나

실험은 시각 판별·공간 추론·고해상도 지각을 다루는 5개 벤치마크(MMVP, BLINK, HRBench-4K/8K, MME-RealWorld)에서 수행됐다. 백본은 Qwen2.5-VL, Qwen3-VL, InternVL3, Gemma-3 계열 6종이고, 비교 대상은 Pixel Reasoner, Vision-R1, LVR, ILVR, Monet이다. Qwen2.5-VL-7B에서 ReaLVR은 5개 과제 평균 63.7%로 LVR-SFT 대비 +4.0, LVR-RL 대비 +3.3, Monet-SFT 대비 +2.9, Monet-RL 대비 +1.5, 가장 강한 잠재 추론 비교군인 ILVR 대비 +0.8점을 기록했다. LVR-SFT 대비 향상은 5개 과제 전부에서 나타났고 MMVP +8.4, HR-8K +3.3, HR-4K +2.8이 두드러진다. Qwen3-VL-8B는 61.2%, Qwen3-VL-30B는 65.2%로 LVR보다 1.1점 높다. 235B(Qwen3-VL-235B-A22B)에서는 MMVP 81.9, BLINK 75.4, MME-RealWorld 71.0을 기록했지만 HRBench는 평가하지 않아 5과제 평균은 보고되지 않았다. InternVL3-8B는 58.1%, Gemma-3-12B는 41.6%로 각각 LVR-RL을 3.1점, 2.6점 앞선다. 학습에는 128GB AMD MI250X GPU 800장이 사용됐다.

전제와 한계

메커니즘 분석도 수치로 제시된다. 정답이 바뀌는 4종 이미지 편집 각 512쌍에서 정답 변화율은 81.45~86.33%였지만 LVR의 예측 변화율은 5.66~13.09%에 그쳤고, 격차가 68.36~80.67%포인트에 달했다. 원본과 편집 입력 사이 잠재 상태의 평균 풀링 거리는 ReaLVR이 0.13~0.34인 반면 LVR은 0.0005 미만이다. 잠재 위치별 변동도 ReaLVR의 상위 토큰 변동 격차가 0.07로 Monet 0.02, LVR 변형 0.01보다 집중돼 있다. Gemma-3-12B 어휘 헤드를 실제 잠재 벡터 376개(47개 질문 × 8개 상태)에 적용하면 전부 최상위 토큰이 확률 1.0으로 '<'인데, 이는 1단계에서 학습한 종료 태그 사전 때문이며(코사인 0.41 대 무작위 어휘 행 0.02) 언어적 근거를 노출하지 않는다. 그럼에도 평균 잠재에서 선형 프로브로 BLINK 과제 라벨을 99.9% 정확도로 복원한다. 답변이 가장 많이 주목한 잠재 토큰 8개를 다른 상태는 고정한 채 교체하면 ReaLVR의 정답 확률이 0.70에서 0.59로 떨어진다. 목표 영역 강화 비율은 중간 레이어에서 ReaLVR 약 2, Monet 약 1.6, LVR 1.3 이하다. 추론 예산 K를 0~20으로 스윕하면 짧은 스팬으로도 이득의 상당 부분을 얻고 K=8이 평균 정확도 최고다.

개발자 관점에서 이 논문의 실용적 요점은 개입 지점이 학습 손실 하나뿐이라는 것이다. 아키텍처도 추론 절차도 바꾸지 않고 GRPO 목적에 시각 증거 손실을 더하는 것만으로 잠재 토큰의 근거 보존과 답변 의존도를 함께 끌어올린다. 잠재 추론을 쓰는 MLLM을 파인튜닝하거나 평가할 때, 최종 정답 정확도 외에 이미지 교란에 대한 예측 변화율과 잠재 상태의 교란 민감도를 함께 봐야 한다는 점을 시사한다. ROI 주석이 있는 데이터에서는 영역 단위 감독이 가능하고, 없으면 전체 이미지 목표로 폴백하므로 주석 예산이 제한된 파이프라인에도 적용할 수 있다. 다만 학습 비용은 정책 롤아웃에 정답·오답 분기와 잠재 궤적 재생성을 더한 만큼 늘어난다.

한계와 전제는 원문에 흩어져 제시된다. 시각 목표는 ROI 주석이 없거나 마스크가 비면 전체 이미지로 대체되어 영역 특이성이 약해진다. 유효한 오답이 없으면 선택적 크레딧이 0이 되어 균일 감독으로 퇴화한다. 비전 인코더와 커넥터를 동결하므로 프로토타입 자체는 학습되지 않는다. 고정 컨텍스트 교체 실험은 8개 토큰만 바꾸고 나머지를 고정한 국소적 의존성만 보여주며, 저자들도 이후 상태를 재생성하면 추가 효과가 생길 수 있다고 밝힌다. 235B에서는 HRBench를 평가하지 않아 5과제 평균이 없고, 정답과 오답 ReaLVR 응답의 목표 영역 강화 곡선이 유사해 공간 정렬만으로 정답 여부를 설명할 수 없다는 점도 인정한다. 논문은 벤치마크 정확도를 넘어 연속 잠재 추론의 내부 동역학을 규명하는 연구가 더 필요하다고 마무리한다.