Where-OPD가 합성 장면의 위치 힌트로 MLLM 지각을 넓힌다

Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

HF Daily2610.02117

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc2026-10-01

무엇인가

이 논문은 멀티모달 대형 언어모델(MLLM)의 시각 지각을 on-policy self-distillation(OPSD)으로 끌어올리는 문제를 다룬다. OPSD는 학생 모델 자신의 동결 또는 EMA 복사본을 교사로 쓰되, 교사에게만 학생이 볼 수 없는 특권 정보를 주는 방식이다. 기존 MLLM용 OPSD 연구들은 대개 교사에게 질문 관련 영역을 잘라낸 이미지나 확대 뷰를 주는 식으로 시각 관찰 자체를 더 좋게 만들어 왔다. 그런데 저자들은 이런 접근이 세밀한 확대가 도움이 되는 과제에서만 이득을 주고, 사람이 주석한 그라운딩 데이터나 외부 교사 모델을 필요로 한다는 점을 지적한다. 실제로 그들 평가에서 Vision-OPD는 Qwen3.5-4B의 V*를 8.90점, ZoomBench를 14.56점 올렸지만 CountQA는 10.73점 떨어뜨렸다. 그래서 논문이 던지는 질문은 이렇다. 교사에게 무엇을 보여줄지가 아니라, 이미지 어디에서 근거를 찾아야 하는지를 특권 정보로 줄 수는 없을까.

어떻게 동작하나

제안 방법 Where-OPD는 교사와 학생이 같은 이미지와 질문을 받되, 교사만 텍스트로 된 공간 힌트 h를 추가로 받는다. 즉 학생 입력은 x=(I,Q), 교사 입력은 x+=(I,Q,h)다. 힌트는 질문과 관련된 시각 요소를 지목하고 그 위치를 알려주며, 예를 들어 초록 십자가 몇 개인지 묻는 질문에 대해 "Scanning for green crosses: found one near (377, 400), found one near (213, 805). Counting: 2 total."처럼 각 인스턴스의 좌표와 최종 개수를 나열한다. 이 힌트를 사람 주석 없이 대량으로 얻기 위해 저자들은 장면을 절차적으로 생성한다. 장면은 상태 z = ({(c_i, r_i, u_i, v_i)} i=1..M, b)로 완전히 규정되는데, c_i는 색-도형 범주, r_i는 반지름, (u_i, v_i)는 중심 좌표, M은 객체 수, b는 배경색이다. 렌더링 전에 모든 요소의 정체성·속성·위치가 알려져 있으므로, 범주 c에 해당하는 객체 집합 O_c(z) = {(u_i, v_i) | c_i = c}와 그 개수 N_c를 곧바로 계산해 정답 a와 힌트 h = T(c, O_c(z))를 자동 생성할 수 있다. 학습 데이터 전체 튜플 (I, Q, a, h)가 사람 주석이나 영역 제안, 외부 대형 모델 없이 만들어진다.

무엇과 다른가

학습 목표는 학생이 실제로 방문한 상태에서의 토큰 단위 증류다. 학생 정책에서 궤적 y를 샘플링하고, 같은 접두사에 대해 학생 분포 p_t와 특권 교사 분포 q_t를 비교한다. 교사는 초기 체크포인트에 동결되며(θ̄ = θ0), 계산 효율을 위해 학생의 상위 K=100개 토큰과 대응하는 교사 로짓, 그리고 꼬리 확률 항으로 분포를 근사한 뒤 β=0.5의 일반화된 Jensen–Shannon 발산을 최소화한다. 교사 분포는 고정 타깃으로 취급되어 그래디언트는 학생 쪽으로만 흐른다. 추론 시에는 (I, Q)만 들어가고 힌트는 쓰이지 않는다.

어떻게 쓰나

실험은 Qwen3.5-4B, Qwen3.5-9B, Qwen3-VL-4B 세 모델에서 진행됐다. 학습 데이터는 1024×1024 장면 3,000개로, 7개 도형 클래스와 12개 색, 장면당 12~40개 객체, 반지름 14~64픽셀로 구성되며 한 에폭만 학습한다. 비교 대상은 Vision-OPD, OPD-V, Imagine-OPD, S2VOPD다. 평가는 카운팅(CountQA), 문서 이해(DocVQA, OCRBench), 차트 이해(ChartQA, EvoChart), 일반 지각(CVBench, BLINK, MME-RealWorld, GQA), 환각(HallusionBench, AMBER), 고해상도 세부 지각(V*, HR-Bench 4K·8K, ZoomBench)까지 15개 벤치마크다.

전제와 한계

결과 수치는 뚜렷하다. Qwen3.5-4B에서 ChartQA +7.20점, EvoChart +10.11점, CountQA +2.53점, OCRBench +1.93점이 올랐다. 합성 카운팅 장면만으로 학습했는데도 실제 이미지 벤치마크로 전이되어, CVBench·V*·HR-Bench 4K·8K·ZoomBench·MME-RealWorld·BLINK 평균이 세 모델에서 각각 3.23점, 1.07점, 1.29점 향상됐다. 추론 시 thinking을 켠 결과와 끈 결과 중 좋은 쪽을 쓰면 Where-OPD는 평균 3.28점 오르는 반면 Vision-OPD는 0.45점에 그쳤고, Vision-OPD는 나머지 12개 벤치마크에서 오히려 정확도가 떨어졌다. 정성적으로도 Where-OPD는 정답을 맞히면서 질문 관련 영역 전체에 어텐션을 두는 반면 베이스 모델과 Vision-OPD는 그렇지 못했다.

절제 실험은 특권 정보의 종류가 결정적임을 보여준다. 특권 정보를 아예 주지 않으면 OPSD는 베이스 모델 평균에 머문다. 정답만 주면 71.27, 좌표만 주면 72.35, 좌표와 개수를 함께 주면 72.94로 가장 높다. 반대로 Vision-OPD처럼 대상 객체를 잘라낸 이미지를 주면 평균이 떨어지고 CountQA가 크게 훼손된다. 같은 합성 장면과 학습 스텝에서 SFT와 GRPO는 이득이 미미하거나 없었고 OPSD가 가장 높았다. 교사 갱신에 대해서는 동결(η=0)이 가장 좋았고 η를 올릴수록 성능이 떨어졌는데, 저자들은 합성 이미지로 교사를 갱신하면 약간의 도메인 시프트가 생긴다고 가설을 세운다. 데이터 크기는 3,000 장면이 테스트한 범위에서 최적으로, 장면 밀도가 높을수록 CountQA에는 유리했다.

개발자 관점에서 이 방법의 실용적 가치는 위치 메타데이터를 만들 수 있는 데이터라면 무엇이든 적용 가능하다는 점이다. 객체 좌표와 개수를 아는 시뮬레이터, 합성 렌더러, 혹은 좌표 라벨이 붙은 내부 데이터가 있다면 외부 교사 모델 없이 자기증류 신호를 만들 수 있다. 다만 그대로 가져다 쓰기 전에 확인할 것은 세 가지다. 첫째, 학습 데이터가 절차적으로 생성된 기하 도형 카운팅 장면뿐이라 자연 이미지에는 위치 메타데이터가 없어 힌트 생성 파이프라인을 그대로 옮길 수 없다. 둘째, 교사를 동결하는 것이 최선이라는 결론은 저자들 스스로 가설로 제시한 것이며 다른 데이터 분포에서는 달라질 수 있다. 셋째, 기본 평가가 greedy 디코딩과 thinking 비활성화 기준이므로 실제 서비스 조건과 다를 수 있다. 힌트는 추론 시 완전히 사라지기 때문에 배포 시 추가 비용이나 프롬프트 변경이 없다는 점은 장점이다.