FocusVTC가 시각 텍스트 압축의 해상도 딜레마를 적응형 확대로 푼다
FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution
무엇인가
긴 문맥 추론은 어텐션 연산, 추론 지연, KV 캐시 메모리를 크게 잡아먹는다. 시각 텍스트 압축(VTC)은 텍스트를 페이지 이미지로 렌더링해 비전 언어 모델이 훨씬 적은 시각 토큰으로 같은 문서를 담게 하는 접근이다. 문제는 고정 해상도다. 낮은 DPI는 토큰을 아끼지만 정확한 글자를 흐리고, 높은 DPI는 문서 전체에 토큰을 쓰면서 관련 없는 대목까지 선명하게 만든다. Glyph는 조밀 렌더링에 지속 사전학습과 사후학습을 결합했고, DeepSeek-OCR은 압축된 시각 표현에서 텍스트를 복원하는 문제를 다뤘지만 이 딜레마 자체는 남아 있었다. 저자들의 핵심 관찰은 전역 문맥 커버리지와 국소 정독이 같은 해상도를 쓸 필요가 없다는 것이다.
어떻게 동작하나
FocusVTC는 저해상도 전역 뷰를 유지한 채 추론 도중 필요한 영역만 고해상도로 확대한다. 모델은 질문과 저해상도 페이지들로 시작해 추론 세그먼트를 생성하고, 그다음 행동으로 최종 답변이나 영역 확대 호출을 고른다. 확대 호출은 페이지 번호와 정규화된 바운딩 박스([0,1000]^4)를 지정하고, 도구는 같은 페이지를 더 높은 DPI로 렌더링한 이미지에서 해당 영역 픽셀만 잘라 관측으로 돌려준다. 좌표가 원본 페이지 기준이라 저해상도 뷰와 고해상도 뷰가 정렬되고, 모델은 추론·행동·관측을 이력에 붙여 답을 내거나 호출 예산을 다 쓸 때까지 반복한다.
무엇과 다른가
학습은 두 단계다. 먼저 29.4K 규모의 REL-CoT(Reasoning-Evidence Localization chain-of-thought) 데이터를 만들었다. ChatQA·ChatQA2·TriviaQA·HotpotQA·2WikiMultihopQA·MuSiQue·FinQA에서 후보를 모으고, DeepSeek V4 Flash로 상식만으로 답할 수 있는 질문을 걸러낸 뒤, Gemini 3.5 Flash가 페이지 인덱스와 정규화 바운딩 박스를 포함한 추론 흔적을 달고, GPT-5 mini가 그 영역이 정답을 뒷받침하는지 독립 검증한다. 이 데이터로 48·60·72·84·96·120·144 DPI 일곱 해상도에서 REL-SFT를 수행해 근거 위치 찾기를 가르친다. 이어 GRPO가 완전한 상호작용 궤적을 과제 수준 보상으로 최적화하며 언제 어디를 확대할지, 관측을 어떻게 추론에 통합할지, 언제 멈출지를 학습한다. 보상은 정답 0.8과 형식 0.2에 정답일 때만 켜지는 도구 보너스를 더한 형태이고, 도구 보너스는 초기 해상도가 낮을수록 커지는 가중치, IoU 기반 위치 정확도, 호출 효율(서로 다른 정답 영역 수 대비 호출 수)의 곱이다. 별도 지속 사전학습 단계는 없다.
어떻게 쓰나
렌더링 자체도 실험 대상이다. 15개 폰트를 8개 포인트 크기에서 문자 오류율(CER), 시각 토큰 비용, 혼동하기 쉬운 문자열로 평가했더니 DejaVu Sans와 Verdana가 9pt에서 처음 5% CER 기준을 통과했고, 보간 임계값은 각각 8.69pt, 8.68pt였다. 기준을 통과한 폰트 중 DejaVu Sans가 32K 토큰 문맥당 8,368.4개로 Verdana(8,417.8개)보다 저렴했고, 혼동 문자열 CER도 0.30%p 낮았다(95% CI [-0.52, -0.09]). 저자들은 DejaVu Sans 9pt에 1pt 줄 간격을 더한 설정을 쓰며, 이 선택만으로 LongBench가 54.93에서 56.40으로 올랐다고 보고한다.
전제와 한계
72 DPI RULER v1에서 도구 관측을 포함해 2.9배 압축으로 87.4점을 냈다. 같은 조건에서 Glyph는 3.0배 압축에 57.5점이다. LongBench에서는 56.40으로 텍스트 입력 백본 Qwen3.5-9B(55.86)를 앞섰고, 고정 72 DPI의 같은 백본 대비로는 20.54점 높다. MRCR에서는 6개 길이 구간 매크로 평균이 31.65에서 45.56으로 13.91점 올랐고, 2/4/8개 바늘 평균은 60.76/45.21/30.71로 Glyph의 42.63/25.97/16.57을 크게 앞선다. VTCBench에서는 검색·추론·기억 전체 매크로 평균 51.19를 기록했다. 일반 멀티모달 성능도 유지돼 MMMU는 65.12에서 66.73으로, MME는 2424.02에서 2457.62로 올랐다. 토큰 비용은 RULER v1 72 DPI에서 프롬프트 2,154개와 추가 관측 723개, 합계 약 2,877개로 8,400토큰 텍스트 문맥 대비 2.9배 압축이다. MRCR 최장 구간에서는 텍스트 197,909토큰이 프롬프트 53,181토큰이 되고, 바늘 관측 7,296/10,290/13,048토큰을 더해도 3.3/3.1/3.0배 압축을 유지한다. 64K–128K 4바늘 MRCR에서 온라인 종단 간 지연은 텍스트 대비 2.79배 빨랐다(오프라인 페이지 렌더링 제외).
학습 구성 요소의 기여도도 분리돼 있다. REL-SFT는 GRPO의 유용한 초기화로, SFT 없이 GRPO만 한 모델 대비 보고된 9개 집계 중 8개를 개선했다(LongBench 49.30에서 56.40). 유일한 예외는 VTCBench 추론(38.15에서 36.25)이다. 도구를 정책 학습 없이 붙이면 오히려 나빠진다. Qwen3.5-9B+tools와 GRPO 없는 FocusVTC+tools는 각각 도구 없는 버전보다 모든 집계에서 낮았고, GRPO 없는 FocusVTC는 도구를 켜면 LongBench가 37.86에서 25.41로 떨어졌다. GRPO를 거친 뒤에는 GRPO 없는 도구 버전을 9개 집계 모두에서 앞서며 RULER v1이 22.98에서 87.38로 뛴다. GRPO 진행 과정을 보면 0–36 스텝에서는 호출 수와 응답 길이가 늘면서 IoU가 오르고, 36–60 스텝에서는 호출이 줄고 IoU가 잠시 내려가며, 60–150 스텝에서 응답이 짧아지고 IoU가 안정화되면서 점수가 최고 체크포인트에 도달한다. 탐색적 도구 사용이 선택적 근거 수집으로 바뀌는 과정이다.
실무적으로 이 논문은 긴 문서를 통째로 넣지 말고 저해상도로 훑게 한 뒤 필요할 때만 확대해서 읽게 하라는 설계를 수치로 뒷받침한다. 답이 문서의 소수 구절에 달려 있는 QA·검색 과제에서 이득이 크고, 근거가 문서 전체에 흩어진 요약 과제에서는 이득이 거의 없다. 도입을 검토한다면 세 가지를 확인해야 한다. 첫째, 페이지 렌더링은 오프라인 비용이며 보고된 2.79배 지연 개선에 포함되지 않는다. 둘째, 도구 호출 예산과 초기 DPI가 성능과 비용을 좌우한다. 48·60 DPI는 추가 관측 비용이 커서 절약분이 줄고, 144 DPI부터 시작하면 입력 토큰이 2.8/2.6배로 늘어나는데 성능 이득은 작다. 저자들이 택한 72 DPI가 균형점이다. 셋째, 폰트와 포인트 크기가 문자 오류율을 통해 하류 점수를 실제로 바꾼다.
저자들이 밝힌 전제와 한계도 분명하다. 요약 과제는 근거가 국소화되지 않고 분산돼 있어 개선폭이 작고, few-shot 결과는 시연이 여러 영역에 걸칠 수 있어 혼재한다. VTCBench에서는 검색과 기억 평균은 최고지만 추론 전체 평균은 고정 해상도 백본보다 낮다. 지연 개선 수치는 오프라인 페이지 렌더링을 제외한 온라인 구간만 측정한 것이고, REL-CoT는 공개 QA 데이터셋에서 파생됐으므로 원본 데이터셋의 사용·재배포 조건을 따른다.