EviRover가 한 번의 시선을 넘어 증거를 찾아 지각한다
EviRover: Reinforcing Agentic Perception Beyond a Glance
무엇인가
시각 지각은 관례적으로 이미지를 한 번 보고 단일 예측을 내는 방식으로 정식화된다. 이미지 내용과 모델의 파라메트릭 지식만으로 질의를 해결할 수 있다는 가정이다. 이 논문은 그 가정이 깨지는 경우를 '증거 불충분 상황에서의 지각(perception under insufficient evidence)'이라 부른다. 세밀한 시각 디테일을 봐야 하거나, 이미지 밖의 지식이 필요하거나, 최신 정보가 필요한 경우다. 기존 멀티모달 에이전트들은 대개 질의응답을 위해 상호작용할 뿐, grounding·segmentation·counting 같은 지각 과제 자체는 여전히 이미지-질의 쌍에서 한 번에 예측하는 틀을 유지한다. 문제는 이런 상황에서도 모델이 위치나 경계, 개수를 반드시 내놓아야 한다는 점이다.
어떻게 동작하나
저자들은 지각을 증거 탐색 과정으로 재정의한다. 첫 관찰에서 바로 예측하는 대신, 더 세밀한 시각 검사나 외부 지식원을 통해 빠진 증거를 찾아 해결한다. 기존 에이전트가 텍스트 답변을 뒷받침할 증거를 모으는 것과 달리, 여기서는 지각 출력 자체가 목표다. 그래서 더 엄격한 시험대가 된다. 검색한 증거를 입력 이미지 위의 위치·경계·개수로 변환해야 하고, 그 결과는 공간·수치 주석과 직접 대조해 검증할 수 있다. 증거를 획득하는 것과 그것을 시각 내용에 정확히 연결하는 것 둘 다 맞아야 정답이 된다. 핵심 난제는 부족한 증거의 종류가 질의마다 다르다는 것이다. 작은 타깃은 더 자세히 봐야 하고, 낯선 정체성은 외부 검색이 필요하다. 무엇을 어떻게 획득할지 결정하는 것 자체가 고정 절차가 아니라 과제의 일부다. 기존 프롬프트 기반 워크플로는 추론 시점의 수작업 프롬프트 전략에 의존해 탐색 행동이 사람이 설계한 휴리스틱에 갇히고, Liang 등(2026)의 에이전트는 분할에 국한되며 누락된 증거가 항상 외부 지식이라고 가정한다.
무엇과 다른가
데이터가 없어서 저자들은 두 개의 생성 파이프라인을 설계했다. 첫째는 이미지 안에 있지만 한눈에 해상되지 않는 증거다. 타깃이 이미지 면적의 0.1%도 안 되는 고해상도 이미지와, I-spy나 틀린 그림 찾기처럼 여러 영역을 비교·스캔해야 찾을 수 있는 장면을 모은다. Mini-o3에서 각색하거나 웹 이미지 검색으로 수집한다. 둘째는 이미지 밖의 증거다. 공인과 애니메이션 캐릭터의 단체 사진에 대한 지각 질의를 만든다. 실제 단체 사진을 모아 등장 인물의 신원을 검증하는 절차는 85개 이벤트 카테고리 시드 목록에서 출발해 Seed-1.8로 검색어를 확장하고 이미지 검색 엔진에 질의한 뒤, 캡션 대신 Seed-2.0-Pro에 웹 검색 도구를 붙여 신원을 독립적으로 검증한다. 다른 절차는 알려진 인물의 참조 이미지에서 GPT-Image-2로 그 인물이 포함된 단체 사진을 합성하고 Seed-2.0-Pro로 화질과 정체성 보존을 필터링한다. 실제 인물은 참조 이미지가 3개를 넘으면 정체성 보존이 급격히 무너져 단일 참조로 조건을 주고, 애니 캐릭터는 헤어스타일·의상 같은 특징이 뚜렷해 다중 참조가 가능하다. 검증된 신원이 질의의 정답이 된다. grounding과 segmentation은 이미지당 검증된 신원이 최소 하나 필요하고, counting은 등장 인물 전원이 검증되어야 한다. 이름을 직접 부르면 모델이 추가 증거 없이 풀 수 있으므로, 엔티티를 간접 서술로 바꾸는 반복적 치환으로 다중 홉 질의를 만든다. 검색 엔진으로 공개 프로필을 얻어 GPT-5.4-mini가 이름 없이 지칭하는 서술로 바꾸고, Seed-1.8이 도구 없이 풀지 못할 때까지 최대 20홉까지 반복한다. SFT 궤적은 로컬라이제이션에 Gemini-3.0-Pro, 나머지 과제에 Seed-2.0-Pro로 생성하고 논리적으로 일관되게 정답에 도달한 것만 남긴다. 정답이어도 증거 탐색이 거의 없는 궤적은 다운샘플링해, 지식으로 충분하면 바로 답하고 아니면 탐색하는 행동을 함께 학습시킨다. 이렇게 EviRover-SFT-5K와 EviRover-RL-12K가 만들어졌다.
어떻게 쓰나
평가용으로는 사람이 전부 검증한 EviLens 688개 인스턴스를 구축했다. 로컬라이제이션 140, 인식 182, 틀린 그림 찾기 15(주석된 차이 79개), 분할 195, 카운팅 156개다. 인식·로컬라이제이션은 평균 박스 IoU와 [email protected], 분할은 gIoU와 cIoU, 카운팅은 정확 일치 정확도, 틀린 그림 찾기는 IoU 0.5에서 그리디 일대일 매칭의 micro/macro-F1으로 평가한다. 모델은 Qwen3-VL-4B-Instruct에서 출발해 2단계로 학습한다. SFT가 상호작용 형식과 기본 도구 사용을 익히고, RL이 각 질의에 빠진 증거가 무엇인지 식별하고 획득하는 법을 최종 지각 출력의 정답 여부를 피드백으로 배운다. 도구는 10개로, 외부 증거 획득 4개(텍스트 검색, 텍스트→이미지 검색, 이미지 검색, 웹 브라우징), 세밀 시각 검사 3개(영역 크롭, 후보 영역 렌더링), 과제 특화 3개(SAM3 기반 마스크 생성, 나란히 비교, 파이썬 인터프리터)다. 보상 분포가 이질적인 과제들을 함께 학습하기 위해 EMA-GRPO를 쓰고, 보상은 grounding에 IoU, 분할에 예측 마스크와 정답 마스크의 IoU, 카운팅에 일치 지시함수, 틀린 그림 찾기에 soft F1을 쓴다. 긴 롤아웃이 정책 업데이트를 좌우하는 토큰 평균 편향을 피하려고 sequence-mean-token-mean 리덕션을 택했다. 학습은 A800-80GB 8장 한 노드에서 FSDP로 진행했고, SFT는 학습률 5×10⁻⁶, 코사인 스케줄, 워밍업 0.03, 전역 배치 64, 2 에폭이며, RL은 스텝당 프롬프트 8개에 롤아웃 8개씩 총 64개를 4개 미니배치로 나눠 업데이트한다. 궤적당 도구 호출은 35회로 제한한다.
전제와 한계
EviLens 결과에서 EviRover는 백본 대비 다섯 범주 평균 30.2점 향상했다. 로컬라이제이션은 0.444 IoU로 Gemini-3.5-Flash의 0.373을 앞서며 평가된 모든 모델 중 최고였고, 인식도 최고 성적을 냈다. 분할은 Seed-2.1-Turbo의 0.779 gIoU에 이어 2위다. 카운팅에서 백본이 19.2점이었는데 GPT-5.6-Sol에 1.3점 차까지 따라붙었고, 틀린 그림 찾기에서 백본은 0.005에 그쳤다. 참고로 GPT-5.6-Sol은 프롬프트가 여러 차이를 시사해도 단일 박스만 예측해 틀린 그림 찾기 micro-F1이 0.112에 머물렀다. 분할 전문 모델은 최대 0.343 gIoU, grounding 전문 모델은 로컬라이제이션에서 거의 0 IoU를 기록했다. 저자들은 EviLens의 어려움이 지각 정밀도가 아니라 각 질의에 빠진 증거를 획득하는 능력에 있다고 해석한다. 검색 기반 grounding·분할·VQA 벤치마크인 WebEyes에서는 40.0 IoU와 48.5 [email protected]로 독점 모델을 포함한 전체 평가 대상 중 최고 grounding 성능을 냈고, 더 큰 백본을 쓴 프롬프트 기반 워크플로 Pixel-Searcher-8B보다 분할 gIoU가 10.4 높았다. VQA는 Pixel-Searcher-8B와 비슷한 수준이다. 백본 대비로는 grounding이 14.4 IoU, 분할이 24.7 gIoU 올랐다. 일반화도 확인된다. ReasonSeg와 RefCOCOg의 모든 split과 지표에서 백본을 앞서고 Seg-Zero-7B, Perception-R1 같은 과제 특화 모델을 대부분의 지표에서 능가한다. MMMU, MMMU-Pro, MathVerse에서는 최대 4점 향상, BrowseComp-VL은 9.5에서 24.8로 정확도가 두 배 이상이 됐다.
실무에서는 고해상도 이미지에서 아주 작은 객체를 찾아야 하거나, 대상이 간접적으로 지칭되어 신원 확인이 필요하거나, 등장 인물 전체를 세야 하는 파이프라인에 직접 적용할 수 있다. 좌표는 [0,1000]으로 정규화된 xyxy 형식을 쓰고, 도구 호출 예산 35회 안에서 동작한다는 점을 전제로 설계해야 한다. 도입 전에 확인할 것은 학습 데이터의 상당 부분이 합성 이미지이고 정체성 검증 절차에 의존한다는 점, 그리고 성능이 도구 프레임워크 접근성을 전제로 측정됐다는 점이다. 코드와 모델, 데이터는 모두 공개되었다.
원문에는 별도의 한계 절이 없지만 방법 서술에서 드러나는 전제와 제약은 분명하다. 실제 인물 합성은 참조 이미지가 3개를 넘으면 정체성 보존이 신뢰할 수 없어 단일 참조로 제한되고, 캡션은 신원 주석으로 쓸 수 없어 별도 검증에 의존한다. 카운팅 질의는 등장 인물 전원이 검증되어야 해서 데이터 구성 범위가 좁아진다. 다중 홉 질의 재작성은 최대 20홉, 평가 궤적은 도구 호출 35회라는 상한 안에서 이뤄진다. 보상은 최종 지각 출력의 정답 여부에 기반한 결과 보상이라 탐색 과정의 품질 자체를 직접 보상하지는 않는다. 벤치마크 규모도 688개 인스턴스로 크지 않다.