추론 생성을 선택으로 바꿔 멀티모달 검색 에이전트 지연을 90% 줄인다

Selection-Based Structured Reasoning: Toward Efficient Multimodal Search Agents

HF Daily2610.01892

Feiyu Gavin Zhu, Xiaoyu Zhu, Jiqi Yang2026-10-01

무엇인가

멀티모달 검색 에이전트는 텍스트와 이미지 관찰을 행동으로 바꾸며, 관찰·추론·행동을 교차시키는 ReAct식 설계가 흔하다. 문제는 매 행동 앞에 붙는 자유형 추론이다. 추론 단계는 증거를 평가하고 다음 행동을 정하는 데 도움을 주지만, 행동마다 순차적 토큰 생성 비용을 추가한다. 추론 용량이 제한된 소형 온디바이스 모델에서는 길고 반복적인 추론이 더 나은 행동으로 이어지지도 않으면서 생성 비용만 낭비한다. 기존 접근은 간결한 추론을 유도하는 프롬프트나 짧은 추론에 보상을 주는 방식으로 텍스트 양을 줄였지만, 자기회귀 디코딩에서 토큰 간 순차 의존성은 그대로 남는다. 이 논문은 추론의 표현 자체를 바꾸는 직교 방향을 택한다. 저자들의 관찰은 이렇다. 멀티모달 검색에서 엔티티·쿼리·관찰은 문제마다 달라지지만, 다음 행동을 위한 고수준 추론은 자주 반복된다. 다가오는 AI 학회의 장소를 찾는 일과 레고 창립 연도를 찾는 일은 "엔티티는 알지만 원하는 정보가 없으니 엔티티 이름과 관심 속성으로 검색한다"는 같은 근거를 공유한다. 즉 검색 에이전트가 필요한 추론 공간은 자연어 전체를 아우르지 않는다.

어떻게 동작하나

제안 방법인 SSR(Selection-based Structured Reasoning)은 추론을 열린 생성이 아니라 재사용 가능한 자연어 후보들 사이의 선택으로 정식화한다. 추론 라이브러리 R은 짧은 자연어 후보 r1부터 rN까지로 구성되며, 각 후보는 현재 문맥에서 어떤 정보가 있고 무엇이 없는지, 다음에 무엇을 할지를 서술하는 재사용 가능한 추론 흔적이다. 턴 t에서 상호작용 히스토리 h_t가 주어지면, 후보 r_i의 길이 정규화 로그우도를 계산한다. 식 (1)에서 α는 길이 정규화 강도를 조절하며, 저자들은 α=1을 써서 평균 토큰 로그우도로 후보를 비교한다. 음의 로그확률을 단순 합산하면 가장 짧은 후보가 유리해지는 길이 편향이 생기기 때문이다. 이 점수에 온도 τ를 둔 소프트맥스를 적용하면 라이브러리 위의 범주 분포인 선택 정책 q_θ가 된다(식 2). 중요한 점은 이 과정에 별도 분류 헤드가 필요 없다는 것이다. 모델 자체를 후보 분류기로 쓰고, SFT 워밍업도 요구하지 않는다. 선택된 후보 텍스트는 그대로 문맥에 삽입되어 다음 행동(문제별 검색 쿼리, 크롭 위치, 최종 답변) 생성을 이끈다. 지연 이득의 원천은 병렬성이다. 모든 후보 텍스트가 미리 지정되어 있으므로 teacher forcing으로 한 후보 안의 모든 토큰을 한 번의 배치 forward pass로 채점할 수 있고, 후보들 역시 같은 히스토리 KV 캐시를 공유해 동시에 채점된다. 추론 과정에서 새 토큰을 하나도 생성하지 않는다. 저자들은 계산 깊이로 지연을 비교한다. 자유형 추론의 임계 경로는 O(L log(H+L))인 반면, SSR은 가장 긴 후보 채점 O(log(H+Kmax))에 후보 선택 O(log N)을 더한 수준이다. 토큰 수준 병렬화로 L 인자가 사라진다.

무엇과 다른가

학습은 SFT와 RL 양쪽에서 같은 구성 요소를 공유한다. SFT 손실은 범주형 선택 손실과 토큰 단위 행동 손실의 가중합이며, 가중치 λ_reason은 1로 둔다. GRPO 스타일 RL에서는 생성된 추론의 토큰 단위 importance ratio를 선택에 대한 범주형 ratio 하나로 대체하고, 행동 토큰은 기존의 토큰별 ratio를 유지한다. 선택된 후보의 전체 토큰 시퀀스는 하나의 블록으로 문맥에 삽입된다. γ_reason은 1, KL 정규화 계수 β는 10^-3을 쓴다. 같은 선택·행동 구성은 GSPO나 SAPO 같은 다른 GRPO 변형에도 적용된다. 라이브러리는 벤치마크 전체가 공유하는 6개의 수작업 후보로 고정되어 있다. 불확실할 때 이미지 검색으로 엔티티를 식별하기, 텍스트 검색으로 특정 정보를 조회하기, 이미지의 특정 부분을 확대해 살펴보기, 수집한 증거로 질문에 답하기, 이미지에 근거해 답하기, 일반 지식으로 답하기다.

어떻게 쓰나

실험은 2B와 4B Qwen3-VL로 수행했다. 학습에는 VisualProbe, DeepEyes, FVQA-train을 쓰고, 평가는 MMSearch, HR-MMSearch, FVQA-test, InfoSeek, SimpleVQA, LiveVQA, MAT-Search 일곱 개 벤치마크에서 한다. 역이미지 검색, 텍스트 검색, 이미지 크롭 도구를 같은 하네스로 제공하고 LLM-as-judge로 채점한다. 결과로 4B SSR(GRPO) 모델은 평균 성공률 61.37%를 기록해, 동급 최고 4B 모델인 TAPO(GSPO)의 61.25%와 대등하고 4B MMSearch-R1과 SenseNova-MARS를 앞선다. 2B SSR 에이전트는 51.26%로 제로샷 8B 모델과 비슷한 수준이다. 자유형 추론과의 비교에서는 GRPO, GSPO, SAPO, SFT 전반에 걸쳐 턴당 추론 지연을 90% 이상 줄이고 문항당 평균 모델 지연을 28~54% 줄였다. 다만 GSPO와 SAPO에서는 성능이 소폭 하락한다.

전제와 한계

기존 효율적 추론 방법과의 비교도 있다. Chain-of-Draft와 Sketch-of-Thought(프롬프트 기반 압축), 효율 보상 RL(짧은 추론 학습), Probe & Prefill(경량 분류 헤드로 선택적 추론 디코딩) 네 가지 베이스라인 대비 SSR은 가장 높은 성공률을 내면서 추론 속도가 약 7배 이상 빠르다. 평균 모델 지연은 약 2.5초로, 이 지표에서 가장 빠른 베이스라인인 Sketch-of-Thought보다 약 30% 낮다. 95백분위에서 격차는 더 벌어진다. SSR의 p95 추론 시간은 0.071초로 평균보다 10ms 높은 데 그치지만, 베이스라인 p95는 0.798초에서 1.892초에 이른다. 평균과 p95의 간격이 좁다는 것은 후보를 전부 병렬 채점하는 예측 가능한 계산 덕분에 추론 지연이 일관된다는 뜻이다. 문항 수준 p95도 4.6초로 가장 빠른 베이스라인의 6.6초보다 약 30% 낮다. 어블레이션에서 후보의 전체 텍스트 대신 인덱스만 채점하는 변형은 평균 성공률이 3.9%포인트 떨어졌고 일곱 벤치마크 모두에서 하락했다. 추론 후보의 의미 정보가 문맥 의존적 선택에 실제로 기여한다는 뜻이다. 자기회귀 디코딩으로 라이브러리 항목을 재현하는 변형은 SFT 워밍업 뒤 RL 포맷 보상을 주면 비슷한 성공률을 내지만, SFT 없이는 프롬프트 지정과 포맷 보상만으로 라이브러리 준수를 강제할 수 없어 모델이 자유형 추론으로 흘러간다. 라이브러리 크기를 1, 2, 4, 6개로 늘리면 성공률이 37.24%에서 61.37%까지 단조 증가하며, 일반 후보 하나에서 답변/도구호출 두 개로 늘리는 것만으로 17.27%포인트가 오른다. 벤치마크별 선택 분포도 다르게 나타난다. 가장 단순한 SimpleVQA는 "이미지에서 답변" 선택률이 가장 높고 "사실 조회"가 가장 낮으며, 고해상도 이미지 중심의 HR-MMSearch는 "이미지 세부 확인" 선택률이 가장 높다. 전체 턴의 99.9%에서 생성된 행동 유형이 선택된 후보가 기대하는 행동 유형과 일치했다.

개발자 관점에서 이 논문이 쓸모 있는 지점은 명확하다. 소형 모델로 검색·도구 호출 에이전트를 돌리는데 추론 토큰 생성이 지연과 비용의 병목이라면, 추론을 자유 생성이 아니라 후보 선택으로 바꾸는 것이 곧바로 적용 가능한 대안이 된다. 별도 분류 헤드를 붙이거나 SFT로 워밍업할 필요 없이 기존 MLLM의 문맥 조건부 우도만으로 선택이 이뤄지고, RL을 쓴다면 범주형 ratio 하나만 추가하면 된다. 대신 성능의 상당 부분이 라이브러리 설계에 달려 있다. 수작업 후보 6개로 61.37%, 일반 후보 1개로는 37.24%다. 도메인에서 반복되는 고수준 추론 패턴을 뽑아 후보로 정리하는 작업이 선행되어야 한다. 또 p95 지연이 평균에 근접한다는 점은 서빙 SLA 설계에 유리한 성질이다. 반대로 확인해야 할 것은, 라이브러리 밖의 추론이 필요한 개방형 과제에서는 선택지가 막혀 성능 상한이 생긴다는 점이다.

저자들이 밝힌 전제와 한계는 다음과 같다. GSPO와 SAPO에서는 자유형 대비 성능이 소폭 하락하는데, 저자들은 selector-gradient 근사(부록 B.3)가 롤아웃당 여러 번의 그래디언트 업데이트를 거치면서 덜 정확해지기 때문이라고 가설을 세운다. 라이브러리는 6개의 수작업 후보로 고정되어 있고 벤치마크 간에 공유된다. 지연 측정은 벤치마크당 100문항을 샘플링해 H100 GPU와 오프라인 SGLang 추론 엔진에서 수행했으며, 도구 실행과 LLM-as-judge 평가 같은 환경 측면 처리는 모델과 무관한 변동이 크다는 이유로 제외했다. 또한 자유형 자기회귀 변형이 SFT 워밍업 없이는 라이브러리 준수를 강제할 수 없다는 실험 결과는, SSR의 이점 가운데 일부가 성능 자체가 아니라 인터페이스 강제에서 온다는 것을 보여준다.