VLM은 국소 목표만 정하고 실행은 경량 결정 모델이 맡는 모바일 GUI 에이전트
Jev-Mobile: Jev as an Executor for Mobile GUI Agents
무엇인가
모바일 GUI 에이전트의 일반적인 구조는 비전-언어 모델(VLM)이 거의 모든 상호작용 스텝에서 계획과 행동 그라운딩을 동시에 담당하는 것이다. 화면을 읽고, 다음에 누를 것을 정하고, 그 좌표를 찾아내는 일을 매번 같은 모델에 물어보면 지연과 모델 서빙 비용이 누적된다. 이 논문은 그 부담을 어디까지 덜어낼 수 있는지를 묻는다. 저자들이 구분하는 실패 유형은 세 가지다. 후보 커버리지(실행 가능한 후보가 애초에 존재하는가), 선택(Jev가 그중 옳은 것을 고르는가), 핸드오프(제어권이 적절히 VLM으로 돌아오는가).
어떻게 동작하나
제안 시스템 Jev-Mobile의 골격은 저빈도 VLM 계획과 고빈도 경량 실행의 분리다. 위임(delegation) k번째 시점에서 VLM은 사용자 지시 u, 현재 스크린샷과 접근성 트리, 그리고 이전 국소 목표별로 묶인 실제 제출 액션 이력을 읽고 한 번의 호출로 delegate / finish / blocked 중 하나를 내놓는다. 위임할 때는 국소 목표 g_k와 선택적으로 정확한 텍스트 값 v_k를 함께 출력하며, 위임 이후의 요약문은 생성하지 않는다. 그러면 Jev가 g_k 아래에서 여러 개의 원자적 액션을 추가 VLM 호출 없이 실행한다. Jev가 DONE을 내면 다음 목표를 위해 제어권이 돌아가고, BLOCKED는 해석 요청이나 실행 가능한 액션 부족을 알린다. 최종 과제 성공 여부는 VLM이 끝난 뒤 독립 평가기가 판정한다.
무엇과 다른가
실행 공간은 접근성 트리에서 결정적으로 만들어진다. 후보 집합 C_t = f(T_t, z_t, v_k)는 원시 트리 노드와 클릭 가능한 부모 노드를 순회해 구성하며, 보이고 활성화되어 있고 유효한 바운드를 가진 노드가 명시적 플래그에 따라 click, long-press, scroll, focus 액션을 낳는다. v_k에 명시적으로 주어진 텍스트는 포커스된 필드에 대한 input 액션이 되고, Back·Home·Enter·Open app은 관측된 기기 상태와 공유 액션 계약이 지원할 때 추가된다. 후보의 짧은 라벨은 text, description, hint, resource name, class 중 처음 사용 가능한 속성과 노드 인덱스로 만든다. 실행 전에는 후보를 새 관측과 대조해 검증하고, 액션 하나를 수행한 뒤 다시 관측해 C_{t+1}을 만들면서 이전 ID와 좌표를 무효화한다. 비멱등 액션에 모호한 응답이 오면 맹목적으로 재제출하지 않고 검사를 수행한다. 트리를 학습된 의미 그래프로 압축하지 않기 때문에 길거나 노이즈가 많은 트리는 실패 모드로 남는다.
어떻게 쓰나
Jev에 대한 각 요청은 하나의 타입 지정 선택(typed choice)이다. 기준은 현재 후보 ID들과 DONE, BLOCKED를 설명에 매핑하고, 상태에는 g_k, 관측 ID, 텍스트 트리, 현재 위임의 액션 이력이 들어간다. 어댑터가 실행 전에 타입과 ID를 검증한다. 제출된 각 스텝은 선택한 ID, 실제 액션 파라미터, 실행 상태, 전후 관측 ID, 결정적 변경 설명을 기록한다. 핸드오프 시 VLM이 받는 것은 현재 스크린샷·트리와 목표별로 묶인 과제 국소 액션 이력뿐이며, 오래된 스크린샷이나 원시 트리, 예측 액션, 모델이 쓴 요약은 전달되지 않는다. 학습된 라우터나 과제 간 메모리도 쓰지 않는다. 벽시계 시간, 액션 수, 호출 수, 대기, 재시도는 하나의 에피소드 예산을 공유한다.
전제와 한계
실험은 AndroidWorld 전체 과제 스위트에서 세 시스템을 비교한다. Step-wise VLM은 공유 범용 VLM에게 매 관측마다 액션을 고르게 하고, SeeAct-V는 같은 VLM으로 스텝별 결정을 하되 UI-TARS-1.5-7B로 선택 대상을 그라운딩한다(원래의 UGround 구성을 대체한 적응판이라고 논문이 명시한다). Jev-Mobile은 범용 VLM으로 국소 목표를 정하고 Jev로 접근성 트리 후보를 고른다. 모든 범용 VLM 역할은 Qwen3.8-Max(OpenRouter ID qwen/qwen3.8-max-0902)를 쓴다. 성공률은 전체 평가 인스턴스 기준으로 SR = |D|^-1 Σ S_i로 계산하고, 시간과 비용 지표는 성공 궤적 부분집합에 조건부로 계산한다.
결과는 다음과 같다. Jev-Mobile은 평가 과제의 0.79를 완료해 SeeAct-V의 0.78과 비슷하고 Step-wise VLM의 0.84보다 5%포인트 낮다. 성공 궤적에서 평균 총 온라인 시간은 132.67초로 SeeAct-V의 162.63초보다 18.4%, Step-wise VLM의 197.21초보다 32.7% 짧다. 실행 모델에 쓴 평균 시간은 5.16초로, UI-TARS의 12.37초와 스텝별 Qwen 실행기의 94.30초에 비해 크게 작다(Step-wise VLM 대비 94.5% 감소). 성공 궤적당 평균 모델 API 비용은 0.072744달러로, 0.193207달러와 0.273694달러에 비해 Step-wise VLM 대비 73.4% 낮다. 저자들은 하나의 VLM 국소 목표 아래에서 Jev가 여러 액션을 고르고 후보 생성기가 매 액션 후 실행 선택지를 갱신하는 분업이 이 짧은 실행 모델 시간과 일관된다고 해석한다.
실무 관점에서 이 설계가 유효한 조건은 명확하다. 화면 요소가 접근성 트리에 제대로 노출되는 앱이라면, 목표 단위로 VLM 호출을 묶고 그 사이 세부 조작을 값싼 결정 모델에 맡기는 방식으로 지연과 API 비용을 크게 줄일 수 있다. 반대로 트리에 없는 시각적 대상은 현재 후보 인터페이스로 실행할 수 없고, 입력 경로가 출력 가능한 ASCII 텍스트만 지원하며, 액션 이력이 길어지면 압축이 필요하다. 또한 비교가 세 시스템뿐이고, Jev를 소형 VLM으로 바꾼 대조 실험이 없어서 관측된 이득이 타입 지정 결정 모델 실행 자체 때문인지 위임 워크플로 때문인지는 구분되지 않는다. 논문도 시스템들이 같은 범용 VLM을 쓰되 각자의 실행 메커니즘을 유지하므로 결과가 Jev 단독 효과가 아니라 완성된 시스템의 특성이라는 점을 밝힌다.
저자가 명시한 한계는 이렇다. 평가는 AndroidWorld의 모바일 과제에만 국한되며, DOM 구조와 페이지 동역학이 다른 웹 인터페이스는 검증하지 않았다. 베이스라인은 Step-wise VLM과 SeeAct-V 둘뿐이다. Jev-Mobile은 Android 접근성 트리에 의존하므로 시각적으로 보이지만 트리에 없는 대상은 실행 후보로 만들 수 없다. 현재 입력 경로는 출력 가능한 ASCII 텍스트를 지원하고, 긴 액션 이력은 압축이 필요할 수 있다. 향후 과제로 웹 인터페이스 테스트와 같은 위임 컨트롤러 안에서 Jev를 소형 VLM으로 대체하는 비교를 제시한다.