MobileAgent
무엇인가
Mobile-Agent는 Tongyi Lab(Alibaba Group)이 공개한 GUI 에이전트 제품군이다. 화면 이미지를 입력으로 받아 마우스·터치·키 입력을 출력하는 모델과, 그 모델을 여러 역할로 나눠 굴리는 실행 프레임워크를 함께 배포한다. API 호출이나 접근성 트리 대신 렌더링된 화면 자체를 조작 대상으로 삼는 계열에 속한다.
어떻게 동작하나
기반 모델은 GUI-Owl-1.5다. Qwen3-VL 위에 구축된 멀티모달 GUI VLM으로 2B·4B·8B·32B·235B 크기와 Instruct·Thinking 변형이 있다. GUI 지각, 그라운딩, 종단 간 조작을 한 모델에서 처리한다. 그 위의 Mobile-Agent-v3는 계획 수립, 진행 관리, 반성(reflection), 메모리를 담당하는 모듈로 나뉜 멀티에이전트 프레임워크다. ToolCUA는 GUI 동작과 도구 호출 중 무엇을 쓸지 정하는 경로 조정을 맡고, 궤적 인식 도구 합성 → 온라인 에이전트 RL의 2단계 학습 파이프라인으로 훈련된다. MCP 도구 호출도 다룬다.
무엇과 다른가
초기 Mobile-Agent-v1은 단일 에이전트가 화면을 보고 다음 동작을 정하는 구조였다. v2와 v3는 관찰·계획·반성 같은 역할을 분리해 컨텍스트를 나눠 갖게 한다. GUI-Critic-R1은 실행 전에 동작 오류를 진단하는 별도 비평 모델을 둔다. UI-S1은 반온라인 강화학습으로 자동화 성능을 올리는 방법을 다룬다. PC-Agent는 데스크톱, Mobile-Agent-E는 자기 진화형 모바일 조작으로 대상 플랫폼이 갈린다.
어떻게 쓰나
저장소는 작업별 하위 디렉터리로 나뉜다. Mobile-Agent-v3.5, Mobile-Agent-v3, UI-S1, GUI-Critic-R1, PC-Agent, Mobile-Agent-E, Mobile-Agent-v2 각각에 코드가 들어 있다. 모델 가중치는 HuggingFace의 GUI-Owl-1.5 컬렉션과 GUI-Owl-7B·GUI-Owl-32B에서 받는다. 로컬 배포 없이 쓰려면 Alibaba Cloud Bailian이나 ModelScope API-Inference의 온라인 추론을 호출한다. 안드로이드 실행 환경은 Wuying Cloud Phone을 쓰거나 자체 기기를 연결한다.
전제와 한계
동작하려면 조작 대상 GUI가 실제로 있어야 한다. 안드로이드 기기나 에뮬레이터, 데스크톱, 브라우저 중 하나가 필요하다. 모델 가중치를 로컬에서 구동하려면 해당 파라미터 크기를 감당할 하드웨어가 전제가 된다. 평가는 OSWorld, AndroidWorld, 실제 모바일 시나리오 코드로 이뤄지며, OSWorld-MCP는 MCP 도구 호출 능력을 재는 벤치마크다. v3.5와 v3는 프리프린트 단계다.
관련 논문 3
유사 도구
- agent-workspace-linux에이전트가 실제 데스크톱 대신 숨겨진 X11 워크스페이스를 띄워 GUI·브라우저 작업을 하도록 MCP 도구 호출 절차와 격리 규칙을 주입하는 Claude Code 스킬이다.
- atomic-agent로컬 llama.cpp로 오픈웨이트 모델을 돌리며 브라우저·파일·셸을 조작하는 로컬 우선 AI 에이전트 CLI다. 상태와 제어 루프가 전부 사용자 디스크에 남는다.
- SuperAGI자율 AI 에이전트를 만들고 실행·관리하는 Python 기반 프레임워크다. 에이전트 루프와 도구 툴킷, 벡터 저장소 메모리, 웹 콘솔로 구성된다.
- SimpleMemLLM 에이전트에 장기 기억을 붙이는 Python 패키지다. 대화를 원자적 기억으로 압축해 저장하고 의미 기반으로 검색하며, 텍스트와 이미지·오디오·비디오를 함께 다룬다.