이미지 생성기로 GUI 학습 데이터를 합성해 실제 앱 성능을 올린다
AutoGUIWorld: Image Generators as Visual World Models for GUI Agent
무엇인가
GUI 에이전트는 스크린샷을 보고 마우스와 키보드 액션을 내서 소프트웨어 작업을 자동화한다. 이런 에이전트를 학습시키려면 액션이 환경을 어떻게 바꾸는지, 무엇이 상태로 남는지, 앞선 조작이 뒤 단계를 어떻게 제약하는지를 담은 고품질 상호작용 궤적이 필요하다. 문제는 궤적의 다양성이 수집 가능한 환경의 범위에 그대로 묶인다는 점이다. 과학·CAD·전자설계 소프트웨어는 특수한 상태와 조작을 노출하고, 창작·전문 워크플로는 콘텐츠 보존과 의존적 편집 단계를 요구한다. 환경 풀을 넓히려면 소프트웨어를 배포·설정하고 태스크 상태를 준비하고 재현 가능한 실행을 유지해야 하며, 특수 소프트웨어는 의존성·런타임·라이선스·계정 제약까지 따라붙는다. 기존 수집 방식인 인간 시연, 자동 탐색 후 필터링, 튜토리얼·녹화 영상 추출은 모두 접근 가능한 실행 환경이나 이미 존재하는 기록에 커버리지가 종속된다.
어떻게 동작하나
AutoGUIWorld의 핵심은 GUI 상호작용을 부분관측 마르코프 결정과정으로 보고, 에이전트가 실제로 소비하는 것은 관측 수준 전이 P(s̃_{t+1}|h_t,a_t)뿐이라는 점에 착안한 것이다. 잠재 상태 S나 호스트 시스템의 전이 T는 아예 인스턴스화하지 않고, 관측 전이 P를 시각적 월드 모델로 직접 모델링한다. 논문은 길이 T 궤적의 결합분포를 p(τ,s̃_0) 곱하기 π(a_t|h_t,τ) 곱하기 P(s̃_{t+1}|h_t,a_t)로 분해하고, 앞의 두 항은 구조화 샘플링으로, 정책 π는 메타 플래너로, 전이 P는 이미지 생성기로 각각 구현한다. 즉 계획 계층이 무엇이 일어나야 하는지를 정하고, 시각 월드 모델 계층이 그 결과 화면이 어떻게 보여야 하는지를 정하는 분업 구조다.
무엇과 다른가
절차는 여섯 단계다. 먼저 GUI 월드 샘플링 공간에서 초기 상태를 뽑는다. OS 기반(운영체제 종류, 화면 기하, 액션 공간, 인터페이스 관례, 앱 생태계), 시각적 외형(테마 모드, 색 팔레트, 배경화면, 타이포그래피, 밀도), 초기 GUI 상태(창·탭 개수, 레이아웃, 전경 관계, 페이지 콘텐츠, 보이는 컨트롤)의 세 축이다. 이 구조화 명세를 상세한 시각 설명으로 컴파일해 Image2가 초기 스크린샷 s̃_0을 렌더링하고, 시드 메타데이터와 함께 저장한다. 그다음 시드가 고정된 뒤에 태스크 지시문을 생성한다. 순서가 중요한데, 지시문만으로는 어느 화면에서 수행할지가 정해지지 않기 때문에 시드에 조건을 걸어 존재하지 않는 앱이나 숨은 창을 참조하는 태스크를 피한다. 롤아웃 전에 메타 플래너 Π_ψ가 태스크와 시드 컨텍스트로 원자적 액션 시퀀스와 각 단계의 기대 시각 변화 δ_t를 생성하고, 롤아웃 중에는 Voyager가 현재 스크린샷·계획된 액션·롤아웃 컨텍스트를 받아 δ_t를 렌더링 프롬프트 r_t로 확장한다. Image2는 s̃_{t+1} ~ M_φ^V(s̃_t, r_t)로 다음 화면을 만들고, 이 화면이 다시 다음 단계의 참조가 되면서 레이아웃·배경·스타일·사용자 가시 콘텐츠가 궤적 전체로 이어진다. 포인팅 액션에는 LocateAnything으로 타깃 영역을 찾아 중심점을 좌표 라벨로 붙이고, 최종적으로 깨끗한 사전 액션 스크린샷·지시문·이력을 입력으로 액션과 좌표를 출력하는 단일 스텝 학습 인스턴스로 변환한다. 이 변환 덕분에 학습 시점에는 합성 생성기가 없어도 SFT, 궤적 리플레이, 강화학습 데이터 구성이 가능하다.
어떻게 쓰나
결과물은 Ubuntu·Windows·macOS·Chrome에 걸친 79,266개 스텝 단위 샘플이다. Chrome이 35,209개로 가장 많고 Ubuntu 24,250개, Windows 14,778개, macOS 5,029개다. Qwen 임베딩의 MMD로 잰 합성-ScaleCUA 거리는 ρ 0.59~1.24로, 독립적으로 수집된 실제 데이터셋들 사이의 변동과 같은 스케일이다. 다만 C2ST 분류기는 합성-실제 쌍에서 AUC 약 1.00, 실제-실제 쌍에서 0.95~1.00으로 여전히 수집 출처를 구분해낸다. OmniParser-v2.0으로 검출한 UI 커버리지는 12개 도메인-임계값 비교 전부에서 ScaleCUA를 넘는다(증가폭 Ubuntu 63~77%, Windows 51~75%, Web 49~71%, macOS 10~13%). 궤적 길이는 Ubuntu 평균 11.9스텝, Windows 11.4스텝, P90이 24와 25이며, macOS는 평균 2.50개 앱을 열고 액션 타입 엔트로피가 0.92로 가장 높다. 논문이 직접 밝히는 특이점은 precondition과 blocker 필드가 현재 릴리스에서 전부 0이고 렌더링된 종료 상태가 거의 항상 성공이라는 것, 즉 실패로 끝나는 궤적이 사실상 없다는 점이다.
전제와 한계
평가는 Qwen3.5-35B-A3B를 이 궤적으로 파인튜닝한 AGW-35B로 수행했다. OSWorld 평균 태스크 점수는 33.0%에서 40.8%로 올랐고, 시스템 태스크 +25.0점, GIMP +19.2점, Calc +8.5점, Impress +12.8점, 멀티앱 태스크는 12.0%에서 20.9%로 개선됐다. Windows Agent Arena는 19.4%에서 27.9%로(Writer +26.3점, VLC +23.8점), macOSWorld 성공률은 28.1%에서 45.0%로 올랐다(System & Interface 31.0→62.1%, Advanced 13.3→40.0%, System Apps 44.7→65.8%, 멀티앱 13.8→27.6%). ScienceBoard는 14.0%에서 32.2%로 뛰었고 KAlgebra가 6.5→48.4%, ChimeraX가 37.9→55.2%였으며 성공 태스크 수가 20개에서 46개로 늘었다. 네 벤치마크 등가중 평균은 23.6%에서 36.5%로 12.8포인트 상승했다. ScreenSpot-Pro 그라운딩은 31.7%에서 57.1%로 오르며 아이콘 16.2→32.9%, 텍스트 41.2→72.0%를 기록했다. 반면 Chrome은 OSWorld에서 39.0%에서 26.0%로, WAA에서 11.2%에서 0.0%로 하락했고 macOSWorld의 Safety 항목도 20.7%에서 17.2%로 내려갔다. 35개 도메인 중 25개가 개선, 7개 동일, 3개 하락이다. 실제 인간 시연 350k개로 학습한 AgentNet 런과 비교해 약 80k 합성 샘플만 쓴 AGW-35B가 4개 벤치마크 모두에서 앞섰고 ScienceBoard 격차가 32.2% 대 16.8%로 가장 컸다. 단 두 런은 추론 설정이 다르다.
개발자 입장에서 이 논문이 쓸모 있는 지점은 GUI 에이전트 학습 데이터가 부족한데 설치·라이선스·런타임 문제로 실행 환경을 늘리기 어려운 상황이다. 특히 과학·CAD처럼 특수 소프트웨어를 다루는 도메인에서 합성 궤적이 실제 전이로 이어진다는 증거를 제시한다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, Chrome처럼 합성 데이터가 오히려 성능을 떨어뜨린 도메인이 있다는 점, 둘째, Safety 점수가 하락했다는 점, 셋째, 좌표 라벨 생성에 LocateAnything 같은 별도 그라운딩 모델이 전제된다는 점이다. 파이프라인 자체는 학습 시점에 생성기를 요구하지 않는 단일 스텝 인스턴스로 변환되므로, 기존 SFT·RL 데이터 파이프라인에 얹는 형태로 검토할 수 있다.
저자들이 밝힌 가장 큰 한계는 생성된 화면이 시각적으로 그럴듯해도 앞선 액션을 충실히 반영하지 않을 수 있다는 것이다. 평가 가능한 데스크톱 전이 42,526개 중 VLM 감사가 1,293개(3.04%)를 액션-이미지 불일치로 표시했고, 유효하지 않은 액션·타깃 없음·잘못된 그라운딩 단계를 제거한 뒤에도 39,351개 중 818개(2.08%)가 불일치로 남았다. 잔여 오류는 텍스트 입력, 드래그, 스크롤, 키보드 상호작용에 집중되며 명령 치환, 문서 내용 날조, 조기 포맷팅, 액션 효과 누락, 의도치 않은 지속 콘텐츠 변경 같은 유형을 포함한다. 궤적이 길어지고 상호작용이 복잡해지면 생성 오류가 누적되어 환각 인터페이스 상태나 액션 결과를 만들 수 있다는 점도 인정한다. 이에 대한 저자들의 제안은 도메인 특화 상호작용으로 월드 모델을 추가 학습시켜 특정 소프트웨어나 워크플로에 맞춘 수직적 GUI 월드 모델을 만드는 방향이다.