실제 데스크톱을 조합해 컴퓨터 사용 에이전트의 그라운딩을 학습시킨다
DeskForge: Dense Supervision from Desktop Environments for Computer-Use Agents
무엇인가
컴퓨터 사용 에이전트는 여러 애플리케이션 창과 대화상자, 시스템 컨트롤이 한 화면에 뒤섞인 데스크톱에서 동작 지점을 정확히 짚어야 한다. 비슷하게 생긴 컨트롤과 다른 앱에서 온 방해 요소를 구분해야 하고, 같은 앱이라도 내용이나 창 위치가 달라질 수 있다. 기존 학습 자원은 이 조건을 동시에 만족하지 못한다. 정적 스크린샷 코퍼스는 장면 자체를 바꿀 수 없고, 대부분 단일 앱이나 단일 타깃만 주석하며, 실행 가능한 환경은 조밀한 화면 주석이 아니라 과제 평가를 목적으로 설계됐다.
어떻게 동작하나
저자들의 발상은 데스크톱을 기록하는 대신 생성하는 것이다. DeskForge는 리눅스 데스크톱 환경으로, 실제 애플리케이션을 격리된 세션에서 실행한다. 장면 명세가 앱 선택과 초기 상태, 표시할 콘텐츠, 창 배치와 스태킹, 외형, 해상도를 제어한다. 주석 파이프라인은 스크린샷, 접근성 트리, 측정된 창 기하를 융합해 요소의 타입·텍스트·기하·상호작용 속성은 물론 부모-자식 구조, 읽기 순서, 앱과 창 소유권, 스태킹 관계까지 담은 조밀 주석을 만든다. 가려진 요소는 노출된 부분을 사각형들의 합집합으로 표현해, 컨트롤 전체가 아니라 실제로 보이는 영역만 유효한 클릭 영역으로 취급한다. 접근성 이름과 화면에 렌더링된 텍스트는 분리해서 관리하고, 접근성 트리에서 누락된 데스크톱 컨트롤은 창 기하에서 복구한다. 자동 감사로 일관성이 없거나 지나치게 희박한 4.7%의 캡처를 제외했고, 사람 감사에서는 표본으로 뽑은 요소 주석의 99.8%가 정확했다.
무엇과 다른가
상호작용 기록도 함께 남긴다. 장면을 탐색할 때 실행 가능한 요소를 샘플링해 추정된 가시 영역 안에서 클릭하고, 변화가 일어난 경우와 그렇지 않은 경우를 모두 기록한다. 각 전이는 이전 화면, 실행한 행동, 이후 화면을 목표 메타데이터와 효과 요약에 연결한다. 그라운딩 예시를 만들 때는 비전언어모델에 전후 관찰과 타깃 맥락을 주고 단일 단계 지시문을 작성하게 한다. 지시문은 좌표나 주석 마커를 언급하지 않으면서 이전 스크린샷만으로 타깃을 식별할 수 있어야 하고, 이후 관찰은 지시문 작성에만 쓰일 뿐 그라운딩 모델에는 주어지지 않는다. 사람 감사에서 무작위로 뽑은 지시문의 97.8%가 타당하다고 판정됐다.
어떻게 쓰나
이렇게 만든 DeskForge-1M은 121만 개의 주석 달린 데스크톱 관측과 1억 5970만 개의 요소 인스턴스, 91만 7000건의 클릭 전이를 담는다. 19개 애플리케이션, 7개 외형 프리셋, 7개 해상도(1366×768부터 3840×2160까지)를 아우르며 약 32만 4000개 장면으로 묶인다. 요소 수 기준으로 논문이 비교표에 든 가장 큰 자원의 약 7.6배다. 관측은 밀도가 높고 어수선하다. 관측당 평균 132개 요소(중앙값 121개)가 주석되고, 90.9%가 앱을 두 개 이상 포함하며, 97.7%가 가려진 요소를 갖고, 절반에 가까운 관측에서 요소의 30% 이상이 가림의 영향을 받는다. 훈련·검증·테스트 분할은 장면 단위로 나눠 같은 장면의 재캡처와 상호작용 프레임이 섞이지 않게 했고, 새 장면, 학습에 없던 앱(GNOME System Monitor, Pluma, Xarchiver), 예약된 외형 프리셋(Quartz Night Nord), 예약된 해상도(2880×1800)의 네 가지 held-out 조건을 둔다.
전제와 한계
실험은 Qwen3.5-4B, Gemma4-E4B IT, InternVL3.5-8B, UI-R1-3B 네 모델을 DeskForge-1M의 20만 개 단일 타깃 그라운딩 예시로 LoRA 파인튜닝한다. H100 8장으로 1에폭, 유효 전역 배치 크기 64다. 네 모델 모두 모든 held-out 조건에서 개선됐다. Qwen의 평균 정확도는 76.26%에서 87.54%로, UI-R1은 38.01%에서 84.59%로 올랐고, Gemma와 InternVL은 각각 85.12%, 81.42%에 도달했다. 개선폭은 데스크톱 장면이 어려워질수록 커진다. 화면 위 앱 수가 1개에서 4개 이상으로 늘 때 파인튜닝된 Qwen은 몇 점만 잃는 반면 베이스 모델과 참조 모델 UI-Venus-2-9B는 꾸준히 성능이 떨어져, 베이스와의 격차가 9.7점에서 14.3점으로 벌어진다. 타깃의 가시 면적 손실이 35%까지 커질 때도 격차가 10.9점에서 13.7점으로 커진다.
외부 전이도 확인된다. 파인튜닝에 쓰지 않은 ScreenSpot-Pro, ScreenSpot-v2, OSWorld-G, UI-Vision, MMBench-GUI 다섯 벤치마크에서 네 모델 모두 정확도가 올랐다. Qwen은 ScreenSpot-Pro에서 11.51%포인트, OSWorld-G에서 10.11%포인트 상승했고, Gemma는 다섯 벤치마크 평균이 24.9점 올랐다. UI-R1은 ScreenSpot-Pro에서 14.48%에서 27.20%로, 평균은 39.87%에서 47.14%로 개선됐다. InternVL은 평균 1.51점의 완만한 상승을 보였다. ScreenSpot-v2 세부 결과를 보면 Qwen은 데스크톱에서 14.37점, 모바일에서 10.77점, 웹에서 6.41점 올랐는데, DeskForge-1M에는 모바일 화면이 전혀 없다. 장기 과제에서도 효과가 나타난다. Qwen3.6-27B 플래너를 고정하고 액션 모델 가중치만 바꾼 비교에서, Qwen은 WebArena-Infinity 119개 과제 중 31개에서 50개로, OpenApps 100개 과제 중 3개에서 15개로 성공 수가 늘었다. Gemma는 Infinity 패널에서 5개에서 40개로 가장 크게 늘었고, InternVL은 두 환경에서 각각 7개씩, GUI 특화 모델인 UI-R1은 Infinity 7개와 OpenApps 5개를 더 풀었다. 조밀 주석은 화면 전체 요소 검출에도 쓰인다. RT-DETRv4-L 검출기를 파인튜닝해 GroundCUA로 교차 데이터셋 전이를 평가한 결과 group F1 62.17%로, OmniParser v2의 58.55%와 ScreenParse YOLO11L의 57.59%를 앞섰다.
실무 관점에서 이 논문이 주는 신호는 명확하다. 에이전트의 계획 능력은 그대로 두고 화면 좌표를 짚는 액션 모델만 바꿨는데도 다단계 과제 성공률이 크게 올랐다는 점은, GUI 자동화 파이프라인에서 병목이 추론이 아니라 시각적 그라운딩일 수 있음을 시사한다. 또 학습 데이터를 수집하는 대신 통제된 환경에서 생성하는 접근은, 자사 제품 화면에 맞는 그라운딩 데이터를 자체적으로 만들려는 팀에 참고할 만한 절차를 제공한다. 다만 접근성 트리가 제대로 노출되는 애플리케이션이어야 한다는 전제가 그대로 적용되므로, 대상 앱이 이 조건을 만족하는지 먼저 확인해야 한다.
저자들이 밝힌 한계도 분명하다. 현재 수집은 리눅스 백엔드에 의존하고, 접근성 지원이 적절한 애플리케이션을 필요로 한다. 일곱 가지 외형 프리셋은 선택된 시각적 관습을 재현할 뿐 네이티브 Windows나 macOS 애플리케이션을 실행하는 것이 아니다. 비전언어모델 학습은 단일 타깃 그라운딩에 집중돼 있어, 인터페이스 구조와 기록된 상태 변화를 함께 학습하는 것은 다음 단계로 남겨뒀다. 보존된 전이 기록은 행동 결과를 학습하는 순방향·역방향 동역학 목표에 활용할 수 있고, 상태 기반 검증을 갖춘 목표 조건부 다중 애플리케이션 과제를 개발하면 장기 컴퓨터 사용 에이전트의 온라인 학습으로 확장할 수 있다고 저자들은 전망한다.