GUI와 CLI를 함께 쓰도록 학습해 컴퓨터 사용 에이전트를 개선한다
HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents
무엇인가
컴퓨터 사용 에이전트(CUA)는 화면을 보고 마우스와 키보드를 조작해 디지털 작업을 대신 수행한다. 이 논문이 겨냥하는 문제는 기존 CUA의 실행 방식이 양자택일이라는 점이다. GUI 상호작용에만 의존하는 방식은 반복 작업에서 비효율적이고 오류가 잦다. 반대로 애플리케이션별 API나 전용 도구를 붙여 GUI를 보강하는 방식은 앱마다 상당한 엔지니어링이 필요하고 다른 앱으로 확장하기 어렵다. 저자들은 다음 세대 CUA가 GUI의 범용성과 셸 명령의 효율성을 동시에 가져야 한다고 주장한다. 목표는 한 작업 안에서 GUI와 CLI를 섞어 쓰는 하이브리드 실행이다. 여기서 핵심 난제는 현재 모델이 작업 수행 중 언제, 어떻게 CLI를 써야 하는지 모른다는 것이다.
어떻게 동작하나
저자들은 이 난제를 데이터로 푼다. GUI만 쓰는 궤적, CLI만 쓰는 궤적, GUI와 CLI를 번갈아 쓰는 궤적 — 세 종류를 만들어내는 데이터 구축 파이프라인을 설계했다. 그 산출물이 HybridCUA-8K이며, 5K개의 하이브리드 궤적과 3K개의 검증된 RLVR 태스크로 구성된다. 즉 하이브리드 실행을 흉내 낼 수 있는 시연 데이터와, 정답 검증이 가능한 강화학습용 문제를 함께 확보한 셈이다.
무엇과 다른가
학습 프레임워크는 두 단계다. 먼저 구축한 궤적에 대해 지도 미세조정(SFT)을 수행해 하이브리드 실행의 기본 형태를 익히게 한다. 이어서 CLI 인지 보상(CLI aware rewards)을 사용하는 강화학습을 적용한다. 이 보상 설계의 목적은 에이전트가 CLI를 아무 때나 남발하지 않고 선택적으로, 그리고 신뢰할 수 있게 쓰도록 유도하는 것이다. 이렇게 학습된 모델이 HybridCUA-9B다.
어떻게 쓰나
실험 결과는 OSWorld에서 53.6% 정확도로, 베이스 모델 대비 14.8%포인트 향상이다. WindowsAgentArena에서는 4.0%포인트 향상을 기록했다. 저자들은 이를 하이브리드 GUI·CLI 패러다임의 효과와 크로스 플랫폼 일반화 가능성의 근거로 제시한다. 다만 제공된 원문 범위에는 베이스 모델의 구체적 정체, 비교 대상 베이스라인의 개별 수치, 보상 함수의 정확한 형태, 학습 하이퍼파라미터가 제시되지 않았다.
전제와 한계
개발자 관점에서 이 논문이 주는 실무적 시사점은 명확하다. OS 수준 자동화, 설치·설정 작업, 대량 파일 처리, 반복적인 개발 환경 조작처럼 셸 명령 한 줄로 끝나는 일을 GUI 클릭으로 풀어내는 것은 낭비다. HybridCUA는 그 판단을 모델이 스스로 하도록 데이터와 보상으로 학습시키는 구성을 보여준다. 에이전트를 직접 만든다면 행동 공간에 셸 실행을 넣을 때의 권한·샌드박스 경계, 대상 환경에 셸이 실제로 존재하는지, 그리고 CLI 호출이 실패했을 때 GUI로 되돌아가는 복구 경로를 함께 설계해야 한다.
저자가 명시한 한계 절은 제공된 원문 범위에서 확인되지 않는다. 다만 논문의 전제는 분명하다. CLI를 쓸 수 있는 환경이어야 하고, 평가는 OSWorld와 WindowsAgentArena 두 벤치마크에 한정되며, 하이브리드 궤적 5K와 검증 태스크 3K 규모의 데이터 구축 파이프라인을 먼저 돌려야 한다는 비용이 따른다. 크로스 플랫폼 일반화는 4.0%포인트 향상으로 보고됐지만, 셸 명령 체계가 다른 운영체제 전반으로 어디까지 옮겨가는지는 이 수치만으로 단정하기 어렵다.