DeskMind, Mac에서 소형 모델 두 개로 컴퓨터 조작을 대신한다
Mac에서 사용자의 컴퓨터를 대신 조작하는 에이전트 DeskMind가 공개됐다. 눈에 띄는 점은 판단을 클라우드가 아니라 사용자 기기에서 도는 두 개의 소형 모델이 맡는다는 것이다. Qwen3.5 0.8B와 4B를 파인튜닝해 MLX 위에서 실행하며, 호출당 과금이나 외부 전송이 없다. 개발자 gxcsoccer는 3주, 약 600달러, 20여 차례의 학습을 거쳐 이 버전을 내놨다고 적었다.
방식은 Jev에서 착안했다. 매 단계를 텍스트 생성이 아니라 객관식으로 바꾸고, 모델이 각 선택지에 점수를 매기게 하는 구조다. Jev가 클라우드 서비스인 것과 달리 전부 로컬에서 돌리는 버전을 원해서 Qwen3.5 기반의 0.8B와 4B를 직접 학습시켰다. 결정 서비스는 Jev와 같은 POST /v1/systemone 요청 형식을 사용하므로, 기존에 쓰던 하네스는 주소만 바꾸면 이 로컬 모델에 연결된다. 동작은 2단계다. 0.8B가 확신을 가지면 약 0.5초 만에 바로 실행하고, 확신이 없으면 4B로 넘겨 약 3.6초를 들여 다시 판단한다. 해석이 두 갈래로 갈리는 지시는 임의로 고르지 않고 사용자에게 먼저 되묻는다. 예를 들어 표에 같은 이름의 주문이 두 건 있으면 어느 쪽인지 확인한다.
평가는 직접 만든 실기기 작업 13개를 각 3회씩 돌리는 방식으로 이뤄졌다. 공개 버전 기준 39회 중 38회를 성공했고, 끝내지 않고서 완료했다고 보고한 사례는 없었다고 한다. 다만 저자 스스로 문제를 직접 출제했고 표본도 작아 참고 수준이라고 밝혔으며, 문항별 결과는 모두 공개했다.
배경에는 클라우드 API를 쓰기 어려운 환경이 있다. 회사 업무에서는 외부 서비스의 API를 그대로 쓸 수 없는 경우가 많고, 겸사겸사 모델 학습 자체를 익혀보려는 목적도 있었다. 학습 데이터는 공개 데이터셋과 자체 합성 데이터를 섞었고, 데스크톱 조작 데이터는 오라클로 자동 라벨링한 뒤 대형 모델을 증류하는 방식을 썼다. 학습 인프라는 Tinker에서 시작해 알리바바 클라우드 PAI로 옮겼다가, 결국 시간 단위로 GPU를 임대하는 쪽이 가장 저렴했다고 한다.
개발자 입장에서 이 사례가 보여주는 것은 computer use 에이전트의 판단 계층을 소형 모델 두 개로 나눠 로컬에서 감당할 수 있다는 점이다. 빠른 모델이 대부분의 단계를 처리하고 느린 모델이 애매한 단계만 받치는 구조는 지연과 비용을 동시에 관리하는 한 가지 패턴이 된다. 또 요청 형식을 기존 서비스와 맞춰두면 하네스를 다시 짜지 않고 백엔드만 교체할 수 있다는 것도 실무적으로 의미가 있다.
한계도 분명히 적혀 있다. 라벨 스무딩을 0.95로 설정한 탓에 0.8B의 확신 값이 0.96 문턱 근처에 몰렸고, 그 결과 전체 단계의 70%가 4B로 넘어가 속도가 충분히 나오지 않는다고 한다. 다음 학습에서 손볼 계획이라고 밝혔다. "이 폴더 좀 정리해줘"처럼 모호한 지시는 잘 처리하지 못하고, 파일이 많은 폴더에서는 단계마다 수십 초가 걸린다. Apple 실리콘 칩에서만 동작하며 첫 실행 시 약 5.3GB의 모델을 내려받아야 한다.