실시간 GUI 피드백으로 컴퓨터 사용 에이전트를 토큰 단위 자기증류 학습한다

ComputerSD: Online Self-Distillation from Real-Time Feedback for Computer-Use Agents

arXiv2609.40253v1

Yong Du2026-09-30조회 4

무엇인가

컴퓨터 사용 에이전트(CUA)를 온라인으로 학습시킬 때 가장 큰 걸림돌은 보상의 희소성이다. 환경 검증기가 주는 것은 에피소드 끝의 성공/실패 신호뿐이고, 그 에피소드 안의 여러 행동 중 어느 것이 유효했고 어느 것이 중복이거나 잘못됐는지는 알려주지 않는다. 그래서 크레딧 할당이 계속 문제로 남는다. 온폴리시 자기증류(OPSD)는 참조 궤적이나 스킬 같은 특권 정보를 조건으로 정책이 자기 응답을 다시 채점하게 해서 토큰 수준 신호를 얻지만, 저자들은 이를 CUA 온라인 학습에 그대로 적용하면 두 가지가 깨진다고 지적한다. 첫째, 롤아웃 전에 고정된 지도는 학생이 참조 경로를 벗어나는 순간 현재 상태와 어긋나고, 그 상태에서 옳은 행동의 토큰까지 억제한다. 둘째, 지도가 만든 확률 이동이 단계의 정답 여부와 일치하지 않는다. 논문은 학습 내내 올바른 단계의 토큰 80% 이상이 억제되고, 잘못된 단계의 토큰도 20% 가까이 강화된다는 관찰을 제시한다.

어떻게 동작하나

ComputerSD의 핵심 발상은 행동을 실행한 직후의 관찰이 두 문제를 동시에 해결한다는 것이다. 행동 하나가 실행되면 그 결과가 다음 화면에 나타나고, 이 전이(transition)를 보고 쓴 피드백은 학생이 실제로 도달한 상태를 정확히 기술하므로 어긋남이 사라진다. 같은 피드백이 그 행동이 옳았는지도 판정할 수 있으므로, 특권 문맥을 만드는 신호가 그 문맥이 유발한 토큰 수준 감독을 얼마나 신뢰할지도 결정할 수 있다. 이를 위해 저자들은 GUI 분석기를 따로 학습시킨다. 먼저 OSWorld 일부에서 기본 정책으로 과제당 K개의 궤적을 수집해 성공·실패가 섞인 다양한 상호작용 풀을 만들고, 전문가 모델(Kimi-K3)이 각 단계의 문맥에 대해 단계별 가치 점수와 지도를 주석한다. 이 데이터로 Qwen3-VL-8B-Thinking에서 초기화한 분석기를 지도학습으로 미세조정한 뒤 동결하고, 온라인 학습 중에는 이 분석기만 실시간 피드백을 생성한다.

무엇과 다른가

학습 목표는 두 층으로 결합된다. 각 행동 뒤 분석기가 내놓은 지도 g를 기존 문맥 h에 붙여 특권 문맥 h+를 만들고, 같은 샘플 응답에 대해 두 문맥에서의 토큰 로그확률 차이 δ를 계산한다. 이 δ에 단계 가치 점수 s를 곱한 ℓ = s·δ를 시그모이드에 통과시켜 게이트 γ = σ(β_gate·ℓ)를 얻고, 최종 OPSD 손실은 γ·ℓ의 기대값이다. 즉 단계 판정과 방향이 맞는 토큰 신호는 강화하고 어긋나는 신호는 억제한다. 여기에 궤적 수준 GRPO 손실을 더해 L = L_GRPO + λ_OPSD·L_OPSD를 최적화하며, 논문은 λ_OPSD=0.01, 게이트 예리도 β_gate=5를 사용한다. 단계마다 분석기 호출과 재채점이 끼어들어 롤아웃이 멈추지 않도록, 환경 상호작용·GUI 분석·특권 재채점·정책 최적화를 겹쳐 돌리는 완전 비동기 파이프라인을 설계했다.

어떻게 쓰나

실험은 OSWorld-Verified에서 진행했고, Multiple Apps와 Chrome 범주를 학습에서 제외해 분포 외(OOD) 평가에 썼다. 평가셋은 도메인 내 222개, OOD 139개 과제이며 WindowsAgentArena에서 교차 플랫폼 일반화도 측정한다. 학습은 과제 4개마다 8개 궤적, 총 32개 궤적 배치로 180회 정책 업데이트, 최대 상호작용 스텝은 학습 30·평가 50이다. 결과적으로 결과 보상만 쓰는 GRPO와 비교해 Qwen3-VL-8B-Thinking에서 성공률 37.9%에서 39.8%로 1.9%p, 컴퓨터 사용 특화 모델 EvoCUA-8B에서 43.8%에서 47.9%로 4.1%p 향상됐다. 학습에서 제외한 범주에서는 21.6%→27.5%, 30.2%→34.9%로 이득이 더 컸다. GRPO는 도메인 내 성능은 올리면서 OOD 성능을 오히려 떨어뜨린 반면, ComputerSD는 두 백본 모두에서 도메인 내와 OOD를 함께 개선했다. GRPO 대비 OOD 이득은 Qwen3-VL에서 5.9%p, WindowsAgentArena에서 1.2%p, EvoCUA-8B에서 각각 5.2%p와 3.6%p다.

전제와 한계

학습 효율 분석도 눈에 띈다. ComputerSD는 Qwen3-VL-8B-Thinking에서 약 100회, EvoCUA-8B에서 40회 업데이트 만에 GRPO의 최종 성능에 도달했고, 같은 성능에 필요한 궤적 예산은 각각 GRPO의 약 56%와 22%였다. 비동기 파이프라인은 동기 버전 대비 처리량이 5배이며, 시간당 처리 궤적 수는 비동기 GRPO 약 370개 대비 ComputerSD 약 210개로 GRPO 처리량의 약 57%를 유지한다. 절제 실험은 설계의 각 요소가 필수적임을 보여준다. 미세조정하지 않은 기본 모델을 분석기로 쓰면 1.8%p, 실시간 피드백을 고정 지도로 바꾸면 4.8%p, 가치 게이트를 제거하면 3.2%p 성능이 떨어진다. 게이트 설계 비교에서는 이진 하드 게이트가 4.6%p 하락했고, 반대 방향 게이트는 교사-학생 격차가 커지면서 정책 엔트로피가 감소하는 불안정한 양상을 보였다. λ_OPSD를 0.1로 키우면 KL 손실이 다른 설정보다 10배 이상 치솟아 최적화가 흔들리고, 0.001로 줄이면 감독이 너무 약해진다.

실무 관점에서 이 논문이 주는 시사점은 명확하다. GUI 자동화 에이전트를 강화학습으로 다듬을 때 결과 보상만으로는 중간 행동의 가치를 구분할 수 없고, 그렇다고 외부 교사 모델을 붙이면 비용과 정렬 문제가 생긴다. ComputerSD는 정책 자신을 특권 문맥으로 재채점하는 자기증류에, 실행 직후 화면이라는 값싼 실시간 신호와 단계 판정 게이트를 얹어 이 비용을 통제한다. 특히 평가 시에는 GUI 분석기 호출이나 추가 지도를 전혀 쓰지 않고 평범한 문맥만으로 추론한다는 점이 중요하다. 도입을 검토한다면 분석기 미세조정에 필요한 전문가 주석 파이프라인, 게이트 예리도와 OPSD 손실 계수의 민감도, 그리고 비동기 파이프라인을 유지할 인프라 여력(동기 대비 5배 처리량 차이)을 먼저 확인해야 한다.

저자들이 밝힌 전제와 한계도 분명하다. 실험은 통제된 벤치마크 환경에서만 수행됐고 사람 참여자나 개인정보 수집은 없었다. 실제 배포 환경에서의 동작과 안전성은 이 연구의 범위를 벗어나며, 배포에는 추가 평가와 안전장치, 사람의 감독이 필요하다고 명시한다. 또한 방법 자체가 미세조정된 GUI 분석기의 품질에 의존하고, 분석기 추론과 재채점 때문에 GRPO 대비 처리량이 약 57%로 줄어드는 비용을 안고 있다.