VLM 에이전트가 성공 궤적을 시각 스킬 카드로 축적해 정책과 함께 진화한다
ViSkill: Reinforcing VLM Agents with Evolving Visual-Native Skills
무엇인가
강화학습으로 VLM 에이전트를 훈련하면 성공 전략은 정책 파라미터에 암묵적으로만 흡수된다. 에이전트는 에피소드마다 비슷한 공간 해법을 처음부터 다시 발견해야 한다. 스킬 증강 에이전트는 성공 궤적을 재사용 가능한 전략으로 증류해 이 낭비를 줄여 왔지만, 기존 접근은 대부분 텍스트 중심이다. 격자 배치, 상대 위치, 행동과 상태의 대응 관계를 언어로 펴는 과정에서 시각적 환경에 결정적인 기하 정보가 사라진다. 시각 증거를 일부 도입한 최근 연구들도 스킬 구축과 정책 최적화를 분리해 두어, 둘 사이의 상호 개선 가능성은 충분히 탐구되지 않았다. 이 논문은 이 두 간극을 표현 격차와 학습 격차로 명명하고, 저장(저장소)과 정책이 함께 진화하는 구조를 제안한다.
어떻게 동작하나
ViSkill의 핵심 단위는 복합 시각 스킬 카드다. 성공 궤적의 원본 관측 프레임에 궤적 주석을 달아 공간적·절차적 진행을 명시하고, 정책이 그 궤적을 스스로 요약해 만든 고수준 전략 설명을 같은 이미지 안에 텍스트로 렌더링해 하나의 카드로 합친다. 스킬은 z_k = (C_k, g_k, u_k, n_k)로 정의된다. C_k는 카드 이미지, g_k는 검색에 쓰는 기하 디스크립터, u_k는 효용, n_k는 사용 횟수다. 검색은 언어 매칭이 아니라 기하 유사도로 이뤄진다. 환경별 특징 추출기가 초기 과제 구성을 상대 위치·거리·장애물 같은 기하 디스크립터 g로 매핑하고, 각 스킬에 대해 q_k = α·s_k + (1−α)·u_k를 계산한다. s_k는 기하 유사도, u_k는 과거 효용이며 α=0.9다. 최고 점수 스킬이 임계값 δ_r=0.8을 넘을 때만 검색되어 VLM의 시각 컨텍스트에 그대로 붙는다. 종료 후 효용은 EMA 계수 β=0.1로 갱신된다.
무엇과 다른가
스킬 축적은 아무 성공 궤적이나 받지 않는다. 길이 예산 게이트 L(τ) ≤ L_bud(x)(과제별 솔버가 제공하는 L*(x) 사용)와 신규성 게이트 q_max < δ_d=0.9를 모두 통과해야 증류 대상이 된다. 라이브러리가 용량에 도달하면 u_k·log(n_k+1)이 가장 낮은 스킬을 축출한다. 학습 신호도 스킬을 활용한다. 실패한 궤적이라도 검색된 스킬의 참조 경로를 얼마나 따라갔는지로 부분 점수를 준다. 에이전트가 도달한 최장 지점 ℓ과 실행 궤적 길이 L(τ), 참조 궤적 길이 L_z로 r_skill = max(0, (ℓ − (L(τ) − ℓ)) / L_z)를 계산하고, 실패했고 스킬이 검색된 경우에만 R(τ) = r_env(τ) + λ·r_skill(τ, z)로 합산한다. λ=0.8이며 이 보상은 항상 완료 보너스보다 작아 전역 보상 순서를 흐트러뜨리지 않는다. 정책은 이 보상으로 PPO를 돌린다. 빈 라이브러리에서 시작하는 초기 탐색 공백을 메우기 위한 콜드스타트 옵션도 있다. 오프라인 솔버가 만든 후보 궤적을 외부 모델이 요약하고, 기하 특징 공간에서 최원점 샘플링으로 다양성을 확보해 라이브러리를 미리 채운다. 비율 γ=0.2가 기본값이고 γ=0이면 외부 모델 의존 없이 시작한다.
어떻게 쓰나
실험은 2D 공간 계획과 3D 조작을 아우르는 세 환경에서 이뤄졌다. Sokoban은 상자를 목표 위치로 밀어야 하고, FrozenLake는 구멍을 피해 목표로 이동해야 하며, PrimitiveSkill은 VAGEN의 Place·Stack·Drawer·Align과 AtlasVA의 Swap 과제로 구성된 좌표 기반 3D 조작이다. 백본은 Qwen2.5-VL-3B-Instruct이며 VAGEN, AtlasVA, ViSkill이 같은 백본과 환경 시드를 공유한다. ViSkill은 전체 성공률 0.89를 기록해 평가된 모든 상용·오픈소스 베이스라인을 앞섰다. Sokoban 0.82, FrozenLake 0.84로 월드모델 추론을 쓰는 VAGEN(0.79, 0.74)과 공간 기반 보상 셰이핑을 쓰는 AtlasVA(0.79, 0.83)를 모두 넘었고, PrimitiveSkill에서는 평균 1.00으로 AtlasVA와 동률이면서 VAGEN을 12%포인트 앞섰다. 콜드스타트를 켜면 전체가 0.91로 올라 AtlasVA의 0.87을 4%포인트 차로 벌린다. 개선은 2D에 집중되어 Sokoban이 0.82에서 0.88로, FrozenLake가 0.84에서 0.85로 오르고 PrimitiveSkill은 1.00에서 포화된다. 학습 곡선에서도 ViSkill은 표준 PPO보다 일관되게 빠르게 수렴하고 더 높은 성공률에 도달한다.
전제와 한계
절제 실험은 설계 선택의 기여를 분리한다. 스킬 표현을 원시 텍스트로 두거나 OCR로 이미지화한 Text-Skill·OCR-Skill은 Sokoban과 FrozenLake 모두에서 ViSkill에 크게 뒤진다. 원본 시각 궤적을 그대로 보존하는 것이 필수적이라는 뜻이다. 구성 요소를 빼면 스킬 유도 보상 제거 시 Sokoban −0.05, FrozenLake −0.04, 전략 설명 제거 시 Sokoban −0.10, 정책 최적화 자체를 끄면 Sokoban −0.53, FrozenLake −0.51로 가장 크게 무너진다. 검색과 증류는 유지하되 학습을 멈추면 성능이 절반 이하로 떨어지는데, 이는 정책과 스킬 라이브러리의 공진화가 핵심이라는 주장을 뒷받침한다. 하이퍼파라미터 민감도도 보고된다. 스킬 보상 가중치는 λ=0.8에서 Sokoban 0.82, FrozenLake 0.84로 정점이고 λ=0.0은 Sokoban에서 0.05 하락, λ=1.0도 성능을 떨어뜨린다. 검색 임계값은 δ_r=0.80이 최적이며 0.75는 부정합 스킬을, 0.85는 검색 빈도 부족을 낳는다. 신규성 임계값은 δ_d=0.90이 최적이고 0.85는 중복 스킬로 효용이 하락하며 0.95는 라이브러리 성장을 막는다. 콜드스타트 비율을 키우면 성능이 계속 오르며 Sokoban은 γ=0.6에서 1.00으로 포화되고 FrozenLake는 γ=1.0에서 0.89에 도달한다. 카드 해상도를 0.2배로 줄여도 Sokoban에서는 Text-Skill·OCR-Skill을 앞서며 토큰을 가장 적게 쓴다. 학습된 라이브러리를 최적화되지 않은 베이스 모델에 붙여도 효과가 있어 Sokoban 0.41, FrozenLake 0.39를 기록했고, 공동 최적화로 증류한 라이브러리가 그렇지 않은 것보다 우수했다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 명확하다. 첫째, 공간 구조가 중요한 에이전트에서는 스킬을 자연어 지시문으로 저장하는 관행이 손실이 크다. 관측 프레임을 주석과 함께 이미지로 유지하고 전략 설명을 같은 카드에 얹는 편이 검색 정확도와 토큰 효율 양쪽에서 낫다. 둘째, 스킬 라이브러리를 정책 학습과 분리된 검색 인덱스로 두지 말고, 실패 궤적에 부분 점수를 주는 보상 항과 증류 게이트를 정책 루프 안에 넣는 구성이 성능 차이를 만든다. 셋째, 품질 게이트와 신규성 게이트, 효용 기반 축출을 함께 두지 않으면 라이브러리가 중복 스킬로 비대해지면서 효용이 떨어진다. 도입 시에는 검색 임계값과 신규성 임계값을 자체 환경에서 스윕해야 하며, 논문이 쓴 0.80과 0.90은 참고값일 뿐이다.
저자들이 밝힌 한계도 분명하다. ViSkill은 현재 VAGEN 프레임워크가 지원하는 환경에서만 평가되었고, 더 복잡하거나 개방형인 설정에서 시각 스킬 카드가 같은 이점을 주는지는 검증되지 않았다. 또한 스킬 유도 보상은 유용한 부분 진전이 검색된 스킬이 표현하는 상태에 도달한다고 가정하는데, 유효한 해법이 서로 겹치지 않는 상태 경로를 지나는 경우에는 안내가 제한적일 수 있다. 실험은 전적으로 시뮬레이션 환경에서 수행되었고 사람·개인정보·물리 시스템이 개입하지 않는다. 실제 배포에는 과제별 안전 제약과 인간 감독이 필요하며, 궤적 품질·신규성 게이트는 저품질 행동 축적을 완화할 뿐 개방형 응용에서의 안전 검증을 대체하지 않는다.