SimpleICL은 로봇 인컨텍스트 학습의 프롬프트 모호성을 문제 정의로 해소한다

In-context Robot Learning Made Simple: A Democratized Recipe for Manipulation Tasks

arXiv2609.38173v1

Minxing Li2026-09-29조회 5

무엇인가

로봇 인컨텍스트 학습(ICL)은 사람이 물체를 조작하는 영상을 프롬프트로 주면 로봇이 그 과제를 추론해 실행하는 패러다임이다. 문제는 이 과제 자체가 제대로 정의되어 있지 않다는 점이다. 하나의 시연 영상은 행동 궤적, 물체의 의미, 조작 어포던스, 공간 관계, 과제 목표를 동시에 담고 있어서 로봇이 무엇을 따라야 하는지가 불분명하다. 사람의 손 궤적을 그대로 재현해야 하는지, 물체 의미만 보고 상황에 맞게 응용해야 하는지, 조작 방식까지 똑같이 따라야 하는지가 영상만으로는 결정되지 않는다. HOST, GEN 1.5, Zero-WAM 같은 동시대 연구들이 제로샷 일반화의 가능성을 보였지만, ICL이 최소한 무엇을 필요로 하는지, 데이터는 어떻게 설계해야 하는지, 미세한 어포던스까지 학습 가능한지는 미해결로 남아 있었다.

어떻게 동작하나

이 논문의 첫 번째 기여는 프롬프트 모호성을 걷어내는 문제 정의다. 모델이 배워야 할 대상으로 네 가지 의미 차원을 제시한다. 행동 의미(잡기·놓기·회전·누르기 같은 범주 수준의 행동 구분), 구성 의미(행동들의 구조와 순서 — 물체를 집기 전에 회전하는 것과 집은 뒤 회전하는 것은 다른 의미다), 물체 의미(공간 궤적을 흉내내는 것이 아니라 특정 물체를 조작한다는 인식, 즉 실행 시점의 물체 위치가 시연과 다르면 실제 포즈에 맞춰야 한다), 어포던스 의미(머그컵의 몸통을 잡을지 손잡이를 잡을지 같은 조작 방식의 추론)다. 반대로 흔들리지 않아야 할 세 가지도 명시한다. 시연과 실행 환경 사이의 물체 위치 불일치, 사람의 실행 속도·팔 형태·손 모양·파지 각도 같은 저수준 행동 세부, 조명·배경·방해 물체 같은 장면 변화다. 단, 극단적인 위치 차이는 별개의 의미로 취급한다.

무엇과 다른가

데이터 설계는 이 정의를 강제하도록 짜였다. 같은 장면에서 서로 다른 행동을 하는 시연을 모아 행동 판별 데이터를 만들고, 물체 위치를 일부러 어긋나게 하고 의미적으로 다른 방해 물체를 배치해 물체 판별 데이터를 만든다. 동일한 행동 집합을 다른 순서로 배열해 구성 판별 데이터를, 사람 손과 로봇 그리퍼의 파지 위치·방식을 쌍마다 일치시키되 쌍 사이에서는 다르게 해 어포던스 판별 데이터를 구성한다. 여기에 시연자 불변성(맨손·장갑·피부톤 변화)과 환경 불변성(조명·색온도·시점 변화) 증강을 더한다. 수집은 장면과 그 안의 실행 과제 묶음을 단위로 하는 그룹 기반 전략을 쓰며, 완전히 새 장면으로 넘어가는 major 전환과 물체 배치·조명·배경만 바꾸는 minor 전환을 구분한다. minor 전환으로 사람 시연과 로봇 실행의 장면 결합을 끊어 궤적 복사를 막으면서, 로봇 플랫폼 하나로 하루 최대 3,000개의 유효한 사람-로봇 데이터 쌍을 얻는다고 저자들은 밝힌다.

어떻게 쓰나

모델은 비주얼 프롬프트 인코딩 모듈이 핵심이다. 원본 시연 영상을 사전학습 비주얼 인코더(ViT나 동결된 백본)로 프레임 임베딩 시퀀스로 만들고, 이를 펼쳐 공유 잠재 공간으로 투영한다. 이어 무작위로 초기화한 소수의 학습 가능한 컨텍스트 토큰이 cross-attention으로 영상 임베딩 시퀀스를 반복 질의하면서 과제와 무관한 배경 잡음과 사람 손 모양 같은 세부를 억제하고 과제 관련 단서만 뽑아낸다. 출력은 압축된 조건 토큰 집합이며, 원래 텍스트와 상태 임베딩을 담고 있는 비디오 DiT와 액션 DiT의 컨텍스트에 이어 붙여 cross-attention으로 최종 조건부 정책을 만든다. 컨텍스트 토큰 수가 영상 길이와 무관하게 고정되어 장기 과제로 확장되고, 키프레임을 휴리스틱으로 고르지 않고 정책과 함께 종단간 미분 학습된다는 것이 장점으로 제시된다. 구현은 Wan2.2-5B를 백본으로 1B 액션 DiT, 액션 지평 32, 128개 쿼리 토큰, 4개 블록·은닉 차원 3072의 0.6B 쿼리 모듈을 쓰고, 비디오 DiT는 LoRA로, 나머지는 전체 파라미터로 학습한다.

전제와 한계

시뮬레이션은 RoboTwin 2.0에서 ICL 지향 데이터 18,000개 시연으로 학습하고, RoboTwin이 기본 지원하지도 학습셋에 있지도 않은 7개 신규(OOD) 과제로 평가한다. 저자들이 보고한 핵심 수치는 미래 예측을 제거했을 때의 급락이다. 시각적 모호성 과제 성공률이 72.1%에서 20.2%로, OOD 과제가 65.9%에서 17.9%로 떨어져 비디오 시연에서 시간적 정보를 활용하는 데 미래 예측이 결정적이라고 주장한다. 또한 ICL 지향 데이터로 학습한 모델은 비디오 조건 없이도 시각적 모호성 상황에서 더 높은 성공률을 보였고, 비디오 조건은 학습에 없던 신규 과제 성능을 끌어올렸다. 실세계 실험은 Franka 플랫폼과 Intel RealSense D435 카메라 3대, 3Dconnexion 스페이스 마우스 텔레오퍼레이션으로 수행했고, 학습셋에 없던 물체를 쓰는 8개 과제(무게 재기, 접시 닦기, 차 서빙, 서랍 당기기, 비누 디스펜서 누르기, 과일 놓기, 젓가락 정리, 선반 정리)를 Easy(단일 과제)·Medium(여러 과제 중 선택)·Hard(같은 과제에 유효한 대상이 여러 개) 세 난이도로 평가했다. 베이스라인은 Fast-WAM과 π0.5이며, 본문 발췌에는 Table 3의 개별 수치가 제시되지 않았다. 견고성 표(Table 5)에서는 원래 성능 0.81, 공간 불일치 0.79, 시연자 외형 0.77, 스타일 0.80, 조명 0.78, 배경 0.79, 방해 물체 0.75로 평균 0.78을 기록했고, cross-group pairing을 뺀 모델은 공간 불일치에서 0.51로 무너지며 평균 0.70에 그쳤다.

구성과 어포던스는 별도로 분석했다. 구성 판별은 같은 장면에 다른 순서의 시연을 명시적으로 넣지 않아도 모델이 장면 내용과 순서 패턴을 스스로 분리해 학습했다. 반면 어포던스 판별은 같은 물체에 서로 다른 파지 방식을 담은 데이터를 명시적으로 만들어야만 습득되었고, 현재 설정에서는 모델이 물체 정체성과 어포던스를 스스로 분리하지 못했다. 저자들은 ICL 범위에서 미세한 어포던스가 전역적 시간·구성 관계보다 학습하기 어렵다고 해석한다. 어텐션 시각화에서는 초기에 손에만 집중하고, 손이 목표 물체에 처음 닿는 순간과 과제 완료 시점에 두 번 피크가 나타나며, 중간 단계에서는 양손과 물체를 따라가는 상호작용 중심의 시간 구조가 관찰되었다.

실무 관점에서 이 논문의 값어치는 성능 수치보다 레시피에 있다. 거대 사전학습이나 전용 데이터 인프라 없이, 사람 시연 영상과 소규모 로봇 실행 데이터만으로 새 물체·새 과제에 일반화하는 정책을 만들려는 팀이라면 먼저 프롬프트에서 무엇을 따르고 무엇을 무시할지 명시적으로 정의해야 한다는 것이 이 연구의 주장이다. 데이터 수집 단계에서 시연 장면과 실행 장면을 의도적으로 분리하지 않으면 모델이 궤적 복사 지름길을 학습한다는 점, 어포던스처럼 미세한 의미는 데이터를 명시적으로 설계하지 않으면 학습되지 않는다는 점은 실제 파이프라인 설계에서 바로 확인해야 할 항목이다. 한계도 분명하다. 저자들은 실행 속도, 팔 형태, 손 모양, 파지 각도, 개인 습관 같은 사람 행동의 저수준 세부를 이 논문 범위에서는 무관한 잡음으로 취급한다고 밝히며, 실행 속도를 시연에 맞추는 것 같은 세밀한 조건화가 필요한 상황은 다루지 않는다. 극단적인 위치 차이는 별개 의미로 간주하고, 어포던스는 명시적 데이터 없이는 분리되지 않는다는 점도 전제로 남는다. 데이터·학습 파이프라인 전체를 오픈소스로 공개하겠다고 예고했다.