EyeRobot 2.0이 손목 카메라 없이 능동 시선으로 정밀 조작을 해낸다

EyeRobot 2.0: Active Gaze for Precise Manipulation without Wrist Cameras

arXiv2610.03710v1

Kush Hari2026-10-02조회 7

무엇인가

양팔 로봇으로 마커 뚜껑을 덮거나 빨대를 컵 구멍에 꽂는 정밀 조작을 하려면 시각 정보가 정확해야 한다. 지금까지 널리 쓰인 방식은 그리퍼에 손목 카메라를 다는 것이다. 하지만 시야를 그리퍼에 묶으면 공구 사용, 전신 조작, 잡은 물체가 카메라를 가리는 상황에서 한계가 생기고, 그리퍼 설계도 복잡해지며 모션 블러와 자아 카메라 가림이 따라온다. 저자들은 손목 카메라를 빼는 비용을 수치로 제시한다. 같은 데이터로 학습한 표준 정책에서 수동 스테레오만 쓰면 실환경 성공률이 52%에서 27%로 떨어진다. 이 논문은 그 격차를 손목 카메라 없이 메우는 것을 목표로 한다.

어떻게 동작하나

제안하는 것은 Active Visual Fixation(AVF)이다. 두 눈 시점이 장면의 하나의 3D 고정점(fixation point)을 향해 회전해 시선을 중앙에 모으고, 그 결과 영상은 중심부에 더 많은 시각 토큰을 배분하는 방식으로 포비에이티드(foveated) 처리된다. 계산을 과제 관련 특징에 집중시키는 물리적 어텐션인 셈이다. 고정점은 매 타임스텝 갱신되고, 고정점 중심의 스테레오 멀티 크롭 관측이 하위 그리퍼 정책에 들어가 행동 청크를 만든다. 카메라를 광학 중심 기준으로 회전시키는 것은 3D 재구성 없이 영상 워핑만으로 합성할 수 있어서, 데이터 수집과 학습, 배포에 같은 스테레오 카메라를 쓸 수 있다.

무엇과 다른가

시선 학습은 두 단계다. 1단계는 목표 객체 조건부 고정 정책으로, 언어 프롬프트와 현재 고정 관측, 극좌표로 표현된 현재 고정점을 입력받아 방위각·고도 변화량과 거리 변화량을 이산 분포로 출력한다. 텔레옵 데모에서 뽑은 스테레오 정지 영상 롤아웃에 PPO를 적용하고, SAM3로 언어 프롬프트에 해당하는 객체를 검출한 뒤 FoundationStereo로 뽑은 깊이를 마스크와 교차시킨 3D 중심을 정답 위치로 삼아 r = -||p_cur - p_gt||_2 보상을 준다. 결과는 30Hz로 과제 관련 객체를 빠르게 고정하는 가벼운 정책이다. 2단계는 언제 어디를 볼지 정하는 상위 타깃 선택기다. EyeRobot과 같은 BC-RL 루프로, 로봇 프로프리오셉션을 조건으로 과제별 프롬프트에 대한 범주 분포를 내고 15프레임마다 새 타깃을 낸다. 보상은 BC 정책의 행동 예측 오차에서 뽑는다. 예측·정답 양팔 행동 청크를 같은 좌표계로 옮긴 뒤 정답에서 더 많이 움직인 '활성 팔'을 찾고, 그 팔의 두 청크 사이 아크길이 프레셰 거리의 음수를 보상으로 쓴다. 양팔 데모의 허위 상관에 둔감해지고 L2보다 속도 불변적인 지표라는 설명이다. 사람의 시선 라벨 없이도 과제 수행을 돕는 고정 순서가 학습된다.

어떻게 쓰나

행동 표현도 고정점 기준으로 바꾼다. 프로프리오셉션과 행동 청크를 고정점을 향한 사이클로피언(가상 중심안) 회전으로 정의되는 고정 상대 SE(3) 프레임으로 정규화한다. 이 프레임은 고정점을 따라 동적으로 움직이며 학습할 행동 분포의 크기를 줄인다. 그리퍼 정책은 고정점까지의 거리도 관측으로 받아 깊이를 이해하는 앵커로 쓴다. 시뮬레이션 ablation에서 월드 프레임 SE(3) 행동을 쓰면 성능이 21% 떨어져 시선 없는 자아 전용 베이스라인과 비슷해졌는데, 저자들은 저데이터 영역에서 전역 출력 공간이 특정 궤적 위치에 과적합되기 쉽다고 해석한다.

전제와 한계

실험은 실제 7개, MuJoCo 시뮬레이션 6개 과제로 구성된다. 과제당 10~53분의 텔레옵 데이터를 모았고, 14자유도 I2RT YAM 양팔 매니퓰레이터에 손목 카메라 없이 베이스 관절 위 35cm, 아래로 45도 기울인 고정 스테레오 카메라를 달았다. 각 눈은 대각 120도 화각에 1600x1200 해상도다. 베이스라인은 ACT로 같은 데이터, 같은 아키텍처와 하이퍼파라미터로 학습했고, 시뮬레이션에서 여러 행동 공간을 비교해 가장 좋았던 엔드이펙터 상대 SE(3)를 실제 평가에도 썼다. 실제로는 과제당 25개 장면 구성과 3개 시드로 1000회 이상의 물리 롤아웃을, 시뮬레이션은 100개 무작위 구성에서 1800회 롤아웃을 평가했다.

결과는 일관된다. 정적 스테레오 정책 대비 시뮬레이션에서 평균 20%, 실제에서 40% 높은 성능을 냈다. 정밀 과제에서 격차가 특히 크다. 마커 삽입은 4%에서 68%로, 빨대 삽입은 8%에서 44%로 올랐다. 손목 카메라가 잘 보이는 정밀 과제(마커, 티, 토스터, 렌치)에서는 자아+손목 정책과 비슷했고(69% 대 64%), 잡은 물체가 손목 카메라를 가리는 과제(버블티, 냄비)에서는 48% 대 22%로 두 배 이상 앞섰다. 손목 카메라 정책은 이런 상황에서 시선 없는 스테레오 수준으로 무너졌다. 색색의 방해 물체를 흩뿌린 실험에서도 손목 카메라 정책은 시야에서 가장 크거나 눈에 띄는 물체로 손을 뻗고 되돌아오지 못한 반면, 능동 시선은 첫 파지 성공률이 유의하게 높았다. 시선 분석에서는 마커 과제에서 뚜껑을 먼저 응시하다가 마커를 집기 직전에 시선을 옮기고 뚜껑을 덮는 동안 유지하는 등 사람과 유사한 전환이 나타났고, 때로는 연필 파우치 같은 정적 물체를 조작 중 앵커로 쓰기도 했다. 구성 요소별 ablation도 원문에 있다. 포비에이션(다중 스케일 이미지 피라미드)을 빼고 눈마다 주변부 뷰 하나만 쓰면 실제 성능이 20% 떨어졌고 세밀한 이미지 이해가 필요한 정밀 과제에서 격차가 가장 컸지만, 시뮬레이션에서는 차이가 없었다. 저자들은 시뮬레이션 실행 변동이 거의 없어 폐루프 시각 서보잉 수요가 적기 때문일 수 있다고 본다. 스테레오 대신 단안만 쓰고 고정 깊이 입력도 빼면 실제 과제 평균 18% 나빠졌다.

실무 관점에서 볼 점은 세 가지다. 첫째, 시선 정책과 그리퍼 정책을 분리해 각각 RL과 BC로 학습하는 구조라 손목 카메라 없이 자아 시점 데이터만으로 정밀 과제를 노리는 팀이 그대로 참고할 수 있다. 둘째, 행동을 고정점 상대 좌표계로 정규화하는 아이디어는 시선 모듈을 쓰지 않더라도 행동 분포를 좁히는 일반적인 트릭으로 시도해볼 만하다. 셋째, 비용을 감안해야 한다. 학습은 NVIDIA L40S 8장으로 돌렸고, 추론 처리량은 베이스라인이 약 40Hz인데 AVF 정책은 약 20Hz다. 또 시선 정책이 안정될 때까지 1초를 기다린 뒤 행동을 시작한다. 실시간성이 중요한 과제라면 이 지연을 먼저 확인해야 한다.

저자들이 밝힌 한계는 분명하다. 현재는 과제별 시선·그리퍼 정책만 학습하며, 멀티태스크로 확장하려면 타깃 선택기가 일반 프롬프트를 다룰 수 있을 만큼 큰 코퍼스로 학습돼야 하고 프롬프트 생성을 위한 별도 아키텍처(예: 비전-언어 모델)가 필요할 수 있다. 이 연구는 머리나 목의 움직임을 제어하지 않으며, 좋은 머리 위치가 이미 주어졌다는 전제 아래 미세한 눈 움직임의 조정만 다룬다. 또한 객체 수준 사전학습으로 충분한 과제가 많지만, 조작에 더 도움이 될 수 있는 객체 내부(sub-object) 수준의 시선은 아직 학습하지 못한다.