EgoLAP이 언어 행동 추론으로 인간 영상을 로봇 학습에 연결한다

EgoLAP: Learning from Egocentric Human Data through Language-Action Reasoning

arXiv2610.08726v1

Lihan Zha2026-10-06

무엇인가

로봇 파운데이션 모델은 태스크·환경·임베디먼트를 넓혀가며 로봇 시연 데이터를 스케일업해 왔지만, 그런 시연은 수집 비용이 크고 인간 활동의 폭에 비하면 협소하다. 1인칭 인간 영상은 규모와 행동 다양성을 제공하지만, 형태·기구학·제어의 차이에서 오는 임베디먼트 갭 때문에 원시 인간 궤적은 제어의 감독 대상으로 부적합하다. 기존 연구는 상호작용 핫스팟과 어포던스, 손 포즈나 이미지 공간 트랙, 잠재 플랜, 시각적으로 편집된 임베디먼트 같은 수작업 파이프라인으로 중간 표현을 뽑아냈는데, 이런 표현은 추출 파이프라인의 귀납 편향과 실패 모드를 그대로 물려받아 확장성이 제한된다. 갭은 규모에서도 드러난다. Ego4D에 3,000시간의 1인칭 영상이 있는데도 MimicPlay와 Motion Tracks는 태스크별 인간 영상 약 10분만으로 학습하고, ATM은 100개 영상, Phantom은 태스크당 250~350개 시연을 쓴다.

어떻게 동작하나

논문의 핵심 통찰은 인간과 로봇이 저수준 행동을 공유할 필요는 없고 운동 의도(motion intent)를 공유하면 된다는 것이다. 즉 어떤 움직임을 만들어야 하는지, 그리고 현재 물리 상태에서 그것이 왜 적절한지를 공유한다. EgoLAP은 인간 손 궤적과 로봇 엔드이펙터 궤적을 동일한 언어 기반 인터페이스로 매핑하는 VLA 사전학습 프레임워크다. '무엇'은 언어 행동으로 표현한다. 포즈와 그리퍼 상태 변화를 구조적이고 시간적으로 추상화한 자연어 설명으로, 예컨대 "앞으로 3cm 이동, 시계방향 14도 회전, 그리퍼 닫기" 같은 문장이다. 결정적 정규화기 G_e가 임베디먼트 메타데이터(단일팔 로봇, 양팔 로봇, 인간 데이터)에만 특화되어 1초 창의 손 또는 엔드이펙터 움직임을 이산 토큰으로 바꾼다. 좌표계 정렬을 위해 각 샘플 시작 시점에 자기중심적 행동 프레임을 정의하는데, 손목 카메라가 있는 단일팔 로봇은 엔드이펙터 프레임, 양팔 로봇은 베이스 프레임, 인간 데이터는 헤드마운트 카메라 프레임을 쓴다. 문법은 동사·방향·크기·단위 구조이고, 이동은 병진, 기울임은 롤/피치, 회전은 요를 뜻한다. 병진 크기는 정수 cm, 회전 크기는 5도 배수로 반올림하며 0으로 반올림되는 성분은 생략하고, 그리퍼에는 열기·닫기·유지 구절을 붙이며 양팔 동작은 좌팔·우팔 절로 나눠 쓴다. 이 변환은 수동 라벨링이나 VLM 라벨링, 학습된 행동 토크나이저를 필요로 하지 않는다.

무엇과 다른가

언어 행동은 '무엇'을 말하지만 현재 물리 상태에서 '왜' 그 움직임이 적절한지는 말하지 않는다. 그래서 일부 인간·로봇 궤적에 운동 수준 추론(motion-level reasoning) r_t를 붙인다. 태스크 지시, 순서가 있는 궤적 프레임, 최근 행동 이력, 현재 프레임의 정답 언어 행동이 주어지면, 구체적인 엔드이펙터-물체 관계와 접촉·어포던스 증거, 라벨된 움직임의 즉각적 물리 효과를 서술하는 근거를 생성한다. 예를 들어 반죽 치대기의 근거는 "반죽 덩어리가 금속 볼 바닥에 놓여 있고 양 손바닥이 반죽 상단과 측면에 직접 접촉해 있다. 치대기는 볼 표면에 대항해 반죽을 변형시키는 것을 요구한다. 양손이 주로 뒤로 병진하면서 손목을 위로 기울이고 손가락을 펴서, 다음 누름 동작 전에 몸 쪽으로 반죽을 당긴다" 같은 식이다. 이 추론은 의도적으로 국소적이고 물리 중심이며, 상위 태스크나 서브태스크 추론보다 낮은 계층에 있어 저수준 행동에 직접 연결되면서 임베디먼트 사이를 전이한다. 추론과 언어 행동을 합쳐 물리적으로 근거한 '행동 사고 연쇄(action chain-of-thought)'를 이룬다.

어떻게 쓰나

아키텍처는 Mixture-of-Transformers로, PaliGemma-2B 비전-언어 백본과 처음부터 초기화한 3억 파라미터 행동 전문가(action expert)를 짝지었다. VLM은 베이스 카메라 1장과 손목 카메라 2장까지 최대 3장의 RGB 이미지, 태스크 지시, 고유수용 상태를 입력받고, 없는 카메라 뷰는 0으로 패딩한다. 정규화된 상태는 256개 균일 빈으로 이산화해 텍스트로 프롬프트에 덧붙인다. 어텐션 마스크는 구조적이다. 이미지·지시·상태 토큰이 양방향 프리픽스를 이루고, 추론과 언어 행동 토큰은 이 프리픽스에 어텐션하며 자기들끼리는 인과적이다. 행동 전문가는 자기 토큰과 관측-지시-상태 프리픽스에는 어텐션하지만 추론 토큰과 언어 행동 토큰에는 어텐션할 수 없다. 그 결과 추론 시점에 텍스트 생성이 전혀 필요 없다. 지식 절연(knowledge insulation)으로 행동 전문가의 그래디언트가 VLM에 들어가기 전에 차단되므로, 백본은 텍스트 목표로만 최적화되고 행동 전문가는 그 표현을 소비하는 법을 배운다. 손실은 λ_text·L_text + L_FM이며, 행동 지평 K=30, λ_text=0.8로 자기회귀 VLM 목표를 흐름 매칭보다 살짝 낮춘다. 추론 시 행동 전문가는 가우시안 노이즈에서 출발해 학습된 속도장을 적분해 제어 명령을 만들고, 텍스트 목표는 훈련 전용이라 제어에 생성 비용을 더하지 않는다.

전제와 한계

실세계 평가는 팔 간격과 카메라 구성이 모든 학습 임베디먼트와 다른 맞춤형 양팔 YAM 로봇에서 이뤄졌다. 강체·관절·변형체 조작에 걸친 5개 행동(Pick Place Simple, Fold Pants, Handover & Place, Wipe Object, Pick Place Complex)을 태스크당 10회, 복잡한 Pick Place만 12회 시행하고 평균 태스크 진행도를 보고한다. 시뮬레이션은 ABC 기반 양팔 벤치마크 14개 태스크로, 모델이 시뮬레이션 데이터로 학습된 적이 없어 제로샷 평가이며 태스크당 100 에피소드, 총 1,400 에피소드를 돌린다. 베이스라인은 행동 표현만 바꾼 세 계열이다. EgoLAP은 언어 행동과 운동 수준 추론을 쓰고, EgoFAST는 언어 행동을 FAST 토큰으로 바꾸되 같은 추론을 쓰며, EgoOAT는 OAT 토큰에 같은 추론을 붙인다. 백본·아키텍처·데이터 혼합·전처리·최적화 예산·평가 프로토콜이 모두 동일하고, 모든 표현이 같은 1초 행동 청크에 대응한다. 결과적으로 EgoLAP은 실세계 평균 태스크 진행도 80.1%를 기록해 대안 행동 표현 대비 2.3배 성능을 냈다. 표현을 고정하고 인간 데이터 추가 효과만 보면 시뮬레이션 성공률이 7.2%에서 16.4%로 2.3배 올랐다. 추론 없이 표현만 비교하면 EgoLAP이 시뮬 16.4%·실세계 44.5%, EgoFAST가 1.6%·35.2%, EgoOAT가 2.7%·18.0%였다. 도메인 갭이 가장 큰 미학습 시뮬레이터에서 언어 행동이 FAST·OAT보다 한 자릿수 배 좋았고, 같은 시뮬레이션 환경 데이터로 직접 학습한 ABC-VLA보다 시뮬 +16.9포인트, 실세계 +54.5포인트 앞섰다.

운동 수준 추론의 효과는 표현에 따라 극명하게 갈린다. EgoLAP은 실세계에서 44.5%에서 80.1%로 35.6포인트 올랐고 이는 5개 태스크 전부에서 유지됐으며, 시뮬레이션에서는 16.4%에서 38.3%로 21.9포인트 올라 모든 태스크군에서 유지됐다. 반면 같은 감독이 EgoFAST에는 시뮬레이션에서 7.1포인트만 더하고 실세계에서는 35.2%에서 26.1%로 오히려 해를 끼쳤다. EgoOAT는 시뮬 +0.7포인트, 실세계 +7.6포인트에 그쳤다. 인간 데이터가 추론을 강화한다는 증거도 있다. 로봇 데이터만 쓴 언어 행동 정책은 추론으로 7.2%에서 18.4%로(+11.2포인트) 오르지만, 인간 데이터를 더하면 16.4%에서 38.3%로(+21.9포인트) 오른다. 인간 데이터 추가 효과는 추론 없이 9.2포인트, 추론과 함께 19.9포인트다. 추론 형식 비교에서는 ECoT 스타일 복합 목표(현재 서브태스크, 가시 물체 바운딩 박스, 시각 트레이스)가 단독으로는 5.3%에 그쳐 추론 없는 언어 행동의 16.4%보다 낮았고, 이를 운동 수준 추론 앞에 쌓으면 14.4%로 운동 수준 추론 단독의 38.3%에 절반에도 못 미쳤다. 운동 수준 추론은 FAST에 7.1포인트, ECoT 복합에 9.1포인트, 순수 언어 행동에 21.9포인트를 더했다.

후학습 실험에서는 GRPO로 ABC의 언어 행동을 강화학습했고 비전 인코더와 행동 전문가는 동결했다. 보상은 파싱된 언어 행동의 병진 제곱 오차, 측지 회전 오차, 이진 그리퍼 오차의 합으로, 언어 행동에 대한 간접적 행동 복제 정렬 보상에 해당한다. 추론 사전학습 후 추론 생성 없이 언어 행동만 샘플링하는 변형, 추론까지 생성하는 변형, 추론 없는 베이스라인 세 가지를 비교했는데 전문가를 동결했는데도 세 갈래 모두 시뮬레이션 성공률이 올랐고, 추론 사전학습이 더 강한 초기화를 제공했다. 다만 RL 샘플링 중 추론을 생성하면 언어 행동만 샘플링할 때(+19.4%)보다 성능 향상이 작았다(+12.7%). ABC 근거 데이터가 학습에서 한 번도 본 적 없어 샘플된 근거가 분포 밖이 되고, 그 결과 뒤따르는 언어 행동 생성도 나빠지기 때문이다. 표현 정렬 분석에서는 1,002개의 균형 잡힌 인간·로봇 프레임에서 마지막 층 특징을 평균 풀링하고 각 임베디먼트 평균을 뺀 뒤 교차 임베디먼트 코사인 검색을 수행했다. 로봇→인간 R@1은 51%에서 76%로(+25포인트, 95% CI [16,39], p<.005), 인간→로봇은 42%에서 63%로(+21포인트, p=.04) 올랐다. 2-스킬 분할은 69%에서 92%로(+23포인트, CI [16,30]), MRR은 61%에서 80%로 개선됐다. 두 임베디먼트가 여전히 선형 분리 가능하다는 것은 추론이 도메인 정체성은 보존하면서 두 도메인에 같은 내부 조직(접기는 접기 근처, 놓기는 놓기 근처)을 부여한다는 뜻이다.

개발자 관점에서 이 논문의 실무적 시사점은 행동 표현 선택이 인간 데이터 전이의 성패를 가른다는 점이다. 로봇 시연만으로는 부족해 1인칭 인간 영상을 활용하려는 팀이라면, 손 포즈나 트랙을 별도 파이프라인으로 뽑아 정책에 먹이는 대신 이미 알려진 카테시안 포즈를 결정적 문법으로 언어 행동에 직렬화하고, 그 위에 접촉·기하·어포던스에 근거한 국소적 추론을 보조 감독으로 얹는 구성을 우선 검토할 만하다. 특히 추론 텍스트를 추론 시점에 생성하지 않도록 어텐션 마스크로 행동 전문가를 텍스트 토큰에서 분리하는 설계는 실시간 제어 지연에 민감한 시스템에서 그대로 참고할 수 있는 패턴이다. 다만 언어 행동과 추론의 시너지는 언어 기반 인터페이스에서만 나타났고 FAST·OAT 같은 비언어 토큰에서는 재현되지 않았으므로, 기존에 이산 행동 토크나이저를 쓰는 파이프라인에 추론 감독만 덧붙이는 것은 기대만큼 효과가 없을 수 있다. 또한 언어 행동은 기계 파싱 가능한 결정적 문법이라 별도 보상 모델 없이 검증 가능한 목표가 된다는 점도, RL 후학습을 계획하는 팀에 유용한 성질이다.

저자들이 밝힌 한계는 명확하다. 언어 행동은 현재 고정된 1초 창을 양자화된 병진과 회전으로 요약하기 때문에, 빠르고 접촉이 많은 조작에 필요한 동역학이나 정밀도를 놓칠 수 있다. 다만 언어라는 형식 자체가 적응적 정밀도를 지원할 수 있어서, 향후에는 거친 장기 지평 설명과 미세한 고주파 보정을 결합하고 포즈 트래킹, UMI, 인터넷 영상에서 나오는 근사 라벨을 허용하는 표현이 가능하다고 본다. 평가는 양팔 테이블탑 태스크에 국한되어 있고, 강화학습 연구는 시뮬레이션에만 confined되어 있으며 태스크 보상이 아니라 모션 매칭 프록시를 최적화한다. 향후 과제로 태스크 수준 피드백을 사용해 운동 수준 추론과 행동 전문가를 함께 후학습하는 것을 제안한다.