로봇 정책의 내부 표현을 추론 시점에 조향해 분포 이동 성능을 되살린다

RoboIRS: Inference-Time Internal Representation Steering for Generalist Robot Policies

arXiv2610.04681v1

Jiuzhou Lei2026-10-03

무엇인가

이 논문이 다루는 문제는 vision-language-action(VLA) 모델과 world-action 모델(WAM)이 학습 분포를 벗어난 과제 변형 앞에서 성능이 떨어진다는 것이다. 저자들이 강조하는 지점은 이 저하가 완전한 무능이 아니라는 관찰이다. 정책은 새로운 장면·물체 배치·물체 외형에서도 일부 과제는 낮은 성공률로 성공한다. LLM이 같은 조건에서도 진실된 응답과 그렇지 않은 응답을 섞어 내놓는 현상과 유사하며, 최근 메커니즘 해석가능성 연구는 내부 표현을 인과적으로 조작해 행동을 바꿀 수 있음을 보여줬다. 로봇 정책에도 이런 시도가 있었지만, sparse autoencoder로 특징을 식별하는 데 그치거나(Grant 등, Swann 등), 운동 속도나 엔드이펙터 높이처럼 미리 정의된 소수 행동 속성만 조향하거나(Häon 등, Buurmeijer 등), nominal·perturbed 관측 쌍을 맞춰야 하는 제어 기반 접근(Hong 등)에 머물렀다. RoboIRS는 성공·실패 롤아웃만으로 일반 과제 성공률 자체를 겨냥한다.

어떻게 동작하나

방법의 골격은 π0.5를 예로 설명된다. π0.5는 PaliGemma 비전-언어 백본과 18개 트랜스포머 레이어로 된 action expert로 구성되고, flow matching으로 행동 청크를 반복 정제한다. 각 환경 타임스텝 t, 디노이징 스텝 n에서 잔차 스트림 R(ℓ,t,n)은 T_a개의 행동 토큰 × 1024차원이고, 개입 지점은 바로 이 토큰 수준 잔차 표현이다. 절차는 세 단계다. 먼저 과제당 성공 롤아웃 최대 10개, 실패 롤아웃 최대 10개를 모아 모든 타임스텝·레이어·디노이징 스텝의 활성값을 기록한다(30스텝 롤아웃이면 (30, 18, 10, 10, 1024) 텐서). 다음으로 조향 벡터를 만드는데, 두 가지 방식을 검토한다. 하나는 성공 롤아웃 잔차 평균에서 실패 롤아웃 잔차 평균을 뺀 대조 차이이고, 다른 하나는 성공/실패를 구분하는 로지스틱 분류기 P(y=1|x)=σ(wᵀx+b)의 가중치 w다. 라벨은 성공 롤아웃의 모든 타임스텝이 0, 실패 롤아웃은 엔드이펙터가 성공 궤적이 훑은 공간을 벗어나는 첫 스텝부터 1이 된다. 분류기 학습은 CPU 여러 개로 3분 이내에 끝나고, 검증 AUC 평균은 0.88이다. 마지막으로 개입 위치를 정한다. LLM처럼 개입 지점과 강도를 전수 탐색하는 것은 로봇에서는 매 후보마다 다단계 정책 추론이 필요해 비용이 과도하므로, 대신 홀드아웃 검증 롤아웃에서 실패 탐지 AUC가 가장 높은 행동 토큰 위치를 레이어별로 고른다. 선택된 잔차는 r_steered = r + s·α·(‖r‖/‖v‖)·v 로 수정되며, α가 강도, s∈{-1,+1}이 방향이다. 잔차 크기가 레이어마다 다르므로 ‖r‖/‖v‖로 스케일한다. 부호는 성공 공간으로 밀어 넣는 방향이라고 가정하지 않고 경험적으로 정하는데, 어떤 잠재 요인은 과소 활성화되면 +v가, 과대 활성화되면 -v가 도움이 될 수 있다는 해석이다. 한 방향을 먼저 평가하고 성능이 단조 감소할 때만 반대 부호를 시험해 롤아웃 비용을 줄인다.

무엇과 다른가

시뮬레이션 결과는 LIBERO-PRO 벤치마크에서 나온다. 원래 LIBERO로 파인튜닝된 frozen π0.5를 쓰고, 성공률이 10~85% 사이로 포화되지 않은 15개 과제를 골랐다. 조향은 마지막 디노이징 스텝에서만 적용하고, α는 [0.03, 0.05, 0.10, 0.15, 0.20]을 시드 1개·20 롤아웃으로 훑어 과제별 최적값을 정한 뒤 3개 시드에 걸쳐 150 롤아웃으로 평가했다. 평균 성공률은 44.4%에서 66.2%로 21.8%포인트 올랐다. 15개 중 12개(80%)가 개선됐고, 이 12개는 모두 조향 후 평균이 미조향 평균 + 표준편차 1개를 넘겼다. 나머지 3개는 뚜렷한 개선이 없었는데 L5와 L12는 소폭 감소, L8은 변화 없음이며, L5·L12의 감소는 미조향 성능의 표준편차 범위 안이라 실질적 퇴보로 보기 어렵다고 저자들은 정리한다.

어떻게 쓰나

베이스라인 비교에서는 contrastive activation addition(CAA), sample-and-re-rank(K=16), flow velocity에 대한 gradient guidance와 겨룬다. RoboIRS가 평균 66.2%로 가장 높았고, re-ranking은 추론 시간을 1074.86ms까지 늘려 다른 방법의 약 8배를 썼다. 과제별로는 re-ranking이 7개 과제에서 평균 9.7%포인트 앞섰지만, RoboIRS는 나머지 8개 과제에서 평균 22.7%포인트 크게 앞섰다. gradient guidance는 거의 도움이 안 됐는데, 분류기가 주로 인코딩된 상태에 의존해 행동 공간 그래디언트가 약하기 때문이며, 행동만 쓰는 분류기로 계산하면 평균 43.5%였다. 절제 실험에서는 각 레이어에서 AUC가 가장 높은 토큰을 마지막 디노이징 스텝에서만 조향하는 것이 π0.5에 가장 좋았다. 무작위 방향 대조군은 미조향 기준선과 비슷해, 분류기에서 유도한 방향 자체가 중요하다는 근거가 된다. 아키텍처 확장도 확인된다. DiT 기반이고 학습 레시피가 다른 world-action 모델 Cosmos Policy에 적용해 8개 과제에서 매크로 평균 성공률이 35.4%에서 55.4%로 올랐고 6개 과제가 의미 있게 개선됐다. Cosmos Policy는 별도 action expert 없이 행동 청크를 잠재 프레임에 타일링해 196개 토큰을 만들기 때문에, 단일 토큰 대신 마지막 트랜스포머 블록의 196개 토큰 전체를 조향하고 분류기는 196개 토큰의 평균 풀링 잔차로 학습했다. 정규화 공간에서 학습했기 때문에 조향 벡터로 w/σ와 w⊙σ 두 가지를 쓰는데, 전자가 C1~C5에서, 후자가 C6~C8에서 더 좋았다. 실로봇 조작 2개 과제에서도 같은 π0.5 정책의 성공률이 개선됐지만, 본문에 구체적 수치는 제시되지 않았다.

전제와 한계

분석 파트에서 저자들은 실패 모드를 두 갈래로 나눈다. 의사결정 오류가 지배적인 과제(L3, L6, L9, L10, L11, L14, L15)에서는 평균 24.9%포인트, 행동 정밀도 오류가 지배적인 과제(L1, L2, L4, L5, L7, L8, L12, L13)에서는 평균 19.1%포인트가 올랐다. 예컨대 L10에서 미조향 정책은 물체 위치가 바뀐 뒤 알파벳 수프 대신 버터를 자주 집었는데 조향 후에는 올바른 물체를 고른다. 개선되지 않은 3개 과제의 분류기는 검증 AUC도 낮았다(L5 0.701, L8 0.827, L12 0.820, 전체 선택 지점 평균 0.90). t-SNE 시각화에서는 조향된 잔차가 국소적으로 더 밀집하는 경향이 보였고, L8의 실패 롤아웃 잔차는 조향 후 성공 롤아웃 영역으로 이동했는데도 과제 성공률은 오르지 않았다. 저자들은 이를 성공·실패를 예측하는 방향이 반드시 성공률을 올리는 인과적 조향 방향은 아니라는 증거로 읽는다. 조향 벡터의 과제 간 전이는 실패 원인이 비슷한지에 달려 있다. 그릇을 접시에 놓기 과제에서 L2 벡터를 L5로 옮기면 62%에서 86%로 올랐지만(둘 다 부정확한 파지로 실패), L10 벡터를 L6로 옮기면 46%로 떨어졌다(L10은 버터와 혼동, L6는 샐러드 드레싱과 혼동).

개발자 관점에서 이 논문의 실용적 함의는 정책 파라미터를 전혀 갱신하지 않고 추론 시점 개입만으로 분포 이동 성능을 되살린다는 점이다. 이미 배포된 frozen 정책 위에 성공·실패 롤아웃 몇 개를 모아 작은 선형 분류기를 학습하고, 검증 AUC로 개입할 레이어·토큰 위치를 고른 뒤, 조향 강도 α만 과제별로 스윕하면 된다. 분류기 학습이 CPU로 3분 이내이고 추론 시간 증가도 작다는 점은 재학습 파이프라인 없이 빠르게 보정이 필요한 현장에 매력적이다. 다만 재사용성을 기대할 때 주의할 점이 있다. 조향 벡터는 과제별로 따로 만들어야 하고, 다른 과제로 전이하려면 실패 원인이 유사한지 먼저 확인해야 한다. 또한 개입 위치와 벡터 구성 방식이 아키텍처에 의존한다. π0.5에서는 마지막 디노이징 스텝의 레이어별 최고 AUC 토큰 하나가 최적이었지만, Cosmos Policy에서는 196개 토큰 전체를 조향해야 했고 정규화 공간 해석에 따라 w/σ와 w⊙σ 중 무엇이 나은지도 과제마다 갈렸다. 즉 새 정책에 적용할 때는 개입 지점과 벡터 형태를 다시 정하는 작업이 필요하다.

저자들이 밝힌 한계는 세 가지다. 첫째, 성공 롤아웃과 실패 롤아웃의 행동 자체가 뚜렷하게 다르지 않은 과제에서는 라벨링과 분류기 학습이 어려워 방법이 덜 효과적일 수 있다. 둘째, 실험은 소수의 VLA·WAM 아키텍처에 국한된다. 이 연구의 주된 목적이 LLM의 표현 조향 기법을 로봇 정책으로 옮기는 것의 실현 가능성을 살피는 데 있기 때문이며, 아키텍처마다 과제 관련 정보를 다르게 인코딩하므로 개입 위치·조향 벡터·조향 전략을 달리 골라야 할 수 있다고 본다. 셋째, LLM의 관련 표현 조향 기법들과 마찬가지로 조향 강도 같은 하이퍼파라미터를 경험적으로 선택해야 하므로 배포 전에 추가 비용이 발생한다.