공개 인코더만으로 로봇 월드모델을 무력화하는 전이 가능한 국소 패치

TAPDreamer: Transferable Adversarial Patches for World Action Models

arXiv2610.06814v1

Xuanyu Lu2026-10-05조회 1

무엇인가

월드 액션 모델(WAM)은 로봇 제어를 위한 범용 기반으로 떠오르고 있다. 현재 관측만으로 행동을 예측하는 대신, 시각 세계가 로봇 행동과 함께 어떻게 진화하는지를 학습한다. 문제는 이 파이프라인이 시각 표현을 암묵적으로 신뢰한다는 점이다. 카메라는 외부에서 접근 가능한 입력 채널이고, 시각 인코더는 태스크와 모델 사이에서 재사용되는 경우가 많다. 즉 공유 인터페이스 하나가 오염되면 모델별 액션 헤드를 우회할 수 있다. 기존 WAM 공격들은 행동이나 예측 미래에 대해 최적화하므로 대상 모델의 출력이나 생성 모듈 접근이 필요했다. 이 논문은 그 접근 요구를 없앨 수 있는지 묻는다.

어떻게 동작하나

TAPDreamer의 위협 모델은 이렇다. 공격자는 공개된 시각 인코더의 가중치와 그래디언트에 화이트박스로 접근하고, 소스 태스크 하나의 공개 데모 이미지 몇 장을 갖는다. 이미지 정규화와 카메라 뷰 구성 같은 전처리도 안다고 가정한다. 반면 다운스트림 월드 모델과 액션 디코더, 그 그래디언트, 행동 레이블, 태스크 보상은 필요 없다. 대상 정책 질의도 없다. 능력은 고정된 국소 영역의 픽셀을 교체하는 것뿐이며, 공격된 관측은 T_p(x) = (1-M)⊙x + M⊙p 로 표현된다. 배포 시 패치 내용·위치·면적은 고정되고, 벤치마크 안에서 태스크와 모델에 걸쳐 같은 패치를 재사용한다.

무엇과 다른가

패치 구성 절차는 단순하다. 소스 태스크 하나의 서로 다른 데모에서 6프레임을 뽑아(J=6) 깨끗한 잠재를 캐시하고, 패치 영역 전체에 대해 인코더 출력의 모든 잠재 위치와 채널에서 깨끗한 표현과 패치된 표현의 평균 L1 거리를 최대화한다. Adam gradient ascent 500스텝, 학습률 0.02, 픽셀은 [-1,1] 균등 초기화 후 매 업데이트마다 범위로 투영하고 마스크로 지지집합을 강제한다. LIBERO에서는 224×448 캔버스의 외부 뷰 좌상단 81×81 영역으로 입력의 6.54%를, RoboTwin에서는 6.59%를 차지한다.

어떻게 쓰나

실험은 LIBERO 40개 태스크(4개 스위트 × 10개, 태스크당 50회 시행)와 RoboTwin 50개 태스크(태스크당 100회 시행)에서 폐루프로 수행됐다. 기본 평가 모델 FastWAM은 깨끗한 입력에서 97.65% 성공률을 보이지만 고정 패치 하나로 0.00%가 된다. RoboTwin도 90.86%에서 0.00%로 떨어진다. 위치와 면적을 맞춘 랜덤 패치는 각각 81.45%, 79.20%를 유지하므로, 성능 하락을 단순한 국소 가림으로 설명할 수 없다. LIBERO 네 개 스위트 모두 0.00%다.

전제와 한계

전이도 강하다. 패치를 고정한 채 victim 모델만 바꾸면 DreamWAM-uncond 1.45%, DreamWAM-joint 1.00%, Motus 10.60%로 떨어진다. 같은 조건의 랜덤 패치는 84.55%, 86.10%, 82.40%를 유지한다. 재최적화를 위한 대상 모델 피드백은 쓰지 않는다. 저자들이 강조하는 지점은 DreamWAM-uncond가 미래 프레임을 명시적으로 읽지 않고 행동을 예측하는 구성인데도 강하게 영향받는다는 사실이다.

메커니즘 분석은 왜 국소 패치가 장면 전체를 흔드는지 설명한다. VAE 인코더 병목의 14×28 공간 self-attention에서, 표현 변화의 제곱 크기 중 패치 풋프린트 밖 비율이 attention 입력에서는 1% 미만이지만 출력에서 약 71%, 최종 잠재에서 79%로 올라간다. ΔH = ΔU + (AΔV + ΔAV + ΔAΔV)W_O 분해에서 TAPDreamer는 가중치와 값의 결합 변화항 ΔAΔV가 가장 크고, 랜덤 패치에서는 이 항이 작다. attention 가중치나 값을 깨끗한 것으로 복원하면 잠재와 행동 변화가 크게 줄고 풋프린트 밖 섭동이 억제된다. 또 풋프린트 밖 위치들이 거의 같은 방향과 크기의 변화 벡터를 받아 일관된 변위를 만든다. 전이 측면에서는 12개 소스 상태의 평균 변화를 템플릿으로 삼았을 때 36개 홀드아웃 상태 변화와의 중앙 코사인 유사도가 0.981이고 잔차 비율 중앙값은 0.206이다. 같은 관측의 깨끗한 표현끼리 교차 태스크 코사인 유사도는 0.371에 그친다. 하한 비율 중앙값은 0.833(범위 0.732–0.918)이며, 풋프린트 밖 최종 잠재 변화 에너지의 약 95.3%가 공유 공간 성분에 있고 그 방향의 교차 태스크 코사인 유사도는 약 0.997이다.

개발자에게 주는 의미는 방어 지점에 대한 것이다. 시각 인코더를 공유하는 로봇 스택에서 다운스트림 액션 생성만 보호하면 충분하지 않다. 공개 VAE 인코더를 재사용하는 파이프라인이라면 인코더 단계에서 국소 패치 내성을 평가해야 하고, 카메라 입력 경로와 전처리 정규화, 뷰 합성 방식이 공격자에게 알려질 수 있다는 전제를 위협 모델에 넣어야 한다. 벤치마크 성공률만 보지 말고 위치·면적을 맞춘 랜덤 패치 대조군과 비교하는 것이 최소한의 확인 절차다.

한계도 분명하다. 모든 실험이 LIBERO와 RoboTwin 시뮬레이션에서 수행됐고 실제 로봇 검증은 없다. 공격자는 공개 인코더 화이트박스 접근과 전처리 지식을 갖는다고 가정하며, 패치는 표준 공격 평가에서 시행 내내 보인다. 저자들이 제안하는 방어(의심스러운 영역의 key/value 약화, 국소 섭동 밖 표현을 보존하도록 인코더 학습)는 적응형 공격에 대한 효과와 깨끗한 태스크 성능에 미치는 영향이 아직 평가되지 않았다고 논문은 명시한다.