ActionPiece는 MSE 너머 물리적 거리 순서를 보존하는 행동 토크나이저다
ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models
무엇인가
자율회귀 방식의 비전-언어-행동(VLA) 모델은 연속 행동을 이산 토큰으로 바꾸고 다음 토큰 예측으로 로봇 명령을 생성한다. 이때 행동 토크나이저는 정책이 학습할 정답 토큰과, 예측된 토큰에서 복원될 실행 명령을 동시에 결정한다. 논문이 지적하는 문제는 평가 기준이다. 기존에는 평균제곱오차(MSE) 같은 점별 복원 오차로 토크나이저 품질을 재는데, 같은 작업의 여러 시연에서 반복되는 유사 동작 사이의 미세한 조정, 즉 물체 위치나 로봇 상태, 실행 단계에 따른 차이가 압축 과정에서 약화되거나 왜곡되거나 심지어 방향이 뒤집혀도 개별 오차는 작게 나올 수 있다. 논문은 복원 오차 e_i에 대해 x̂_j - x̂_i = (x_j - x_i) + (e_j - e_i)라는 식을 들어, 두 번째 항이 원래의 행동 차이를 줄이거나 키우거나 뒤집을 수 있음을 보인다. 정책이 토큰 시퀀스를 정확히 예측하더라도 디코더는 왜곡된 행동을 실행하므로, 이 문제는 실행 결과까지 그대로 이어진다.
어떻게 동작하나
이를 측정하기 위해 논문은 물리적 순위 일관성(PRC, Physical Rank Consistency)을 제안한다. 각 행동 청크를 기준(anchor)으로 삼아 원본 행동 공간에서 가장 가까운 k=32개 이웃을 찾고, 복원 전후의 물리적 거리 순위를 스피어만 상관계수로 비교해 평균낸다. 물리적 거리는 병진, SO(3) 상의 최단 측지 회전각, 그리퍼 상태를 결합해 정의하며, 청크 단위에서는 대응하는 시간 스텝의 거리를 평균낸다. 스케일은 학습 행동에서 적합하고 그룹 가중치는 하나의 엠바디먼트 안에서 고정된다. 중요한 점은 PRC를 디코딩된 행동 공간에서 계산한다는 것으로, 이 덕분에 토큰 어휘와 시퀀스 길이, 디코더 구조가 다른 토크나이저끼리도 같은 물리적 기준으로 비교할 수 있다. 논문은 MSE가 개별 복원의 충실도를, PRC가 물리적 거리 순서의 보존을 측정한다고 정리한다.
무엇과 다른가
ActionPiece는 이 관계를 토크나이저 학습 자체에 감독 신호로 넣는다. 구조는 얕은 트랜스포머 인코더-디코더와 잔차 벡터 양자화(RVQ)로 이루어진 코덱이다. 인코더가 S개의 잠재 슬롯을 만들고, 깊이 Q, 코드북당 K개 항목을 가진 RVQ가 각 슬롯을 표현하면 전체 토큰 수는 T = S×Q가 되며, 디코더는 한 번의 패스로 완전한 행동 청크를 복원한다. 여기에 두 가지 물리적 순서 목표가 더해진다. 첫째, 물리적 순위 보존(PRP)은 인코더 특징 거리와 양자화된 특징 거리를 0.25 대 0.75로 가중 결합한 표현 거리에서, 물리적으로 가까운 쌍(5퍼센타일)의 거리가 먼 쌍(95퍼센타일)의 거리보다 작아지도록 softplus 힌지 손실(마진 0.1)을 건다. 둘째, 양자화 정규화(QR)는 같은 근-원 쌍에 대해 코드워드 할당 확률 분포 사이의 젠슨-섀넌 발산에도 같은 순서 제약(마진 0.1)을 적용한다. 즉 PRP는 표현 기하를, QR은 이산 어휘로의 배정 확률을 각각 규제한다. 전체 손실은 복원 MSE, 코드북 커밋 손실, 두 물리적 순서 손실의 합이며 가중치는 λ_vq=0.25, λ_r=λ_q=6.25×10⁻⁴다. 학습이 끝나면 토크나이저를 동결하고 그 인덱스를 VLM 어휘에 추가한 뒤, 표준 다음 토큰 예측으로 정책을 학습한다.
어떻게 쓰나
실험은 Qwen3-VL-4B 정책 하나를 고정하고 토크나이저만 바꾸는 통제 비교로 진행됐다. ActionCodec, OAT, FASTer, FAST, 표준 RVQ와 비교했으며 정책 데이터와 프롬프트, 옵티마이저, 전역 배치, 학습 예산, 행동 및 실행 지평, 시드, 평가 프로토콜을 모두 고정했다. 결과는 LIBERO 94.8%(최강 베이스라인 ActionCodec 93.7%), 미학습 LIBERO-Plus 68.8%(최강 베이스라인 64.3%)로, 격차가 1.1%포인트에서 4.5%포인트로 벌어졌고 LIBERO-Plus의 7개 변화 범주 중 6개에서 앞섰다. 실제 로봇 시연(BridgeData V2)으로 학습한 SimplerEnv 실전-시뮬 전이에서는 71.9%로 최고 평균을 기록했고, 정밀 배치가 필요한 블록 쌓기 58.3%, 스푼 83.3%, 가지 91.7%였다. VLA-Arena에서는 L0/L1/L2 각각 82.2%/42.7%/29.5%, 33개 셀 등가 평균 51.5%로 비교 모델 중 가장 높았으며, L0만 학습했음에도 L1과 L2 평균에서 각각 7.0%포인트, 5.0%포인트 앞섰다.
전제와 한계
구성 요소 분리 실험은 두 목표가 함께 작동한다는 주장을 뒷받침한다. 표준 RVQ가 LIBERO 90.9%, LIBERO-Plus 60.4%인데, PRP만 더하면 93.8%/65.4%, QR만 더하면 92.9%/62.4%, 둘 다 더하면 94.8%/68.8%가 된다. PRC도 0.902에서 PRP 0.947, QR 0.916, 결합 0.953으로 올라 정책 성공률 향상이 물리적 이웃 구조 보존과 함께 나타났다. 개별 기여는 PRP가 더 크지만 QR을 더하면 LIBERO-Plus 성공률이 3.4%포인트 추가로 오르고, 카메라 시프트 범주는 PRP 단독 35.5%에서 결합 45.1%로 개선된다. 별도로 55개 토크나이저-벤치마크 평가를 모아 보면 PRC와 정책 성공의 스피어만 상관이 0.681로, 복원 충실도의 0.544보다 높았다.
실무적으로 이 논문이 주는 신호는 명확하다. VLA 파인튜닝에서 행동 토크나이저는 흔히 고정된 전처리 부품으로 취급되지만, 여기서는 토크나이저를 바꾸는 것만으로 정책 아키텍처와 학습 프로토콜을 그대로 둔 채 성공률과 분포 밖 일반화가 달라진다. 특히 LIBERO에서 1.1%포인트 차이가 LIBERO-Plus에서 4.5%포인트로 커진다는 점은, 시연 데이터가 학습 분포를 벗어나는 환경에서 토크나이저의 관계 보존 능력이 더 중요해진다는 해석을 가능하게 한다. 따라서 자체 VLA 파이프라인을 만들 때는 MSE만 보고 토크나이저를 고르지 말고, 디코딩된 행동 공간에서 PRC 같은 순위 보존 지표를 함께 재고, 토크나이저 학습 손실에 물리적 순위 감독을 넣는 것을 검토할 만하다. 다만 PRC 계산에는 원본 행동 청크의 최근접 이웃과 물리적 거리 정의가 필요하므로, 엠바디먼트별 스케일 적합과 거리 가중치 설정을 먼저 정해야 한다.
논문이 제공된 본문에는 별도의 한계 절이 없다. 다만 본문 곳곳에서 전제가 드러난다. 물리적 거리의 스케일은 학습 행동에서 적합하고 그룹 가중치는 하나의 엠바디먼트 안에서 고정되므로, 거리 정의와 가중치가 엠바디먼트에 종속된다. 평가는 LIBERO, LIBERO-Plus, SimplerEnv, VLA-Arena 네 벤치마크에 한정되며, VLA-Arena 정책은 L0 데이터만으로 학습하고 L1/L2는 일반화 평가로만 쓴다. 또한 토크나이저는 학습 후 동결되어 정책 학습 중에는 갱신되지 않고, PRC는 k=32 이웃이라는 특정 설정에 의존한다. 논문은 물리적 순위 감독이 정책 성공과 함께 개선된다는 상관을 보이지만, 어떤 조건에서 이 감독이 실패하는지에 대한 분석은 제시하지 않는다.