FoldBack는 놓친 파지를 되돌려 옷 접기 장기 작업을 스스로 복구한다

FoldBack: Self-Correcting Masked Generative Policy for Long-Horizon Garment Folding

arXiv2610.10462v1

Lipeng Zhuang2026-10-07

무엇인가

옷 접기는 정밀한 단일팔·양팔 집기-놓기 동작을 연속으로 수행해야 하는 장기 호라이즌 조작이다. 각 동작이 옷의 형상을 바꾸고, 그 형상이 다음 접기 동작의 조건을 결정하기 때문에 파지를 놓치거나 미끄러지면 이후 동작 전체가 무효가 된다. 문제는 기존 정책들이 이 실패를 되돌아보지 않는다는 점이다. 짧은 호라이즌 정책은 최근 관측만으로 행동 청크를 만들어 반응적으로 실행하고, MGP-Long 같은 장기 생성 정책은 완전한 궤적을 만들고 미래 토큰을 관측에 맞춰 다듬지만, 이미 실행된 토큰은 의도한 조작 결과가 나왔는지와 무관하게 궤적 이력으로 고정된다. 런타임 모니터는 이상을 감지할 뿐 정책 궤적 자체를 고치지 못하고, 복구 인식 방법들은 별도 복구 시연, 정책 적응, 또는 LLM/VLM 추론에 의존한다.

어떻게 동작하나

FoldBack은 Masked Generative Policy(MGP)를 백본으로 쓴다. VQ-VAE 토크나이저가 연속 행동 궤적을 이산 토큰으로 매핑하고, Masked Generative Transformer가 부분적으로 마스킹된 토큰 시퀀스와 관측으로부터 마스킹된 토큰을 병렬 예측한다. 행동은 팔마다 3차원 말단 위치, 4차원 쿼터니언, 이진 그리퍼 상태를 담은 16차원 벡터이고, 정책은 T스텝 궤적을 N개의 이산 토큰으로 표현한다. 핵심 차이는 상태 관리다. FoldBack은 파지가 검증된 이력, 아직 확정되지 않은 파지 임계 윈도우, 편집 가능한 미래라는 세 층을 유지한다. 파지 임계 윈도우는 실행됐다고 해서 곧바로 이력에 들어가지 않고, 필요한 파지가 모두 검증된 뒤에만 이력에 추가된다. 실패하면 이력은 그대로 두고 해당 윈도우는 편집 가능한 상태로 남는다.

무엇과 다른가

첫 번째 추론 시점 결정은 언제 다듬고 검증할지다. Key-Action-Aligned Inference는 디코딩된 그리퍼 상태 시퀀스에서 열림→닫힘 전이를 Pick, 닫힘→열림 전이를 Place로 뽑아 키 액션을 정의하고, 각 키 액션마다 t_k-4부터 t_k+3까지의 윈도우를 잡는다. 양팔 조작에서는 두 팔의 Pick 전이를 하나의 키 액션으로 묶어 첫 그리퍼 닫힘부터 해당 관절 리프트 끝까지를 윈도우로 삼는다. 각 키 액션 윈도우 실행 전후로 최신 관측을 써서 남은 미실행 토큰을 다듬고, 다듬을 때마다 그리퍼 상태 시퀀스를 다시 디코딩해 키 액션의 시점과 윈도우, 토큰 집합을 재계산한다. Pick/Place 순서와 팔 배정은 고정되지만 타이밍은 이동할 수 있다. 갱신마다 MGP 마스크 리파인을 두 번 돌린다.

어떻게 쓰나

두 번째는 실패 후 어떻게 되돌릴지다. 파지 결과 모니터는 파지 닫힘 전과 리프트 후에 손끝 아래 고정 영역에서 로컬 포인트클라우드를 추출하고, 이를 각 그리퍼 좌표계로 표현한 뒤 PointNet 기반 이진 분류기로 성공 확률을 낸다. 옷 분할이 필요 없고 그리퍼 자체는 대부분 배제된다. 학습은 Flat'n'Fold의 성공 시연에 대한 이진 교차 엔트로피로 이뤄지며, 음성 쌍은 리프트 후 포인트클라우드를 근처 pre-pick 프레임의 로컬 포인트클라우드로 바꿔 만들어 실제 실패 궤적 없이 놓친 파지를 근사한다. 임계값은 0.50으로 검증 세트에서 고정한다. 검증된 롤백은 pre-grasp에서 post-lift까지 실행한 말단 모션을 기록해 두었다가, 실패 시 그리퍼를 열고 기록된 모션을 역으로 실행해 파지 직전 자세를 복원한다. 양팔 중 한쪽만 실패하면 성공한 그리퍼는 닫힌 채로 유지해 파지를 보존한다.

전제와 한계

세 번째는 어디를 어떻게 재시도할지다. 검증된 롤백은 재시도 가능한 자세를 만들 뿐 궤적을 고치지는 않는다. 실패한 윈도우 이후의 미실행 토큰은 그 파지가 성공했을 것을 전제로 생성됐기 때문이다. 구조적 궤적 계획 수리는 두 단계로 진행된다. 거리 기반 리마스킹은 실패 윈도우 이후 토큰을 후속 키 액션 단위 세그먼트로 나누고, 실패 지점에서 멀어질수록 마스킹 비율을 ρ_base=0.30에서 ρ_near=0.80 사이에서 α=0.50의 비율로 감쇠시킨다. 각 세그먼트 안에서는 가장 최근 생성 시점에 저장해 둔 신뢰도가 낮은 토큰부터 다시 마스킹하고, 롤백 후 관측으로 재생성하되 검증된 접두부와 선택되지 않은 미래 토큰은 앵커로 고정한다. 실패 인식 후보 재샘플링은 방금 실패한 파지를 반복하지 않도록 후보 8개를 뽑고, 각 팔의 에피소드 단위 실패 픽 위치 기억을 두어 반경 0.04m 안에 들어오는 후보를 거부한다. 최대 3배치까지 샘플링하며, 재생성 위치의 평균 신뢰도로 후보를 점수화해 가장 높은 것을 실행한다. 양팔 비대칭 실패에서는 성공한 팔의 저장된 모션과 실패한 팔의 재생성 모션을 시간 정렬해 결합하고, 역기구학 실패나 관절 한계 위반 후보는 버린 뒤 배치 단위 MGT 패스로 평가한다.

실험은 Baxter 양팔 로봇과 ZED2 RGB-D 카메라를 쓰는 Flat'n'Fold 셋업에서 실제로 수행됐다. 포인트클라우드는 작업 공간으로 크롭해 4096점으로 다운샘플링한다. 냅킨 두 사이즈, 수건 3개 인스턴스, 바지, 반소매 티셔츠, 긴소매 티셔츠, 반소매 셔츠 등 6개 카테고리 33벌을 평가했고, 냅킨은 사이즈별 15회씩 30회, 나머지 카테고리는 각 15회 시행했다. 결과는 최종 접기 성공률 75.2%, 최종 마스크 IoU 0.837로, 복구 기능이 없는 최강 베이스라인 MGP-Long의 45.7%, 0.689를 크게 앞선다. KAAI만 적용해도 평균 최종 성공률이 45.7%에서 53.3%로 오르고, 구조적 수리까지 붙이면 62.9%에서 75.2%로 뛴다. 6개 카테고리 전부에서 최종 성공률이 가장 높았고, 5단계 전략에서는 MGP-Long 대비 스테이지 완료율이 31.9~37.3 포인트 향상됐다. 통제된 코너 슬립 실험에서는 한 코너 슬립 85.7%, 두 코너 슬립 80.0%의 복구 성공률을 기록했고, 구조적 수리가 없는 버전보다 최종 성공률이 각각 20.0, 33.3 포인트 높았다. 비대칭 양팔 실패에서 성공한 파지를 유지한 비율은 100%로, 양팔을 함께 재생성하는 버전의 71.4%를 크게 웃돈다. 파지 결과 모니터는 실패 파지 96건과 성공 파지 352건에서 실패 재현율 92.7%, 팔 단위 오탐률 4.5%를 보였다.

일반화 실험도 있다. 바지의 학습 시 배치 각도 대비 5~20도, 20~30도 미학습 회전에서 FoldBack은 80.0%, 73.3%, 60.0%의 최종 성공률을 냈고 MGP-Long은 66.7%, 60.0%, 40.0%에 그쳤다. 카테고리마다 옷 한 벌씩을 학습에서 제외한 미학습 인스턴스 실험에서는 FoldBack이 평균 66.7%로 MGP-Long 36.7%, DP3 28.3%를 앞섰고 6개 카테고리 모두에서 최고였다. 주름이나 일부 접힌 모서리가 있는 비정형 초기 배치에서는 냅킨 80.0%, 수건 73.3%로 MGP-Long의 53.3%, 46.7%를 크게 앞섰다. 절제 실험에서는 같은 횟수의 리파인을 균등 분배한 Uniform보다 키 액션 경계에서 다듬는 KAAI가 더 높은 스테이지 완료율과 최종 성공률을 냈고, 거리 기반 리마스킹이 복구 성공률 85.7%와 최종 성공률 93.3%로 전체 미래 재생성이나 실패 윈도우만 재생성하는 방식보다 우수했다. 실패 인식 후보 선택은 첫 재시도 성공률 71.4%, 복구 성공률 85.7%, 최종 성공률 93.3%를 기록했다. 배치 재샘플링 비용은 복구 이벤트당 58ms로 단일 후보의 37ms 대비 부담이 작다.

개발자 관점에서 이 논문의 실용적 요점은 복구 능력을 정책 재학습 없이 추론 시점 계층으로 얹는다는 것이다. 롤백 절차는 정책에 독립적이라 액션 청킹 정책에도 그대로 붙일 수 있고, 실제로 DP3에 동일한 파지 모니터와 검증된 롤백만 장착해도 코너 슬립 조건에서 최종 접기 성공률이 올랐다. 파지 모니터 역시 성공 시연만으로 학습되며, 리프트 후 포인트클라우드를 근처 pre-pick 프레임 것으로 치환해 실패 데이터를 합성한다. 다만 자기 태스크에 옮길 때는 그리퍼 상태 전이로 Pick/Place를 정의하는 방식이 자기 동작 시퀀스에 맞는지, 파지 검증 임계값 0.50과 배제 반경 0.04m, 재시도 3회 예산이 적절한지, 포인트클라우드 크롭과 4096점 다운샘플링이 충분한지 확인해야 한다. 리파인 주기와 마스킹 비율(0.80/0.30/0.50)도 튜닝 대상이다.

저자들이 밝힌 전제와 한계도 분명하다. 유효한 복구 후보를 3배치 안에 찾지 못하면 복구 에피소드를 실패로 표시하고 복원된 파지 직전 자세에서 조작을 종료한다. 파지 실패가 감지된 스테이지에서 최대 3회의 롤백-재시도만 허용하며, 그 안에 스테이지가 끝나지 않으면 시행 자체가 종료된다. 모니터 임계값은 검증 세트에서 고정되고, 학습은 성공 시연 기반 합성 음성 쌍에 의존한다. 저자들은 향후 과제로 접기 전에 별도의 펼치기 단계가 필요한 더 어려운 초기 배치로 확장하는 것을 언급한다.